Science
CovaSyn wird an einem Benchmark gemessen, den wir nicht entworfen haben: MolecularIQ (Bartmann et al., ICLR 2026, Poster). Frontier-Modelle erreichen dort 14 bis 41 % bei chemischer Strukturanalyse, mit CovaSyn-MCP-Anbindung 76 bis 92 %. Diese Seite fasst Methodik und Ergebnisse zusammen und stellt die Zitation zum Kopieren bereit.
Methodik
Fremder, begutachteter Benchmark
MolecularIQ stammt von Bartmann et al. (Klambauer Lab, Institut fuer Machine Learning, JKU Linz) und ist als Poster auf der ICLR 2026 angenommen. CovaSyn hat den Benchmark weder entworfen noch daran mitgearbeitet; wir haben unsere Werkzeuge daran gemessen.
Symbolische Verifikation
Jede Antwort wird symbolisch gegen die hinterlegte Loesung geprüft: exakte Übereinstimmung oder falsch. Kein Sprachmodell als Richter, keine Teilpunkte, kein Interpretationsspielraum. Dieser Satz ist wichtiger als jede einzelne Zahl.
Umfang
4 Modelle, 3.540 verifizierte Aufgaben, 12.540 Modell-Antworten. Daten-Snapshot: 2026-05-17.
Nachvollziehbar
Datensatz und Auswertungscode sind öffentlich (Links unten). Jede der hier gezeigten Zahlen lässt sich damit unabhängig reproduzieren.
Ergebnisse je Modell
Baseline heißt: dasselbe Modell ohne Werkzeuge. Die MCP-Spalte ist dasselbe Modell mit angebundenem CovaSyn-MCP-Server. Haiku 4.5 wurde auf dem vollen Test-Split ausgewertet, die übrigen drei Modelle auf einer proportional stratifizierten Stichprobe.
| Modell | Baseline | + CovaSyn MCP | Δ | Lift |
|---|---|---|---|---|
| Claude Haiku 4.5 | 21,18 % | 85,38 % | +64,20 pp | 4,03× |
| Claude Opus 4.7 | 40,75 % | 91,51 % | +50,76 pp | 2,25× |
| OpenAI GPT-5.5 | 22,29 % | 89,92 % | +67,63 pp | 4,03× |
| Gemini 3.5 Flash | 13,68 % | 75,66 % | +61,98 pp | 5,53× |
Quelle: Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. ICLR 2026 (Poster). arXiv:2601.15279. Snapshot: 2026-05-17.
Zitieren Sie diese Arbeit
Wenn Sie die Zahlen dieser Seite in einer Publikation, einem Poster oder einem internen Bericht verwenden, zitieren Sie bitte das MolecularIQ-Paper der Autoren:
@inproceedings{bartmann2026moleculariq,
title = {MolecularIQ: Characterizing Chemical Reasoning Capabilities
Through Symbolic Verification on Molecular Graphs},
author = {Bartmann, C. and Schimunek, J. and Ielanskyi, M. and
Seidl, P. and Klambauer, G. and Luukkonen, S.},
booktitle = {International Conference on Learning Representations (ICLR)},
year = {2026},
note = {Poster. arXiv:2601.15279},
url = {https://arxiv.org/abs/2601.15279}
}Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. ICLR 2026 (Poster). arXiv:2601.15279.
Paper, Daten, Code
Das PDF liegt bei arXiv, nicht auf unseren Servern. Datensatz und Code gehören den Autoren des Benchmarks.
Die Langfassung
Kostenaufschlüsselung pro Frage, Kategorien-Analyse, Fehlermodi und die vollständigen Diagramme finden Sie auf der Benchmark-Seite.
Zur vollständigen Benchmark-Auswertung →