CovaSyn

Science

CovaSyn wird an einem Benchmark gemessen, den wir nicht entworfen haben: MolecularIQ (Bartmann et al., ICLR 2026, Poster). Frontier-Modelle erreichen dort 14 bis 41 % bei chemischer Strukturanalyse, mit CovaSyn-MCP-Anbindung 76 bis 92 %. Diese Seite fasst Methodik und Ergebnisse zusammen und stellt die Zitation zum Kopieren bereit.

Methodik

Fremder, begutachteter Benchmark

MolecularIQ stammt von Bartmann et al. (Klambauer Lab, Institut fuer Machine Learning, JKU Linz) und ist als Poster auf der ICLR 2026 angenommen. CovaSyn hat den Benchmark weder entworfen noch daran mitgearbeitet; wir haben unsere Werkzeuge daran gemessen.

Symbolische Verifikation

Jede Antwort wird symbolisch gegen die hinterlegte Loesung geprüft: exakte Übereinstimmung oder falsch. Kein Sprachmodell als Richter, keine Teilpunkte, kein Interpretationsspielraum. Dieser Satz ist wichtiger als jede einzelne Zahl.

Umfang

4 Modelle, 3.540 verifizierte Aufgaben, 12.540 Modell-Antworten. Daten-Snapshot: 2026-05-17.

Nachvollziehbar

Datensatz und Auswertungscode sind öffentlich (Links unten). Jede der hier gezeigten Zahlen lässt sich damit unabhängig reproduzieren.

Ergebnisse je Modell

Baseline heißt: dasselbe Modell ohne Werkzeuge. Die MCP-Spalte ist dasselbe Modell mit angebundenem CovaSyn-MCP-Server. Haiku 4.5 wurde auf dem vollen Test-Split ausgewertet, die übrigen drei Modelle auf einer proportional stratifizierten Stichprobe.

ModellBaseline+ CovaSyn MCPΔLift
Claude Haiku 4.521,18 %85,38 %+64,20 pp4,03×
Claude Opus 4.740,75 %91,51 %+50,76 pp2,25×
OpenAI GPT-5.522,29 %89,92 %+67,63 pp4,03×
Gemini 3.5 Flash13,68 %75,66 %+61,98 pp5,53×

Quelle: Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. ICLR 2026 (Poster). arXiv:2601.15279. Snapshot: 2026-05-17.

Benchmark-Zusammenfassung: Trefferquote aller Modell-Konfigurationen mit und ohne CovaSyn-MCP
Gesamt-Trefferquote je Modell-Konfiguration. Bildquelle: eigene Auswertung auf dem öffentlichen MolecularIQ-Test-Split (Bartmann et al., ICLR 2026).

Zitieren Sie diese Arbeit

Wenn Sie die Zahlen dieser Seite in einer Publikation, einem Poster oder einem internen Bericht verwenden, zitieren Sie bitte das MolecularIQ-Paper der Autoren:

BibTeX
@inproceedings{bartmann2026moleculariq,
  title     = {MolecularIQ: Characterizing Chemical Reasoning Capabilities
               Through Symbolic Verification on Molecular Graphs},
  author    = {Bartmann, C. and Schimunek, J. and Ielanskyi, M. and
               Seidl, P. and Klambauer, G. and Luukkonen, S.},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year      = {2026},
  note      = {Poster. arXiv:2601.15279},
  url       = {https://arxiv.org/abs/2601.15279}
}
Fliesstext
Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. ICLR 2026 (Poster). arXiv:2601.15279.

Paper, Daten, Code

Das PDF liegt bei arXiv, nicht auf unseren Servern. Datensatz und Code gehören den Autoren des Benchmarks.

Die Langfassung

Kostenaufschlüsselung pro Frage, Kategorien-Analyse, Fehlermodi und die vollständigen Diagramme finden Sie auf der Benchmark-Seite.

Zur vollständigen Benchmark-Auswertung
Science: MolecularIQ-Ergebnisse und Zitation | CovaSyn