MolecularIQ, arXiv:2601.15279
Benchmark und Methodik
Wir messen CovaSyn an MolecularIQ, einem unabhängigen Benchmark (Bartmann et al., Klambauer Lab, Institut für Machine Learning, JKU Linz). Frontier-Modelle erreichen dort 14 bis 41 % bei chemischer Strukturanalyse, mit angebundenem CovaSyn-MCP 76 bis 92 %. Hier stehen die Zahlen, die Methodik und die Grenzen der Messung.
Konto anlegen, API-Schlüssel holen, die Tools in Claude, ChatGPT oder Cursor nutzen.
Das Ergebnis
Dieselben Modelle, einmal ohne und einmal mit CovaSyn.
Vier Modelle, 3.540 verifizierte Aufgaben, 12.540 Antworten. Gewertet wird nur die exakte Übereinstimmung mit der hinterlegten Lösung.
- Modelle allein
- 14 bis 41 %
- Mit CovaSyn-MCP
- 76 bis 92 %
Quelle: Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279. Snapshot: 2026-05-17.
Ergebnisse je Modell
Der Effekt hängt nicht an einem Modell.
Die Spalte „Ohne Werkzeuge“ zeigt das Modell allein, die MCP-Spalte dasselbe Modell mit angebundenem CovaSyn-MCP-Server. Haiku 4.5 wurde auf dem vollen Test-Split ausgewertet, die übrigen drei Modelle auf einer proportional stratifizierten Stichprobe.
| Modell | Ohne Werkzeuge | Mit CovaSyn-MCP | Differenz (Prozentpunkte) | Faktor |
|---|---|---|---|---|
| Claude Haiku 4.5 | 21,18 % | 85,38 % | +64,20 | 4,03× |
| Claude Opus 4.7 | 40,75 % | 91,51 % | +50,76 | 2,25× |
| OpenAI GPT-5.5 | 22,29 % | 89,92 % | +67,63 | 4,03× |
| Gemini 3.5 Flash | 13,68 % | 75,66 % | +61,98 | 5,53× |
Quelle: Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279. Snapshot: 2026-05-17.
Vier Modelle, drei Anbieter, dieselbe Richtung. Der Effekt der Anbindung ist nicht an ein bestimmtes Modell gebunden, sondern quer durch die Frontier-Modelle reproduzierbar. Wer heute mit Claude arbeitet und morgen zu GPT-5.5 oder Gemini wechselt, behält ihn.
Methodik
Was gemessen wurde und wie.
Benchmarks, die ein Anbieter selbst entwirft, verdienen Misstrauen: wer die eigenen Werkzeuge testet, hat einen Anreiz, gut dazustehen. Deshalb messen wir an einem Benchmark, den wir nicht entworfen haben und auf dessen Aufgabenwahl wir keinen Einfluss hatten.
- Unabhängiger Benchmark
- MolecularIQ stammt von Bartmann et al. (Klambauer Lab, Institut für Machine Learning, JKU Linz) und ist als Preprint auf arXiv veröffentlicht (arXiv:2601.15279). CovaSyn hat den Benchmark weder entworfen noch daran mitgearbeitet; wir haben unsere Werkzeuge daran gemessen.
- Symbolische Verifikation
- Jede Antwort wird symbolisch gegen die hinterlegte Lösung geprüft: exakte Übereinstimmung oder falsch. Kein Sprachmodell als Richter, keine Teilpunkte, kein Interpretationsspielraum. Diese Strenge macht das Ergebnis robust gegen Rosinenpicken, und das ist wichtiger als jede einzelne Zahl.
- Aufgaben
- Ausgewertet wurde der Test-Split von MolecularIQ mit 3.540 Aufgaben, eingegrenzt auf symbolisch verifizierbare Fragetypen.
- Modelle und Umfang
- Vier Modelle: Claude Haiku 4.5, Claude Opus 4.7, OpenAI GPT-5.5 und Gemini 3.5 Flash, jeweils ohne Werkzeuge und mit CovaSyn-MCP. Insgesamt 12.540 ausgewertete Modellantworten (je Aufgabe und Modell eine Antwort ohne und eine mit CovaSyn-MCP); Haiku 4.5 auf dem vollen Test-Split, die übrigen drei auf einer stratifizierten Stichprobe von 910 Fragen je Modell, um die Kosten vertretbar zu halten.
- Werkzeuge
- Chemische Grundoperationen aus der CovaBasicChem-Suite: deterministische Cheminformatik, die exakte Werte liefert, die das Modell in seine Antwort übernimmt.
- Datenstand und Nachvollziehbarkeit
- Daten-Snapshot vom 17.05.2026. Datensatz und Auswertungscode sind öffentlich, einen CovaSyn-Zugang legen Sie kostenlos an; damit lässt sich jede Zahl auf dieser Seite nachrechnen.
Paper, Daten, Code
- Paper bei arXiv (Abstract)https://arxiv.org/abs/2601.15279
- Paper-PDF bei arXivhttps://arxiv.org/pdf/2601.15279
- Datensatz auf Hugging Facehttps://huggingface.co/datasets/ml-jku/moleculariq-v0.0
- Auswertungscode auf GitHubhttps://github.com/ml-jku/moleculariq
Das PDF liegt bei arXiv, nicht auf unseren Servern. Datensatz und Code gehören den Autoren des Benchmarks.
Zitieren
Wenn Sie die Zahlen dieser Seite in einer Publikation, einem Poster oder einem internen Bericht verwenden, zitieren Sie bitte das MolecularIQ-Paper der Autoren:
@misc{bartmann2026moleculariq,
title = {MolecularIQ: Characterizing Chemical Reasoning Capabilities
Through Symbolic Verification on Molecular Graphs},
author = {Bartmann, C. and Schimunek, J. and Ielanskyi, M. and
Seidl, P. and Klambauer, G. and Luukkonen, S.},
year = {2026},
eprint = {2601.15279},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2601.15279}
}Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279.
Langfassung
Was das in Kosten bedeutet.
Genauigkeit ist die eine Hälfte, die Kosten pro Frage sind die andere. Wer Chemie-Anfragen in großer Zahl stellt, rechnet nicht in einzelnen Tokens, sondern in Tausenden Werkzeugaufrufen pro Woche. Mit CovaSyn lässt sich oft das günstigere Modell einsetzen, ohne Genauigkeit aufzugeben.
| Konfiguration | Genauigkeit | US-Dollar je Frage | Latenz |
|---|---|---|---|
| Haiku 4.5 ohne Werkzeuge | 21,18 % | 0,00069 | 2,1 s |
| Haiku 4.5 mit CovaSyn-MCP | 85,38 % | 0,00781 | 5,8 s |
| Opus 4.7 ohne Werkzeuge | 40,75 % | 0,02529 | 5,1 s |
| Opus 4.7 mit CovaSyn-MCP | 91,51 % | 0,12536 | 7,4 s |
| GPT-5.5 ohne Werkzeuge | 22,29 % | 0,02750 | 7,9 s |
| GPT-5.5 mit CovaSyn-MCP | 89,92 % | 0,03005 | 9,4 s |
| Gemini 3.5 Flash ohne Werkzeuge | 13,68 % | 0,00940 | 5,5 s |
| Gemini 3.5 Flash mit CovaSyn-MCP | 75,66 % | 0,02170 | 10,8 s |
Die Aussage in einem Satz
Haiku 4.5 mit CovaSyn erreicht mehr als die doppelte Genauigkeit von Opus 4.7 ohne Werkzeuge bei rund einem Drittel der Kosten und ist rund 16-mal günstiger als Opus 4.7 mit CovaSyn bei 6 Prozentpunkten weniger Genauigkeit. Gemini 3.5 Flash mit CovaSyn zeigt den größten relativen Zugewinn (5,53fach, von 13,7 auf 75,7 %) bei rund 2,3fachen Grundkosten und doppelter Latenz; es liegt nahe, wenn Gemini bei Ihnen bereits im Einsatz ist.
Bei zehntausend Fragen im Monat kostet Opus 4.7 mit CovaSyn rund 1.250 US-Dollar, Haiku 4.5 mit CovaSyn rund 78 US-Dollar und Gemini 3.5 Flash mit CovaSyn rund 217 US-Dollar.
Kategorien
Wo die Anbindung am stärksten wirkt.
Mittlerer Zugewinn je Fragekategorie, gemittelt über Haiku 4.5, Opus 4.7 und GPT-5.5. Für Gemini 3.5 Flash liegen im aktuellen Snapshot keine Werte je Kategorie vor.
| Kategorie | Ohne Werkzeuge | Mit CovaSyn-MCP | Differenz (Prozentpunkte) |
|---|---|---|---|
| Gerüst und Fragmente | 18,0 % | 86,5 % | +68,4 |
| Ringe und Topologie | 29,4 % | 93,2 % | +63,8 |
| Bindungen und Ketten | 17,6 % | 80,9 % | +63,3 |
| Fragen mit mehreren Merkmalen | 27,3 % | 88,4 % | +61,1 |
| Atom- und Formelzählungen | 38,7 % | 98,3 % | +59,7 |
| Stereochemie | 28,7 % | 86,0 % | +57,4 |
| Elektronische Eigenschaften und H-Brücken | 31,2 % | 81,5 % | +50,3 |
Das sind die Bausteine der täglichen medizinalchemischen Arbeit. Ein Molekülgerüst muss exakt bestimmt sein, eine Ringanalyse darf nicht ins Raten kippen, eine Mehrfachbedingung wie „alle Verzweigungspunkte innerhalb zweier Bindungen zu einem Halogen“ muss exakt aufgelöst werden.
Grenzen
Wo die verbleibende Lücke sitzt.
Die Trefferquote liegt nicht bei 100 %, und das verschweigen wir nicht. Jede falsche Antwort mit CovaSyn-MCP haben wir einer von drei Ursachen zugeordnet. So setzen sich die Fehlantworten je Modell zusammen, und hier lohnt es sich, bei Ihrer eigenen Validierung genauer hinzusehen.
| Ursache | Haiku 4.5 | Opus 4.7 | GPT-5.5 | Gemini 3.5 Flash |
|---|---|---|---|---|
| Werkzeugergebnis übergangen | 81 % | 86 % | 66 % | 25 % |
| Formatfehler | 1 % | 1 % | 25 % | 73 % |
| Werkzeugwert passt nicht | 18 % | 13 % | 9 % | 3 % |
- Werkzeugergebnis übergangen
- Das Modell übergeht ein korrektes Werkzeugergebnis und antwortet selbst. Das Verhalten hängt am Modell, nicht am Werkzeug. Eine klarere Prompt-Struktur senkt den Anteil deutlich, beseitigt ihn aber nicht vollständig.
- Werkzeugwert passt nicht
- Der Wert des Werkzeugs passt nicht zur Frage. Das sind echte Fehler im Ablauf, meist Grenzfälle bei komplexer Stereochemie oder ungewöhnlichen Strukturen. Diese Fälle bearbeiten wir laufend.
- Formatfehler
- Die Ausgabe des Modells lässt sich nicht auslesen. Diese Klasse ist technisch leicht abzufangen, weil sie bei einer Prüfung der Ausgabe sofort auffällt.
Höchstens 18 % der Fehlantworten eines Modells gehen auf einen unpassenden Werkzeugwert zurück. Der Rest entsteht beim Modell: Es übergeht ein korrektes Ergebnis oder liefert eine Ausgabe, die sich nicht auslesen lässt. Beides lässt sich im Ablauf abfangen.
Folgen
Was das für Forschung und Entwicklung bedeutet.
- Das Modell ist nicht mehr automatisch der Engpass.
- Wer heute pro Chemie-Anfrage rund 0,03 US-Dollar zahlt, kommt mit gleicher oder besserer Genauigkeit auf rund 0,008 US-Dollar. Das verändert die Kostenrechnung medizinalchemischer Abläufe spürbar.
- Der Zugewinn ist modellunabhängig.
- Wer eine MCP-Schicht aufbaut, ist nicht an Anthropic, OpenAI oder Google gebunden. Kommt das nächste Frontier-Modell, lässt es sich direkt anbinden, und der Effekt überträgt sich.
- Die Lücke ist offengelegt.
- Für die Validierung in regulierten Umgebungen ist eine offene Fehlerverteilung mehr wert als ein glattes Versprechen. Ihr QA-Team kann aus den Fehlerklassen direkt Risikobewertung und Akzeptanzkriterien ableiten.
FAQ
Häufige Fragen
Was ist der MolecularIQ-Benchmark?
Ein 2026 vom Klambauer Lab, Institut für Machine Learning, JKU Linz veröffentlichter Benchmark (arXiv:2601.15279), der misst, wie gut Sprachmodelle strukturierte chemische Analysen lösen. 3.540 Aufgaben im ausgewerteten Test-Split, symbolische Verifikation ohne Sprachmodell als Richter.
Warum steigt die Genauigkeit mit CovaSyn-MCP so stark?
Sprachmodelle raten bei strukturellen Chemie-Aufgaben wie Atomzählungen oder der Extraktion von Gerüsten oft, weil ihnen ein deterministischer Mechanismus fehlt. CovaSyn liefert per Werkzeugaufruf exakte Werte aus cheminformatischen Bibliotheken, die das Modell in seine Antwort übernimmt.
Wie kann Haiku 4.5 mit CovaSyn günstiger sein als Opus 4.7 ohne?
Haiku 4.5 ist das deutlich kleinere Modell: In dieser Messung kostete eine Frage ohne Werkzeuge rund 0,0007 US-Dollar, bei Opus 4.7 rund 0,025. Die Werkzeugaufrufe heben Haiku auf rund 0,008 US-Dollar je Frage, also etwa ein Drittel von Opus 4.7 ohne Werkzeuge. Weil die MCP-Schicht die strukturelle Korrektheit liefert, bleiben dem kleinen Modell Formulierung und Schlussfolgerung. Ergebnis: rund 85 statt 41 % Genauigkeit.
Lässt sich das Ergebnis nachrechnen?
Ja. Der Datensatz liegt öffentlich auf Hugging Face, der Auswertungscode auf GitHub, die Modelle sind über ihre offiziellen Schnittstellen erreichbar, und einen CovaSyn-MCP-Zugang legen Sie kostenlos an.
Warum hat Gemini 3.5 Flash den niedrigsten Wert, aber den größten Zugewinn?
Gemini 3.5 Flash startet mit 13,68 % am niedrigsten der vier Modelle, weil es auf Geschwindigkeit und Kosten ausgelegt ist, nicht auf strukturelle Chemie. Genau deshalb ist der relative Zugewinn mit dem Faktor 5,53 am größten: die MCP-Schicht liefert die strukturelle Korrektheit, die dem Modell allein fehlt. Mit 0,02170 US-Dollar je Frage schlägt Gemini mit CovaSyn Opus 4.7 ohne Werkzeuge um mehr als 30 Prozentpunkte, bei deutlich niedrigeren Kosten als Opus 4.7 mit CovaSyn.
Was ist mit den übrigen CovaSyn-Werkzeugen?
Die Zahlen auf dieser Seite stammen aus einem Teil unserer Werkzeuge. Die übrigen messen wir an passenden Datensätzen. Sobald Ergebnisse vorliegen, stehen sie auf dieser Seite, mit voller Methodik und voller Verteilung.
Forschung und Entwicklung
Die Entwicklung der CovaSyn-MCP-Plattform ist von der Bescheinigungsstelle Forschungszulage (BSFZ) als Forschung und Entwicklung im Sinne des Forschungszulagengesetzes bescheinigt.
Die Bescheinigung bewertet den Forschungscharakter der Entwicklungsarbeit. Sie ist keine Aussage über Produkteigenschaften und keine staatliche Produktzulassung. Bescheinigungsstelle Forschungszulage.
Nächster Schritt
Messen Sie selbst nach.
Die Werkzeuge hinter diesen Zahlen testen Sie kostenlos am eigenen Molekül.
Konto anlegen, API-Schlüssel holen, die Tools in Claude, ChatGPT oder Cursor nutzen.
