Zum Inhalt springen
CovaSyn
MCP kostenlos testen

MolecularIQ, arXiv:2601.15279

Benchmark und Methodik

Wir messen CovaSyn an MolecularIQ, einem unabhängigen Benchmark (Bartmann et al., Klambauer Lab, Institut für Machine Learning, JKU Linz). Frontier-Modelle erreichen dort 14 bis 41 % bei chemischer Strukturanalyse, mit angebundenem CovaSyn-MCP 76 bis 92 %. Hier stehen die Zahlen, die Methodik und die Grenzen der Messung.

Konto anlegen, API-Schlüssel holen, die Tools in Claude, ChatGPT oder Cursor nutzen.

Ergebnis je ModellMolecularIQ, exakte Übereinstimmung
Modell alleinMit CovaSyn-MCP0 %25 %50 %75 %100 %Haiku 4.5+64,2 Pp. · 4,0×Haiku 4.5, Modell allein: 21,18 %Haiku 4.5, mit CovaSyn-MCP: 85,38 %21,2 %85,4 %Opus 4.7+50,8 Pp. · 2,2×Opus 4.7, Modell allein: 40,75 %Opus 4.7, mit CovaSyn-MCP: 91,51 %40,8 %91,5 %GPT-5.5+67,6 Pp. · 4,0×GPT-5.5, Modell allein: 22,29 %GPT-5.5, mit CovaSyn-MCP: 89,92 %22,3 %89,9 %Gemini 3.5 Flash+62,0 Pp. · 5,5×Gemini 3.5 Flash, Modell allein: 13,68 %Gemini 3.5 Flash, mit CovaSyn-MCP: 75,66 %13,7 %75,7 %
Trefferquote auf dem Test-Split, symbolisch verifiziert: Haiku 4.5 auf allen 3.540 Aufgaben, die übrigen Modelle auf je 910. Gleiche Fragen ohne und mit CovaSyn. Pp. = Prozentpunkte.

Das Ergebnis

Dieselben Modelle, einmal ohne und einmal mit CovaSyn.

Vier Modelle, 3.540 verifizierte Aufgaben, 12.540 Antworten. Gewertet wird nur die exakte Übereinstimmung mit der hinterlegten Lösung.

Modelle allein
14 bis 41 %
Mit CovaSyn-MCP
76 bis 92 %
MolecularIQ, arXiv:2601.15279, bei arXiv

Quelle: Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279. Snapshot: 2026-05-17.

Ergebnisse je Modell

Der Effekt hängt nicht an einem Modell.

Die Spalte „Ohne Werkzeuge“ zeigt das Modell allein, die MCP-Spalte dasselbe Modell mit angebundenem CovaSyn-MCP-Server. Haiku 4.5 wurde auf dem vollen Test-Split ausgewertet, die übrigen drei Modelle auf einer proportional stratifizierten Stichprobe.

Trefferquote je Modell ohne und mit CovaSyn-MCP
ModellOhne WerkzeugeMit CovaSyn-MCPDifferenz (Prozentpunkte)Faktor
Claude Haiku 4.521,18 %85,38 %+64,204,03×
Claude Opus 4.740,75 %91,51 %+50,762,25×
OpenAI GPT-5.522,29 %89,92 %+67,634,03×
Gemini 3.5 Flash13,68 %75,66 %+61,985,53×

Quelle: Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279. Snapshot: 2026-05-17.

Vier Modelle, drei Anbieter, dieselbe Richtung. Der Effekt der Anbindung ist nicht an ein bestimmtes Modell gebunden, sondern quer durch die Frontier-Modelle reproduzierbar. Wer heute mit Claude arbeitet und morgen zu GPT-5.5 oder Gemini wechselt, behält ihn.

Methodik

Was gemessen wurde und wie.

Benchmarks, die ein Anbieter selbst entwirft, verdienen Misstrauen: wer die eigenen Werkzeuge testet, hat einen Anreiz, gut dazustehen. Deshalb messen wir an einem Benchmark, den wir nicht entworfen haben und auf dessen Aufgabenwahl wir keinen Einfluss hatten.

Unabhängiger Benchmark
MolecularIQ stammt von Bartmann et al. (Klambauer Lab, Institut für Machine Learning, JKU Linz) und ist als Preprint auf arXiv veröffentlicht (arXiv:2601.15279). CovaSyn hat den Benchmark weder entworfen noch daran mitgearbeitet; wir haben unsere Werkzeuge daran gemessen.
Symbolische Verifikation
Jede Antwort wird symbolisch gegen die hinterlegte Lösung geprüft: exakte Übereinstimmung oder falsch. Kein Sprachmodell als Richter, keine Teilpunkte, kein Interpretationsspielraum. Diese Strenge macht das Ergebnis robust gegen Rosinenpicken, und das ist wichtiger als jede einzelne Zahl.
Aufgaben
Ausgewertet wurde der Test-Split von MolecularIQ mit 3.540 Aufgaben, eingegrenzt auf symbolisch verifizierbare Fragetypen.
Modelle und Umfang
Vier Modelle: Claude Haiku 4.5, Claude Opus 4.7, OpenAI GPT-5.5 und Gemini 3.5 Flash, jeweils ohne Werkzeuge und mit CovaSyn-MCP. Insgesamt 12.540 ausgewertete Modellantworten (je Aufgabe und Modell eine Antwort ohne und eine mit CovaSyn-MCP); Haiku 4.5 auf dem vollen Test-Split, die übrigen drei auf einer stratifizierten Stichprobe von 910 Fragen je Modell, um die Kosten vertretbar zu halten.
Werkzeuge
Chemische Grundoperationen aus der CovaBasicChem-Suite: deterministische Cheminformatik, die exakte Werte liefert, die das Modell in seine Antwort übernimmt.
Datenstand und Nachvollziehbarkeit
Daten-Snapshot vom 17.05.2026. Datensatz und Auswertungscode sind öffentlich, einen CovaSyn-Zugang legen Sie kostenlos an; damit lässt sich jede Zahl auf dieser Seite nachrechnen.

Paper, Daten, Code

Das PDF liegt bei arXiv, nicht auf unseren Servern. Datensatz und Code gehören den Autoren des Benchmarks.

Zitieren

Wenn Sie die Zahlen dieser Seite in einer Publikation, einem Poster oder einem internen Bericht verwenden, zitieren Sie bitte das MolecularIQ-Paper der Autoren:

BibTeX
@misc{bartmann2026moleculariq,
  title         = {MolecularIQ: Characterizing Chemical Reasoning Capabilities
                   Through Symbolic Verification on Molecular Graphs},
  author        = {Bartmann, C. and Schimunek, J. and Ielanskyi, M. and
                   Seidl, P. and Klambauer, G. and Luukkonen, S.},
  year          = {2026},
  eprint        = {2601.15279},
  archivePrefix = {arXiv},
  url           = {https://arxiv.org/abs/2601.15279}
}
Fließtext
Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279.

Langfassung

Was das in Kosten bedeutet.

Genauigkeit ist die eine Hälfte, die Kosten pro Frage sind die andere. Wer Chemie-Anfragen in großer Zahl stellt, rechnet nicht in einzelnen Tokens, sondern in Tausenden Werkzeugaufrufen pro Woche. Mit CovaSyn lässt sich oft das günstigere Modell einsetzen, ohne Genauigkeit aufzugeben.

Genauigkeit, Kosten je Frage und Latenz je Konfiguration
KonfigurationGenauigkeitUS-Dollar je FrageLatenz
Haiku 4.5 ohne Werkzeuge21,18 %0,000692,1 s
Haiku 4.5 mit CovaSyn-MCP85,38 %0,007815,8 s
Opus 4.7 ohne Werkzeuge40,75 %0,025295,1 s
Opus 4.7 mit CovaSyn-MCP91,51 %0,125367,4 s
GPT-5.5 ohne Werkzeuge22,29 %0,027507,9 s
GPT-5.5 mit CovaSyn-MCP89,92 %0,030059,4 s
Gemini 3.5 Flash ohne Werkzeuge13,68 %0,009405,5 s
Gemini 3.5 Flash mit CovaSyn-MCP75,66 %0,0217010,8 s

Die Aussage in einem Satz

Haiku 4.5 mit CovaSyn erreicht mehr als die doppelte Genauigkeit von Opus 4.7 ohne Werkzeuge bei rund einem Drittel der Kosten und ist rund 16-mal günstiger als Opus 4.7 mit CovaSyn bei 6 Prozentpunkten weniger Genauigkeit. Gemini 3.5 Flash mit CovaSyn zeigt den größten relativen Zugewinn (5,53fach, von 13,7 auf 75,7 %) bei rund 2,3fachen Grundkosten und doppelter Latenz; es liegt nahe, wenn Gemini bei Ihnen bereits im Einsatz ist.

Bei zehntausend Fragen im Monat kostet Opus 4.7 mit CovaSyn rund 1.250 US-Dollar, Haiku 4.5 mit CovaSyn rund 78 US-Dollar und Gemini 3.5 Flash mit CovaSyn rund 217 US-Dollar.

Kosten und GenauigkeitUS-Dollar je Frage
Modell alleinMit CovaSyn-MCP02550751000,0010,010,1US-Dollar je Frage (logarithmisch)Genauigkeit in %2,1× Genauigkeitzu 31 % der KostenHaiku 4.5, allein: 21,18 %, 0,00069 USDHaiku 4.5, mit CovaSyn: 85,38 %, 0,00781 USDHaiku 4.5Haiku 4.5Opus 4.7, allein: 40,75 %, 0,02529 USDOpus 4.7, mit CovaSyn: 91,51 %, 0,12536 USDOpus 4.7Opus 4.7GPT-5.5, allein: 22,29 %, 0,02750 USDGPT-5.5, mit CovaSyn: 89,92 %, 0,03005 USDGPT-5.5GPT-5.5Gemini 3.5 Flash, allein: 13,68 %, 0,00940 USDGemini 3.5 Flash, mit CovaSyn: 75,66 %, 0,02170 USDGemini 3.5 FlashGemini 3.5 Flash
Oben links ist gut: hohe Genauigkeit bei niedrigen Kosten. Jede Linie verbindet dasselbe Modell ohne und mit CovaSyn. Gestrichelt: Haiku 4.5 mit CovaSyn gegen Opus 4.7 allein.

Kategorien

Wo die Anbindung am stärksten wirkt.

Mittlerer Zugewinn je Fragekategorie, gemittelt über Haiku 4.5, Opus 4.7 und GPT-5.5. Für Gemini 3.5 Flash liegen im aktuellen Snapshot keine Werte je Kategorie vor.

Mittlere Genauigkeit je Fragekategorie ohne und mit CovaSyn-MCP
KategorieOhne WerkzeugeMit CovaSyn-MCPDifferenz (Prozentpunkte)
Gerüst und Fragmente18,0 %86,5 %+68,4
Ringe und Topologie29,4 %93,2 %+63,8
Bindungen und Ketten17,6 %80,9 %+63,3
Fragen mit mehreren Merkmalen27,3 %88,4 %+61,1
Atom- und Formelzählungen38,7 %98,3 %+59,7
Stereochemie28,7 %86,0 %+57,4
Elektronische Eigenschaften und H-Brücken31,2 %81,5 %+50,3

Das sind die Bausteine der täglichen medizinalchemischen Arbeit. Ein Molekülgerüst muss exakt bestimmt sein, eine Ringanalyse darf nicht ins Raten kippen, eine Mehrfachbedingung wie „alle Verzweigungspunkte innerhalb zweier Bindungen zu einem Halogen“ muss exakt aufgelöst werden.

Zugewinn je KategorieMittel über drei Modelle
Modell alleinMit CovaSyn-MCP0 %25 %50 %75 %100 %Gerüst und Fragmente+68,4 Pp.Gerüst und Fragmente, Modell allein: 18,00 %Gerüst und Fragmente, mit CovaSyn-MCP: 86,50 %18,0 %86,5 %Ringe und Topologie+63,8 Pp.Ringe und Topologie, Modell allein: 29,40 %Ringe und Topologie, mit CovaSyn-MCP: 93,20 %29,4 %93,2 %Bindungen und Ketten+63,3 Pp.Bindungen und Ketten, Modell allein: 17,60 %Bindungen und Ketten, mit CovaSyn-MCP: 80,90 %17,6 %80,9 %Fragen mit mehreren Merkmalen+61,1 Pp.Fragen mit mehreren Merkmalen, Modell allein: 27,30 %Fragen mit mehreren Merkmalen, mit CovaSyn-MCP: 88,40 %27,3 %88,4 %Atom- und Formelzählungen+59,7 Pp.Atom- und Formelzählungen, Modell allein: 38,70 %Atom- und Formelzählungen, mit CovaSyn-MCP: 98,30 %38,7 %98,3 %Stereochemie+57,4 Pp.Stereochemie, Modell allein: 28,70 %Stereochemie, mit CovaSyn-MCP: 86,00 %28,7 %86,0 %Elektronische Eigenschaften und H-Brücken+50,3 Pp.Elektronische Eigenschaften und H-Brücken, Modell allein: 31,20 %Elektronische Eigenschaften und H-Brücken, mit CovaSyn-MCP: 81,50 %31,2 %81,5 %
Gemittelt über Haiku 4.5, Opus 4.7 und GPT-5.5, sortiert nach dem Zugewinn.

Grenzen

Wo die verbleibende Lücke sitzt.

Die Trefferquote liegt nicht bei 100 %, und das verschweigen wir nicht. Jede falsche Antwort mit CovaSyn-MCP haben wir einer von drei Ursachen zugeordnet. So setzen sich die Fehlantworten je Modell zusammen, und hier lohnt es sich, bei Ihrer eigenen Validierung genauer hinzusehen.

FehlantwortenAnteil je Ursache
Jeder Balken = alle Fehlantworten eines Modells mit CovaSyn (100 %). Die Fehleranalyse ist eine eigene Klassifizierung mit eigener Zählbasis; für die Trefferquote gilt die Tabelle oben.
Zusammensetzung der Fehlantworten mit CovaSyn-MCP je Modell, Anteil an allen Fehlantworten
UrsacheHaiku 4.5Opus 4.7GPT-5.5Gemini 3.5 Flash
Werkzeugergebnis übergangen81 %86 %66 %25 %
Formatfehler1 %1 %25 %73 %
Werkzeugwert passt nicht18 %13 %9 %3 %
Werkzeugergebnis übergangen
Das Modell übergeht ein korrektes Werkzeugergebnis und antwortet selbst. Das Verhalten hängt am Modell, nicht am Werkzeug. Eine klarere Prompt-Struktur senkt den Anteil deutlich, beseitigt ihn aber nicht vollständig.
Werkzeugwert passt nicht
Der Wert des Werkzeugs passt nicht zur Frage. Das sind echte Fehler im Ablauf, meist Grenzfälle bei komplexer Stereochemie oder ungewöhnlichen Strukturen. Diese Fälle bearbeiten wir laufend.
Formatfehler
Die Ausgabe des Modells lässt sich nicht auslesen. Diese Klasse ist technisch leicht abzufangen, weil sie bei einer Prüfung der Ausgabe sofort auffällt.

Höchstens 18 % der Fehlantworten eines Modells gehen auf einen unpassenden Werkzeugwert zurück. Der Rest entsteht beim Modell: Es übergeht ein korrektes Ergebnis oder liefert eine Ausgabe, die sich nicht auslesen lässt. Beides lässt sich im Ablauf abfangen.

Folgen

Was das für Forschung und Entwicklung bedeutet.

Das Modell ist nicht mehr automatisch der Engpass.
Wer heute pro Chemie-Anfrage rund 0,03 US-Dollar zahlt, kommt mit gleicher oder besserer Genauigkeit auf rund 0,008 US-Dollar. Das verändert die Kostenrechnung medizinalchemischer Abläufe spürbar.
Der Zugewinn ist modellunabhängig.
Wer eine MCP-Schicht aufbaut, ist nicht an Anthropic, OpenAI oder Google gebunden. Kommt das nächste Frontier-Modell, lässt es sich direkt anbinden, und der Effekt überträgt sich.
Die Lücke ist offengelegt.
Für die Validierung in regulierten Umgebungen ist eine offene Fehlerverteilung mehr wert als ein glattes Versprechen. Ihr QA-Team kann aus den Fehlerklassen direkt Risikobewertung und Akzeptanzkriterien ableiten.

FAQ

Häufige Fragen

Was ist der MolecularIQ-Benchmark?

Ein 2026 vom Klambauer Lab, Institut für Machine Learning, JKU Linz veröffentlichter Benchmark (arXiv:2601.15279), der misst, wie gut Sprachmodelle strukturierte chemische Analysen lösen. 3.540 Aufgaben im ausgewerteten Test-Split, symbolische Verifikation ohne Sprachmodell als Richter.

Warum steigt die Genauigkeit mit CovaSyn-MCP so stark?

Sprachmodelle raten bei strukturellen Chemie-Aufgaben wie Atomzählungen oder der Extraktion von Gerüsten oft, weil ihnen ein deterministischer Mechanismus fehlt. CovaSyn liefert per Werkzeugaufruf exakte Werte aus cheminformatischen Bibliotheken, die das Modell in seine Antwort übernimmt.

Wie kann Haiku 4.5 mit CovaSyn günstiger sein als Opus 4.7 ohne?

Haiku 4.5 ist das deutlich kleinere Modell: In dieser Messung kostete eine Frage ohne Werkzeuge rund 0,0007 US-Dollar, bei Opus 4.7 rund 0,025. Die Werkzeugaufrufe heben Haiku auf rund 0,008 US-Dollar je Frage, also etwa ein Drittel von Opus 4.7 ohne Werkzeuge. Weil die MCP-Schicht die strukturelle Korrektheit liefert, bleiben dem kleinen Modell Formulierung und Schlussfolgerung. Ergebnis: rund 85 statt 41 % Genauigkeit.

Lässt sich das Ergebnis nachrechnen?

Ja. Der Datensatz liegt öffentlich auf Hugging Face, der Auswertungscode auf GitHub, die Modelle sind über ihre offiziellen Schnittstellen erreichbar, und einen CovaSyn-MCP-Zugang legen Sie kostenlos an.

Warum hat Gemini 3.5 Flash den niedrigsten Wert, aber den größten Zugewinn?

Gemini 3.5 Flash startet mit 13,68 % am niedrigsten der vier Modelle, weil es auf Geschwindigkeit und Kosten ausgelegt ist, nicht auf strukturelle Chemie. Genau deshalb ist der relative Zugewinn mit dem Faktor 5,53 am größten: die MCP-Schicht liefert die strukturelle Korrektheit, die dem Modell allein fehlt. Mit 0,02170 US-Dollar je Frage schlägt Gemini mit CovaSyn Opus 4.7 ohne Werkzeuge um mehr als 30 Prozentpunkte, bei deutlich niedrigeren Kosten als Opus 4.7 mit CovaSyn.

Was ist mit den übrigen CovaSyn-Werkzeugen?

Die Zahlen auf dieser Seite stammen aus einem Teil unserer Werkzeuge. Die übrigen messen wir an passenden Datensätzen. Sobald Ergebnisse vorliegen, stehen sie auf dieser Seite, mit voller Methodik und voller Verteilung.

Siegel der Bescheinigungsstelle Forschungszulage, Forschung und Entwicklung 2026

Forschung und Entwicklung

Die Entwicklung der CovaSyn-MCP-Plattform ist von der Bescheinigungsstelle Forschungszulage (BSFZ) als Forschung und Entwicklung im Sinne des Forschungszulagengesetzes bescheinigt.

Die Bescheinigung bewertet den Forschungscharakter der Entwicklungsarbeit. Sie ist keine Aussage über Produkteigenschaften und keine staatliche Produktzulassung. Bescheinigungsstelle Forschungszulage.

Sicherheit und Datenschutz

Nächster Schritt

Messen Sie selbst nach.

Die Werkzeuge hinter diesen Zahlen testen Sie kostenlos am eigenen Molekül.

Konto anlegen, API-Schlüssel holen, die Tools in Claude, ChatGPT oder Cursor nutzen.

Benchmark und Methodik | CovaSyn