Zum Inhalt springen
CovaSyn

Benchmark

14 % → 92 %: Wie CovaSyn auf dem MolecularIQ-Chemie-Benchmark abschneidet

Die Arbeitsgruppe von Klambauer (JKU Linz) hat einen Benchmark für molekulares Schlussfolgern entwickelt, der Chemie symbolisch überprüft statt mit LLM-Richtern. Vier Frontier-LLMs erreichen darauf 14 bis 41 Prozent. Mit CovaSyn-MCP-Anbindung springen dieselben Modelle auf 76 bis 92 Prozent, drei davon über 85. Vier Modelle, 12.540 ausgewertete Modellantworten, vollständige Zahlen einschließlich der Lücken.

CovaSyn-Team9 Min. Lesezeit

Alle Artikel
14 % → 92 %: Wie CovaSyn auf dem MolecularIQ-Chemie-Benchmark abschneidet

Was uns interessiert hat

Wir wollten wissen, wie weit ein modernes Frontier-LLM in der Chemie wirklich kommt, wenn es allein arbeitet, und wie viel sich davon mit einer passenden MCP-Anbindung ändert. Atome zählen, Ringe identifizieren, Stereozentren bestimmen, Scaffolds extrahieren: das sind Aufgaben, an denen sich gut zeigt, ob ein Modell rechnet oder rät.

Statt einen eigenen Benchmark zu bauen, haben wir einen unabhängigen verwendet.

Der Benchmark

MolecularIQ stammt aus dem Institut für Machine Learning der JKU Linz (Bartmann, Schimunek, Ielanskyi, Seidl, Klambauer, Luukkonen; arXiv:2601.15279). Wir haben den Test-Split mit 3.540 Aufgaben verwendet, eingegrenzt auf die Fragetypen, die symbolisch verifizierbar sind. Die 12.540 ausgewerteten Modellantworten sind keine Aufgabenzahl: Haiku 4.5 hat alle 3.540 Aufgaben beantwortet, die übrigen drei Modelle je eine Stichprobe von 910, und jede Aufgabe einmal ohne und einmal mit CovaSyn-MCP. Die Bewertung erfolgt ohne LLM-Richter: Nur eine vollständige Übereinstimmung mit der Referenzlösung ergibt einen Treffer.

Die Zahlen

Vier Frontier-Modelle, jeweils mit und ohne CovaSyn-MCP-Anbindung:

ModellOhne MCP+ CovaSyn MCPFaktor
Claude Haiku 4.521,18 %85,38 %4,03×
Claude Opus 4.740,75 %91,51 %2,25×
OpenAI GPT-5.522,29 %89,92 %4,03×
Gemini 3.5 Flash13,68 %75,66 %5,53×

Vier Modelle, drei Anbieter, gleiche Richtung. Drei der vier Konfigurationen landen bei 85 bis 92 Prozent, das ohne Werkzeuge schwächste Modell (Gemini 3.5 Flash) bei 76 Prozent, trotzdem eine 5,5-fache Steigerung gegenüber dem eigenen Ausgangswert. Über alle vier zusammen ergibt das einen Sprung von 14 bis 41 Prozent auf 76 bis 92 Prozent. Gemini 3.5 Flash startet am niedrigsten und macht den relativ größten Sprung, weil das schwächste Modell am stärksten von der strukturellen Verifikation profitiert.

Was das in Kosten heißt

Kosten pro Frage, gleicher Snapshot:

  • Opus 4.7 ohne MCP: 40,75 % bei 0,02529 USD pro Frage
  • Opus 4.7 mit MCP: 91,51 % bei 0,12536 USD pro Frage
  • Haiku 4.5 mit MCP: 85,38 % bei 0,00781 USD pro Frage
  • Gemini 3.5 Flash mit MCP: 75,66 % bei 0,02170 USD pro Frage (ohne MCP: 0,00940 USD)

Die spannende Zeile ist Haiku. Haiku mit MCP erreicht mehr als die doppelte Genauigkeit von Opus ohne MCP, bei rund einem Drittel der Kosten. Verglichen mit Opus plus MCP fallen die Kosten auf rund ein Sechzehntel, die Genauigkeit nur um sechs Prozentpunkte. Gemini mit MCP zeigt mit 5,53× die größte relative Steigerung und übertrifft Opus ohne MCP um über 30 Prozentpunkte bei rund 86 % von dessen Kosten; die richtige Option für Teams, die Gemini bereits einsetzen.

Wo der Effekt am größten ist

Gemittelt über Claude Haiku 4.5, Claude Opus 4.7 und OpenAI GPT-5.5 und gruppiert nach sieben Fragekategorien:

  • Gerüst und Fragmente: 18,0 % → 86,5 %
  • Ringe und Topologie: 29,4 % → 93,2 %
  • Bindungen und Ketten: 17,6 % → 80,9 %
  • Fragen mit mehreren Merkmalen: 27,3 % → 88,4 %
  • Atom- und Formelzählungen: 38,7 % → 98,3 %
  • Stereochemie: 28,7 % → 86,0 %
  • Elektronische Eigenschaften und H-Brücken: 31,2 % → 81,5 %

Das sind genau die Bausteine, die in der Medizinalchemie täglich gebraucht werden. Auf einem nennenswerten Teil der Teilaufgaben erreicht die Gemini-Konfiguration sogar eine Trefferquote von 100 Prozent, was ohne Tools nicht passiert.

Was noch nicht 100 Prozent ist

Ein Teil der Modell-Antworten bleibt falsch, obwohl das Tool den richtigen Wert geliefert hat. Das Modell ignoriert oder überschreibt das Ergebnis. Ein kleinerer Teil sind Formatprobleme oder Tool-Werte, die nicht passen. Die Verteilung zeigen wir auf covasyn.com/benchmark. Wir publizieren das, weil eine ehrliche Lücke besser ist als ein blank poliertes Marketingversprechen.

Was das praktisch bedeutet

Die Modellkosten sind nicht mehr automatisch der Engpass. Wer 0,03 USD pro Frage zahlt, kann bei vergleichbarer oder besserer Genauigkeit auf 0,008 USD pro Frage heruntergehen. Die Steigerung selbst ist modellunabhängig und überträgt sich daher auf das jeweils nächste Frontier-Modell.

Für regulierte Pharma- und CDMO-Workflows ist das relevant, weil sich der Validierungsaufwand an reproduzierbaren Zahlen orientiert. Genau die haben wir publiziert.

Wie es weitergeht

Weitere CovaSyn-Module testen wir gerade an passenden Datensätzen. Sobald die Zahlen vorliegen, kommen sie im gleichen Format auf covasyn.com/benchmark. Methodik, Lücken, alles.

Im kostenlosen Zugang können Sie selbst nachvollziehen, wie sich die Anbindung anfühlt: Konto anlegen, API-Schlüssel erzeugen, mit dem eigenen Agenten verbinden.

Quelle

Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279. Code: github.com/ml-jku/moleculariq. Dataset: huggingface.co/datasets/ml-jku/moleculariq-v0.0. Datenstand: 17.05.2026.

Nächster Schritt

Nachrechnen statt schätzen.

Konto anlegen, API-Schlüssel holen, die Tools in Claude, ChatGPT oder Cursor nutzen.

14 % → 92 %: Wie CovaSyn auf dem MolecularIQ-Chemie-Benchmark abschneidet | CovaSyn