Zum Inhalt springen
CovaSyn

KI für Chemie

KI für Chemie und Drug Discovery, die deterministische Tool-Schicht.

Frontier-LLMs erreichen bei reinen Chemie-Aufgaben 14 bis 41 %. Mit deterministischer MCP-Tool-Anbindung 76 bis 92 %, gemessen auf MolecularIQ, einem unabhängigen Benchmark (arXiv:2601.15279). Diese Seite erklärt, wo KI für Chemie heute wirklich funktioniert, wo nicht, und wie das Model Context Protocol (MCP) die Lücke schließt.

Was „KI für Chemie“ 2026 wirklich heißt

Der Begriff wird locker verwendet. Drei sehr verschiedene Dinge stecken dahinter, die man nicht verwechseln darf:

  • KI-Agenten mit Chemie-Tools. Ein LLM wie Claude, GPT oder Gemini ruft über eine Standard-Schnittstelle deterministische Chemie-Funktionen auf. Das ist der Stack, der 2025/26 produktiv wurde. Mehr dazu unten, und konkret auf der MCP-Plattformseite.
  • LLMs, die selbst Chemie „rechnen“. Man fragt ein LLM ohne Tools nach logP, pKa oder einer ICH-M7-Triage. Das funktioniert für intuitive Antworten und scheitert reproduzierbar bei harten numerischen oder kategorialen Fragen. Auf MolecularIQ, dem Benchmark des Klambauer Lab der JKU Linz (arXiv:2601.15279), landen in unserer Auswertung vier Frontier-Modelle bei 14 bis 41 %.
  • Spezial-Modelle für Chemie (Foundation Models, feinabgestimmte LLMs). AlphaFold und RoseTTAFold für Proteinstrukturen, BioGPT für biomedizinische Texte, ChemLLM als Sprachmodell für Chemie. Stark in eng definierten Bereichen, aber kein durchgehender Forschungs-Stack. Wer „KI für Chemie“ einsetzen will, kombiniert diese Spezialmodelle als Tools, nicht als alleinige Antwortgeber.

Die Architektur, die 2026 funktioniert, ist LLM-Agent plus deterministische Tool-Schicht. Das LLM versteht die Frage und plant die Schritte. Die Tool-Schicht rechnet. Beide sind getrennt. Dafür hat Anthropic 2024 das Model Context Protocol (MCP) als offenen Standard veröffentlicht.

Drei Probleme, die KI allein in der Chemie nicht löst

  • Halluzination im Werteraum

    Das LLM erfindet plausible, aber falsche Zahlen: logP 2,3 statt 4,1, pKa „etwa 5“ statt 5,23. In einer Einreichung ist so ein Wert nicht haltbar.

  • Fehlender Audit-Trail

    Antworten ohne Reproduzierbarkeit lassen sich im Umfeld von EU-GMP Annex 11 und 21 CFR Part 11 nicht belegen. Pilotprojekte scheitern damit spätestens im QA-Audit.

  • Inkonsistenz zwischen Durchläufen

    Selbst bei Temperatur 0 kann ein LLM bei Wiederholung abweichende Antworten geben. Ein Validierungsprotokoll lässt sich so nicht abschließen.

Mehr zu den drei Fehlerbildern und warum „besseres Datenmanagement“ die falsche Antwort ist: Datenqualität ist nicht das eigentliche Bottleneck.

Wie MCP für Chemie die Lücke schließt

Das Model Context Protocol ist die standardisierte Schnittstelle zwischen LLM und Tool-Funktion. Ein MCP-Server für Chemie stellt Funktionen wie covatox_assess_ichm7_batch oder covastab_design_study als deterministische Tools mit klar definierter Eingabe und Ausgabe bereit. Das LLM ruft sie auf, bekommt eine reproduzierbare Antwort und kommuniziert sie oder verarbeitet sie weiter.

Drei Konsequenzen für Pharma- und Chemie-Teams

Deterministische Werkzeuge statt LLM-Schätzung
Wenn der Agent ADMET, einen Tox-Endpunkt oder eine Stabilitätsvorhersage braucht, ruft er eine deterministische Funktion auf. Beim tausendsten Aufruf identisch mit dem ersten.
Audit-Trail eingebaut
Jeder Werkzeugaufruf wird mit Zeitpunkt, Werkzeug, Version und Ergebnisstatus protokolliert, die Versionen sind gepinnt. Reproduzierbarkeit ist eine technische Eigenschaft der Schicht.
Standardisierte Schnittstelle
Das Model Context Protocol ist ein offener Standard, den viele Clients unterstützen, darunter Claude, ChatGPT, Cursor und VS Code. Kein Vendor-Lock-in auf Client-Seite.

Hintergrund und technische Details auf der MCP-Plattformseite und im Marktüberblick „Die 5 wichtigsten Chemie-MCP-Server für Pharma R&D im Vergleich“.

Foundation Models und Tool-Layer, zwei Wege für KI in der Chemie

In der Pharma-KI zeichnen sich zwei getrennte Architektur-Lager ab. Wer eine Plattform-Entscheidung trifft, sollte den Unterschied kennen, weil er bestimmt, welche Abläufe reproduzierbar sind und welche nicht.

Lager A

Foundation Models

Ein großes Modell rechnet alles selbst: vom Text-Prompt zur 3D-Struktur, zu Quanteneigenschaften, zur Retrosynthese, in einem durchgehenden Stack. Beispiele: ChemLLM, Nachfolger von AlphaFold, multimodale Pharma-Modelle.

Stark in:
Exploration neuer Wirkstoffklassen, Materialwissenschaft, generative Aufgaben, bei denen Kreativität wichtiger ist als Reproduzierbarkeit.
Schwach in:
Audit-Trail, Reproduzierbarkeit, regulatorische Einreichungen. Gleicher Prompt, zwei Durchläufe, zwei Antworten.

Lager B (hier steht CovaSyn)

LLM plus deterministischer Tool-Layer

Ein Frontier-LLM (Claude, GPT, Gemini) plant und kommuniziert. Eine getrennte deterministische Schicht (CovaSyn-MCP-Tools, RDKit, OpenMS) rechnet. Verbunden über das Model Context Protocol.

Stark in:
Reproduzierbarkeit, Unterstützung der Validierung, Abläufe nach ICH M7 und Q1, regulierte Umgebungen, Kosten im großen Maßstab.
Schwach in:
reine Exploration ohne klare Tool-Verträge. Wenn die Antwort nicht aus einer existierenden Funktion kommt, liefert die Schicht nichts.

Wann welche Architektur

Beide Lager schließen sich nicht aus, sondern decken unterschiedliche Phasen des Lebenszyklus in Forschung und Entwicklung ab:

Frühe Discovery, neue Modalitäten
Foundation Models. Wer im White Space arbeitet, braucht generative Freiheit.
Lead-Optimierung, Tox-Triage, Stabilität, Einreichungen
Tool-Layer-Architektur. Wenn QA und Auditoren mitlesen, braucht es Reproduzierbarkeit.
Reale Pipelines
Beides parallel. Das Foundation Model schlägt einen Kandidaten vor, der Tool-Layer rechnet ihn nach.

CovaSyn ist ausdrücklich die Tool-Layer-Hälfte. Wir konkurrieren nicht mit Anbietern von Foundation Models, wir sind die Schicht darunter, die Vorschläge solcher Modelle in reproduzierbarer Form nachrechnet. Mehr zur konkreten Anwendung auf der MCP-Plattformseite.

Werkzeugbereiche bei CovaSyn

Deterministische Werkzeuge für NMR, MS, IR, UV, Stabilität, Toxikologie, Löslichkeit und mehr, jedes einzeln aufrufbar aus Claude Desktop, Cursor, VS Code oder dem eigenen Agenten-Stack.

  • Cheminformatik (covabasic, covachem)

    SMILES, InChI und MOL, Druglikeness, Fingerprints, Scaffold-Analyse, ADMET, pKa, Tautomere: die Standardschicht für Med-Chem-KI-Abläufe.

  • Toxikologie (covatox)

    ICH-M7-Bewertung in Serie, Tox21-Endpunkte, strukturelle Alerts, CYP450, Ökotoxikologie. Für die regulatorische Triage.

  • Massenspektrometrie (covams)

    Formelvorhersage, Fragment-Annotation, Verunreinigungsprofile, Metaboliten-ID, Retentionszeit-Vorhersage. Auswertung mit deterministischen Backends.

  • NMR (covnmr)

    1D- und 2D-NMR-Auswertung, Vorhersage und Zuordnung, Sudoku-Solver, Verifikation, Identifikation.

  • Stabilität (covastab)

    Arrhenius-Modelle, Haltbarkeitsschätzung nach ICH Q1E, OOS/OOT-Erkennung, Chargenvariabilität.

  • Bio (covabio)

    Antikörper-Profile, Peptide, ADC, mRNA, Oligos, siRNA, Immunogenität, Developability, für Biotech-Abläufe.

  • Faltung und Struktur (covafold, covadock)

    Protein- und RNA-Faltung, Bindestellen, Mutationsanalyse, Docking. Eigene Tool-Schicht, nicht nur ein AlphaFold-Wrapper.

  • DoE und Optimierung (covadoe, covaopt)

    Versuchsplanung mit Anleitung durch den Agenten, Response Surface Modeling, Prozessoptimierung, robuste Bedingungen, für CDMO-Abläufe.

Vollständige Werkzeugliste ansehen

Beweis

Gemessen auf einem unabhängigen Benchmark

Auf MolecularIQ vom Klambauer Lab, Institut für Machine Learning, JKU Linz, 3.540 verifizierte Chemie-Aufgaben (arXiv:2601.15279): vier Frontier-LLMs mit und ohne CovaSyn-MCP-Anbindung.

Ohne CovaSyn
14 bis 41 %
Mit CovaSyn-MCP
76 bis 92 %
ModellOhne CovaSynMit CovaSyn-MCP
Claude Haiku 4.521,2 %85,4 %
Claude Opus 4.740,8 %91,5 %
OpenAI GPT-5.522,3 %89,9 %
Gemini 3.5 Flash13,7 %75,7 %

Bei allen ausgewerteten Modellen liegt die Trefferquote mit CovaSyn über dem besten Wert ohne CovaSyn. Der Zuwachs kommt aus der deterministischen Tool-Schicht, nicht aus dem Modell.

Quelle: Bartmann C., Schimunek J., Ielanskyi M., Seidl P., Klambauer G., Luukkonen S. (2026). MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs. arXiv:2601.15279. Snapshot: 2026-05-17.

Vollständige Methodik, Lücken und Reproduktionsschritte

Reale Abläufe mit KI in der Chemie

  • KI für Drug Discovery

    Der Agent erzeugt Wirkstoffkandidaten, filtert sie mit covachem_adme und covatox_assess_ichm7_batch und übergibt die besten Treffer an das Med-Chem-Team.

  • KI für Stabilitätsstudien

    Der Agent entwirft mit covastab_design_study ein Stressschema nach ICH Q1A, schätzt die Haltbarkeit mit covastab_estimate_shelf und gleicht sie mit Realdaten ab.

  • KI für die Mutagenitäts-Triage nach ICH M7

    Der Agent prüft eine Bibliothek von Verunreinigungen mit covatox_assess_ichm7_batch, ordnet sie den Klassen 1 bis 5 zu und liefert je Substanz eine auditierbare Begründung. Die Prüfung durch Fachleute bleibt.

  • KI für die Spektrometrie-Auswertung

    Ein Massenspektrum kommt herein, der Agent ruft covams_identify und covams_fragment_annotate auf und gibt eine strukturierte Identifikation mit Konfidenzwert zurück. NMR analog mit covnmr_identify.

Für wen das gebaut ist

  • Pharma-Teams in Forschung und Entwicklung

    Med-Chem, ADMET, regulatorische Triage. Wer ICH M7, Q1 und Annex 11 schon kennt, kennt unser Vokabular.

  • Biologika-Teams

    Antikörper, mRNA, ADCs, Oligos. Bio-Werkzeuge mit Developability, Immunogenität, Viskosität.

  • CDMOs und Auftragsforschung

    Zeitkritische Abläufe vom Angebot bis zur Freigabe, in denen Standardrechnungen nicht auf eine Warteschlange warten sollen.

  • KI-Engineering-Teams in der Pharmaindustrie

    Wer ein eigenes Claude-Deployment oder einen Agenten-Stack betreibt und einen Chemie-MCP-Server einklinken will, ohne ihn selbst zu bauen.

Häufige Fragen zu KI für Chemie und Drug Discovery

Was ist der beste KI-Stack für Chemie 2026?

Ein Frontier-LLM (Claude, GPT, Gemini) mit einer deterministischen MCP-Chemie-Tool-Schicht darunter. Das LLM versteht und plant, die MCP-Tools rechnen. Auf MolecularIQ (arXiv:2601.15279), einem fremden Benchmark, liegen LLMs ohne Werkzeuge bei 14 bis 41 %, mit CovaSyn-MCP bei 76 bis 92 %.

Was ist der Unterschied zwischen einem LLM für Chemie und einem KI-Agenten für Chemie?

Ein LLM für Chemie erzeugt Text (auch Zahlen) auf Basis seiner Trainingsdaten, es rechnet nicht, es erinnert sich. Ein KI-Agent für Chemie nutzt ein LLM als Sprach- und Planungsschicht und ruft daneben deterministische Tools auf, die die eigentliche Berechnung machen. Letzteres ist reproduzierbar und auditierbar, ersteres nicht.

Wie unterscheidet sich KI für Drug Discovery von klassischer Cheminformatik?

Klassische Cheminformatik ist eine deterministische Funktion mit klar definierter Eingabe und Ausgabe (RDKit, Open Babel, OpenMS). KI für Drug Discovery legt einen KI-Agenten obendrauf, der Abläufe orchestriert, Daten interpretiert und mit dem Menschen kommuniziert. Beide brauchen einander: die deterministische Schicht sorgt für reproduzierbare Rechenergebnisse, der Agent macht die Bedienung natürlich.

Kann ich Claude oder GPT direkt für die ICH-M7-Triage verwenden?

Ohne Tool-Anbindung nicht für regulatorische Einreichungen: die Antworten sind weder reproduzierbar noch nachvollziehbar belegt. Mit einem deterministischen QSAR-Backend über MCP (etwa CovaSyn covatox_assess_ichm7_batch) sind die Antworten reproduzierbar und auditierbar; die Bewertung durch Fachleute bleibt.

Welche Datenhaltung braucht KI für Chemie in der EU-Pharma?

Die DSGVO schreibt keinen Speicherort vor, verlangt aber für Übermittlungen in Drittländer eigene Garantien. Viele Pharmaunternehmen bevorzugen deshalb eine Datenhaltung in der EU, und viele IT-Sicherheitsabteilungen fordern einen Betrieb auf eigener Infrastruktur. CovaSyn bietet beides: Hosting bei Hetzner in Nürnberg und den Betrieb als Container im eigenen Haus.

Was kostet KI für Chemie in der Praxis?

Der Umfang reicht von der Evaluierung einzelner Abläufe bis zum Rollout im Unternehmen mit Betrieb im eigenen Haus. Wir besprechen das individuell im 30-minütigen Erstgespräch (Teams), zugeschnitten auf Ihren Ablauf.

Nächster Schritt

KI in Ihrer Chemie nachprüfbar machen.

Konto anlegen, API-Schlüssel holen, die Tools in Claude, ChatGPT oder Cursor nutzen.

KI für Chemie: die deterministische Tool-Schicht | CovaSyn