
Worum es geht
Am 19. Mai 2026 sind in Nature drei Arbeiten zeitgleich erschienen, die in der Summe einen Trendwechsel markieren: KI-Systeme arbeiten in der wissenschaftlichen Entdeckung jetzt durchgehend, nicht nur assistierend. Hypothesen, Experimentdesign, Code-Optimierung, alles automatisierbar. Drei Architekturen, drei Bereiche, ein gemeinsames Muster.
Was diesem Muster fehlt, ist eine deterministische Schicht, die unten arbeitet. Ohne sie bleibt jeder dieser Agenten an menschlicher Kontrolle hängen, sobald es um regulatorisch relevante Berechnung geht. Genau dafür gibt es das Model Context Protocol, und genau dort positionieren wir CovaSyn.
Die drei Arbeiten im Schnelldurchlauf
Robin (FutureHouse).
Ein Multi-Agent-System, das aus der reinen Eingabe „dry age-related macular degeneration“ eine Therapie-Hypothese formuliert (Verstärkung der RPE-Phagozytose), in 30 Minuten im Schnitt 551 Publikationen auswertet, einen bekannten Glaukom-Wirkstoff (Ripasudil) als Kandidaten benennt und im RNA-seq-Follow-up ABCA1 als möglichen neuen mechanistischen Treiber identifiziert. Berichtete Effektgröße: 1,89-fache Steigerung der Phagozytose in primären humanen RPE-Stammzellen. DOI: 10.1038/s41586-026-10652-y.
Co-Scientist (Google DeepMind).
Gemini-basiertes Multi-Agent-System mit Self-Play-Turnier zur Hypothesen-Generation und -Bewertung. Drei biomedizinische Validierungen in Nature: KIRA6 als AML-Kandidat mit einem 18-fachen Selektivitätsfenster (primitive AML-Zellen gegenüber Lymphoblastoid-Kontrollen), Vorinostat als anti-fibrotisch im humanen Leberorganoid, und unabhängige Re-Entdeckung eines unpublizierten Befunds zu bakteriellem Gentransfer bei AMR, in zwei Tagen Rechenzeit. DOI: 10.1038/s41586-026-10644-y.
ERA (Google DeepMind).
LLM-getriebene Baumsuche, die wissenschaftliche Software iterativ gegen eine Qualitätsmetrik umschreibt. Ergebnisse: 40 Methoden, die den bisherigen Stand der Technik bei scRNA-seq-Batch-Integration auf dem OpenProblems-Benchmark schlagen; 14 Modelle, die die CDC-CovidHub-Ensembles für COVID-19-Hospitalisierung in der Saison 2024 / 25 quer durch 52 US-Jurisdiktionen schlagen; Leistung auf Expertenniveau bei der Geo-Segmentierung und der Vorhersage neuronaler Aktivität. DOI: 10.1038/s41586-026-10658-6.
Die drei Studien teilen eine offene Stelle, die in jeder der Arbeiten unter „Limitations“ oder „Discussion“ landet: Die Arbeit im Nasslabor, die Validierung und die finale regulatorische Bewertung bleiben beim Menschen. Robins Leistung bei unbeaufsichtigten Bioinformatik-Aufgaben fällt laut Studie auf 15 Prozent. Co-Scientist braucht menschliche Experten bei der Kandidaten-Auswahl. Alle drei sind explizit als „alongside human scientists“ konzipiert.
> Wo es im Markt klemmt: Im Benchling Biotech AI Report 2026 (n = 100 KI-Verantwortliche) nennen 55 Prozent „schlechte Datenqualität“ als Hauptgrund, warum KI-Pilotprojekte nicht in Produktion gehen. Die Nature-Arbeiten zeigen die obere Schicht (Hypothesen, Design); der Benchling-Report zeigt, dass es unten klemmt. Genau in dieser Lücke sitzt die deterministische Tool-Schicht.
Warum das die MCP-Frage stellt
Schaut man auf die Architekturen, sind alle drei Systeme im Kern LLM-Agenten mit Werkzeugen. Robin hat eine Literaturrecherche-Pipeline; Co-Scientist hat Kritikschleifen für Hypothesen; ERA hat einen Code-Editor mit Benchmark-Auswertung. Sobald aber eine chemische, spektroskopische oder regulatorisch relevante Frage kommt, gehen die Antworten an einen Menschen oder an ein Ad-hoc-Skript.
Genau für diese Bruchstelle gibt es seit Ende 2024 einen offenen Standard, das Model Context Protocol. Ein MCP-Server bietet einem KI-Agenten geprüfte Werkzeugaufrufe über eine einheitliche Schnittstelle. Statt dass der Agent def predict_logp(smiles) aus einem Skript ohne Spezifikation aufruft, ruft er das MCP-Tool covabasic_druglikeness auf, versioniert, mit Audit-Trail und mit definiertem Vertrag über Eingabe und Ausgabe.
Für die drei Nature-Architekturen heißt das: Wenn Robin in der nächsten Iteration nicht nur Ripasudil benennen, sondern auch dessen ICH-M7-Profil prüfen soll, ist das ein MCP-Tool-Aufruf. Wenn Co-Scientist KIRA6 als AML-Kandidat vorschlägt, ist die Selektivitäts-Berechnung gegen Off-Targets ein MCP-Tool-Aufruf. Wenn ERA eine Methode für Batch-Integration optimiert, ist die Validierung gegen einen Referenzdatensatz an Spektren ein MCP-Tool-Aufruf. In allen drei Fällen ist die Tool-Antwort deterministisch, reproduzierbar und auditierbar, also genau das, was eine LLM-Hypothese braucht, um über den Status „interessant“ hinauszukommen.
Wie CovaSyn in diesen Stack passt
CovaSyn liefert für die Pharma- / Biotech- / Chemie-Domäne eine MCP-Schicht mit Werkzeugen für Cheminformatik, Toxikologie, Massenspektrometrie, NMR, Stabilität, Bio, DoE und Optimierung. Drei konkrete Andock-Punkte für KI-Wissenschaftler-Systeme:
- Hypothesen-Validierung. Wenn der Agent „Wirkstoff X für Indikation Y“ vorschlägt, gibt ein einziger CovaSyn-Tool-Call (
covatox_assess_ichm7_batch) eine deterministische mutagene-Verunreinigungs-Triage zurück, dieselbe Ausgabe, die ein menschlicher Bewerter erstellen würde, aber in Sekunden statt Stunden. - Randbedingungen für das Experimentdesign. Stabilitätsstudien folgen ICH Q1A / Q1E. Ein Co-Scientist-Loop, der
covastab_design_studyaufruft, bekommt ein protokollkonformes Stress-Schema zurück, statt ein generisches Schema halluzinieren zu müssen. - Reproduzierbarkeit für regulatorische Einreichungen. Die Tools sind versionsfest, Audit-Logs greifbar; das ist genau das, was eine Einreichung bei FDA oder EMA braucht und was eine generische Python-Funktion in einem Notebook nicht liefert.
Wir haben das im Vorfeld auf MolecularIQ gemessen (MolecularIQ-Benchmark-Post): vier Frontier-LLMs (Haiku 4.5, Opus 4.7, GPT-5.5, Gemini 3.5 Flash) steigen von 14 bis 41 % ohne Werkzeuge auf 76 bis 92 % Genauigkeit, sobald CovaSyn-MCP eingebunden ist; drei der vier landen bei 85 bis 92 %, das ohne Werkzeuge schwächste Modell (Gemini 3.5 Flash) bei 76 %. Die Hebelwirkung ist nicht modellspezifisch, sondern strukturell: deterministische Tools schließen die Lücke, die LLM-Halluzination offen lässt.
Was sich aus den Arbeiten für die Praxis ergibt
Wer heute einen KI-Agenten für die pharmazeutische F&E aufbaut, kann sich an dem orientieren, was die Arbeiten offen lassen:
1. Trenne Hypothesengeneration von Validierung. Die LLM-Schicht generiert Kandidaten; die deterministische Schicht qualifiziert sie. Robin / Co-Scientist machen genau das, nur dass die deterministische Schicht bei beiden ad-hoc gebaut wurde. 2. Mach die Validierungs-Schicht aus Standardbausteinen. Selbst gebaute Adapter sind keine Hilfe, wenn der Agent in sechs Monaten den nächsten Tool-Aufruf braucht. MCP ist der Standard, an den Anthropic, OpenAI und große Open-Source-Projekte 2025 angedockt haben. 3. Plan den Audit-Trail von Anfang an mit. Wenn der Agent jemals in eine GxP-Pipeline einlaufen soll, muss jede Tool-Antwort versionsfest und reproduzierbar sein. CovaSyn macht das standardmäßig; wer es selbst baut, muss es sich selbst draufschreiben.
Was wir konkret anbieten
Wenn Sie an einem solchen Stack arbeiten, egal ob inhouse, akademisch oder im CDMO-Kontext, gibt es drei sinnvolle Berührungspunkte mit CovaSyn:
- Kostenloser Zugang zum Ausprobieren: der volle Werkzeugumfang, MCP-Endpunkt direkt anbindbar an Claude Desktop, Cursor, VS Code oder Ihren eigenen Agenten. Anlegen auf workspace.covasyn.com.
- Benchmark-Bericht zum Vergleich auf /de/benchmark; wenn Sie den Zugewinn in Ihrem Stack reproduzieren wollen, ist die Methodik dokumentiert.
- Selbst gehostete Variante für regulierte Umgebungen, in denen externes Cloud-Hosting nicht in Frage kommt, Details zur MCP-Lösung für Drug Discovery.
Quellen
- Robin: A multi-agent system for automating scientific discovery, FutureHouse / Edison Scientific. *Nature*, 19. Mai 2026. DOI: 10.1038/s41586-026-10652-y.
- Co-Scientist, Google DeepMind. *Nature*, 19. Mai 2026. DOI: 10.1038/s41586-026-10644-y.
- ERA, Google DeepMind. *Nature*, 19. Mai 2026. DOI: 10.1038/s41586-026-10658-6.
- Vergleichende Zusammenfassung der drei Arbeiten: LinkedIn-Post von Suk H., 19. Mai 2026.
- Benchling Biotech AI Report 2026 (n=100): LinkedIn-Announcement.
- CovaSyn-Benchmark auf MolecularIQ (arXiv:2601.15279): /de/blog/iclr-2026-molecular-iq-benchmark.
