Forschende am IES Parquesol haben am 11. Juni 2026 eine Multi-Agenten-Architektur vorgestellt, die spekulative Ausgaben von Large Language Models in testbare wissenschaftliche Hypothesen transformiert. Das Paper (arxiv:2608.19206) kehrt die gängige Perspektive um: Halluzinationen werden nicht unterdrückt, sondern als Ausgangsmaterial für kreative Hypothesengenerierung genutzt.
Das von Nicolas Rodriguez-Alvarez und zwei weiteren Autoren entwickelte System adressiert einen Widerspruch in der aktuellen LLM-Entwicklung. Während moderne Modelle zunehmend darauf ausgerichtet sind, Faktualität zu priorisieren, könnte diese Entwicklung spekulatives Forschungs- und Entwicklungsverhalten einschränken. Die Autoren behandeln dies als "semantische Überanpassung" und "Diversity Collapse".
Epistemological Friction Loop als Kernkonzept
Die Architektur besteht aus fünf Komponenten: einem Problem-Konfigurationsmodul, einem Hypothesen-generierenden Agent, einem Kritiker-Agent, einem semantischen Filter und einem Evaluator. Der Workflow folgt sieben Schritten, beginnend mit der Problemeingabe bis zur Extraktion von Hypothesen im JSON-Format.
Das zentrale Konzept ist eine "epistemologische Reibung": ein iterativer Prozess, in dem spekulative Ideen gegen empirische Kriterien bewertet werden. Der generierende Agent erzeugt spekulative Ideen, während der Kritiker-Agent diese gegen Durchführbarkeit, Spezifität, Nicht-Duplikation und Neuheit prüft. Der semantische Filter durchläuft acht Iterationsrunden, um Redundanz zu reduzieren.
Die experimentellen Läufe nutzten mistral-large-latest als generierenden Agent. Die Orchestrierung, Ablationsbedingungen und Log-Schreiben sind für eine gegebene Konfiguration und einen bestimmten Seed deterministisch, während die LLM-Responses stochastisch bleiben.
Keine allgemeine Überlegenheit gegenüber Selbstreflexion
Die Studie verglich das vollständige System gegen fünf Ablationsbedingungen: Direct Prompting (Baseline), Self-Reflection, Entfernung des semantischen Filters, Entfernung der Web-Suche-Verankerung und Entfernung der "Lateral Lenses".
Die Ergebnisse zeigten keine allgemeine Überlegenheit des vollständigen Systems gegenüber einfacher Selbstreflexion. Direct Prompting rangierte unter den schwächsten Bedingungen bei den meisten gemessenen Metriken. Jede Architektur-Variante verschob das Gleichgewicht zwischen Originalität, Durchführbarkeit, Diversität und empirischer Verankerung unterschiedlich.
Der Hauptvorteil des vollständigen Systems zeigte sich bei Hypothesen, die starke physische, empirische oder institutionelle Constraints überstehen müssen. Die Autoren betonen, dass der Wert von Halluzinationen erst durch Architektur, empirische Verankerung und explizite Bewertung entsteht.
Architektonische Grenzen von Halluzinationen
Die Arbeit fügt sich in einen breiteren Forschungskontext ein. Eine Studie vom September 2025 (arxiv:2509.16297) argumentierte, dass Halluzination kein zufälliger Defekt, sondern eine definierende Grenze von Transformer-basierten Modellen darstellt. Eine Analyse vom April 2026 (arxiv:2606.07537) dokumentierte, dass LLMs mit einer Konsistenz halluzinieren, die über Generationen und Skalierungen hinweg persistiert.
Eine Quelle vom Dezember 2025 erkannte an, dass Halluzination aus denselben extrapolativen Mechanismen stammt, die Generalisierung ermöglichen. Sie kann architektonisch nicht entfernt werden, ohne die Reasoning-Fähigkeit zu reduzieren. Mitigation hängt von Grounding und Inference-Level-Constraints ab.
Der Rodriguez-Alvarez-Ansatz implementiert diese Einsicht: Statt Halluzinationen zu eliminieren, werden sie in ein Constraint-System eingebettet, das über mehrere Agenten-Rollen verteilt ist. Die Studie wurde primär in Rust implementiert und nutzt strukturierte JSON-Logs für Reproduzierbarkeit.
Implikationen für wissenschaftliche Forschung
Die Architektur nutzt eine funktionale Analogie zwischen "narrativem Träumen" (generativ) und "exekutiver Kontrolle" (bewertend), nicht als neurokognitive Aussage, sondern als Architektur-Metapher. Die Initial-Experimente generierten diverse, viabilitäts-bewertete Hypothesen über physische und sozialwissenschaftliche Domänen hinweg.
Die Autoren betonen Reproduzierbarkeit durch deterministische Seed-Kontrolle für Log-Generierung, strukturierte JSON-Output-Formate und publizierte Metrik-Berechnungen aus Experiment-Logs. Das System ist mit/ohne externe Websuche einsetzbar, wobei die empirische Kritik durch den Kritiker-Agent in beiden Modi funktioniert.
