Forschende der Zhejiang University, Hong Kong University of Science and Technology, Tsinghua University und des Tencent Jarvis Lab haben am 19. August 2026 MedUAG vorgestellt, ein Framework zur Vereinheitlichung von Verständnis und Generierung in medizinischen Multimodal-Modellen. Das Projekt umfasst den nach Angaben der Autoren bisher größten Trainingsdatensatz für medizinisches Unified Understanding and Generation (UAG) mit über 6 Millionen Instanzen, einen standardisierten Evaluierungs-Benchmark sowie ein trainiertes Baseline-Modell.

Die Forschungsarbeit ist auf arXiv unter der Nummer 2608.18937 verfügbar. Als Corresponding Authors zeichnen Xian Wu und Zuozhu Liu verantwortlich. Weitere Autoren sind Zijie Meng, Yuncheng Zhang, Hualiang Wang, Yitian Tang, Xiaotang Gai, Chen Shen, Songtao Jiang, Shaosheng Cao und Jian Wu.

Drei Komponenten: Datensatz, Benchmark und Modell

MedUAG besteht aus drei Kernkomponenten. Der Trainingsdatensatz MedUAGCorpus umfasst nach Angaben der Forschenden über 6 Millionen Instanzen und deckt 14 verschiedene Imaging-Modalitäten ab. Der Datensatz wurde für diverse Trainingsaufgaben im UAG-Framework konzipiert.

Der Benchmark MedUAGBench standardisiert die Evaluierung medizinischer Generierungsfähigkeiten über 12 verschiedene Aufgaben hinweg. Laut den Autoren erweitert MedUAGBench die bisherige Evaluierung medizinischer Generierung über bestehende Grenzen hinaus durch einheitliche Protokolle.

Das MedUAG-Modell selbst wurde end-to-end über alle Verständnis- und Generierungsaufgaben hinweg trainiert. Die Forschenden berichten von starker Performance über ein breites Aufgabenspektrum und positionieren das Modell als Baseline für nächstgenerationen-medizinische Multimodal-Systeme.

Problemstellung: Ressourcenlücke bei medizinischem UAG

Die Autoren identifizieren zwei zentrale Defizite bei der Übertragung von UAG-Paradigmen auf medizinische Anwendungen. Trotz der rasanten Entwicklung von Multimodalen Large Language Models (MLLMs) fehlen umfassende, standardisierte Korpora und Benchmarks für den medizinischen Bereich. Zudem existieren bisher wenige validierte medizinische Modelle, die Verständnis und Generierung in einem einheitlichen System kombinieren – die vorhandenen Arbeiten seien durch die beschriebenen Ressourcenlücken limitiert.

MLLMs haben sich laut der Forschungsarbeit von isolierten Verständnis- oder Generierungssystemen zu einheitlichen UAG-Frameworks entwickelt. Diese ermöglichen das Lernen universeller Repräsentationen innerhalb eines einzigen Systems, reduzieren die Abhängigkeit von Task-spezifischem Fine-Tuning und skalieren über heterogene Modalitäten.

Parallele Forschung zu medizinischem Multimodal-Learning

MedUAG reiht sich in eine Serie von Forschungsarbeiten zu medizinischem Multimodal-Learning ein. MedM2G, veröffentlicht am 7. März 2024, war laut der Publikation das erste medizinische generative Modell für einheitliche Medical Multi-Modal Generation und unterstützt Text-zu-Bild, Bild-zu-Text sowie Modalitätengenerierung (CT, MRI, X-Ray) mittels Cross-Guided Diffusion.

UniMedVL, erschienen im Oktober 2025, verfolgt ebenfalls einen vereinheitlichten Ansatz für medizinisches Multimodal-Verständnis und -Generierung durch Observation-Knowledge-Analysis. UniMod, veröffentlicht am 10. August 2026, adressiert Multi-Modal Learning zur medizinischen Diagnose durch Cross-Modality und Within-Modality Alignment. Im Oktober 2025 fand der MEDIQA-WV 2025 Shared Task zu Medical Visual Question Answering (MedVQA) für Wundpflege-VQA mit natürlichsprachlichen Anfragen über medizinische Bilder statt.

Zielsetzung und wissenschaftliche Einordnung

MedUAG soll laut den Forschenden zur Vereinheitlichung medizinischer KI-Systeme beitragen, indem es erstmals umfassende Ressourcen – Daten und Benchmarks – für medizinisches UAG bereitstellt, ein wettbewerbsfähiges Baseline-Modell etabliert und den Weg für nächstgenerationen-medizinische Multimodal-Systeme ebnet, die Verständnis und Generierung in einem integrierten Framework kombinieren.

Die Forschungsarbeit ist auf arXiv frei zugänglich. Details zu Trainingsmethodik, Architektur und quantitativen Ergebnissen liegen in der Publikation vor.