Die Integration von Large Language Models (LLMs) mit physischen Agenten und strukturierten Wissensdatenbanken soll embodied AI ermöglichen – künstliche Intelligenz, die nicht nur Sprache versteht, sondern in der realen Welt handelt. Während LLMs Anzeichen künstlicher allgemeiner Intelligenz zeigen, fehlt ihnen die Verankerung in der physischen Welt. Vision-Language-Action Models (VLAs) und agentenbasierte Architekturen bilden den technischen Kern dieser Entwicklung.

Von End-to-End-Pipelines zu modularen Agentensystemen

Ein konzeptionelles Framework für allgemeine embodied intelligence integriert LLMs, strukturierte Wissensdatenbanken und physische Agenten, um Verständnis, Reasoning und Handeln in komplexen Umgebungen zu ermöglichen, wie TechXplore am 27. Juli 2026 berichtete. Embodied AI wird nicht als bloße Kombination leistungsstarker KI-Modelle mit Robotern verstanden, sondern als ko-evolutionäres Paradigma: Intelligente Algorithmen, physische Strukturen und dynamische Umgebungen entwickeln sich gemeinsam.

Die neueste Forschungsrichtung seit August 2025 fokussiert auf modulare, agentenbasierte Systeme statt monolithischer End-to-End-Pipelines. LLMs erweitern dabei die Funktionalität des Robot Operating System (ROS), ohne getestete Software-Module zu ersetzen. Agenten interpretieren Nutzerintentionen, generieren Pläne, rufen Robot-APIs auf oder agieren als Coordinator, Planner oder Perception Actor. Sie können über unstrukturierte Anweisungen nachdenken, Robotik-Fähigkeiten sequenzieren und sich durch Interaktion anpassen.

Vision-Language-Action Models: Technische Evolution von 2023 bis 2025

RT-2 (Zitkovich et al., 2023) kombinierte Vision Encoder (ViT-22B/ViT-4B) und Language Encoder (PaLM-E) mit Symbol-Tuning als Action Decoder. Das System war das erste, das gemeinsam auf Web-basierte Visual Question Answering und Robotik-Datensätze feinabgestimmt wurde und emergente Funktionalitäten zeigte.

Octo (Team et al., 2024) stellte das erste generalistische Policy-Modell dar, trainiert auf einem Multi-Robot-Datensatz mit über 800.000 Trajektorien. Das Open-Source Foundation Model nutzt einen CNN-Vision Encoder, T5-base Language Encoder und Diffusion Transformer als Action Decoder. Open-VLA (Kim et al., 2024) bot eine Open-Source-Alternative zu RT-2 mit DINOv2 und SigLIP Vision Encoder sowie Prismatic-7B Language Encoder. Das Modell zeigte überlegene Parametereffizienz und Generalisierung durch effizientes LoRA Fine-Tuning.

Mobility-VLA (Chiang et al., 2024) nutzte Demonstrationsvideo-Tours als Environmental Prior und verwendete Long-Context ViT, T5-basierte Instruction Encoder sowie ein Hybrid Diffusion + Autoregressive Ensemble für Navigation auf Basis komplexer multimodaler Anweisungen. Diffusion-VLA (Wen et al., 2024) kombinierte einen Transformer-basierten Visual Encoder mit Autoregressive Reasoning Module und Diffusion Policy Head für präzise Steuerung und zuverlässige Sequenzplanung.

Echtzeit-Inferenz und 3D-Wahrnehmung ab 2025

Tiny-VLA (Wen et al., 2025) erreichte mit FastViT Low-Latency Encoding, kompaktem Language Encoder (128-d) und Diffusion Policy Decoder (50 Millionen Parameter) fünffach schnellere Inferenz als Open-VLA. Das Modell eliminierte Pretraining-Anforderungen und ermöglichte Echtzeit-Anwendungen. Point-VLA (Li et al., 2025) integrierte CLIP mit 3D Point Cloud für Vision Encoding, Llama-2 für Language Encoding und einen Transformer-basierten Action Decoder.

Hybride Architekturen: Multimodale LLMs und World Models

Eine bedeutsame Erkenntnis aus September 2025 betont die Notwendigkeit gemeinsamer MLLM-World Model (WM)-getriebener embodied AI-Architekturen. Multimodale LLMs ermöglichen kontextbezogenes Task Reasoning, übersehen aber physikalische Constraints. World Models sind physik-bewusst für Simulation, fehlt aber hochrangige Semantik. Die Verbindung beider kann semantische Intelligenz mit verankerter physikalischer Interaktion überbrücken.

PaLM-E integrierte beispielsweise ViT und PaLM zu einem embodied multimodalen LLM, das auf Basis wahrgenommener Bilder und hochrangiger Sprachanweisungen Textpläne als Anweisungen für Low-Level Robotik-Policies generiert. Das Modell nutzt Internet-Scale-Wissen für Task Planning.

Selbstbewusstsein und Multi-Agenten-Kollaboration

Modelle können explizit über ihre Limitationen befragt werden. Ein neuerer Ansatz formuliert Selbstbewusstseinaufgaben als intuitive Suchfragen: Ein embodied Agent fragt sein Basis-LLM zu existierendem Weltwissen einer Situation ab. Mehrere LLM-Agenten können kollaborativ ihre Fähigkeiten und Schwächen durch gegenseitiges Befragen offenbaren und aus versteckten Repräsentationen ihrer inneren Zustände Modell-Eigenschaften ableiten.

Multimodale Verarbeitung und sprachbasierte Interaktion

Embodied intelligent interaction erfordert natürlichsprachiges Reasoning, visuell-räumliche semantische Wahrnehmung und Alignment von visueller Wahrnehmung mit Sprachsystemen. Language-based embodied intelligent interaction wurde zum zentralen Forschungsfokus, wobei Systeme menschliche Sprachanweisungen verstehen und Aufgaben autonom ausführen müssen.

Durch ihre Reasoning- und Generalisierungsfähigkeiten ermöglichen LLMs embodied Systemen das Verständnis von Sprachanweisungen, die Verankerung semantischen Wissens in physikalischer Erfahrung sowie Zero-Shot- und Few-Shot-Adaptation.

Anwendungen in Robotik, Fertigung und Gesundheitswesen

Diese Entwicklungen beschleunigten das Deployment von embodied AI in realen Domänen: Robotik, autonomes Fahren, intelligente Fertigung und Gesundheitswesen. Mehrere Surveys adressieren die Intersection von Foundation Models und Robotik, mit Fokus auf multimodale Architekturen, Komponenten und den allgemeinen Einsatz multimodaler Modelle in robotischen Entscheidungsfindungs- und Planungsprozessen.

Eine aktuelle Taxonomie klassifiziert Model-Integration-Ansätze und präsentiert komparative Analysen der Rollen von Agenten in verschiedenen Lösungen der heutigen Literatur, einschließlich Peer-reviewed Forschung, Community-getriebener Projekte, ROS-Pakete und industrieller Frameworks.