Eine am 2. Juni 2026 auf arXiv veröffentlichte Vergleichsstudie untersucht die Leistungsfähigkeit der Transformer-Modelle BART, BERT und RoBERTa für automatische Textzusammenfassungen. Das zentrale Ergebnis: BART erzielt bei abstraktiven Zusammenfassungsaufgaben überlegene Resultate, da das Modell als einziges der drei eine Sequenz-zu-Sequenz-Architektur für Generierungsaufgaben nutzt. BERT und RoBERTa sind hingegen primär encoder-basierte Modelle für Textverständnis-Aufgaben.
Architektonische Grundlagen der verglichenen Modelle
BART (Bidirectional and Auto-Regressive Transformers) kombiniert architektonische Komponenten von BERT und GPT. Das Modell verfügt über einen bidirektionalen Encoder wie BERT und einen autoregressiven Decoder wie GPT. Die ursprüngliche Transformer-Architektur basiert auf einem Encoder-Decoder-Modell, bei dem der Encoder hochdimensionale Repräsentationen von Eingabesequenzen lernt, die der Decoder dann auf Ausgabesequenzen abbildet.
Die Modelle werden auf großen Textkorpora wie BookCorpus oder Wikipedia vortrainiert, bevor sie für spezifische Aufgaben feinabgestimmt werden. BART wurde im Paper "BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension" vorgestellt und nutzt eine Denoising-Methode für das Sequenz-zu-Sequenz-Pretraining.
Leistungsanalyse von BART-LARGE-CNN
Eine im Oktober 2024 veröffentlichte Untersuchung evaluierte BART-LARGE-CNN nach Feinabstimmung auf dem BBC NEWS DATASET. Die Forscher testeten das Modell anhand von sechs verschiedenen Artikeltypen und dokumentierten folgende Ergebnisse:
- Technische Artikel: Zusammenfassungen waren flüssig, grammatikalisch korrekt, akkurat, prägnant und kohärent ohne Abweichungen vom Quelltext
- Artikel mit numerischen Fakten: Zusammenfassungen zeigten Flüssigkeit und Kohärenz, enthielten jedoch Faktenfehler und Ungenauigkeiten
- Sportartikel: Zusammenfassungen waren flüssig und akkurat, ließen aber wichtige Informationen aus
- Gesundheitsartikel: Zusammenfassungen erfüllten alle Qualitätskriterien (Flüssigkeit, duplikatfrei, akkurat, prägnant, kohärent)
- Politikartikel: Zusammenfassungen erfüllten alle Qualitätskriterien
Das feinabgestimmte Modell zeigte signifikante Verbesserungen gegenüber den Baseline-Varianten bei ROUGE-Score und BERTScore. Bei der Feinabstimmung sank der Trainingsverlust, während der Validierungsverlust zunächst abnahm und dann wieder anstieg – ein Indikator für Overfitting. Das Modell funktioniert gut bei Zeitungsartikeln, liefert aber schlechte Ergebnisse bei Dialog-Eingaben.
BART im Vergleich zu anderen Transformer-Modellen
Laut Forschungsergebnissen vom April 2025 erzielt BART state-of-the-art-Resultate bei verschiedenen abstraktiven Aufgaben wie Konversationszusammenfassungen, Question Answering und allgemeinen Summarization-Tasks. Bei vergleichbaren Trainingsressourcen erreicht BART die Performance von RoBERTa auf den GLUE- und SQuAD-Benchmarks.
Eine 2025 veröffentlichte Studie verglich BART, T5 und Fin-T5 für Zusammenfassungen langer Dokumente anhand des Gutenberg Dataset. Weitere Vergleichsanalysen beziehen Modelle wie LongT5, BigBird Pegasus, HAT-BART und DYLE ein. Eine im Dezember 2024 publizierte Übersichtsarbeit identifiziert BART, BERT und PEGASUS als Standardansätze für abstraktive Textzusammenfassungen einzelner Dokumente.
Bewertungsmetriken und Forschungsmethodik
Die Forschung nutzt primär ROUGE-Scores und BERTScore als Evaluierungsmetriken. ROUGE misst die lexikalische Überlappung zwischen generierten und Referenzzusammenfassungen, während BERTScore die semantische Ähnlichkeit bewertet. Diese Metriken erlauben quantitative Vergleiche der Modellleistung über verschiedene Datensätze hinweg.
Anwendungsdomänen und Spezialisierungen
Transformer-basierte Summarization-Modelle werden in mehreren Bereichen eingesetzt:
- Nachrichtenartikel-Zusammenfassungen (eine im Mai 2025 veröffentlichte Forschungsarbeit fokussiert auf deutschsprachige Texte)
- Zusammenfassungen langer Dokumente
- Abstraktive Konversationszusammenfassungen
- Question-Answering-Kontexte mit Summarization-Komponenten
Der strukturelle Vorteil von BART gegenüber BERT und RoBERTa für Textzusammenfassungen ergibt sich aus der Sequenz-zu-Sequenz-Architektur, die für Generierungsaufgaben optimiert ist. BERT und RoBERTa sind encoder-basierte Modelle, die primär für Verständnisaufgaben konzipiert wurden und daher für abstraktive Zusammenfassungen strukturell weniger geeignet sind.
