Standard-Benchmarks für Sprachmodelle verwenden binäre Accuracy-Metriken, die jede Antwort als richtig oder falsch einstufen. Reale Hochschulprüfungen arbeiten dagegen oft mit nicht-additiven Bewertungsschemata, die Teilwissen unterschiedlich gewichten. Eine am 18. August 2026 auf arXiv veröffentlichte Studie quantifiziert diese Diskrepanz erstmals anhand des vietnamesischen Abiturs 2025 und zeigt: Acht getestete Sprachmodelle werden durch Standard-Metriken um 0,020 bis 0,159 Punkte pro Frage überschätzt.
Konvexes Bewertungsschema bestraft Teilwissen stärker
Die 2025 durchgeführte Reform des Vietnamese National High School Graduation Examination führte in Part II ein konvexes Punkteschema ein. Kandidaten bewerten vier Richtig/Falsch-Aussagen pro Frage. Die Anzahl korrekter Aussagen ergibt null, 0,10, 0,25, 0,50 oder 1,00 Punkte. Drei korrekt identifizierte Aussagen bringen 0,50 Punkte, nicht die 0,75 Punkte, die eine proportionale Metrik vergeben würde. Part II macht 4,00 von 10,00 Gesamtpunkten aus.
Die Autoren entwickelten den THPT-Ladder Benchmark, der die ministerielle Bewertungspraxis exakt abbildet. Der Benchmark umfasst 632 Items aus 21 offiziellen Prüfungen über elf Fachbereiche. Da das vietnamesische Ministerium Ergebnisse von über einer Million Kandidaten veröffentlicht, lassen sich Sprachmodelle direkt in der menschlichen Kohorte platzieren.
Punktediskrepanz verschiebt Modell um 13 Perzentilpunkte
Das offizielle Rubric zahlte bei den acht getesteten Modellen 0,020 bis 0,159 Punkte weniger pro Part II-Frage aus als proportionaler Kredit. Diese Differenzen haben erhebliche Konsequenzen: Das Modell Qwen3.5-27B erreichte in der Geschichtsprüfung 2025 einen Punkte-Shortfall von 0,042 Punkten. Das verschob das Modell vom 90. auf das 77. Perzentil unter 481.293 Kandidaten.
Bei Claude Sonnet 5 führten unterschiedliche Fehlerverteilungen auf gleichem Genauigkeitsniveau zu Scores zwischen 0,869 und 0,932 Punkten pro Frage – eine Differenz von 0,063 Punkten (7,3 Prozent Variation). Die offiziellen Marks hängen davon ab, wie korrekte Aussagen gruppiert sind. Modell-Accuracy allein ist nicht prädiktiv für die tatsächliche Bewertung unter dem konvexen Schema.
Systematische Fehlerquelle bei Evaluierung
Die Studie demonstriert eine systematische Fehlerquelle: Einfaches Ersetzen komplexer Bewertungsschemata durch binäre Accuracy-Metriken überschätzt die berichteten Scores. Dies ist besonders problematisch bei Prüfungen, wo Teilpunkte-Schemata nicht-linear sind. Die Diskrepanz ist nicht zufällig verteilt, sondern abhängig von Fehler-Mustern.
Die Autoren schlussfolgern: Um KI-Modelle korrekt auf echten Prüfungen zu bewerten, müssen die tatsächlichen Bewertungsschemata implementiert werden. Standard-Accuracy-Metriken können ein Modell um bis zu 13 Perzentilpunkte im Ranking falsch darstellen und unterschätzen damit das systemische Problem von nicht-proportionalen Teilkrediten.
