Forscher der Beihang University (Beijing) und der Wuhan University haben am 12. August 2026 eine überarbeitete Version von CangjieBench publiziert, einem Benchmark zur Bewertung von Large Language Models bei der Code-Generierung in Cangjie. Die Programmiersprache ist Teil des HarmonyOS-Ökosystems und verfügt über begrenzte öffentlich verfügbare Codebeispiele und Dokumentation. Die Studie füllt eine Forschungslücke: Während die Leistung von LLM-Coding-Assistenten bei etablierten Sprachen wie Python und Java gut dokumentiert ist, fehlten bislang empirische Daten zum Verhalten bei neuen, ressourcenarmen Sprachen.

Benchmark-Design und Evaluationsmethodik

CangjieBench besteht aus 248 manuell übersetzten Aufgaben, die aus den etablierten Benchmarks HumanEval und ClassEval stammen. Der Datensatz ist kontaminationsfrei und deckt zwei Modalitäten ab: Text-to-Code (natürlichsprachliche Anforderung zu Code) und Code-to-Code (Code-Übersetzung). Die Forscher evaluierten sechs LLMs unter fünf verschiedenen Methoden:

  • Direct Generation – direkte Code-Generierung ohne Zusatzinformationen
  • Syntax-Constrained Prompting – Prompting mit Syntaxreferenzen
  • Retrieval-Augmented Generation (RAG) über Dokumentation
  • Retrieval über Code-Beispiele
  • Agent-basierte Workflows mit multi-turn repair-Schleifen

Die Bewertung erfolgte nach Pass@1 (erfolgreiche Code-Generierung beim ersten Versuch), Compile Rate (Kompilierungsquote) und Token Cost (Rechenkosten). Fehler wurden in sieben Kategorien klassifiziert, validiert durch zwei LLM-Annotatoren mit einem Cohen's Kappa von mindestens 0,98.

Direktgenerierung scheitert in über 80 Prozent der Fälle

Direct Generation ohne Zusatzinformationen ist laut Studie auf den meisten Modellen nicht praktikabel. Über vier Fünftel der fehlgeschlagenen Samples enthalten fremde Syntax, die der Cangjie-Compiler ablehnt. Dieses Ergebnis zeigt ein kritisches Problem bei unbekannten Programmiersprachen: LLMs greifen auf Muster aus Trainingssprachen zurück, die in der Zielsprache syntaktisch ungültig sind.

Eine kompakte Syntaxreferenz von 2.146 Token lieferte das beste Genauigkeits-zu-Kosten-Verhältnis unter den prompt-basierten Methoden. Diese konzise Syntaxhilfe war effektiver als umfangreichere Ansätze und verbesserte die Kompilierungsrate deutlich.

Agenten kosten bis zu 120-mal mehr Token

Agent-basierte Workflows erreichen die höchsten Pass@1-Raten, erfordern jedoch 10- bis 120-mal höhere Token-Kosten als ein einzelner Prompt-Aufruf. Die Studie zeigt zudem, dass schwächere Agent-Konfigurationen die Leistung einer syntax-constrained Anfrage auf der gleichen Basis-Architektur nicht erreichen. Dieser Befund stellt die pauschale Empfehlung für Agent-Systeme bei Code-Generierung in Frage.

Negatives Transfer-Phänomen bei Python-Referenzen

Ein unerwarteter Befund: Bei Code-to-Code-Aufgaben können Python-Referenzen die Kompilierungsraten unter das Text-to-Code-Niveau senken. Die Forscher führen dies auf ein negatives Transfer-Phänomen zurück, bei dem Modelle sich zu stark an Idiome der Quellsprache Python anpassen und diese in Cangjie übertragen, wo sie syntaktisch ungültig sind. Python-Referenzen helfen nicht immer.

Gestaffelte Assistenz-Architektur empfohlen

Die Studie empfiehlt für neue Programmiersprachen eine dreistufige Assistenz-Architektur: Ein prägnanter Syntax-Spickzettel als erste Stufe, kuratierte Retrieval-Methoden für API-intensive Aufgaben als zweite Stufe und Agent-Schleifen nur für Aufgaben, die mehrturniges Repair benötigen. Dieser Ansatz priorisiert Genauigkeit und Kosteneffizienz gegenüber einer universellen High-Accuracy-Strategie.

Wissenschaftlicher Beitrag

CangjieBench adressiert einen unterexplorierten Bereich. Während existierende Forschung zu ressourcenknappen Programmiersprachen hauptsächlich auf Domain-Specific Languages (DSLs) fokussiert, untersucht diese Studie erstmals systematisch eine allgemeine Programmiersprache mit Datenmangel. Der Begriff „Low-Resource General-Purpose Language" ist für diese Kategorie spezifisch. Code und Daten sind auf GitHub verfügbar (https://github.com/cjhCoder7/CangjieBench). Das Paper wurde am 15. März 2026 eingereicht und am 12. August 2026 überarbeitet.