SYSNeue KI-Tools, die heute starten
KI Tools Heute
Blog

Deutschtest für KI-Modelle: unsere Methode, offengelegt

Ranglisten für Sprachmodelle messen fast ausschließlich Englisch. Wir prüfen deutsche Ausgabe entlang von sechs Kriterien mit festen Aufgaben und zählen Fehler, statt Eindrücke zu vergeben. Dieser Beitrag legt Aufgaben, Zählweise und Grenzen der Methode offen, damit du sie nachbauen oder widerlegen kannst.

Vom Team von KI Tools Heute

Eine Wertung, deren Methode nicht offenliegt, ist eine Meinung mit Zahl. Deshalb steht hier zuerst die Methode und erst danach irgendein Ergebnis. Wer sie nachbaut und zu anderen Zahlen kommt, hat einen Fehler gefunden, und das ist der Sinn der Sache.

Warum ein eigener Test überhaupt nötig ist

Öffentliche Bestenlisten messen überwiegend englische Aufgaben. Dass die Sprachverteilung der Trainingsdaten sich auf die Ausgabequalität auswirkt, ist kein Randdetail: Fraunhofer IAIS hebt beim am 26. November 2024 veröffentlichten Modell Teuken-7B ausdrücklich hervor, dass rund 50 Prozent der Trainingsdaten nicht englisch sind, und begründet das mit den längeren Wortstrukturen von Sprachen wie Deutsch.

Für deutsche Anwender heißt das: Wer aus einer englischen Tabelle abliest, liest die falsche Tabelle.

Die sechs Kriterien

  • Grammatik unter Last: Kasus, Genus und Kongruenz in Sätzen mit mindestens zwei eingeschobenen Nebensätzen.
  • Anredetreue: eine ganze Seite konsequent du oder Sie, ohne Wechsel im Mittelteil.
  • Fachlexik: korrekte Verwendung, nicht nur korrekte Schreibung, von Begriffen aus Verwaltung, Handwerk, Recht und Medizin.
  • Formattreue: Datum, Uhrzeit, Beträge und Telefonnummern nach DIN 5008.
  • Registerwechsel: Amtsdeutsch in verständliches Deutsch überführen, ohne den Inhalt zu verändern.
  • Regionale Varianten: österreichisches und schweizerisches Standarddeutsch auf Anforderung, inklusive ss statt ß.

Wie gezählt wird

Jedes Modell bekommt dieselben Aufgaben im identischen Wortlaut, in einer frischen Sitzung, ohne Systemanweisung, die über die Aufgabe hinausgeht. Bewertet werden gezählte Verstöße pro tausend Wörter, getrennt nach den sechs Kriterien, nicht ein Gesamteindruck.

Zwei Regeln halten das ehrlich: Es wird nicht nachgebessert, also kein zweiter Anlauf mit besserem Prompt, und die Aufgaben stammen aus echten Texten, nicht aus konstruierten Stolperfallen. Ein Modell, das nur auf Fallen getestet wird, sieht schlechter aus, als es im Alltag ist.

Was die Methode nicht kann

Sie misst Sprache, nicht Wissen, nicht Werkzeugnutzung und nicht Verlässlichkeit über lange Sitzungen. Sie misst zu einem Zeitpunkt, und Modelle ändern sich zwischen zwei Veröffentlichungen. Und sie hat eine kleine Stichprobe, weil jede Bewertung von Hand nachgezählt wird.

Deshalb steht an jedem Ergebnis das Prüfdatum und die Modellversion. Ohne beides ist eine Sprachwertung nicht verwertbar, auch unsere nicht.

Warum ein Verzeichnis das kann und ein Blog nicht

Ein einzelner Test veraltet. Eine wiederholte Messung an derselben Adresse nicht, weil sie ein Datum bekommt und die vorherige ersetzt. Genau das ist der Unterschied zwischen einem Artikel über Modelle und einer gepflegten Spalte am Eintrag: Die Spalte wird nachgezogen, der Artikel bleibt stehen.

Dieselbe Logik gilt für die Rechtsangaben je Tool, die parallel gepflegt werden.

Datenschutzfreundliche Analyse nutzen wir nur, wenn du zustimmst. Notwendige Cookies (Login) laufen immer.