KI und Deutschprüfung
KI gegen mein Urteil
Wie genau bewertet KI einen Prüfungstext? Eine C1-Prüferin hat nachgeprüft, mit allen Ergebnissen.
Kurze Antwort
Margarita Votteler ist seit 2009 C1-Prüferin. Im Juli 2026 hat sie Texte für TestDaF, telc C1 Hochschule und Goethe C1 selbst bewertet und ihr Urteil neben das unserer KI gelegt. Bei 15 Texten haben beide eine Gesamtstufe vergeben. In 11 von 15 Fällen kam die KI auf dieselbe Stufe wie die Prüferin. Bei allen 5 echten Lernertexten darunter lag sie richtig.
Alle Ergebnisse
Wir zeigen jede Bewertung, auch die Abweichungen. Die Texte selbst veröffentlichen wir nicht. „Übungstext“ heißt: Wir haben ihn für diesen Vergleich selbst geschrieben, in verschiedenen Niveaustufen.
| Text | KI | Prüferin |
|---|---|---|
| TestDaF Übungstext | unter TDN 3 | unter TDN 3 ✓ |
| TestDaF Übungstext | TDN 3 | knapp TDN 4 KI 1 Stufe strenger |
| TestDaF Übungstext | TDN 3 | TDN 3 ✓ |
| TestDaF Übungstext | TDN 4 | TDN 4 (fast 5) ✓ |
| TestDaF Übungstext | TDN 4 | TDN 5 KI 1 Stufe strenger |
| TestDaF Übungstext | TDN 3 | unter TDN 3 KI 1 Stufe milder |
| TestDaF Übungstext | unter TDN 3 | unter TDN 3 ✓ |
| TestDaF echter Lernertext | TDN 4 | TDN 4 ✓ |
| TestDaF echter Lernertext | unter TDN 3 | unter TDN 3 ✓ |
| telc C1 Hochschule echter Lernertext | nicht bestanden | nicht bestanden ✓ |
| telc C1 Hochschule echter Lernertext | nicht bestanden | nicht bestanden ✓ |
| telc C1 Hochschule Übungstext | nicht bestanden | nicht bestanden ✓ |
| telc C1 Hochschule Übungstext | nicht bestanden (D) | nicht bestanden (D) ✓ |
| telc C1 Hochschule Übungstext | C, knapp bestanden | A KI 2 Stufen strenger |
| Goethe C1 echter Lernertext | bestanden | bestanden ✓ |
Wo die KI danebenlag
- Bei sehr guten Texten war sie zu streng. Sie hat Punkte abgezogen, ohne einen Fehler zeigen zu können. Ein Abzug braucht eine Stelle im Text. Gibt es keine, ist die höchste Stufe richtig.
- Bei einem schwachen Text war sie zu mild. Sie gab TDN 3, die Prüferin „unter TDN 3“. Das ist der teuerste Fehler, denn TDN 3 heißt: An manchen Hochschulen reicht das schon.
- Bei den einzelnen Kriterien hat die Prüferin öfter korrigiert als bei der Gesamtstufe. Ihr Fazit auf dem Bogen: „KI bewertet richtig an offiziellen Kriterien und schwammig an 1-10 Skala.“
Auch Prüfer sind sich nicht immer einig. Ein Übungstext lag zweimal im Stapel. Die Prüferin hat ihn einmal mit TDN 3 und einmal mit knapp TDN 4 bewertet. Eine Stufe Unterschied kommt also auch unter Menschen vor.
Was das für dich heißt
Die Gesamtstufe ist eine gute Orientierung: Sie zeigt dir, ob du ungefähr bei TDN 3, 4 oder 5 stehst oder ob dein Text die Hürde schafft. Nimm sie nicht als Garantie. Am meisten bringen dir die markierten Fehlerstellen und die Frage, was dir zur nächsten Stufe fehlt.
Häufige Fragen
Wie genau ist die KI-Bewertung von GermanExam.pro?
Bei 15 Texten, die Margarita Votteler als Prüferin selbst bewertet hat, kam die KI in 11 Fällen auf dieselbe Gesamtstufe. Bei allen 5 echten Lernertexten darunter lag sie richtig. In 4 Fällen lag sie daneben, dreimal zu streng und einmal zu mild.
Wo liegt die KI am ehesten daneben?
Bei den einzelnen Kriterien, etwa Wortschatz oder Verständlichkeit, öfter als bei der Gesamtstufe. Und bei sehr guten Texten: Dort hat sie Punkte abgezogen, ohne einen Fehler benennen zu können.
Ist ein KI-Urteil so gut wie eine echte Prüfung?
Nein. Die KI-Bewertung ist eine Lernhilfe und eine Einschätzung. Offizielle Noten vergeben nur die Prüfungsinstitute. Sie zeigt dir aber vorher, wo du stehst, und zwar nach den Kriterien deiner Prüfung.
Selbst ausprobieren
- Text einreichen – ohne Konto, dein erster Text ist kostenlos.
- ChatGPT korrigiert zu freundlich? – warum ein Lob noch kein Bestehen ist
- KI-Transparenz – wie unsere Bewertung arbeitet und wo ihre Grenzen liegen