AlmanBench
AlmanBench misst sprachliches und grammatisches Schlussfolgern, speziell im Deutschen. Ihre 1.029 öffentlichen Testfälle prüfen, ob ein Sprachmodell die vollständige Alman-Spezifikation auf echte deutsche Prosa anwenden kann, von kanonischer Literatur bis zu zeitgenössischen Texten.
AlmanBench genießt außerdem eine seltene Form von Benchmark-Integrität. Kein Labor wird einen Trainingslauf darauf verschwenden, einen Datensatz zur deutschen Sprachvereinfachung zu manipulieren, also messen die Scores, was die Modelle tatsächlich können. Obskurität ist unsere Kontaminationsrichtlinie.
Ergebnisse
| Nr. | Modell | Score ↑ |
|---|---|---|
| 1 | GPT-5.5 xhigh | |
| 2 | GPT-5.6 Sol max | |
| 3 | Claude Opus 5 max | |
| 4 | Claude Fable 5 high* | |
| 5 | Claude Fable 5 max* | |
| 6 | GPT-5.6 Sol xhigh | |
| 7 | DeepSeek V4 Flash 0731 max | |
| 8 | Kimi K3 max | |
| 9 | GLM 5.2 | |
| 10 | DeepSeek V4 Flash 0422 | |
| 11 | Inkling max | |
| 12 | GPT-5.6 Luna xhigh | |
| 13 | GPT-5.6 Terra xhigh | |
| 14 | Kimi K2.7 Code | |
| 15 | DeepSeek V4 Pro | |
| 16 | Claude Sonnet 5 xhigh | |
| 17 | Qwen3.8 27B medium | |
| 18 | Qwen3.6 27B | |
| 19 | MiniMax M3 | |
| 20 | Gemma 4 26B A4B IT | |
| 21 | Claude Opus 4.8 max | |
| 22 | Nemotron 3 Ultra | |
| 23 | Qwen3.6 35B A3B | |
| 24 | Step 3.5 Flash | |
| 25 | GPT-OSS 120B high | |
| 26 | Gemma 4 31B IT | |
| 27 | MiMo V2.5 Pro | |
| 28 | Ternary Bonsai 27B | |
| 29 | Laguna S 2.1 | |
| 30 | LongCat Flash Lite Sparse | |
Score nach Ebene
| Modell | naturalistic | targeted | guards | curated |
|---|---|---|---|---|
| GPT-5.5 xhigh | 95,2 % | 100,0 % | 87,5 % | 96,8 % |
| GPT-5.6 Sol max | 94,7 % | 100,0 % | 87,5 % | 96,8 % |
| Claude Opus 5 max | 95,3 % | 95,8 % | 88,3 % | 98,9 % |
| Claude Fable 5 high* | 93,5 % | 98,1 % | 87,5 % | 95,7 % |
| Claude Fable 5 max* | 93,5 % | 96,3 % | 89,2 % | 96,8 % |
| GPT-5.6 Sol xhigh | 92,2 % | 99,5 % | 87,5 % | 95,7 % |
| DeepSeek V4 Flash 0731 max | 92,0 % | 96,8 % | 88,3 % | 96,8 % |
| Kimi K3 max | 90,0 % | 93,1 % | 88,3 % | 95,7 % |
| GLM 5.2 | 89,0 % | 96,3 % | 86,7 % | 94,6 % |
| DeepSeek V4 Flash 0422 | 86,7 % | 97,2 % | 88,3 % | 94,6 % |
| Inkling max | 85,7 % | 100,0 % | 85,8 % | 93,5 % |
| GPT-5.6 Luna xhigh | 83,5 % | 98,1 % | 85,8 % | 93,5 % |
| GPT-5.6 Terra xhigh | 83,3 % | 96,3 % | 88,3 % | 94,6 % |
| Kimi K2.7 Code | 83,0 % | 94,9 % | 87,5 % | 93,5 % |
| DeepSeek V4 Pro | 79,7 % | 97,7 % | 87,5 % | 90,3 % |
| Claude Sonnet 5 xhigh | 77,2 % | 95,4 % | 89,2 % | 88,2 % |
| Qwen3.8 27B medium | 77,2 % | 95,8 % | 87,5 % | 88,2 % |
| Qwen3.6 27B | 74,5 % | 97,2 % | 86,7 % | 87,1 % |
| MiniMax M3 | 71,8 % | 95,4 % | 85,0 % | 87,1 % |
| Gemma 4 26B A4B IT | 70,7 % | 93,5 % | 77,5 % | 75,3 % |
| Claude Opus 4.8 max | 65,8 % | 89,8 % | 84,2 % | 86,0 % |
| Nemotron 3 Ultra | 66,2 % | 92,1 % | 77,5 % | 86,0 % |
| Qwen3.6 35B A3B | 64,3 % | 92,6 % | 84,2 % | 84,9 % |
| Step 3.5 Flash | 58,3 % | 88,4 % | 79,2 % | 86,0 % |
| GPT-OSS 120B high | 60,5 % | 85,2 % | 75,8 % | 76,3 % |
| Gemma 4 31B IT | 50,3 % | 92,6 % | 81,7 % | 72,0 % |
| MiMo V2.5 Pro | 50,5 % | 88,0 % | 80,8 % | 76,3 % |
| Ternary Bonsai 27B | 34,8 % | 75,5 % | 65,8 % | 48,4 % |
| Laguna S 2.1 | 26,3 % | 61,6 % | 65,8 % | 49,5 % |
| LongCat Flash Lite Sparse | 11,8 % | 44,0 % | 46,7 % | 32,3 % |
Zusammensetzung
Der öffentliche Satz enthält 1.029 Testfälle in vier Ebenen. Ein privater zurückgehaltener Satz von rund 200 weiteren Testfällen, nach demselben Standard geprüft, wird nie veröffentlicht und misst Trainingskontamination über die Zeit. Jede veröffentlichte Zeile trägt eine Canary-GUID, damit die Daten aus Trainingskorpora gefiltert werden können.
| Ebene | Testfälle | Aufgabe |
|---|---|---|
| naturalistic | 600 | Echte Prosa mit zusammenwirkenden Regeln. Zur Hälfte kanonische Literatur (1500 bis 1955), zur Hälfte zeitgenössisches Deutsch aus Wikipedia, Tatoeba und handgeschriebenen Sätzen. |
| targeted | 216 | Handgeschriebene Testfälle, die seltene Regeln auf mindestens 25 Beobachtungen heben. |
| guards | 120 | Überkorrektur-Fallen in acht Familien. Formen, die Alman behält und die ein Oberflächenformen-Entferner fälschlich ändern würde. |
| curated | 93 | Handübersetzter demonstrativer Kern. Jede Regel der Spezifikation ist das ausgewiesene Ziel von mindestens einem Testfall. |
Beispiel-Testfall
Ein naturalistischer Testfall aus der deutschen Wikipedia. Der Genitiv nach Familie darf der behalten oder die von-Umschreibung nehmen. Daher führt die Referenz beide gültigen Wiedergaben auf.
- Standarddeutsch
- Der Braunbär gehört zu den Säugetieren aus der Familie der Bären.
- Gültige Wiedergaben
- Die Braunbär gehört zu die Säugetiere aus die Familie der Bären. (kanonisch)
- Die Braunbär gehört zu die Säugetiere aus die Familie von die Bären.
Die Benchmark ausführen
Der Datensatz ist auf Hugging Face veröffentlicht. Der Benchmark-Code liegt im alman-Repository und läuft gegen jedes von Inspect AI unterstützte Modell.
from datasets import load_dataset
ds = load_dataset("osolmaz/almanbench", split="test")
uv run inspect eval alman/bench/task.py --model openai/gpt-5-codex
Zitieren
@misc{almanbench2026,
title = {AlmanBench: A Standard German to Alman Translation Benchmark},
author = {Solmaz, Onur},
year = {2026},
howpublished = {\url{https://alman.ai/almanbench/}}
}