AlmanBench
AlmanBench misst sprachliche und grammatische Schlussfolgern, speziell in die Deutsche. Ihr 1.029 öffentliche Testfälle prüfen, ob ein Sprachmodell die vollständige Alman-Spezifikation auf echte deutsche Prosa anwenden kann, von kanonische Literatur bis zu zeitgenössische Texte.
AlmanBench genießt außerdem ein seltene Form von Benchmark-Integrität. Kein Labor wird ein Trainingslauf darauf verschwenden, ein Datensatz zu die deutsche Sprachvereinfachung zu manipulieren, also messen die Scores, was die Modelle tatsächlich können. Obskurität ist unser Kontaminationsrichtlinie.
Ergebnisse
| Nr. | Modell | Score ↑ |
|---|---|---|
| 1 | GPT-5.5 xhigh | |
| 2 | GPT-5.6 Sol max | |
| 3 | Claude Opus 5 max | |
| 4 | Claude Fable 5 high* | |
| 5 | Claude Fable 5 max* | |
| 6 | GPT-5.6 Sol xhigh | |
| 7 | DeepSeek V4 Flash 0731 max | |
| 8 | Kimi K3 max | |
| 9 | GLM 5.2 | |
| 10 | DeepSeek V4 Flash 0422 | |
| 11 | Inkling max | |
| 12 | GPT-5.6 Luna xhigh | |
| 13 | GPT-5.6 Terra xhigh | |
| 14 | Kimi K2.7 Code | |
| 15 | DeepSeek V4 Pro | |
| 16 | Claude Sonnet 5 xhigh | |
| 17 | Qwen3.8 27B medium | |
| 18 | Qwen3.6 27B | |
| 19 | MiniMax M3 | |
| 20 | Gemma 4 26B A4B IT | |
| 21 | Claude Opus 4.8 max | |
| 22 | Nemotron 3 Ultra | |
| 23 | Qwen3.6 35B A3B | |
| 24 | Step 3.5 Flash | |
| 25 | GPT-OSS 120B high | |
| 26 | Gemma 4 31B IT | |
| 27 | MiMo V2.5 Pro | |
| 28 | Ternary Bonsai 27B | |
| 29 | Laguna S 2.1 | |
| 30 | LongCat Flash Lite Sparse | |
Score nach Ebene
| Modell | naturalistic | targeted | guards | curated |
|---|---|---|---|---|
| GPT-5.5 xhigh | 95,2 % | 100,0 % | 87,5 % | 96,8 % |
| GPT-5.6 Sol max | 94,7 % | 100,0 % | 87,5 % | 96,8 % |
| Claude Opus 5 max | 95,3 % | 95,8 % | 88,3 % | 98,9 % |
| Claude Fable 5 high* | 93,5 % | 98,1 % | 87,5 % | 95,7 % |
| Claude Fable 5 max* | 93,5 % | 96,3 % | 89,2 % | 96,8 % |
| GPT-5.6 Sol xhigh | 92,2 % | 99,5 % | 87,5 % | 95,7 % |
| DeepSeek V4 Flash 0731 max | 92,0 % | 96,8 % | 88,3 % | 96,8 % |
| Kimi K3 max | 90,0 % | 93,1 % | 88,3 % | 95,7 % |
| GLM 5.2 | 89,0 % | 96,3 % | 86,7 % | 94,6 % |
| DeepSeek V4 Flash 0422 | 86,7 % | 97,2 % | 88,3 % | 94,6 % |
| Inkling max | 85,7 % | 100,0 % | 85,8 % | 93,5 % |
| GPT-5.6 Luna xhigh | 83,5 % | 98,1 % | 85,8 % | 93,5 % |
| GPT-5.6 Terra xhigh | 83,3 % | 96,3 % | 88,3 % | 94,6 % |
| Kimi K2.7 Code | 83,0 % | 94,9 % | 87,5 % | 93,5 % |
| DeepSeek V4 Pro | 79,7 % | 97,7 % | 87,5 % | 90,3 % |
| Claude Sonnet 5 xhigh | 77,2 % | 95,4 % | 89,2 % | 88,2 % |
| Qwen3.8 27B medium | 77,2 % | 95,8 % | 87,5 % | 88,2 % |
| Qwen3.6 27B | 74,5 % | 97,2 % | 86,7 % | 87,1 % |
| MiniMax M3 | 71,8 % | 95,4 % | 85,0 % | 87,1 % |
| Gemma 4 26B A4B IT | 70,7 % | 93,5 % | 77,5 % | 75,3 % |
| Claude Opus 4.8 max | 65,8 % | 89,8 % | 84,2 % | 86,0 % |
| Nemotron 3 Ultra | 66,2 % | 92,1 % | 77,5 % | 86,0 % |
| Qwen3.6 35B A3B | 64,3 % | 92,6 % | 84,2 % | 84,9 % |
| Step 3.5 Flash | 58,3 % | 88,4 % | 79,2 % | 86,0 % |
| GPT-OSS 120B high | 60,5 % | 85,2 % | 75,8 % | 76,3 % |
| Gemma 4 31B IT | 50,3 % | 92,6 % | 81,7 % | 72,0 % |
| MiMo V2.5 Pro | 50,5 % | 88,0 % | 80,8 % | 76,3 % |
| Ternary Bonsai 27B | 34,8 % | 75,5 % | 65,8 % | 48,4 % |
| Laguna S 2.1 | 26,3 % | 61,6 % | 65,8 % | 49,5 % |
| LongCat Flash Lite Sparse | 11,8 % | 44,0 % | 46,7 % | 32,3 % |
Zusammensetzung
Die öffentliche Satz enthält 1.029 Testfälle in vier Ebenen. Ein private zurückgehaltene Satz von rund 200 weitere Testfälle, nach dieselbe Standard geprüft, wird nie veröffentlicht und misst Trainingskontamination über die Zeit. Jede veröffentlichte Zeile trägt ein Canary-GUID, damit die Daten aus Trainingskorpora gefiltert werden können.
| Ebene | Testfälle | Aufgabe |
|---|---|---|
| naturalistic | 600 | Echte Prosa mit zusammenwirkende Regeln. Zu die Hälfte kanonische Literatur (1500 bis 1955), zu die Hälfte zeitgenössische Deutsch aus Wikipedia, Tatoeba und handgeschriebene Sätze. |
| targeted | 216 | Handgeschriebene Testfälle, das seltene Regeln auf mindestens 25 Beobachtungen heben. |
| guards | 120 | Überkorrektur-Fallen in acht Familien. Formen, das Alman behält und das ein Oberflächenformen-Entferner fälschlich ändern würde. |
| curated | 93 | Handübersetzte demonstrative Kern. Jede Regel der Spezifikation ist die ausgewiesene Ziel von mindestens ein Testfall. |
Beispiel-Testfall
Ein naturalistische Testfall aus die deutsche Wikipedia. Die Genitiv nach Familie darf der behalten oder die von-Umschreibung nehmen. Daher führt die Referenz beide gültige Wiedergaben auf.
- Standarddeutsch
- Der Braunbär gehört zu den Säugetieren aus der Familie der Bären.
- Gültige Wiedergaben
- Die Braunbär gehört zu die Säugetiere aus die Familie der Bären. (kanonisch)
- Die Braunbär gehört zu die Säugetiere aus die Familie von die Bären.
Die Benchmark ausführen
Die Datensatz ist auf Hugging Face veröffentlicht. Die Benchmark-Code liegt in die alman-Repository und läuft gegen jede von Inspect AI unterstützte Modell.
from datasets import load_dataset
ds = load_dataset("osolmaz/almanbench", split="test")
uv run inspect eval alman/bench/task.py --model openai/gpt-5-codex
Zitieren
@misc{almanbench2026,
title = {AlmanBench: A Standard German to Alman Translation Benchmark},
author = {Solmaz, Onur},
year = {2026},
howpublished = {\url{https://alman.ai/almanbench/}}
}