---
title: "AlmanBench"
language: de-AL
date: 2026-07-25
canonical: https://alman.ai/al/almanbench/
---

AlmanBench misst sprachliche und grammatische Schlussfolgern, speziell in die Deutsche. Ihr 1.029 öffentliche Testfälle prüfen, ob ein Sprachmodell die vollständige Alman-Spezifikation auf echte deutsche Prosa anwenden kann, von kanonische Literatur bis zu zeitgenössische Texte.

AlmanBench genießt außerdem ein seltene Form von Benchmark-Integrität. Kein Labor wird ein Trainingslauf darauf verschwenden, ein Datensatz zu die deutsche Sprachvereinfachung zu manipulieren, also messen die Scores, was die Modelle tatsächlich können. Obskurität ist unser Kontaminationsrichtlinie.

[Datensatz](https://huggingface.co/datasets/osolmaz/almanbench) · [Ergebnisse](https://huggingface.co/datasets/osolmaz/almanbench-results) · [GitHub](https://github.com/osolmaz/alman) · [Spezifikation](https://alman.ai/al/#spec)

## Ergebnisse

| Nr. | Modell | Score ↑ |
| --- | --- | --- |
| 1 | GPT-5.5 xhigh | 94,8 % (976/1029) |
| 2 | Claude Opus 5 max | 94,5 % (972/1029) |
| 3 | GPT-5.6 Sol max | 94,4 % (971/1029) |
| 4 | Claude Fable 5 high | 94,1 % (968/1029) |
| 5 | GPT-5.6 Sol xhigh | 93,5 % (962/1029) |
| 6 | Claude Fable 5 max | 93,4 % (961/1029) |
| 7 | GLM 5.2 | 90,4 % (930/1029) |
| 8 | DeepSeek V4 Flash | 89,7 % (923/1029) |
| 9 | Inkling max | 89,2 % (918/1029) |
| 10 | GPT-5.6 Luna xhigh | 87,7 % (902/1029) |
| 11 | GPT-5.6 Terra xhigh | 87,5 % (900/1029) |
| 12 | Kimi K2.7 Code | 87,0 % (895/1029) |
| 13 | DeepSeek V4 Pro | 85,3 % (878/1029) |
| 14 | Claude Sonnet 5 xhigh | 83,3 % (857/1029) |
| 15 | Qwen3.6 27B | 81,6 % (840/1029) |
| 16 | MiniMax M3 | 79,6 % (819/1029) |
| 17 | Gemma 4 26B A4B IT | 76,6 % (788/1029) |
| 18 | Claude Opus 4.8 max | 74,8 % (770/1029) |
| 19 | Nemotron 3 Ultra | 74,6 % (768/1029) |
| 20 | Qwen3.6 35B A3B | 74,3 % (765/1029) |
| 21 | Step 3.5 Flash | 69,7 % (717/1029) |
| 22 | GPT-OSS 120B high | 68,8 % (708/1029) |
| 23 | Gemma 4 31B IT | 64,8 % (667/1029) |
| 24 | MiMo V2.5 Pro | 64,2 % (661/1029) |
| 25 | Ternary Bonsai 27B | 48,2 % (496/1029) |
| 26 | Laguna S 2.1 | 40,5 % (417/1029) |

### Score nach Ebene

| Modell | naturalistic | targeted | guards | curated |
| --- | --- | --- | --- | --- |
| GPT-5.5 xhigh | 94,2 % (565/600) | 100,0 % (216/216) | 87,5 % (105/120) | 96,8 % (90/93) |
| Claude Opus 5 max | 94,5 % (567/600) | 95,8 % (207/216) | 88,3 % (106/120) | 98,9 % (92/93) |
| GPT-5.6 Sol max | 93,3 % (560/600) | 100,0 % (216/216) | 87,5 % (105/120) | 96,8 % (90/93) |
| Claude Fable 5 high | 93,7 % (562/600) | 98,1 % (212/216) | 87,5 % (105/120) | 95,7 % (89/93) |
| GPT-5.6 Sol xhigh | 92,2 % (553/600) | 99,5 % (215/216) | 87,5 % (105/120) | 95,7 % (89/93) |
| Claude Fable 5 max | 92,7 % (556/600) | 96,3 % (208/216) | 89,2 % (107/120) | 96,8 % (90/93) |
| GLM 5.2 | 88,3 % (530/600) | 96,3 % (208/216) | 86,7 % (104/120) | 94,6 % (88/93) |
| DeepSeek V4 Flash | 86,5 % (519/600) | 97,2 % (210/216) | 88,3 % (106/120) | 94,6 % (88/93) |
| Inkling max | 85,3 % (512/600) | 100,0 % (216/216) | 85,8 % (103/120) | 93,5 % (87/93) |
| GPT-5.6 Luna xhigh | 83,3 % (500/600) | 98,1 % (212/216) | 85,8 % (103/120) | 93,5 % (87/93) |
| GPT-5.6 Terra xhigh | 83,0 % (498/600) | 96,3 % (208/216) | 88,3 % (106/120) | 94,6 % (88/93) |
| Kimi K2.7 Code | 83,0 % (498/600) | 94,9 % (205/216) | 87,5 % (105/120) | 93,5 % (87/93) |
| DeepSeek V4 Pro | 79,7 % (478/600) | 97,7 % (211/216) | 87,5 % (105/120) | 90,3 % (84/93) |
| Claude Sonnet 5 xhigh | 77,0 % (462/600) | 95,4 % (206/216) | 89,2 % (107/120) | 88,2 % (82/93) |
| Qwen3.6 27B | 74,2 % (445/600) | 97,2 % (210/216) | 86,7 % (104/120) | 87,1 % (81/93) |
| MiniMax M3 | 71,7 % (430/600) | 95,4 % (206/216) | 85,0 % (102/120) | 87,1 % (81/93) |
| Gemma 4 26B A4B IT | 70,5 % (423/600) | 93,5 % (202/216) | 77,5 % (93/120) | 75,3 % (70/93) |
| Claude Opus 4.8 max | 65,8 % (395/600) | 89,8 % (194/216) | 84,2 % (101/120) | 86,0 % (80/93) |
| Nemotron 3 Ultra | 66,0 % (396/600) | 92,1 % (199/216) | 77,5 % (93/120) | 86,0 % (80/93) |
| Qwen3.6 35B A3B | 64,2 % (385/600) | 92,6 % (200/216) | 84,2 % (101/120) | 84,9 % (79/93) |
| Step 3.5 Flash | 58,5 % (351/600) | 88,4 % (191/216) | 79,2 % (95/120) | 86,0 % (80/93) |
| GPT-OSS 120B high | 60,3 % (362/600) | 85,2 % (184/216) | 75,8 % (91/120) | 76,3 % (71/93) |
| Gemma 4 31B IT | 50,3 % (302/600) | 92,6 % (200/216) | 81,7 % (98/120) | 72,0 % (67/93) |
| MiMo V2.5 Pro | 50,5 % (303/600) | 88,0 % (190/216) | 80,8 % (97/120) | 76,3 % (71/93) |
| Ternary Bonsai 27B | 34,8 % (209/600) | 75,5 % (163/216) | 65,8 % (79/120) | 48,4 % (45/93) |
| Laguna S 2.1 | 26,5 % (159/600) | 61,6 % (133/216) | 65,8 % (79/120) | 49,5 % (46/93) |

## Zusammensetzung

Die öffentliche Satz enthält 1.029 Testfälle in vier Ebenen. Ein private zurückgehaltene Satz von rund 200 weitere Testfälle, nach dieselbe Standard geprüft, wird nie veröffentlicht und misst Trainingskontamination über die Zeit. Jede veröffentlichte Zeile trägt ein Canary-GUID, damit die Daten aus Trainingskorpora gefiltert werden können.

| Ebene | Testfälle | Aufgabe |
| --- | --- | --- |
| naturalistic | 600 | Echte Prosa mit zusammenwirkende Regeln. Zu die Hälfte kanonische Literatur (1500 bis 1955), zu die Hälfte zeitgenössische Deutsch aus Wikipedia, Tatoeba und handgeschriebene Sätze. |
| targeted | 216 | Handgeschriebene Testfälle, das seltene Regeln auf mindestens 25 Beobachtungen heben. |
| guards | 120 | Überkorrektur-Fallen in acht Familien. Formen, das Alman behält und das ein Oberflächenformen-Entferner fälschlich ändern würde. |
| curated | 93 | Handübersetzte demonstrative Kern. Jede Regel der Spezifikation ist die ausgewiesene Ziel von mindestens ein Testfall. |

## Beispiel-Testfall

Ein naturalistische Testfall aus die deutsche Wikipedia. Die Genitiv nach *Familie* darf *der* behalten oder die *von*-Umschreibung nehmen. Daher führt die Referenz beide gültige Wiedergaben auf.

**Standarddeutsch:** Der Braunbär gehört zu den Säugetieren aus der Familie der Bären.

**Gültige Wiedergaben:**

- Die Braunbär gehört zu die Säugetiere aus die Familie der Bären. (kanonisch)
- Die Braunbär gehört zu die Säugetiere aus die Familie von die Bären.

## Die Benchmark ausführen

Die Datensatz ist auf Hugging Face veröffentlicht. Die Benchmark-Code liegt in die alman-Repository und läuft gegen jede von Inspect AI unterstützte Modell.

```python
from datasets import load_dataset

ds = load_dataset("osolmaz/almanbench", split="test")
```

```console
uv run inspect eval alman/bench/task.py --model openai/gpt-5-codex
```

## Zitieren

```bibtex
@misc{almanbench2026,
  title        = {AlmanBench: A Standard German to Alman Translation Benchmark},
  author       = {Solmaz, Onur},
  year         = {2026},
  howpublished = {\url{https://alman.ai/almanbench/}}
}
```
