---
title: "AlmanBench"
language: de
date: 2026-07-25
canonical: https://alman.ai/de/almanbench/
---

AlmanBench misst sprachliches und grammatisches Schlussfolgern, speziell im Deutschen. Ihre 1.029 öffentlichen Testfälle prüfen, ob ein Sprachmodell die vollständige Alman-Spezifikation auf echte deutsche Prosa anwenden kann, von kanonischer Literatur bis zu zeitgenössischen Texten.

AlmanBench genießt außerdem eine seltene Form von Benchmark-Integrität. Kein Labor wird einen Trainingslauf darauf verschwenden, einen Datensatz zur deutschen Sprachvereinfachung zu manipulieren, also messen die Scores, was die Modelle tatsächlich können. Obskurität ist unsere Kontaminationsrichtlinie.

[Datensatz](https://huggingface.co/datasets/osolmaz/almanbench) · [Ergebnisse](https://huggingface.co/datasets/osolmaz/almanbench-results) · [GitHub](https://github.com/osolmaz/alman) · [Spezifikation](https://alman.ai/de/#spec)

## Ergebnisse

| Nr. | Modell | Score ↑ |
| --- | --- | --- |
| 1 | GPT-5.5 xhigh | 94,8 % (976/1029) |
| 2 | Claude Opus 5 max | 94,5 % (972/1029) |
| 3 | GPT-5.6 Sol max | 94,4 % (971/1029) |
| 4 | Claude Fable 5 high | 94,1 % (968/1029) |
| 5 | GPT-5.6 Sol xhigh | 93,5 % (962/1029) |
| 6 | Claude Fable 5 max | 93,4 % (961/1029) |
| 7 | GLM 5.2 | 90,4 % (930/1029) |
| 8 | DeepSeek V4 Flash | 89,7 % (923/1029) |
| 9 | Inkling max | 89,2 % (918/1029) |
| 10 | GPT-5.6 Luna xhigh | 87,7 % (902/1029) |
| 11 | GPT-5.6 Terra xhigh | 87,5 % (900/1029) |
| 12 | Kimi K2.7 Code | 87,0 % (895/1029) |
| 13 | DeepSeek V4 Pro | 85,3 % (878/1029) |
| 14 | Claude Sonnet 5 xhigh | 83,3 % (857/1029) |
| 15 | Qwen3.6 27B | 81,6 % (840/1029) |
| 16 | MiniMax M3 | 79,6 % (819/1029) |
| 17 | Gemma 4 26B A4B IT | 76,6 % (788/1029) |
| 18 | Claude Opus 4.8 max | 74,8 % (770/1029) |
| 19 | Nemotron 3 Ultra | 74,6 % (768/1029) |
| 20 | Qwen3.6 35B A3B | 74,3 % (765/1029) |
| 21 | Step 3.5 Flash | 69,7 % (717/1029) |
| 22 | GPT-OSS 120B high | 68,8 % (708/1029) |
| 23 | Gemma 4 31B IT | 64,8 % (667/1029) |
| 24 | MiMo V2.5 Pro | 64,2 % (661/1029) |
| 25 | Ternary Bonsai 27B | 48,2 % (496/1029) |
| 26 | Laguna S 2.1 | 40,5 % (417/1029) |

### Score nach Ebene

| Modell | naturalistic | targeted | guards | curated |
| --- | --- | --- | --- | --- |
| GPT-5.5 xhigh | 94,2 % (565/600) | 100,0 % (216/216) | 87,5 % (105/120) | 96,8 % (90/93) |
| Claude Opus 5 max | 94,5 % (567/600) | 95,8 % (207/216) | 88,3 % (106/120) | 98,9 % (92/93) |
| GPT-5.6 Sol max | 93,3 % (560/600) | 100,0 % (216/216) | 87,5 % (105/120) | 96,8 % (90/93) |
| Claude Fable 5 high | 93,7 % (562/600) | 98,1 % (212/216) | 87,5 % (105/120) | 95,7 % (89/93) |
| GPT-5.6 Sol xhigh | 92,2 % (553/600) | 99,5 % (215/216) | 87,5 % (105/120) | 95,7 % (89/93) |
| Claude Fable 5 max | 92,7 % (556/600) | 96,3 % (208/216) | 89,2 % (107/120) | 96,8 % (90/93) |
| GLM 5.2 | 88,3 % (530/600) | 96,3 % (208/216) | 86,7 % (104/120) | 94,6 % (88/93) |
| DeepSeek V4 Flash | 86,5 % (519/600) | 97,2 % (210/216) | 88,3 % (106/120) | 94,6 % (88/93) |
| Inkling max | 85,3 % (512/600) | 100,0 % (216/216) | 85,8 % (103/120) | 93,5 % (87/93) |
| GPT-5.6 Luna xhigh | 83,3 % (500/600) | 98,1 % (212/216) | 85,8 % (103/120) | 93,5 % (87/93) |
| GPT-5.6 Terra xhigh | 83,0 % (498/600) | 96,3 % (208/216) | 88,3 % (106/120) | 94,6 % (88/93) |
| Kimi K2.7 Code | 83,0 % (498/600) | 94,9 % (205/216) | 87,5 % (105/120) | 93,5 % (87/93) |
| DeepSeek V4 Pro | 79,7 % (478/600) | 97,7 % (211/216) | 87,5 % (105/120) | 90,3 % (84/93) |
| Claude Sonnet 5 xhigh | 77,0 % (462/600) | 95,4 % (206/216) | 89,2 % (107/120) | 88,2 % (82/93) |
| Qwen3.6 27B | 74,2 % (445/600) | 97,2 % (210/216) | 86,7 % (104/120) | 87,1 % (81/93) |
| MiniMax M3 | 71,7 % (430/600) | 95,4 % (206/216) | 85,0 % (102/120) | 87,1 % (81/93) |
| Gemma 4 26B A4B IT | 70,5 % (423/600) | 93,5 % (202/216) | 77,5 % (93/120) | 75,3 % (70/93) |
| Claude Opus 4.8 max | 65,8 % (395/600) | 89,8 % (194/216) | 84,2 % (101/120) | 86,0 % (80/93) |
| Nemotron 3 Ultra | 66,0 % (396/600) | 92,1 % (199/216) | 77,5 % (93/120) | 86,0 % (80/93) |
| Qwen3.6 35B A3B | 64,2 % (385/600) | 92,6 % (200/216) | 84,2 % (101/120) | 84,9 % (79/93) |
| Step 3.5 Flash | 58,5 % (351/600) | 88,4 % (191/216) | 79,2 % (95/120) | 86,0 % (80/93) |
| GPT-OSS 120B high | 60,3 % (362/600) | 85,2 % (184/216) | 75,8 % (91/120) | 76,3 % (71/93) |
| Gemma 4 31B IT | 50,3 % (302/600) | 92,6 % (200/216) | 81,7 % (98/120) | 72,0 % (67/93) |
| MiMo V2.5 Pro | 50,5 % (303/600) | 88,0 % (190/216) | 80,8 % (97/120) | 76,3 % (71/93) |
| Ternary Bonsai 27B | 34,8 % (209/600) | 75,5 % (163/216) | 65,8 % (79/120) | 48,4 % (45/93) |
| Laguna S 2.1 | 26,5 % (159/600) | 61,6 % (133/216) | 65,8 % (79/120) | 49,5 % (46/93) |

## Zusammensetzung

Der öffentliche Satz enthält 1.029 Testfälle in vier Ebenen. Ein privater zurückgehaltener Satz von rund 200 weiteren Testfällen, nach demselben Standard geprüft, wird nie veröffentlicht und misst Trainingskontamination über die Zeit. Jede veröffentlichte Zeile trägt eine Canary-GUID, damit die Daten aus Trainingskorpora gefiltert werden können.

| Ebene | Testfälle | Aufgabe |
| --- | --- | --- |
| naturalistic | 600 | Echte Prosa mit zusammenwirkenden Regeln. Zur Hälfte kanonische Literatur (1500 bis 1955), zur Hälfte zeitgenössisches Deutsch aus Wikipedia, Tatoeba und handgeschriebenen Sätzen. |
| targeted | 216 | Handgeschriebene Testfälle, die seltene Regeln auf mindestens 25 Beobachtungen heben. |
| guards | 120 | Überkorrektur-Fallen in acht Familien. Formen, die Alman behält und die ein Oberflächenformen-Entferner fälschlich ändern würde. |
| curated | 93 | Handübersetzter demonstrativer Kern. Jede Regel der Spezifikation ist das ausgewiesene Ziel von mindestens einem Testfall. |

## Beispiel-Testfall

Ein naturalistischer Testfall aus der deutschen Wikipedia. Der Genitiv nach *Familie* darf *der* behalten oder die *von*-Umschreibung nehmen. Daher führt die Referenz beide gültigen Wiedergaben auf.

**Standarddeutsch:** Der Braunbär gehört zu den Säugetieren aus der Familie der Bären.

**Gültige Wiedergaben:**

- Die Braunbär gehört zu die Säugetiere aus die Familie der Bären. (kanonisch)
- Die Braunbär gehört zu die Säugetiere aus die Familie von die Bären.

## Die Benchmark ausführen

Der Datensatz ist auf Hugging Face veröffentlicht. Der Benchmark-Code liegt im alman-Repository und läuft gegen jedes von Inspect AI unterstützte Modell.

```python
from datasets import load_dataset

ds = load_dataset("osolmaz/almanbench", split="test")
```

```console
uv run inspect eval alman/bench/task.py --model openai/gpt-5-codex
```

## Zitieren

```bibtex
@misc{almanbench2026,
  title        = {AlmanBench: A Standard German to Alman Translation Benchmark},
  author       = {Solmaz, Onur},
  year         = {2026},
  howpublished = {\url{https://alman.ai/almanbench/}}
}
```
