Stand August 2026

LLM-Benchmarks für den Mittelstand

Sechs Fähigkeitsklassen und die Frage, welche davon für Ihre Prozesse zählen.

Die Benchmark-Landschaft wächst schneller, als sie sich sortieren lässt

  • Neue Modellfamilien im Wochentakt, jede mit anderen Schwerpunkten
  • Klassische Wissensbenchmarks sind weitgehend gelöst
  • Öffentliche Leaderboards verdichten Teilfähigkeiten zu einer Rangliste
0
Modelle führen in allen sechs Fähigkeitsklassen gleichzeitig.
Ein Benchmark-Score ist immer nur sinnvoll relativ zu einem Prozess.

Sechs Fähigkeitsklassen

Jede beantwortet eine andere Frage über dasselbe Modell.
Reasoning & Wissen
MMLU-Pro, GPQA
Long Context
LongBench v2
Tool Use & Agenten
BFCL, τ-bench
Dokumente & Vision
DocVQA, OCRBench v2
Faktentreue
SimpleQA
Spezialdomänen
BIRD, SWE-bench

Vom Prozess zur Benchmark-Familie

Die Reihenfolge entscheidet darüber, ob ein Score etwas aussagt.
Prozess Rechnungseingang Service-Anfrage im CRM Gefragte Fähigkeit Layout, Tabellen, Handschrift Werkzeuge korrekt aufrufen Benchmark-Familie DocVQA · OCRBench v2 BFCL · τ-bench
Das Grid · Prozess × Klasse

Sechs Prozessfamilien, sechs Benchmark-Klassen

Unternehmensprozesse
Dokumente &
Vision
Working
Agent
Reasoning &
STEM
Data / SQL /
Facts
Agentic
Coding
01
Posteingang &
Backoffice
Rechnungen, Formulare, Verträge
hoch
Dokumente verstehen
DocVQAOCRBench v2MMMUChartQAOfficeQA Pro
mittel
Office-Schritte ausführen
WorkspaceBenchAutomationBench
niedrig
Recherche ergänzen
WideSearch
mittel
Regeln interpretieren
MMLU-ProLongBench v2
mittel
Zahlen korrekt extrahieren
SimpleQAChartQA
niedrig
Nur bei tiefer Automation
ProgramBench
02
Service, Vertrieb &
Innendienst
Anfragen, Status, Folgeaktionen
mittel
Anhänge und Angebote lesen
DocVQAMMMU
hoch
Tools & Policies beherrschen
BFCLτ-benchToolathlon-VerifiedSkillsBench
hoch
Informationen aktiv beschaffen
WideSearchOneMillionBenchDRACO
mittel
Argumentieren & priorisieren
LiveBenchMMLU-Pro
hoch
Fakten stabil halten
SimpleQA
niedrig
Code nur indirekt wichtig
ProgramBench
03
Wissensarbeit,
HR, Recht, PMO
Richtlinien, Akten, E-Mails, Wissen
mittel
Dokumente lesen
DocVQAOfficeQA Pro
mittel
Arbeitskontext verstehen
WorkspaceBenchJobBench
hoch
Quellen finden & verknüpfen
WideSearchDRACO
hoch
Lange Kontexte durchdenken
LongBench v2LiveBenchMMLU-Pro
hoch
Faktentreue sichern
SimpleQA
niedrig
Coding selten Kern
DataSWE
04
Controlling,
BI & Analytics
KPIs, SQL, Charts, Reports
mittel
Reports visuell lesen
ChartQAMMMU
mittel
Analystische Workflows ausführen
OfficeQA ProWorkspaceBench
mittel
Externe Daten beschaffen
WideSearch
mittel
Ergebnisse interpretieren
LiveBenchMMLU-Pro
hoch
SQL, Fakten, Kennzahlen
BIRDFinanceBenchSimpleQA
mittel
Skripte & Datenhilfen
ProgramBenchDataSWE
05
IT, Software &
Automatisierung
Tickets, Code, Tests, Integrationen
niedrig
Visuelle Inputs sind Randthema
MMMU
hoch
Aktionen im System ausführen
BFCLAutomationBenchAgents' Last Exam
niedrig
Recherche nur ergänzend
DRACO
mittel
Repo- und Systemlogik
LongBench v2
niedrig
Fakten eher sekundär
SimpleQA
hoch
Coding in echter Umgebung
SWE-benchSWE-bench ProTerminal-BenchSWE-Atlas
06
F&E, Engineering &
Expertenarbeit
Technische Analysen, Fachlogik
mittel
Technische Artefakte lesen
MMMUChartQA
mittel
Tool-gestützt arbeiten
HLE (with tools)
niedrig
Recherche flankiert
WideSearch
hoch
Fachliches Tiefen-Reasoning
GPQA DiamondMMLU-ProBioMysteryBenchSUPERChemHorizonMath
mittel
Messwerte & Fakten
SimpleQAFinanceBench
mittel
Technisches Coding
DataSWENL2Repo-Bench
Kapitel · Die Seiten im Original

Vier Leaderboards, die Sie kennen sollten

Und was auf jeder Seite tatsächlich in den Spalten steht.

Arena — die bekannteste Rangliste

Menschen stimmen ab, welche von zwei anonymen Antworten ihnen besser gefällt.
Arena Leaderboard Overview mit Top-10-Rangliste der Agent-Kategorie
arena.ai/leaderboard · abgerufen am 28.08.2026

BFCL — Werkzeugaufrufe, aufgeschlüsselt

Getrennte Spalten für agentische Aufgaben, Multi-Turn, Einzelaufrufe — und für Kosten.
BFCL V4 Leaderboard mit Spalten für Overall Accuracy, Kosten, Agentic, Multi Turn und Single Turn
gorilla.cs.berkeley.edu/leaderboard.html · abgerufen am 28.08.2026

SWE-bench — Prozent gelöster Tickets

Der Score gehört der Kombination aus Modell, Agent-Setup und Version.
SWE-bench Verified Leaderboard mit Spalten für Modell, Agent, % Resolved, Kosten, Datum und Release
swebench.com · abgerufen am 28.08.2026

LiveBench — gegen auswendig gelernte Aufgaben

Regelmäßig neue Fragen, frühere Stände bleiben als Zeitleiste sichtbar.
LiveBench Startseite mit Release-Zeitleiste und Leaderboard nach Kategorien
livebench.ai · abgerufen am 28.08.2026

So lesen Sie eine Benchmark-Seite

  • Spalten vor Gesamtwert — die Kategorie, die zu Ihrem Prozess passt, steht selten ganz links
  • Datum und Version — ein Score ohne Stand ist ein Score ohne Aussage
  • Agent- und Prompt-Setup — dasselbe Modell erreicht unter anderem Gerüst andere Werte
  • Kosten pro Lauf — bei hohem Volumen entscheidet diese Spalte über den Business Case
  • Abstände lesen — zwischen Platz eins und Platz zehn liegen oft wenige Punkte
Stapel eingehender Papierdokumente auf einem Schreibtisch

Rechnungseingang

Was im Posteingang tatsächlich geprüft wird.
Gefragte Fähigkeit
  • Layout verstehen, Tabellen lesen, Stempel und Handschrift erfassen
Passende Benchmarks
  • DocVQA, OCRBench v2, MMMU, ChartQA
Warnsignal
  • Die Auswahl stützt sich allein auf einen Textbenchmark
Servicemitarbeiter mit Headset am Arbeitsplatz

Service-Agent am CRM

Was ein Agent im laufenden Prozess leisten muss.
Gefragte Fähigkeit
  • Systeme korrekt aufrufen, Regeln einhalten, über mehrere Schritte konsistent bleiben
Passende Benchmarks
  • BFCL, τ-bench
Warnsignal
  • Chat-Qualität dient als Beleg für Prozessfähigkeit

Dieselbe Zuordnung, drei weitere Prozesse

  • Interner Wissensbot → LongBench v2, SimpleQA
  • BI-Assistenz mit SQL → BIRD, ChartQA
  • Entwicklerassistenz → SWE-bench, LongBench v2, BFCL

Vier Fehlschlüsse, die in Auswahlprozessen Geld kosten

  • „Modell X führt das Leaderboard an." → Modell X ist in Benchmark-Familie Y stark.
  • „Ein hoher Reasoning-Score genügt für Automatisierung." → Für Automatisierung sagen BFCL und τ-bench mehr aus.
  • „OCR beherrscht heute jedes Modell." → Für Dokumentenprozesse gehören OCRBench v2 und DocVQA geprüft.
  • „Große Kontextlänge im Datenblatt bedeutet Verständnistiefe." → LongBench v2 liegt näher an der realen Frage.
20–50
echte Fälle aus Ihrem Unternehmen, an denen ein Modell sich beweist.

Fünf Prüfblöcke in dieser Reihenfolge

Öffentliche Benchmarks als Filter, eigene Prozessfälle als Entscheidung.
1 Benchmark- Passung 2 Prozesssimulation 3 Fehlerkosten 4 Tool- & Integrationsreife 5 Betrieblichkeit
Für welchen Prozess, unter welchen Qualitätsanforderungen, ist welches Modell das richtige?
skillbyte

Benchmark-Passung und Ihre echten Prozessfälle

Alles aus dieser Präsentation steht ausführlich in einem Dossier: sechs Fähigkeitsklassen, vier Leaderboards, fünf Prüfblöcke. Dossier anfordern oder Gespräch vereinbaren.