01 — DER NACHWEIS · 29.08.2026
Fast auf dem Niveau der besten Modelle der Welt.
Zwei unabhängige Ranglisten, an diesem Tag aufgenommen. Wir publizieren keine Numezis-Scores: wir publizieren, was Dritte messen.
Der Abstand zwischen dem besten offenen und dem besten geschlossenen Modell, über 127 Modelle gemessen auf denselben 22 Benchmarks. Artificial Analysis, 29.08.2026.
Der Abstand zwischen dem besten offenen (Kimi K3, 1 674) und dem besten geschlossenen Modell (Claude Opus 5, 1 691), auf anonymen Menschen-Voten. LMArena, 29.08.2026.
Der Rang des leistungsfähigsten Modells, das eine Organisation wirklich in ihren Räumlichkeiten betreiben kann — GLM-5.3-Flash. Vor der Hälfte der Modelle am Markt.
Was eine Aufgabe auf einer Top-API kostet (2,34 $) im Vergleich zu einem installierten offenen Modell (0,09 $). Artificial Analysis, 29.08.2026.
02 — DIE RANGLISTEN
Was Dritte messen.
Jeder Rang ist auf der Quellseite zum Erhebungsdatum überprüfbar. Die Klassen wechseln jedes Quartal; was nicht wechselt, ist die Grössenordnung.
| Modell | Score | Typ | |
|---|---|---|---|
| 1 | Claude Opus 5 (max)API | 1 691 | |
| 2 | Kimi K3 (max)OFFEN | 1 674 | |
| 3 | Qwen 3.8 MaxOFFEN | 1 669 | |
| 4 | Claude Opus 5 (high)API | 1 663 | |
| 5 | GLM-5.3 (max)OFFEN | 1 599 | |
| 6 | Qwen 3.8 27BOFFEN | 1 595 | |
| 7 | Gemini 3.7 Flash (high)API | 1 587 |
| Modell | Rang | Score | Maschine |
|---|---|---|---|
| Qwen 3.8 27BOFFEN | 30von 127 Modellen | 52 | N1 · N2 · N4 |
| Qwen 3.8 Flash-NextOFFEN | 20von 127 Modellen | 56 | N2 · N4 |
| GLM-5.3-FlashOFFEN | 15von 127 Modellen | 57 | N2 · N4 |
| DeepSeek V4 FlashOFFEN | 31von 127 Modellen | 52 | N4 |
| Claude Opus 5 (high)API | 4von 127 Modellen | 61 | — |
| Claude Opus 5 (max)API | 1von 127 Modellen | 63 | — |
Die «Max»-Versionen, die die Ranglisten dominieren (Kimi K3: 2 800 Milliarden Parameter, Qwen 3.8 Max, GLM-5.3), erfordern Cluster aus mehreren Dutzend Karten und bleiben API-Dienste. Sie dienen hier als Niveau-Referenz. Was die Maschine installiert, ist das obige Verzeichnis — die leistungsfähigsten Modelle, die eine Organisation wirklich in ihren eigenen Räumlichkeiten betreiben kann.
Quellen: LMArena ↗ · Artificial Analysis ↗ · Deloitte ↗ — aufgenommen am 29.08.2026
03 — DIE KOSTEN
Leistung ist nicht, was es kostet.
Ein installiertes offenes Modell hat eine Grenzkosten, die gegen null geht. Dieselbe Arbeit, per API, wird pro Aufgabe bezahlt.
Der RechnerDer Preis einer Aufgabe auf GLM-5.3-Flash, installiert bei Ihnen. Die Top-API berechnet für dieselbe Aufgabe 2,34 $.
Die eingesparte API-Rechnung für eine Organisation mit 20 Personen bei regelmässigem Einsatz — 73'000 Aufgaben pro Jahr. Der Rechner zeichnet die Kurve mit Ihren Zahlen.
Inferenzkosten, eingespart vor Ort gegenüber der öffentlichen Cloud, bei bedeutendem Volumen. Deloitte, State of AI in the Enterprise.
04 — WAS DIE MASCHINE BETRIEBT
Keine Versprechen. Benannte Modelle.
Verifiziert auf ihren offiziellen Karten, 29. August 2026: Grösse, Speicher, Lizenz. Das ist installiert, nicht die API-Versionen der Ranglisten.
| Modell | Parameter | Speicher (BF16) | Maschine | Lizenz |
|---|---|---|---|---|
| Qwen 3.8 27BAlibaba · 256 k tokens | 27 B · dense | ≈ 56 Go (BF16) | N1 · N2 · N4 | Apache 2.0 |
| GLM-5.3-FlashZ.ai · 256 k tokens | 320 B · 18 B actifs | ≈ 320 Go (BF16) | N2 · N4 | MIT |
| DeepSeek V4 FlashDeepSeek · 1 M tokens | 284 B · 13 B actifs | ≈ 291 Go (BF16) | N4 | MIT |
| Apertus 70BSCHWEIZEREPFL / ETH / CSCS · 131 k tokens | 71 B · dense | ≈ 142 Go (BF16) | N2 · N4 | Apache 2.0 |
| Apertus v1.5 8BSCHWEIZEREPFL / ETH / CSCS · 131 k tokens | 9 B · dense | ≈ 18 Go (BF16) | N1 · N2 · N4 | Apache 2.0 |
Speicher: Grösse der Modellgewichte in BF16, ohne Kontextspeicher. Der Wechsel zwischen Modellen ist im Service enthalten, jedes Quartal. Apertus ist das Schweizer Modell (EPFL / ETH / CSCS), für den öffentlichen und para-öffentlichen Sektor standardmässig vorgeschlagen.
05 — WAS BENCHMARKS NICHT MESSEN
100 % gilt nur für die Architektur.
Ein Benchmark misst, was ein Modell kann. Er misst nicht, wo Ihre Dokumente sind, während es es tut.
Mit einem Ingenieur sprechenDer wesentliche Unterschied: Ein 97-%-Modell, das in Ihrem Gebäude läuft, schlägt ein 100-%-Modell, das woanders läuft.
Kein ausgehender Datenfluss von Kundeninhalten, durch Konstruktion — nicht durch Versprechen. Jährlich attestiert, dem Revisor vorlegbar.
Keine Architektur ist frei von jedem Risiko. Der Unterschied liegt darin zu wissen, was man beweisen kann — und es der Aufsichtsbehörde vorzulegen.