GLM-5.3-FlashFrontier-Intelligenz, offene Gewichte
GLM-5.3-Flash ist das offene Frontier-Modell von Z.ai, erschienen am 26. August 2026 unter der MIT-Lizenz. Es liegt im Artificial Analysis Intelligenzindex auf Niveau von Claude Opus 4.8, bietet ein Kontextfenster von 1.310.720 Tokens sowie native Text-, Bild- und Video-Eingabe — bei einem 320B-Parameter-MoE, der nur 18B aktiviert. Testen Sie es auf Felo AI Search oder rufen Sie es über die Felo API auf.
Verfügbar auf Felo AI Search und in der Felo API
Modellkarte
GLM-5.3-Flash auf einen Blick
- Lizenz
- MIT · Offene Gewichte
- Parameter
- 320B gesamt · 18B aktiv
- Kontextfenster
- 1.31M Tokens
- Maximale Ausgabe
- 48K Tokens
- Eingabe
- Text · Bild · Video
57
Intelligenzindex
Artificial Analysis · auf Niveau von Claude Opus 4.8
1M
Kontextfenster
1.310.720 Tokens Eingabe
48K
Maximale Ausgabe
48.000 Tokens pro Antwort
MIT
Lizenz
MIT · offene Gewichte
Was die Architektur besonders macht
Z.ai hat die GLM-5-Serie um ein hybrides Attention-Design herum neu aufgebaut und macht damit Intelligenz auf höchstem Niveau praktisch einsetzbar.
Hybride Sparse + Linear Attention
Das erste offene Frontier-Modell, das sparse und lineare Attention vereint. Ein leichtgewichtiger IndexPool hält den Index-Cache bei einem Viertel der Größe, und Manifold-Constrained Hyper-Connections (mHC) verbessern das Scaling — rund 3× weniger Attention-Berechnung und ein 4,4× kleinerer KV cache als bei GLM-5.3, bei voller Präzision im langen Kontext.
Offene Gewichte, MIT-Lizenz
Vollständige Gewichte unter MIT-Lizenz veröffentlicht. Selbst hosten, feintunen oder über Z.ai oder einen der 10+ Anbieter einsetzen, die das Modell auf OpenRouter hosten.
Erstes nativ multimodales GLM-5
Trainiert auf einem multimodalen Korpus mit 30 Billionen Tokens, liest es Texte, Bilder und Videos direkt — ohne separate Vision-Pipeline, ohne mehrere Modelle zusammenzubinden.
Frontier-Arbeit in Flash-Geschwindigkeit
Ein 320B-Parameter-MoE, das pro Token nur 18B aktiviert, erledigt Aufgaben auf Frontier-Niveau mit Agenten-Tempo.
Auf Niveau mit Claude Opus 4.8
Artificial Analysis Intelligenzindex: 57 für GLM-5.3-Flash, 57 für Claude Opus 4.8. Agentic Index: 58 — über Claude Opus 4.8, Claude Fable 5 und GPT-5.6 Sol.
Gebaut für Coding und Agenten
Z.ai Code Bench (max. Aufwand): 29.0 — gegenüber 29.5 bei Claude Opus 4.8. DeepSWE v1.1: 63.4 — 17.2 Punkte über GLM-5.2.
Eine Anfrage für Text, Bilder und Video
Ein Kontextfenster von 1.310.720 Tokens mit nativem multimodalen Input. Chartography: 78.0 gegenüber 64.3 bei DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 gegenüber 69.4.
Antworten unter einer Sekunde
Anbieter auf OpenRouter messen eine mediane First-Token-Zeit von 0.55s und eine Spitzenleistung von rund 134 Tokens/s — bei 10+ Auswahlmöglichkeiten.
GLM-5.3-Flash vs. die Top-Frontier-Modelle
Offizielle Ergebnisse aus der Z.ai-Modellkarte: GLM-5.3-Flash gegen GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra und Gemini 3.7 Flash, August 2026. Höher ist besser — fett markiert den besten Wert in jeder Zeile.
Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Coding
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Agentic
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Vision
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Quelle: offizielle Z.ai-Modellkarte, August 2026. Selbstberichtete Werte; Ergebnisse können je nach Auswertungs-Setup abweichen.
Z.ai Code Bench (max. Aufwand): 29.0 vs. 29.5 bei Claude Opus 4.8 · Artificial Analysis Agentic Index: 58, über Claude Opus 4.8
Z.ai-Ankündigung lesenGLM-5.3-Flash in Rankings von Drittanbietern
Frontend-Design-Skill auf DesignArena und Wert auf der Pareto-Frontier von Artificial Analysis.

DesignArena — Frontend gesamt (nicht agentisch)
GLM-5.3-Flash erreicht im Frontend-Elo von DesignArena 1348 und 1345 — Platz 5 und 6 insgesamt, hinter Kimi K3, GPT-5.6 Sol und Claude Opus 5 sowie vor GLM-5.2, Gemini 3.7 Flash und Claude Sonnet 5.
Quelle: DesignArena von Intelligence · Elo Rating · Alle Modelle

Artificial Analysis — Pareto-Frontier aus Kosten und Leistung
57 Punkte im Intelligenzindex bei $0.045 pro Aufgabe — GLM-5.3-Flash liegt mit GPT-5.6 Sol (max) und Claude Opus 5 (max) auf der Pareto-Frontier, zu einem Bruchteil von deren Kosten.
Quelle: Artificial Analysis, aktualisiert am 26. August 2026
Technische Spezifikationen
Die Details, die zählen, wenn Sie GLM-5.3-Flash in Ihren eigenen Workflows einsetzen.
Kontext & Ausgabe
1.310.720 Tokens Eingabe (1M+ Kontext)
48.000 Tokens maximale Ausgabe
Architektur
320B gesamt / 18B aktiv Mixture-of-Experts, 45 Schichten. Hybride Sparse- und Linear-Attention mit IndexPool und Manifold-Constrained Hyper-Connections (mHC).
Lizenz & Gewichte
MIT-lizenzierte offene Gewichte, trainiert auf einem multimodalen Korpus mit 30 Billionen Tokens.
Geschwindigkeit
Mediane First-Token-Latenz von 0.55s und Spitzendurchsatz von rund 134 Tokens/s über OpenRouter-Anbieter (gemessen im August 2026).
Verfügbarkeit
Live auf Felo AI Search und in der Felo API sowie auf der Z.ai-Plattform und über 10+ OpenRouter-Anbieter.
Modalitäten
Native Text-, Bild- und Video-Eingabe mit Text-Ausgabe — das erste nativ multimodale Modell der GLM-5-Serie.
Ein Modell für alle Eingabetypen
Keine separaten Pipelines, keine zusammengebundenen Modelle — GLM-5.3-Flash liest Texte, Bilder und Videos nativ.
Text & Code
Verarbeitet lange Dokumente, Codebasen und strukturierte Daten in einem Durchgang — 63.4 im DeepSWE v1.1, 84.3 im Terminal-Bench 2.1.
Bilder & Diagramme
Screenshots, Diagramme und Schaubilder einspeisen und fundierte Antworten erhalten: Chartography 78.0 vs. 64.3 bei DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% bei Claude Opus 4.8.
Video
Videos zusammen mit Text und Bildern analysieren: MVBench 77.8%, vor DeepSeek-V4-Flash-Vision-Exp mit 69.4%.
Wer nutzt GLM-5.3-Flash
Von Solo-Entwicklern bis zu Teams mit eigener Inferenz: GLM-5.3-Flash deckt Coding, Recherche und multimodale Arbeit mit einem einzigen offenen Modell ab.
Agenten-Coding
Mit 63.4 im DeepSWE v1.1 und 48.8 im AutomationBench v1.0.6 ist es die starke Wahl für Coding-Agenten, Multi-File-Edits und lange Call-Ketten.
Langfristige Agentenarbeit
Toolathlon 78.4 und ein 1.31M-Token-Fenster halten eine einzelne Session über viele Schritte stabil, ohne Kontextverlust.
Multimodale Recherche
Dokumente, Screenshots, Diagramme und Videoframes in einer Anfrage kombinieren und strukturierte Antworten samt Quellen erhalten.
Video- & Bildanalyse
MVBench 77.8 und Chartography 78.0 decken Videoverständnis, Diagrammlesen und Layout-Analyse von Dokumenten ab.
Selbst hosten
Dank MIT-Lizenz und nur 18B aktiven Parametern können Sie die Gewichte selbst betreiben — für datensensible oder feingetunte Workflows.
Felo-Agenten & Pipelines
Rufen Sie es über die Felo API auf, um Agenten, Automatisierungen und maschinenlesbare Tool-Pipelines zu bauen.
Zwei Wege, GLM-5.3-Flash zu nutzen
Auf Felo AI Search nutzen
Felo AI Search öffnen, Fragen stellen, mit KI im Web suchen und zitierte Antworten von GLM-5.3-Flash erhalten.
Felo AI Search öffnenDie Felo API aufrufen
Felo-API-Key holen, Basis-URL setzen und das Modell aus Claude Code, Codex, Hermes Agent oder einem eigenen OpenAI-kompatiblen Agenten aufrufen.
Zur Felo APIHäufig gestellte Fragen
GLM-5.3-Flash ist das offene Frontier-Modell von Z.ai, erschienen am 26. August 2026. Es ist ein Mixture-of-Experts-Modell mit 320B Parametern, von denen 18B aktiv sind, einem Kontextfenster von 1.310.720 Tokens, nativer Text-, Bild- und Video-Eingabe sowie hybrider Sparse-Linear-Attention. Es steht unter der MIT-Lizenz.
Mit GLM-5.3-Flash auf Felo starten
Das offene Frontier-Modell von Z.ai — 1.31M-Token-Kontext, native multimodale Eingabe und Agentenklasse-Coding an einem Ort.
GLM-5.3-Flash auf Felo AI Search öffnenAuch auf der Z.ai-Plattform und in der Felo API