MIT-Lizenz · Offene Gewichte · Erschienen am 26. August 2026

GLM-5.3-FlashFrontier-Intelligenz, offene Gewichte

GLM-5.3-Flash ist das offene Frontier-Modell von Z.ai, erschienen am 26. August 2026 unter der MIT-Lizenz. Es liegt im Artificial Analysis Intelligenzindex auf Niveau von Claude Opus 4.8, bietet ein Kontextfenster von 1.310.720 Tokens sowie native Text-, Bild- und Video-Eingabe — bei einem 320B-Parameter-MoE, der nur 18B aktiviert. Testen Sie es auf Felo AI Search oder rufen Sie es über die Felo API auf.

Verfügbar auf Felo AI Search und in der Felo API

Modellkarte

GLM-5.3-Flash auf einen Blick

Lizenz
MIT · Offene Gewichte
Parameter
320B gesamt · 18B aktiv
Kontextfenster
1.31M Tokens
Maximale Ausgabe
48K Tokens
Eingabe
Text · Bild · Video
Hybride Sparse- und Linear-Attention: rund 3× weniger Attention-Berechnung und 4,4× kleinere KV cache als bei GLM-5.3.

57

Intelligenzindex

Artificial Analysis · auf Niveau von Claude Opus 4.8

1M

Kontextfenster

1.310.720 Tokens Eingabe

48K

Maximale Ausgabe

48.000 Tokens pro Antwort

MIT

Lizenz

MIT · offene Gewichte

Was die Architektur besonders macht

Z.ai hat die GLM-5-Serie um ein hybrides Attention-Design herum neu aufgebaut und macht damit Intelligenz auf höchstem Niveau praktisch einsetzbar.

Hybride Sparse + Linear Attention

Das erste offene Frontier-Modell, das sparse und lineare Attention vereint. Ein leichtgewichtiger IndexPool hält den Index-Cache bei einem Viertel der Größe, und Manifold-Constrained Hyper-Connections (mHC) verbessern das Scaling — rund 3× weniger Attention-Berechnung und ein 4,4× kleinerer KV cache als bei GLM-5.3, bei voller Präzision im langen Kontext.

Offene Gewichte, MIT-Lizenz

Vollständige Gewichte unter MIT-Lizenz veröffentlicht. Selbst hosten, feintunen oder über Z.ai oder einen der 10+ Anbieter einsetzen, die das Modell auf OpenRouter hosten.

Erstes nativ multimodales GLM-5

Trainiert auf einem multimodalen Korpus mit 30 Billionen Tokens, liest es Texte, Bilder und Videos direkt — ohne separate Vision-Pipeline, ohne mehrere Modelle zusammenzubinden.

Frontier-Arbeit in Flash-Geschwindigkeit

Ein 320B-Parameter-MoE, das pro Token nur 18B aktiviert, erledigt Aufgaben auf Frontier-Niveau mit Agenten-Tempo.

Auf Niveau mit Claude Opus 4.8

Artificial Analysis Intelligenzindex: 57 für GLM-5.3-Flash, 57 für Claude Opus 4.8. Agentic Index: 58 — über Claude Opus 4.8, Claude Fable 5 und GPT-5.6 Sol.

Gebaut für Coding und Agenten

Z.ai Code Bench (max. Aufwand): 29.0 — gegenüber 29.5 bei Claude Opus 4.8. DeepSWE v1.1: 63.4 — 17.2 Punkte über GLM-5.2.

Eine Anfrage für Text, Bilder und Video

Ein Kontextfenster von 1.310.720 Tokens mit nativem multimodalen Input. Chartography: 78.0 gegenüber 64.3 bei DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 gegenüber 69.4.

Antworten unter einer Sekunde

Anbieter auf OpenRouter messen eine mediane First-Token-Zeit von 0.55s und eine Spitzenleistung von rund 134 Tokens/s — bei 10+ Auswahlmöglichkeiten.

Offizielle Modellkarten-Benchmarks

GLM-5.3-Flash vs. die Top-Frontier-Modelle

Offizielle Ergebnisse aus der Z.ai-Modellkarte: GLM-5.3-Flash gegen GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra und Gemini 3.7 Flash, August 2026. Höher ist besser — fett markiert den besten Wert in jeder Zeile.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Coding

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agentic

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Vision

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Quelle: offizielle Z.ai-Modellkarte, August 2026. Selbstberichtete Werte; Ergebnisse können je nach Auswertungs-Setup abweichen.

Z.ai Code Bench (max. Aufwand): 29.0 vs. 29.5 bei Claude Opus 4.8 · Artificial Analysis Agentic Index: 58, über Claude Opus 4.8

Z.ai-Ankündigung lesen
Unabhängige Rankings

GLM-5.3-Flash in Rankings von Drittanbietern

Frontend-Design-Skill auf DesignArena und Wert auf der Pareto-Frontier von Artificial Analysis.

DesignArena — Frontend gesamt (nicht agentisch)

DesignArena — Frontend gesamt (nicht agentisch)

GLM-5.3-Flash erreicht im Frontend-Elo von DesignArena 1348 und 1345 — Platz 5 und 6 insgesamt, hinter Kimi K3, GPT-5.6 Sol und Claude Opus 5 sowie vor GLM-5.2, Gemini 3.7 Flash und Claude Sonnet 5.

Quelle: DesignArena von Intelligence · Elo Rating · Alle Modelle

Artificial Analysis — Pareto-Frontier aus Kosten und Leistung

Artificial Analysis — Pareto-Frontier aus Kosten und Leistung

57 Punkte im Intelligenzindex bei $0.045 pro Aufgabe — GLM-5.3-Flash liegt mit GPT-5.6 Sol (max) und Claude Opus 5 (max) auf der Pareto-Frontier, zu einem Bruchteil von deren Kosten.

Quelle: Artificial Analysis, aktualisiert am 26. August 2026

Technische Spezifikationen

Die Details, die zählen, wenn Sie GLM-5.3-Flash in Ihren eigenen Workflows einsetzen.

Kontext & Ausgabe

1.310.720 Tokens Eingabe (1M+ Kontext)

48.000 Tokens maximale Ausgabe

Architektur

320B gesamt / 18B aktiv Mixture-of-Experts, 45 Schichten. Hybride Sparse- und Linear-Attention mit IndexPool und Manifold-Constrained Hyper-Connections (mHC).

Lizenz & Gewichte

MIT-lizenzierte offene Gewichte, trainiert auf einem multimodalen Korpus mit 30 Billionen Tokens.

Geschwindigkeit

Mediane First-Token-Latenz von 0.55s und Spitzendurchsatz von rund 134 Tokens/s über OpenRouter-Anbieter (gemessen im August 2026).

Verfügbarkeit

Live auf Felo AI Search und in der Felo API sowie auf der Z.ai-Plattform und über 10+ OpenRouter-Anbieter.

Modalitäten

Native Text-, Bild- und Video-Eingabe mit Text-Ausgabe — das erste nativ multimodale Modell der GLM-5-Serie.

Ein Modell für alle Eingabetypen

Keine separaten Pipelines, keine zusammengebundenen Modelle — GLM-5.3-Flash liest Texte, Bilder und Videos nativ.

Text & Code

Verarbeitet lange Dokumente, Codebasen und strukturierte Daten in einem Durchgang — 63.4 im DeepSWE v1.1, 84.3 im Terminal-Bench 2.1.

Bilder & Diagramme

Screenshots, Diagramme und Schaubilder einspeisen und fundierte Antworten erhalten: Chartography 78.0 vs. 64.3 bei DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% bei Claude Opus 4.8.

Video

Videos zusammen mit Text und Bildern analysieren: MVBench 77.8%, vor DeepSeek-V4-Flash-Vision-Exp mit 69.4%.

Wer nutzt GLM-5.3-Flash

Von Solo-Entwicklern bis zu Teams mit eigener Inferenz: GLM-5.3-Flash deckt Coding, Recherche und multimodale Arbeit mit einem einzigen offenen Modell ab.

Agenten-Coding

Mit 63.4 im DeepSWE v1.1 und 48.8 im AutomationBench v1.0.6 ist es die starke Wahl für Coding-Agenten, Multi-File-Edits und lange Call-Ketten.

Langfristige Agentenarbeit

Toolathlon 78.4 und ein 1.31M-Token-Fenster halten eine einzelne Session über viele Schritte stabil, ohne Kontextverlust.

Multimodale Recherche

Dokumente, Screenshots, Diagramme und Videoframes in einer Anfrage kombinieren und strukturierte Antworten samt Quellen erhalten.

Video- & Bildanalyse

MVBench 77.8 und Chartography 78.0 decken Videoverständnis, Diagrammlesen und Layout-Analyse von Dokumenten ab.

Selbst hosten

Dank MIT-Lizenz und nur 18B aktiven Parametern können Sie die Gewichte selbst betreiben — für datensensible oder feingetunte Workflows.

Felo-Agenten & Pipelines

Rufen Sie es über die Felo API auf, um Agenten, Automatisierungen und maschinenlesbare Tool-Pipelines zu bauen.

Zwei Wege, GLM-5.3-Flash zu nutzen

Auf Felo AI Search nutzen

Felo AI Search öffnen, Fragen stellen, mit KI im Web suchen und zitierte Antworten von GLM-5.3-Flash erhalten.

Felo AI Search öffnen

Die Felo API aufrufen

Felo-API-Key holen, Basis-URL setzen und das Modell aus Claude Code, Codex, Hermes Agent oder einem eigenen OpenAI-kompatiblen Agenten aufrufen.

Zur Felo API

Häufig gestellte Fragen

GLM-5.3-Flash ist das offene Frontier-Modell von Z.ai, erschienen am 26. August 2026. Es ist ein Mixture-of-Experts-Modell mit 320B Parametern, von denen 18B aktiv sind, einem Kontextfenster von 1.310.720 Tokens, nativer Text-, Bild- und Video-Eingabe sowie hybrider Sparse-Linear-Attention. Es steht unter der MIT-Lizenz.

Mit GLM-5.3-Flash auf Felo starten

Das offene Frontier-Modell von Z.ai — 1.31M-Token-Kontext, native multimodale Eingabe und Agentenklasse-Coding an einem Ort.

GLM-5.3-Flash auf Felo AI Search öffnen

Auch auf der Z.ai-Plattform und in der Felo API