GLM-5.3-FlashIntelligenza di frontiera, pesi aperti
GLM-5.3-Flash è il modello frontier a pesi aperti di Z.ai, rilasciato il 26 agosto 2026 sotto licenza MIT. Allinea Claude Opus 4.8 sull'Indice di Intelligenza di Artificial Analysis, con una finestra di contesto da 1.310.720 token, input nativo di testo, immagini e video e un MoE da 320B di parametri che ne attiva solo 18B. Provalo su Felo AI Search oppure chiamalo tramite la Felo API.
Disponibile su Felo AI Search e nella Felo API
Scheda del modello
GLM-5.3-Flash in breve
- Licenza
- MIT · Pesi aperti
- Parametri
- 320B totali · 18B attivi
- Finestra di contesto
- 1.31M token
- Output massimo
- 48K token
- Input
- Testo · Immagine · Video
57
Indice di Intelligenza
Artificial Analysis · a livello di Claude Opus 4.8
1M
Finestra di contesto
1.310.720 token in input
48K
Output massimo
48.000 token per risposta
MIT
Licenza
MIT · pesi aperti
Cosa rende l'architettura speciale
Z.ai ha ricostruito la serie GLM-5 attorno a un design di attenzione ibrida, rendendo pratico servire un'intelligenza di livello top.
Attenzione ibrida sparse + lineare
Il primo modello frontier aperto a combinare attenzione sparse e lineare. Un IndexPool leggero riduce l'index cache a un quarto delle dimensioni e le Connessioni Iper-Costrette di Manifold (mHC) migliorano lo scaling — circa 3× meno calcolo di attenzione e KV cache 4,4× più piccola rispetto a GLM-5.3, mantenendo la precisione sui contesti lunghi.
Pesi aperti, licenza MIT
Pesi completi pubblicati sotto MIT. Puoi auto-ospitarlo, raffinarlo o distribuirlo tramite Z.ai o uno qualsiasi dei 10+ provider che lo ospitano su OpenRouter.
Primo GLM-5 nativamente multimodale
Addestrato su un corpus multimodale da 30T token, legge testo, immagini e video direttamente — senza pipeline di vision separata, senza dover assemblare più modelli.
Lavoro da frontier, velocità Flash
Un MoE da 320B di parametri che attiva solo 18B per token porta a termine lavoro di livello frontier alla velocità di un agente.
A livello di Claude Opus 4.8
Indice di Intelligenza di Artificial Analysis: 57 per GLM-5.3-Flash e 57 per Claude Opus 4.8. Indice Agente: 58, sopra Claude Opus 4.8, Claude Fable 5 e GPT-5.6 Sol.
Costruito per coding e agenti
Z.ai Code Bench (max effort): 29.0 contro 29.5 di Claude Opus 4.8. DeepSWE v1.1: 63.4 — 17.2 punti sopra GLM-5.2.
Una sola richiesta per testo, immagini e video
Finestra di contesto da 1.310.720 token con input multimodale nativo. Chartography: 78.0 contro 64.3 di DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 contro 69.4.
Risposte in meno di un secondo
I provider su OpenRouter misurano un tempo mediano al primo token di 0.55s e un picco di throughput di circa 134 token/s, con 10+ provider tra cui scegliere.
GLM-5.3-Flash vs. i migliori modelli frontier
Risultati ufficiali della scheda del modello Z.ai: GLM-5.3-Flash contro GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra e Gemini 3.7 Flash, agosto 2026. Più alto è, meglio è — il grassetto indica il punteggio migliore di ogni riga.
Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Coding
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Agente
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Vision
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Fonte: scheda ufficiale del modello Z.ai, agosto 2026. Dati auto-riportati; i risultati possono variare in base alla configurazione di valutazione.
Z.ai Code Bench (max effort): 29.0 vs. 29.5 di Claude Opus 4.8 · Indice Agente di Artificial Analysis: 58, sopra Claude Opus 4.8
Leggi l'annuncio di Z.aiGLM-5.3-Flash nelle classifiche di terze parti
Competenza nel design frontend su DesignArena e valore sulla frontiera di Pareto di Artificial Analysis.

DesignArena — Frontend complessivo (non agente)
GLM-5.3-Flash si piazza a 1348 e 1345 sull'Elo frontend di DesignArena — 5° e 6° in assoluto, dietro Kimi K3, GPT-5.6 Sol e Claude Opus 5, e davanti a GLM-5.2, Gemini 3.7 Flash e Claude Sonnet 5.
Fonte: DesignArena di Intelligence · Elo Rating · Tutti i modelli

Artificial Analysis — Frontiera di Pareto costo-prestazioni
57 punti sull'Indice di Intelligenza a $0.045 per attività — GLM-5.3-Flash si trova sulla frontiera di Pareto con GPT-5.6 Sol (max) e Claude Opus 5 (max), a una frazione del loro costo.
Fonte: Artificial Analysis, aggiornato al 26 agosto 2026
Specifiche tecniche
I dettagli che contano quando usi GLM-5.3-Flash nei tuoi flussi di lavoro.
Contesto e output
1.310.720 token in input (contesto 1M+)
48.000 token di output massimo
Architettura
Mixture-of-Experts da 320B totali / 18B attivi, 45 layer. Attenzione ibrida sparse + lineare con IndexPool e Connessioni Iper-Costrette di Manifold (mHC).
Licenza e pesi
Pesi aperti con licenza MIT, addestrati su un corpus multimodale da 30T token.
Velocità
Latenza mediana al primo token di 0.55s e picco di throughput di circa 134 token/s sui provider OpenRouter (misurato ad agosto 2026).
Disponibilità
Attivo su Felo AI Search e nella Felo API, oltre che sulla piattaforma Z.ai e tramite 10+ provider OpenRouter.
Modalità
Input nativo di testo, immagini e video con output testuale: il primo modello nativamente multimodale della serie GLM-5.
Un modello, ogni tipo di input
Niente pipeline separate né modelli assemblati: GLM-5.3-Flash legge testo, immagini e video in modo nativo.
Testo e codice
Analizza documenti lunghi, codebase e dati strutturati in un'unica passata — 63.4 su DeepSWE v1.1, 84.3 su Terminal-Bench 2.1.
Immagini e grafici
Carica screenshot, grafici e diagrammi per ottenere risposte motivate: Chartography 78.0 vs. 64.3 di DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% di Claude Opus 4.8.
Video
Analizza video insieme a testo e immagini: MVBench 77.8%, davanti al 69.4% di DeepSeek-V4-Flash-Vision-Exp.
Chi usa GLM-5.3-Flash
Dagli sviluppatori solitari ai team che gestiscono la propria inferenza: GLM-5.3-Flash copre coding, ricerca e lavoro multimodale su un unico modello aperto.
Coding agente
63.4 su DeepSWE v1.1 e 48.8 su AutomationBench v1.0.6 lo rendono una scelta eccellente per agenti di coding, modifiche multi-file e lunghe catene di chiamate.
Lavoro agente a lungo orizzonte
Toolathlon 78.4 e una finestra da 1.31M token mantengono attiva la stessa sessione per molti passaggi, senza perdere contesto.
Ricerca multimodale
Combina documenti, screenshot, grafici e frame video in un'unica richiesta per estrarre risposte strutturate con fonti.
Analisi di video e visuali
MVBench 77.8 e Chartography 78.0 coprono comprensione video, lettura di grafici e analisi del layout dei documenti.
Deployment self-hosted
La licenza MIT e i 18B di parametri attivi ti permettono di eseguire i pesi da solo per flussi sensibili ai dati o raffinati.
Agenti e pipeline Felo
Chiamalo tramite la Felo API per costruire agenti, automazioni e pipeline di strumenti leggibili da macchina.
Due modi per usare GLM-5.3-Flash
Usalo su Felo AI Search
Apri Felo AI Search per fare domande, cercare sul web con l'IA e ottenere risposte citate da GLM-5.3-Flash.
Apri Felo AI SearchChiama la Felo API
Ottieni una chiave Felo API, imposta l'URL di base e chiama il modello da Claude Code, Codex, Hermes Agent o dal tuo agente compatibile OpenAI.
Vedi la Felo APIDomande frequenti
GLM-5.3-Flash è il modello frontier a pesi aperti di Z.ai, rilasciato il 26 agosto 2026. È un modello Mixture-of-Experts da 320B di parametri con 18B attivi, una finestra di contesto da 1.310.720 token, input nativo di testo, immagini e video e attenzione ibrida sparse più lineare. È sotto licenza MIT.
Inizia con GLM-5.3-Flash su Felo
Il modello frontier aperto di Z.ai — contesto da 1.31M token, input multimodale nativo e coding di livello agente in un unico posto.
Apri GLM-5.3-Flash su Felo AI SearchAnche sulla piattaforma Z.ai e nella Felo API