Licenza MIT · Pesi aperti · Rilasciato il 26 agosto 2026

GLM-5.3-FlashIntelligenza di frontiera, pesi aperti

GLM-5.3-Flash è il modello frontier a pesi aperti di Z.ai, rilasciato il 26 agosto 2026 sotto licenza MIT. Allinea Claude Opus 4.8 sull'Indice di Intelligenza di Artificial Analysis, con una finestra di contesto da 1.310.720 token, input nativo di testo, immagini e video e un MoE da 320B di parametri che ne attiva solo 18B. Provalo su Felo AI Search oppure chiamalo tramite la Felo API.

Disponibile su Felo AI Search e nella Felo API

Scheda del modello

GLM-5.3-Flash in breve

Licenza
MIT · Pesi aperti
Parametri
320B totali · 18B attivi
Finestra di contesto
1.31M token
Output massimo
48K token
Input
Testo · Immagine · Video
Attenzione ibrida sparse + lineare: circa 3× meno calcolo di attenzione e KV cache 4,4× più piccola rispetto a GLM-5.3.

57

Indice di Intelligenza

Artificial Analysis · a livello di Claude Opus 4.8

1M

Finestra di contesto

1.310.720 token in input

48K

Output massimo

48.000 token per risposta

MIT

Licenza

MIT · pesi aperti

Cosa rende l'architettura speciale

Z.ai ha ricostruito la serie GLM-5 attorno a un design di attenzione ibrida, rendendo pratico servire un'intelligenza di livello top.

Attenzione ibrida sparse + lineare

Il primo modello frontier aperto a combinare attenzione sparse e lineare. Un IndexPool leggero riduce l'index cache a un quarto delle dimensioni e le Connessioni Iper-Costrette di Manifold (mHC) migliorano lo scaling — circa 3× meno calcolo di attenzione e KV cache 4,4× più piccola rispetto a GLM-5.3, mantenendo la precisione sui contesti lunghi.

Pesi aperti, licenza MIT

Pesi completi pubblicati sotto MIT. Puoi auto-ospitarlo, raffinarlo o distribuirlo tramite Z.ai o uno qualsiasi dei 10+ provider che lo ospitano su OpenRouter.

Primo GLM-5 nativamente multimodale

Addestrato su un corpus multimodale da 30T token, legge testo, immagini e video direttamente — senza pipeline di vision separata, senza dover assemblare più modelli.

Lavoro da frontier, velocità Flash

Un MoE da 320B di parametri che attiva solo 18B per token porta a termine lavoro di livello frontier alla velocità di un agente.

A livello di Claude Opus 4.8

Indice di Intelligenza di Artificial Analysis: 57 per GLM-5.3-Flash e 57 per Claude Opus 4.8. Indice Agente: 58, sopra Claude Opus 4.8, Claude Fable 5 e GPT-5.6 Sol.

Costruito per coding e agenti

Z.ai Code Bench (max effort): 29.0 contro 29.5 di Claude Opus 4.8. DeepSWE v1.1: 63.4 — 17.2 punti sopra GLM-5.2.

Una sola richiesta per testo, immagini e video

Finestra di contesto da 1.310.720 token con input multimodale nativo. Chartography: 78.0 contro 64.3 di DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 contro 69.4.

Risposte in meno di un secondo

I provider su OpenRouter misurano un tempo mediano al primo token di 0.55s e un picco di throughput di circa 134 token/s, con 10+ provider tra cui scegliere.

Benchmark ufficiali della scheda del modello

GLM-5.3-Flash vs. i migliori modelli frontier

Risultati ufficiali della scheda del modello Z.ai: GLM-5.3-Flash contro GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra e Gemini 3.7 Flash, agosto 2026. Più alto è, meglio è — il grassetto indica il punteggio migliore di ogni riga.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Coding

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agente

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Vision

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Fonte: scheda ufficiale del modello Z.ai, agosto 2026. Dati auto-riportati; i risultati possono variare in base alla configurazione di valutazione.

Z.ai Code Bench (max effort): 29.0 vs. 29.5 di Claude Opus 4.8 · Indice Agente di Artificial Analysis: 58, sopra Claude Opus 4.8

Leggi l'annuncio di Z.ai
Classifiche indipendenti

GLM-5.3-Flash nelle classifiche di terze parti

Competenza nel design frontend su DesignArena e valore sulla frontiera di Pareto di Artificial Analysis.

DesignArena — Frontend complessivo (non agente)

DesignArena — Frontend complessivo (non agente)

GLM-5.3-Flash si piazza a 1348 e 1345 sull'Elo frontend di DesignArena — 5° e 6° in assoluto, dietro Kimi K3, GPT-5.6 Sol e Claude Opus 5, e davanti a GLM-5.2, Gemini 3.7 Flash e Claude Sonnet 5.

Fonte: DesignArena di Intelligence · Elo Rating · Tutti i modelli

Artificial Analysis — Frontiera di Pareto costo-prestazioni

Artificial Analysis — Frontiera di Pareto costo-prestazioni

57 punti sull'Indice di Intelligenza a $0.045 per attività — GLM-5.3-Flash si trova sulla frontiera di Pareto con GPT-5.6 Sol (max) e Claude Opus 5 (max), a una frazione del loro costo.

Fonte: Artificial Analysis, aggiornato al 26 agosto 2026

Specifiche tecniche

I dettagli che contano quando usi GLM-5.3-Flash nei tuoi flussi di lavoro.

Contesto e output

1.310.720 token in input (contesto 1M+)

48.000 token di output massimo

Architettura

Mixture-of-Experts da 320B totali / 18B attivi, 45 layer. Attenzione ibrida sparse + lineare con IndexPool e Connessioni Iper-Costrette di Manifold (mHC).

Licenza e pesi

Pesi aperti con licenza MIT, addestrati su un corpus multimodale da 30T token.

Velocità

Latenza mediana al primo token di 0.55s e picco di throughput di circa 134 token/s sui provider OpenRouter (misurato ad agosto 2026).

Disponibilità

Attivo su Felo AI Search e nella Felo API, oltre che sulla piattaforma Z.ai e tramite 10+ provider OpenRouter.

Modalità

Input nativo di testo, immagini e video con output testuale: il primo modello nativamente multimodale della serie GLM-5.

Un modello, ogni tipo di input

Niente pipeline separate né modelli assemblati: GLM-5.3-Flash legge testo, immagini e video in modo nativo.

Testo e codice

Analizza documenti lunghi, codebase e dati strutturati in un'unica passata — 63.4 su DeepSWE v1.1, 84.3 su Terminal-Bench 2.1.

Immagini e grafici

Carica screenshot, grafici e diagrammi per ottenere risposte motivate: Chartography 78.0 vs. 64.3 di DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% di Claude Opus 4.8.

Video

Analizza video insieme a testo e immagini: MVBench 77.8%, davanti al 69.4% di DeepSeek-V4-Flash-Vision-Exp.

Chi usa GLM-5.3-Flash

Dagli sviluppatori solitari ai team che gestiscono la propria inferenza: GLM-5.3-Flash copre coding, ricerca e lavoro multimodale su un unico modello aperto.

Coding agente

63.4 su DeepSWE v1.1 e 48.8 su AutomationBench v1.0.6 lo rendono una scelta eccellente per agenti di coding, modifiche multi-file e lunghe catene di chiamate.

Lavoro agente a lungo orizzonte

Toolathlon 78.4 e una finestra da 1.31M token mantengono attiva la stessa sessione per molti passaggi, senza perdere contesto.

Ricerca multimodale

Combina documenti, screenshot, grafici e frame video in un'unica richiesta per estrarre risposte strutturate con fonti.

Analisi di video e visuali

MVBench 77.8 e Chartography 78.0 coprono comprensione video, lettura di grafici e analisi del layout dei documenti.

Deployment self-hosted

La licenza MIT e i 18B di parametri attivi ti permettono di eseguire i pesi da solo per flussi sensibili ai dati o raffinati.

Agenti e pipeline Felo

Chiamalo tramite la Felo API per costruire agenti, automazioni e pipeline di strumenti leggibili da macchina.

Due modi per usare GLM-5.3-Flash

Usalo su Felo AI Search

Apri Felo AI Search per fare domande, cercare sul web con l'IA e ottenere risposte citate da GLM-5.3-Flash.

Apri Felo AI Search

Chiama la Felo API

Ottieni una chiave Felo API, imposta l'URL di base e chiama il modello da Claude Code, Codex, Hermes Agent o dal tuo agente compatibile OpenAI.

Vedi la Felo API

Domande frequenti

GLM-5.3-Flash è il modello frontier a pesi aperti di Z.ai, rilasciato il 26 agosto 2026. È un modello Mixture-of-Experts da 320B di parametri con 18B attivi, una finestra di contesto da 1.310.720 token, input nativo di testo, immagini e video e attenzione ibrida sparse più lineare. È sotto licenza MIT.

Inizia con GLM-5.3-Flash su Felo

Il modello frontier aperto di Z.ai — contesto da 1.31M token, input multimodale nativo e coding di livello agente in un unico posto.

Apri GLM-5.3-Flash su Felo AI Search

Anche sulla piattaforma Z.ai e nella Felo API