GLM-5.3-FlashIntelligence de pointe, poids ouverts
GLM-5.3-Flash est le modèle de frontière à poids ouverts de Z.ai, sorti le 26 août 2026 sous licence MIT. Il se hisse au niveau de Claude Opus 4.8 sur l'Indice d'intelligence d'Artificial Analysis, avec une fenêtre de contexte de 1.310.720 tokens, une entrée native texte, image et vidéo, et un MoE de 320B de paramètres dont seulement 18B sont actifs. Essayez-le sur Felo AI Search ou appelez-le via la Felo API.
Disponible sur Felo AI Search et la Felo API
Fiche du modèle
GLM-5.3-Flash en un clin d'œil
- Licence
- MIT · Poids ouverts
- Paramètres
- 320B au total · 18B actifs
- Fenêtre de contexte
- 1.31M tokens
- Sortie maximale
- 48K tokens
- Entrée
- Texte · Image · Vidéo
57
Indice d'intelligence
Artificial Analysis · au niveau de Claude Opus 4.8
1M
Fenêtre de contexte
1.310.720 tokens en entrée
48K
Sortie maximale
48.000 tokens par réponse
MIT
Licence
MIT · poids ouverts
Ce qui rend l'architecture unique
Z.ai a repensé la série GLM-5 autour d'un design d'attention hybride, rendant enfin viable le déploiement d'une intelligence de premier rang.
Attention hybride sparse + linéaire
Le premier modèle de frontière ouvert à combiner attention sparse et linéaire. Un IndexPool léger réduit le cache d'index au quart de sa taille et les Connexions Hyper-Contraintes de Manifold (mHC) améliorent le passage à l'échelle — soit environ 3× moins de calcul d'attention et un KV cache 4,4× plus petit que GLM-5.3, sans perdre en précision sur les longues fenêtres de contexte.
Poids ouverts, licence MIT
Poids complets publiés sous MIT. Auto-hébergez-le, affinez-le ou déployez-le via Z.ai ou l'un des plus de 10 fournisseurs qui l'hébergent sur OpenRouter.
Premier GLM-5 nativement multimodal
Entraîné sur un corpus multimodal de 30T tokens, il lit directement texte, images et vidéo — sans pipeline de vision séparé, sans assembler plusieurs modèles.
Travail de frontière, performance Flash
Un MoE de 320B de paramètres qui n'active que 18B par token accomplit du travail de niveau frontière à la vitesse d'un agent.
Au niveau de Claude Opus 4.8
Indice d'intelligence d'Artificial Analysis : 57 pour GLM-5.3-Flash, 57 pour Claude Opus 4.8. Indice Agéntique : 58, au-dessus de Claude Opus 4.8, Claude Fable 5 et GPT-5.6 Sol.
Conçu pour le code et les agents
Z.ai Code Bench (effort maximal) : 29.0, contre 29.5 pour Claude Opus 4.8. DeepSWE v1.1 : 63.4 — 17.2 points au-dessus de GLM-5.2.
Une seule requête pour le texte, les images et la vidéo
Une fenêtre de contexte de 1.310.720 tokens avec entrée multimodale native. Chartography : 78.0 contre 64.3 pour DeepSeek-V4-Flash-Vision-Exp ; MVBench : 77.8 contre 69.4.
Réponses en moins d'une seconde
Les fournisseurs d'OpenRouter mesurent un délai médian de premier token de 0.55s et un débit de pointe d'environ 134 tokens/s, avec plus de 10 fournisseurs au choix.
GLM-5.3-Flash vs. les meilleurs modèles de frontière
Résultats officiels de la fiche du modèle Z.ai : GLM-5.3-Flash face à GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra et Gemini 3.7 Flash, août 2026. Plus c'est élevé, mieux c'est : le gras indique la meilleure note de chaque ligne.
Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Coding
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Agentique
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Vision
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Source : fiche officielle du modèle Z.ai, août 2026. Chiffres autodéclarés ; les résultats peuvent varier selon la configuration d'évaluation.
Z.ai Code Bench (effort maximal) : 29.0 vs. 29.5 pour Claude Opus 4.8 · Indice Agéntique d'Artificial Analysis : 58, au-dessus de Claude Opus 4.8
Lire l'annonce de Z.aiGLM-5.3-Flash dans les classements de tiers
Compétence en design frontend sur DesignArena et valeur sur la frontière de Pareto d'Artificial Analysis.

DesignArena — Frontend global (non agentique)
GLM-5.3-Flash atteint 1348 et 1345 sur l'Elo frontend de DesignArena — 5e et 6e au total, derrière Kimi K3, GPT-5.6 Sol et Claude Opus 5, et devant GLM-5.2, Gemini 3.7 Flash et Claude Sonnet 5.
Source : DesignArena de Intelligence · Elo Rating · Tous les modèles

Artificial Analysis — Frontière de Pareto coût-performance
57 points sur l'Indice d'intelligence à $0.045 par tâche — GLM-5.3-Flash se situe sur la frontière de Pareto avec GPT-5.6 Sol (max) et Claude Opus 5 (max), pour une fraction de leur coût.
Source : Artificial Analysis, mis à jour le 26 août 2026
Spécifications techniques
Les détails qui comptent lorsque vous intégrez GLM-5.3-Flash dans vos propres flux de travail.
Contexte et sortie
1.310.720 tokens en entrée (contexte 1M+)
48.000 tokens de sortie maximale
Architecture
Mixture-of-Experts de 320B total / 18B actifs, 45 couches. Attention hybride sparse + linéaire avec IndexPool et Connexions Hyper-Contraintes de Manifold (mHC).
Licence et poids
Poids ouverts sous licence MIT, entraînés sur un corpus multimodal de 30T tokens.
Vitesse
Délai médian de premier token de 0.55s et débit de pointe d'environ 134 tokens/s chez les fournisseurs OpenRouter (mesuré en août 2026).
Disponibilité
En ligne sur Felo AI Search et dans la Felo API, ainsi que sur la plateforme Z.ai et via plus de 10 fournisseurs OpenRouter.
Modalités
Entrée native texte, image et vidéo avec sortie texte — le premier modèle nativement multimodal de la série GLM-5.
Un modèle, tous les types d'entrée
Pas de pipelines séparés ni de modèles assemblés : GLM-5.3-Flash lit nativement texte, images et vidéo.
Texte et code
Il analyse documents longs, bases de code et données structurées en une seule passe — 63.4 sur DeepSWE v1.1, 84.3 sur Terminal-Bench 2.1.
Images et graphiques
Fournissez captures d'écran, graphiques et diagrammes pour des réponses étayées : Chartography 78.0 vs. 64.3 pour DeepSeek-V4-Flash-Vision-Exp ; OfficeQA-Pro 62.4% vs. 48.9% pour Claude Opus 4.8.
Vidéo
Analysez la vidéo aux côtés du texte et des images : MVBench 77.8%, devant les 69.4% de DeepSeek-V4-Flash-Vision-Exp.
Qui utilise GLM-5.3-Flash
Des développeurs indépendants aux équipes qui font tourner leur propre inférence : GLM-5.3-Flash couvre le code, la recherche et le travail multimodal sur un seul modèle ouvert.
Coding agentique
63.4 sur DeepSWE v1.1 et 48.8 sur AutomationBench v1.0.6 en font un choix solide pour les agents de code, les éditions multi-fichiers et les longues chaînes d'appels.
Travail d'agent à long horizon
Toolathlon 78.4 et une fenêtre de 1.31M tokens maintiennent une même session sur de nombreuses étapes, sans perte de contexte.
Recherche multimodale
Combinez documents, captures, graphiques et images vidéo dans une seule requête pour extraire des réponses structurées avec sources.
Analyse vidéo et visuelle
MVBench 77.8 et Chartography 78.0 couvrent la compréhension vidéo, la lecture de graphiques et l'analyse de mise en page documentaire.
Déploiement auto-hébergé
La licence MIT et ses 18B de paramètres actifs vous permettent d'exécuter les poids vous-même pour des flux sensibles aux données ou affinés.
Agents et pipelines Felo
Appelez-le via la Felo API pour construire agents, automatisations et pipelines d'outils lisibles par machine.
Deux façons d'utiliser GLM-5.3-Flash
Utilisez-le sur Felo AI Search
Ouvrez Felo AI Search pour poser vos questions, chercher sur le web avec l'IA et obtenir des réponses sourcées de GLM-5.3-Flash.
Ouvrir Felo AI SearchAppelez la Felo API
Obtenez une clé Felo API, définissez l'URL de base et appelez le modèle depuis Claude Code, Codex, Hermes Agent ou votre propre agent compatible OpenAI.
Voir la Felo APIQuestions fréquentes
GLM-5.3-Flash est le modèle de frontière à poids ouverts de Z.ai, sorti le 26 août 2026. C'est un modèle Mixture-of-Experts de 320B de paramètres dont 18B actifs, une fenêtre de contexte de 1.310.720 tokens, une entrée native texte, image et vidéo, et une attention hybride sparse plus linéaire. Il est sous licence MIT.
Démarrez avec GLM-5.3-Flash sur Felo
Le modèle de frontière ouvert de Z.ai — contexte de 1.31M tokens, entrée multimodale native et code de niveau agentique en un seul endroit.
Ouvrir GLM-5.3-Flash sur Felo AI SearchAussi sur la plateforme Z.ai et la Felo API