Licence MIT · Poids ouverts · Sorti le 26 août 2026

GLM-5.3-FlashIntelligence de pointe, poids ouverts

GLM-5.3-Flash est le modèle de frontière à poids ouverts de Z.ai, sorti le 26 août 2026 sous licence MIT. Il se hisse au niveau de Claude Opus 4.8 sur l'Indice d'intelligence d'Artificial Analysis, avec une fenêtre de contexte de 1.310.720 tokens, une entrée native texte, image et vidéo, et un MoE de 320B de paramètres dont seulement 18B sont actifs. Essayez-le sur Felo AI Search ou appelez-le via la Felo API.

Disponible sur Felo AI Search et la Felo API

Fiche du modèle

GLM-5.3-Flash en un clin d'œil

Licence
MIT · Poids ouverts
Paramètres
320B au total · 18B actifs
Fenêtre de contexte
1.31M tokens
Sortie maximale
48K tokens
Entrée
Texte · Image · Vidéo
Attention hybride sparse + linéaire : environ 3× moins de calcul d'attention et un KV cache 4,4× plus petit que GLM-5.3.

57

Indice d'intelligence

Artificial Analysis · au niveau de Claude Opus 4.8

1M

Fenêtre de contexte

1.310.720 tokens en entrée

48K

Sortie maximale

48.000 tokens par réponse

MIT

Licence

MIT · poids ouverts

Ce qui rend l'architecture unique

Z.ai a repensé la série GLM-5 autour d'un design d'attention hybride, rendant enfin viable le déploiement d'une intelligence de premier rang.

Attention hybride sparse + linéaire

Le premier modèle de frontière ouvert à combiner attention sparse et linéaire. Un IndexPool léger réduit le cache d'index au quart de sa taille et les Connexions Hyper-Contraintes de Manifold (mHC) améliorent le passage à l'échelle — soit environ 3× moins de calcul d'attention et un KV cache 4,4× plus petit que GLM-5.3, sans perdre en précision sur les longues fenêtres de contexte.

Poids ouverts, licence MIT

Poids complets publiés sous MIT. Auto-hébergez-le, affinez-le ou déployez-le via Z.ai ou l'un des plus de 10 fournisseurs qui l'hébergent sur OpenRouter.

Premier GLM-5 nativement multimodal

Entraîné sur un corpus multimodal de 30T tokens, il lit directement texte, images et vidéo — sans pipeline de vision séparé, sans assembler plusieurs modèles.

Travail de frontière, performance Flash

Un MoE de 320B de paramètres qui n'active que 18B par token accomplit du travail de niveau frontière à la vitesse d'un agent.

Au niveau de Claude Opus 4.8

Indice d'intelligence d'Artificial Analysis : 57 pour GLM-5.3-Flash, 57 pour Claude Opus 4.8. Indice Agéntique : 58, au-dessus de Claude Opus 4.8, Claude Fable 5 et GPT-5.6 Sol.

Conçu pour le code et les agents

Z.ai Code Bench (effort maximal) : 29.0, contre 29.5 pour Claude Opus 4.8. DeepSWE v1.1 : 63.4 — 17.2 points au-dessus de GLM-5.2.

Une seule requête pour le texte, les images et la vidéo

Une fenêtre de contexte de 1.310.720 tokens avec entrée multimodale native. Chartography : 78.0 contre 64.3 pour DeepSeek-V4-Flash-Vision-Exp ; MVBench : 77.8 contre 69.4.

Réponses en moins d'une seconde

Les fournisseurs d'OpenRouter mesurent un délai médian de premier token de 0.55s et un débit de pointe d'environ 134 tokens/s, avec plus de 10 fournisseurs au choix.

Benchmarks officiels de la fiche du modèle

GLM-5.3-Flash vs. les meilleurs modèles de frontière

Résultats officiels de la fiche du modèle Z.ai : GLM-5.3-Flash face à GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra et Gemini 3.7 Flash, août 2026. Plus c'est élevé, mieux c'est : le gras indique la meilleure note de chaque ligne.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Coding

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agentique

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Vision

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Source : fiche officielle du modèle Z.ai, août 2026. Chiffres autodéclarés ; les résultats peuvent varier selon la configuration d'évaluation.

Z.ai Code Bench (effort maximal) : 29.0 vs. 29.5 pour Claude Opus 4.8 · Indice Agéntique d'Artificial Analysis : 58, au-dessus de Claude Opus 4.8

Lire l'annonce de Z.ai
Classements indépendants

GLM-5.3-Flash dans les classements de tiers

Compétence en design frontend sur DesignArena et valeur sur la frontière de Pareto d'Artificial Analysis.

DesignArena — Frontend global (non agentique)

DesignArena — Frontend global (non agentique)

GLM-5.3-Flash atteint 1348 et 1345 sur l'Elo frontend de DesignArena — 5e et 6e au total, derrière Kimi K3, GPT-5.6 Sol et Claude Opus 5, et devant GLM-5.2, Gemini 3.7 Flash et Claude Sonnet 5.

Source : DesignArena de Intelligence · Elo Rating · Tous les modèles

Artificial Analysis — Frontière de Pareto coût-performance

Artificial Analysis — Frontière de Pareto coût-performance

57 points sur l'Indice d'intelligence à $0.045 par tâche — GLM-5.3-Flash se situe sur la frontière de Pareto avec GPT-5.6 Sol (max) et Claude Opus 5 (max), pour une fraction de leur coût.

Source : Artificial Analysis, mis à jour le 26 août 2026

Spécifications techniques

Les détails qui comptent lorsque vous intégrez GLM-5.3-Flash dans vos propres flux de travail.

Contexte et sortie

1.310.720 tokens en entrée (contexte 1M+)

48.000 tokens de sortie maximale

Architecture

Mixture-of-Experts de 320B total / 18B actifs, 45 couches. Attention hybride sparse + linéaire avec IndexPool et Connexions Hyper-Contraintes de Manifold (mHC).

Licence et poids

Poids ouverts sous licence MIT, entraînés sur un corpus multimodal de 30T tokens.

Vitesse

Délai médian de premier token de 0.55s et débit de pointe d'environ 134 tokens/s chez les fournisseurs OpenRouter (mesuré en août 2026).

Disponibilité

En ligne sur Felo AI Search et dans la Felo API, ainsi que sur la plateforme Z.ai et via plus de 10 fournisseurs OpenRouter.

Modalités

Entrée native texte, image et vidéo avec sortie texte — le premier modèle nativement multimodal de la série GLM-5.

Un modèle, tous les types d'entrée

Pas de pipelines séparés ni de modèles assemblés : GLM-5.3-Flash lit nativement texte, images et vidéo.

Texte et code

Il analyse documents longs, bases de code et données structurées en une seule passe — 63.4 sur DeepSWE v1.1, 84.3 sur Terminal-Bench 2.1.

Images et graphiques

Fournissez captures d'écran, graphiques et diagrammes pour des réponses étayées : Chartography 78.0 vs. 64.3 pour DeepSeek-V4-Flash-Vision-Exp ; OfficeQA-Pro 62.4% vs. 48.9% pour Claude Opus 4.8.

Vidéo

Analysez la vidéo aux côtés du texte et des images : MVBench 77.8%, devant les 69.4% de DeepSeek-V4-Flash-Vision-Exp.

Qui utilise GLM-5.3-Flash

Des développeurs indépendants aux équipes qui font tourner leur propre inférence : GLM-5.3-Flash couvre le code, la recherche et le travail multimodal sur un seul modèle ouvert.

Coding agentique

63.4 sur DeepSWE v1.1 et 48.8 sur AutomationBench v1.0.6 en font un choix solide pour les agents de code, les éditions multi-fichiers et les longues chaînes d'appels.

Travail d'agent à long horizon

Toolathlon 78.4 et une fenêtre de 1.31M tokens maintiennent une même session sur de nombreuses étapes, sans perte de contexte.

Recherche multimodale

Combinez documents, captures, graphiques et images vidéo dans une seule requête pour extraire des réponses structurées avec sources.

Analyse vidéo et visuelle

MVBench 77.8 et Chartography 78.0 couvrent la compréhension vidéo, la lecture de graphiques et l'analyse de mise en page documentaire.

Déploiement auto-hébergé

La licence MIT et ses 18B de paramètres actifs vous permettent d'exécuter les poids vous-même pour des flux sensibles aux données ou affinés.

Agents et pipelines Felo

Appelez-le via la Felo API pour construire agents, automatisations et pipelines d'outils lisibles par machine.

Deux façons d'utiliser GLM-5.3-Flash

Utilisez-le sur Felo AI Search

Ouvrez Felo AI Search pour poser vos questions, chercher sur le web avec l'IA et obtenir des réponses sourcées de GLM-5.3-Flash.

Ouvrir Felo AI Search

Appelez la Felo API

Obtenez une clé Felo API, définissez l'URL de base et appelez le modèle depuis Claude Code, Codex, Hermes Agent ou votre propre agent compatible OpenAI.

Voir la Felo API

Questions fréquentes

GLM-5.3-Flash est le modèle de frontière à poids ouverts de Z.ai, sorti le 26 août 2026. C'est un modèle Mixture-of-Experts de 320B de paramètres dont 18B actifs, une fenêtre de contexte de 1.310.720 tokens, une entrée native texte, image et vidéo, et une attention hybride sparse plus linéaire. Il est sous licence MIT.

Démarrez avec GLM-5.3-Flash sur Felo

Le modèle de frontière ouvert de Z.ai — contexte de 1.31M tokens, entrée multimodale native et code de niveau agentique en un seul endroit.

Ouvrir GLM-5.3-Flash sur Felo AI Search

Aussi sur la plateforme Z.ai et la Felo API