GLM-5.3-FlashInteligencia de frontera, pesos abiertos
GLM-5.3-Flash es el modelo de frontera de pesos abiertos de Z.ai, lanzado el 26 de agosto de 2026 bajo licencia MIT. Iguala a Claude Opus 4.8 en el Índice de Inteligencia de Artificial Analysis, con una ventana de contexto de 1.310.720 tokens, entrada nativa de texto, imagen y vídeo, y un MoE de 320B de parámetros que activa solo 18B. Pruébalo en Felo AI Search o llámalo a través de la Felo API.
Disponible en Felo AI Search y en la Felo API
Ficha del modelo
GLM-5.3-Flash de un vistazo
- Licencia
- MIT · Pesos abiertos
- Parámetros
- 320B en total · 18B activos
- Ventana de contexto
- 1.31M tokens
- Salida máxima
- 48K tokens
- Entrada
- Texto · Imagen · Vídeo
57
Índice de Inteligencia
Artificial Analysis · al nivel de Claude Opus 4.8
1M
Ventana de contexto
1.310.720 tokens de entrada
48K
Salida máxima
48.000 tokens por respuesta
MIT
Licencia
MIT · pesos abiertos
Qué hace especial a la arquitectura
Z.ai reconstruyó la serie GLM-5 en torno a un diseño de atención híbrida, haciendo viable servir inteligencia de primer nivel.
Atención híbrida dispersa + lineal
El primer modelo de frontera abierto que combina atención dispersa y lineal. Un IndexPool ligero mantiene la caché de índices en un cuarto del tamaño y las Conexiones Hiperrestrictas de Manifold (mHC) mejoran el escalado: unos 3× menos cómputo de atención y un KV cache 4,4× más pequeño que GLM-5.3, sin perder precisión en contextos largos.
Pesos abiertos, licencia MIT
Pesos completos publicados bajo MIT. Puedes autoalojarlo, afinarlo o desplegarlo a través de Z.ai o de cualquiera de los más de 10 proveedores que lo alojan en OpenRouter.
El primer GLM-5 nativamente multimodal
Entrenado sobre un corpus multimodal de 30T tokens, lee texto, imágenes y vídeo directamente: sin pipeline de visión separado, sin ensamblar varios modelos.
Trabajo de frontera, rendimiento Flash
Un MoE de 320B de parámetros que activa solo 18B por token completa trabajo de nivel frontera a velocidad de agente.
Al nivel de Claude Opus 4.8
Índice de Inteligencia de Artificial Analysis: 57 para GLM-5.3-Flash y 57 para Claude Opus 4.8. Índice Agéntico: 58, por encima de Claude Opus 4.8, Claude Fable 5 y GPT-5.6 Sol.
Pensado para código y agentes
Z.ai Code Bench (esfuerzo máximo): 29.0, frente a 29.5 de Claude Opus 4.8. DeepSWE v1.1: 63.4, 17.2 puntos por encima de GLM-5.2.
Una sola petición para texto, imágenes y vídeo
Ventana de contexto de 1.310.720 tokens con entrada multimodal nativa. Chartography: 78.0 frente a 64.3 de DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 frente a 69.4.
Respuestas en menos de un segundo
Los proveedores de OpenRouter midieron un tiempo mediano hasta el primer token de 0.55s y un pico de unos 134 tokens/s, con más de 10 proveedores para elegir.
GLM-5.3-Flash vs. los principales modelos de frontera
Resultados oficiales de la ficha del modelo de Z.ai: GLM-5.3-Flash frente a GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra y Gemini 3.7 Flash, agosto de 2026. Cuanto más alto, mejor: la negrita marca la mejor puntuación de cada fila.
Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Coding
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Agéntico
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Visión
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Fuente: ficha oficial del modelo de Z.ai, agosto de 2026. Cifras autodeclaradas; los resultados pueden variar según la configuración de evaluación.
Z.ai Code Bench (esfuerzo máximo): 29.0 vs. 29.5 de Claude Opus 4.8 · Índice Agéntico de Artificial Analysis: 58, por encima de Claude Opus 4.8
Leer el anuncio de Z.aiGLM-5.3-Flash en los rankings de terceros
Habilidad de diseño frontend en DesignArena y valor en la frontera de Pareto de Artificial Analysis.

DesignArena — Frontend general (no agéntico)
GLM-5.3-Flash se sitúa en 1348 y 1345 en el Elo de frontend de DesignArena — 5.º y 6.º en general, por detrás de Kimi K3, GPT-5.6 Sol y Claude Opus 5, y por delante de GLM-5.2, Gemini 3.7 Flash y Claude Sonnet 5.
Fuente: DesignArena de Intelligence · Elo Rating · Todos los modelos

Artificial Analysis — Frontera de Pareto de coste y rendimiento
57 puntos en el Índice de Inteligencia por $0.045 por tarea — GLM-5.3-Flash se sitúa en la frontera de Pareto junto a GPT-5.6 Sol (max) y Claude Opus 5 (max), a una fracción de su coste.
Fuente: Artificial Analysis, actualizado el 26 de agosto de 2026
Especificaciones técnicas
Los detalles que importan cuando usas GLM-5.3-Flash en tus propios flujos de trabajo.
Contexto y salida
1.310.720 tokens de entrada (contexto 1M+)
48.000 tokens de salida máxima
Arquitectura
Mixture-of-Experts de 320B totales / 18B activos, 45 capas. Atención híbrida dispersa + lineal con IndexPool y Conexiones Hiperrestrictas de Manifold (mHC).
Licencia y pesos
Pesos abiertos con licencia MIT, entrenados sobre un corpus multimodal de 30T tokens.
Velocidad
Latencia mediana hasta el primer token de 0.55s y pico de rendimiento de unos 134 tokens/s en los proveedores de OpenRouter (medido en agosto de 2026).
Disponibilidad
En línea en Felo AI Search y en la Felo API, además de la plataforma de Z.ai y más de 10 proveedores de OpenRouter.
Modalidades
Entrada nativa de texto, imagen y vídeo con salida de texto: el primer modelo nativamente multimodal de la serie GLM-5.
Un modelo, cualquier tipo de entrada
Sin pipelines separados ni modelos ensamblados: GLM-5.3-Flash lee texto, imágenes y vídeo de forma nativa.
Texto y código
Analiza documentos largos, bases de código y datos estructurados en una sola pasada: 63.4 en DeepSWE v1.1 y 84.3 en Terminal-Bench 2.1.
Imágenes y gráficos
Introduce capturas, gráficos y diagramas para obtener respuestas fundamentadas: Chartography 78.0 vs. 64.3 de DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% de Claude Opus 4.8.
Vídeo
Analiza vídeo junto a texto e imágenes: MVBench 77.8%, por delante del 69.4% de DeepSeek-V4-Flash-Vision-Exp.
Quién usa GLM-5.3-Flash
Desde desarrolladores en solitario hasta equipos con su propia inferencia: GLM-5.3-Flash cubre código, investigación y trabajo multimodal en un único modelo abierto.
Código agéntico
63.4 en DeepSWE v1.1 y 48.8 en AutomationBench v1.0.6 lo convierten en una gran opción para agentes de código, ediciones de varios archivos y cadenas largas de llamadas.
Trabajo de agente de largo recorrido
Toolathlon 78.4 y una ventana de 1.31M tokens mantienen una misma sesión a lo largo de muchos pasos sin perder contexto.
Investigación multimodal
Combina documentos, capturas, gráficos y fotogramas de vídeo en una sola petición para extraer respuestas estructuradas con fuentes.
Análisis de vídeo y visual
MVBench 77.8 y Chartography 78.0 cubren comprensión de vídeo, lectura de gráficos y análisis de maquetación de documentos.
Despliegue propio
La licencia MIT y los 18B de parámetros activos hacen que puedas ejecutar los pesos tú mismo para flujos sensibles a datos o afilados.
Agentes y pipelines de Felo
Llámalo a través de la Felo API para construir agentes, automatizaciones y pipelines de herramientas legibles por máquina.
Dos formas de usar GLM-5.3-Flash
Úsalo en Felo AI Search
Abre Felo AI Search para hacer preguntas, buscar en la web con IA y obtener respuestas citadas de GLM-5.3-Flash.
Abrir Felo AI SearchLlama a la Felo API
Consigue una clave de la Felo API, configura la URL base y llama al modelo desde Claude Code, Codex, Hermes Agent o tu propio agente compatible con OpenAI.
Ver la Felo APIPreguntas frecuentes
GLM-5.3-Flash es el modelo de frontera de pesos abiertos de Z.ai, lanzado el 26 de agosto de 2026. Es un modelo Mixture-of-Experts de 320B de parámetros con 18B activos, una ventana de contexto de 1.310.720 tokens, entrada nativa de texto, imagen y vídeo y atención híbrida dispersa más lineal. Está bajo licencia MIT.
Empieza con GLM-5.3-Flash en Felo
El modelo de frontera abierto de Z.ai: contexto de 1.31M tokens, entrada multimodal nativa y código de nivel agéntico en un solo lugar.
Abrir GLM-5.3-Flash en Felo AI SearchTambién en la plataforma de Z.ai y en la Felo API