Licencia MIT · Pesos abiertos · Lanzado el 26 de agosto de 2026

GLM-5.3-FlashInteligencia de frontera, pesos abiertos

GLM-5.3-Flash es el modelo de frontera de pesos abiertos de Z.ai, lanzado el 26 de agosto de 2026 bajo licencia MIT. Iguala a Claude Opus 4.8 en el Índice de Inteligencia de Artificial Analysis, con una ventana de contexto de 1.310.720 tokens, entrada nativa de texto, imagen y vídeo, y un MoE de 320B de parámetros que activa solo 18B. Pruébalo en Felo AI Search o llámalo a través de la Felo API.

Disponible en Felo AI Search y en la Felo API

Ficha del modelo

GLM-5.3-Flash de un vistazo

Licencia
MIT · Pesos abiertos
Parámetros
320B en total · 18B activos
Ventana de contexto
1.31M tokens
Salida máxima
48K tokens
Entrada
Texto · Imagen · Vídeo
Atención híbrida dispersa + lineal: unos 3× menos cómputo de atención y un KV cache un 4,4× más pequeño que en GLM-5.3.

57

Índice de Inteligencia

Artificial Analysis · al nivel de Claude Opus 4.8

1M

Ventana de contexto

1.310.720 tokens de entrada

48K

Salida máxima

48.000 tokens por respuesta

MIT

Licencia

MIT · pesos abiertos

Qué hace especial a la arquitectura

Z.ai reconstruyó la serie GLM-5 en torno a un diseño de atención híbrida, haciendo viable servir inteligencia de primer nivel.

Atención híbrida dispersa + lineal

El primer modelo de frontera abierto que combina atención dispersa y lineal. Un IndexPool ligero mantiene la caché de índices en un cuarto del tamaño y las Conexiones Hiperrestrictas de Manifold (mHC) mejoran el escalado: unos 3× menos cómputo de atención y un KV cache 4,4× más pequeño que GLM-5.3, sin perder precisión en contextos largos.

Pesos abiertos, licencia MIT

Pesos completos publicados bajo MIT. Puedes autoalojarlo, afinarlo o desplegarlo a través de Z.ai o de cualquiera de los más de 10 proveedores que lo alojan en OpenRouter.

El primer GLM-5 nativamente multimodal

Entrenado sobre un corpus multimodal de 30T tokens, lee texto, imágenes y vídeo directamente: sin pipeline de visión separado, sin ensamblar varios modelos.

Trabajo de frontera, rendimiento Flash

Un MoE de 320B de parámetros que activa solo 18B por token completa trabajo de nivel frontera a velocidad de agente.

Al nivel de Claude Opus 4.8

Índice de Inteligencia de Artificial Analysis: 57 para GLM-5.3-Flash y 57 para Claude Opus 4.8. Índice Agéntico: 58, por encima de Claude Opus 4.8, Claude Fable 5 y GPT-5.6 Sol.

Pensado para código y agentes

Z.ai Code Bench (esfuerzo máximo): 29.0, frente a 29.5 de Claude Opus 4.8. DeepSWE v1.1: 63.4, 17.2 puntos por encima de GLM-5.2.

Una sola petición para texto, imágenes y vídeo

Ventana de contexto de 1.310.720 tokens con entrada multimodal nativa. Chartography: 78.0 frente a 64.3 de DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 frente a 69.4.

Respuestas en menos de un segundo

Los proveedores de OpenRouter midieron un tiempo mediano hasta el primer token de 0.55s y un pico de unos 134 tokens/s, con más de 10 proveedores para elegir.

Benchmarks oficiales de la ficha del modelo

GLM-5.3-Flash vs. los principales modelos de frontera

Resultados oficiales de la ficha del modelo de Z.ai: GLM-5.3-Flash frente a GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra y Gemini 3.7 Flash, agosto de 2026. Cuanto más alto, mejor: la negrita marca la mejor puntuación de cada fila.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Coding

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agéntico

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Visión

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Fuente: ficha oficial del modelo de Z.ai, agosto de 2026. Cifras autodeclaradas; los resultados pueden variar según la configuración de evaluación.

Z.ai Code Bench (esfuerzo máximo): 29.0 vs. 29.5 de Claude Opus 4.8 · Índice Agéntico de Artificial Analysis: 58, por encima de Claude Opus 4.8

Leer el anuncio de Z.ai
Rankings independientes

GLM-5.3-Flash en los rankings de terceros

Habilidad de diseño frontend en DesignArena y valor en la frontera de Pareto de Artificial Analysis.

DesignArena — Frontend general (no agéntico)

DesignArena — Frontend general (no agéntico)

GLM-5.3-Flash se sitúa en 1348 y 1345 en el Elo de frontend de DesignArena — 5.º y 6.º en general, por detrás de Kimi K3, GPT-5.6 Sol y Claude Opus 5, y por delante de GLM-5.2, Gemini 3.7 Flash y Claude Sonnet 5.

Fuente: DesignArena de Intelligence · Elo Rating · Todos los modelos

Artificial Analysis — Frontera de Pareto de coste y rendimiento

Artificial Analysis — Frontera de Pareto de coste y rendimiento

57 puntos en el Índice de Inteligencia por $0.045 por tarea — GLM-5.3-Flash se sitúa en la frontera de Pareto junto a GPT-5.6 Sol (max) y Claude Opus 5 (max), a una fracción de su coste.

Fuente: Artificial Analysis, actualizado el 26 de agosto de 2026

Especificaciones técnicas

Los detalles que importan cuando usas GLM-5.3-Flash en tus propios flujos de trabajo.

Contexto y salida

1.310.720 tokens de entrada (contexto 1M+)

48.000 tokens de salida máxima

Arquitectura

Mixture-of-Experts de 320B totales / 18B activos, 45 capas. Atención híbrida dispersa + lineal con IndexPool y Conexiones Hiperrestrictas de Manifold (mHC).

Licencia y pesos

Pesos abiertos con licencia MIT, entrenados sobre un corpus multimodal de 30T tokens.

Velocidad

Latencia mediana hasta el primer token de 0.55s y pico de rendimiento de unos 134 tokens/s en los proveedores de OpenRouter (medido en agosto de 2026).

Disponibilidad

En línea en Felo AI Search y en la Felo API, además de la plataforma de Z.ai y más de 10 proveedores de OpenRouter.

Modalidades

Entrada nativa de texto, imagen y vídeo con salida de texto: el primer modelo nativamente multimodal de la serie GLM-5.

Un modelo, cualquier tipo de entrada

Sin pipelines separados ni modelos ensamblados: GLM-5.3-Flash lee texto, imágenes y vídeo de forma nativa.

Texto y código

Analiza documentos largos, bases de código y datos estructurados en una sola pasada: 63.4 en DeepSWE v1.1 y 84.3 en Terminal-Bench 2.1.

Imágenes y gráficos

Introduce capturas, gráficos y diagramas para obtener respuestas fundamentadas: Chartography 78.0 vs. 64.3 de DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% de Claude Opus 4.8.

Vídeo

Analiza vídeo junto a texto e imágenes: MVBench 77.8%, por delante del 69.4% de DeepSeek-V4-Flash-Vision-Exp.

Quién usa GLM-5.3-Flash

Desde desarrolladores en solitario hasta equipos con su propia inferencia: GLM-5.3-Flash cubre código, investigación y trabajo multimodal en un único modelo abierto.

Código agéntico

63.4 en DeepSWE v1.1 y 48.8 en AutomationBench v1.0.6 lo convierten en una gran opción para agentes de código, ediciones de varios archivos y cadenas largas de llamadas.

Trabajo de agente de largo recorrido

Toolathlon 78.4 y una ventana de 1.31M tokens mantienen una misma sesión a lo largo de muchos pasos sin perder contexto.

Investigación multimodal

Combina documentos, capturas, gráficos y fotogramas de vídeo en una sola petición para extraer respuestas estructuradas con fuentes.

Análisis de vídeo y visual

MVBench 77.8 y Chartography 78.0 cubren comprensión de vídeo, lectura de gráficos y análisis de maquetación de documentos.

Despliegue propio

La licencia MIT y los 18B de parámetros activos hacen que puedas ejecutar los pesos tú mismo para flujos sensibles a datos o afilados.

Agentes y pipelines de Felo

Llámalo a través de la Felo API para construir agentes, automatizaciones y pipelines de herramientas legibles por máquina.

Dos formas de usar GLM-5.3-Flash

Úsalo en Felo AI Search

Abre Felo AI Search para hacer preguntas, buscar en la web con IA y obtener respuestas citadas de GLM-5.3-Flash.

Abrir Felo AI Search

Llama a la Felo API

Consigue una clave de la Felo API, configura la URL base y llama al modelo desde Claude Code, Codex, Hermes Agent o tu propio agente compatible con OpenAI.

Ver la Felo API

Preguntas frecuentes

GLM-5.3-Flash es el modelo de frontera de pesos abiertos de Z.ai, lanzado el 26 de agosto de 2026. Es un modelo Mixture-of-Experts de 320B de parámetros con 18B activos, una ventana de contexto de 1.310.720 tokens, entrada nativa de texto, imagen y vídeo y atención híbrida dispersa más lineal. Está bajo licencia MIT.

Empieza con GLM-5.3-Flash en Felo

El modelo de frontera abierto de Z.ai: contexto de 1.31M tokens, entrada multimodal nativa y código de nivel agéntico en un solo lugar.

Abrir GLM-5.3-Flash en Felo AI Search

También en la plataforma de Z.ai y en la Felo API