GLM-5.3-FlashInteligência de fronteira, pesos abertos
GLM-5.3-Flash é o modelo de fronteira de pesos abertos da Z.ai, lançado em 26 de agosto de 2026 sob licença MIT. Ele empata com o Claude Opus 4.8 no Índice de Inteligência da Artificial Analysis, com uma janela de contexto de 1.310.720 tokens, entrada nativa de texto, imagem e vídeo e um MoE de 320B de parâmetros que ativa apenas 18B. Teste-o no Felo AI Search ou chame-o pela Felo API.
Disponível no Felo AI Search e na Felo API
Ficha do modelo
GLM-5.3-Flash em resumo
- Licença
- MIT · Pesos abertos
- Parâmetros
- 320B no total · 18B ativos
- Janela de contexto
- 1.31M tokens
- Saída máxima
- 48K tokens
- Entrada
- Texto · Imagem · Vídeo
57
Índice de Inteligência
Artificial Analysis · no nível do Claude Opus 4.8
1M
Janela de contexto
1.310.720 tokens de entrada
48K
Saída máxima
48.000 tokens por resposta
MIT
Licença
MIT · pesos abertos
O que torna a arquitetura especial
A Z.ai reconstruiu a série GLM-5 em torno de um design de atenção híbrida, tornando viável servir inteligência de nível superior.
Atenção híbrida esparsa + linear
O primeiro modelo de fronteira aberto a combinar atenção esparsa e linear. Um IndexPool leve mantém o index cache em um quarto do tamanho, e as Conexões Hiper-Restritas de Manifold (mHC) melhoram o scaling — cerca de 3× menos computação de atenção e KV cache 4,4× menor do que o GLM-5.3, sem perder precisão em contextos longos.
Pesos abertos, licença MIT
Pesos completos publicados sob MIT. Hospede-os você mesmo, faça fine-tuning ou implante via Z.ai ou qualquer um dos mais de 10 provedores que o hospedam na OpenRouter.
Primeiro GLM-5 nativamente multimodal
Treinado em um corpus multimodal de 30T tokens, ele lê texto, imagens e vídeo diretamente — sem pipeline de visão separado, sem unir vários modelos.
Trabalho de fronteira, desempenho relâmpago
Um MoE de 320B de parâmetros que ativa apenas 18B por token entrega trabalho de nível de fronteira na velocidade de um agente.
No nível do Claude Opus 4.8
Índice de Inteligência da Artificial Analysis: 57 para o GLM-5.3-Flash e 57 para o Claude Opus 4.8. Índice Agêntico: 58, acima do Claude Opus 4.8, do Claude Fable 5 e do GPT-5.6 Sol.
Feito para código e agentes
Z.ai Code Bench (máximo esforço): 29.0, contra 29.5 do Claude Opus 4.8. DeepSWE v1.1: 63.4 — 17.2 pontos acima do GLM-5.2.
Uma única solicitação para texto, imagens e vídeo
Janela de contexto de 1.310.720 tokens com entrada multimodal nativa. Chartography: 78.0 contra 64.3 do DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 contra 69.4.
Respostas em menos de um segundo
Provedores na OpenRouter mediram um tempo mediano de primeiro token de 0.55s e pico de throughput de cerca de 134 tokens/s, com mais de 10 provedores para escolher.
GLM-5.3-Flash vs. os melhores modelos de fronteira
Resultados oficiais da ficha do modelo da Z.ai: GLM-5.3-Flash contra GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra e Gemini 3.7 Flash, agosto de 2026. Quanto maior, melhor — o negrito marca a melhor pontuação de cada linha.
Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Coding
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Agêntico
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Visão
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Fonte: ficha oficial do modelo da Z.ai, agosto de 2026. Valores autorreportados; os resultados podem variar conforme a configuração de avaliação.
Z.ai Code Bench (máximo esforço): 29.0 vs. 29.5 do Claude Opus 4.8 · Índice Agêntico da Artificial Analysis: 58, acima do Claude Opus 4.8
Ler o anúncio da Z.aiGLM-5.3-Flash nos rankings de terceiros
Habilidade de design frontend no DesignArena e valor na fronteira de Pareto da Artificial Analysis.

DesignArena — Frontend geral (não agêntico)
O GLM-5.3-Flash chega a 1348 e 1345 no Elo de frontend do DesignArena — 5º e 6º no geral, atrás de Kimi K3, GPT-5.6 Sol e Claude Opus 5, e à frente de GLM-5.2, Gemini 3.7 Flash e Claude Sonnet 5.
Fonte: DesignArena da Intelligence · Elo Rating · Todos os modelos

Artificial Analysis — Fronteira de Pareto custo-desempenho
57 pontos no Índice de Inteligência a $0.045 por tarefa — o GLM-5.3-Flash fica na fronteira de Pareto com GPT-5.6 Sol (max) e Claude Opus 5 (max), a uma fração do custo deles.
Fonte: Artificial Analysis, atualizado em 26 de agosto de 2026
Especificações técnicas
Os detalhes que importam quando você usa o GLM-5.3-Flash nos seus próprios fluxos de trabalho.
Contexto e saída
1.310.720 tokens de entrada (contexto 1M+)
48.000 tokens de saída máxima
Arquitetura
Mixture-of-Experts de 320B totais / 18B ativos, 45 camadas. Atenção híbrida esparsa + linear com IndexPool e Conexões Hiper-Restritas de Manifold (mHC).
Licença e pesos
Pesos abertos com licença MIT, treinados em um corpus multimodal de 30T tokens.
Velocidade
Latência mediana de primeiro token de 0.55s e pico de throughput de cerca de 134 tokens/s nos provedores da OpenRouter (medido em agosto de 2026).
Disponibilidade
No ar no Felo AI Search e na Felo API, além da plataforma da Z.ai e de mais de 10 provedores da OpenRouter.
Modalidades
Entrada nativa de texto, imagem e vídeo com saída em texto — o primeiro modelo nativamente multimodal da série GLM-5.
Um modelo, todos os tipos de entrada
Sem pipelines separados nem modelos unidos: o GLM-5.3-Flash lê texto, imagens e vídeo de forma nativa.
Texto e código
Analisa documentos longos, bases de código e dados estruturados em uma única passada — 63.4 no DeepSWE v1.1, 84.3 no Terminal-Bench 2.1.
Imagens e gráficos
Envie capturas, gráficos e diagramas para obter respostas embasadas: Chartography 78.0 vs. 64.3 do DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% do Claude Opus 4.8.
Vídeo
Analise vídeo junto de texto e imagens: MVBench 77.8%, à frente dos 69.4% do DeepSeek-V4-Flash-Vision-Exp.
Quem usa o GLM-5.3-Flash
De desenvolvedores solo a equipes que rodam a própria inferência: o GLM-5.3-Flash cobre código, pesquisa e trabalho multimodal em um único modelo aberto.
Código agêntico
63.4 no DeepSWE v1.1 e 48.8 no AutomationBench v1.0.6 fazem dele uma ótima escolha para agentes de código, edições em vários arquivos e longas cadeias de chamadas.
Trabalho de agente de longo horizonte
Toolathlon 78.4 e uma janela de 1.31M tokens mantêm uma única sessão viva por muitos passos, sem perder contexto.
Pesquisa multimodal
Combine documentos, capturas, gráficos e frames de vídeo em uma única solicitação para extrair respostas estruturadas com fontes.
Análise de vídeo e visual
MVBench 77.8 e Chartography 78.0 cobrem compreensão de vídeo, leitura de gráficos e análise de layout de documentos.
Hospedagem própria
A licença MIT e os 18B de parâmetros ativos permitem rodar os pesos você mesmo em fluxos sensíveis a dados ou com fine-tuning.
Agentes e pipelines do Felo
Chame-o pela Felo API para construir agentes, automações e pipelines de ferramentas legíveis por máquina.
Duas formas de usar o GLM-5.3-Flash
Use no Felo AI Search
Abra o Felo AI Search para fazer perguntas, buscar na web com IA e receber respostas citadas do GLM-5.3-Flash.
Abrir o Felo AI SearchChame a Felo API
Obtenha uma chave da Felo API, defina a URL base e chame o modelo do Claude Code, Codex, Hermes Agent ou do seu próprio agente compatível com OpenAI.
Ver a Felo APIPerguntas frequentes
GLM-5.3-Flash é o modelo de fronteira de pesos abertos da Z.ai, lançado em 26 de agosto de 2026. É um modelo Mixture-of-Experts de 320B de parâmetros com 18B ativos, janela de contexto de 1.310.720 tokens, entrada nativa de texto, imagem e vídeo e atenção híbrida esparsa + linear. Ele é licenciado sob MIT.
Comece com o GLM-5.3-Flash no Felo
O modelo de fronteira aberto da Z.ai — contexto de 1.31M tokens, entrada multimodal nativa e código de nível agêntico em um só lugar.
Abrir o GLM-5.3-Flash no Felo AI SearchTambém na plataforma da Z.ai e na Felo API