Licença MIT · Pesos abertos · Lançado em 26 de agosto de 2026

GLM-5.3-FlashInteligência de fronteira, pesos abertos

GLM-5.3-Flash é o modelo de fronteira de pesos abertos da Z.ai, lançado em 26 de agosto de 2026 sob licença MIT. Ele empata com o Claude Opus 4.8 no Índice de Inteligência da Artificial Analysis, com uma janela de contexto de 1.310.720 tokens, entrada nativa de texto, imagem e vídeo e um MoE de 320B de parâmetros que ativa apenas 18B. Teste-o no Felo AI Search ou chame-o pela Felo API.

Disponível no Felo AI Search e na Felo API

Ficha do modelo

GLM-5.3-Flash em resumo

Licença
MIT · Pesos abertos
Parâmetros
320B no total · 18B ativos
Janela de contexto
1.31M tokens
Saída máxima
48K tokens
Entrada
Texto · Imagem · Vídeo
Atenção híbrida esparsa + linear: cerca de 3× menos computação de atenção e KV cache 4,4× menor do que no GLM-5.3.

57

Índice de Inteligência

Artificial Analysis · no nível do Claude Opus 4.8

1M

Janela de contexto

1.310.720 tokens de entrada

48K

Saída máxima

48.000 tokens por resposta

MIT

Licença

MIT · pesos abertos

O que torna a arquitetura especial

A Z.ai reconstruiu a série GLM-5 em torno de um design de atenção híbrida, tornando viável servir inteligência de nível superior.

Atenção híbrida esparsa + linear

O primeiro modelo de fronteira aberto a combinar atenção esparsa e linear. Um IndexPool leve mantém o index cache em um quarto do tamanho, e as Conexões Hiper-Restritas de Manifold (mHC) melhoram o scaling — cerca de 3× menos computação de atenção e KV cache 4,4× menor do que o GLM-5.3, sem perder precisão em contextos longos.

Pesos abertos, licença MIT

Pesos completos publicados sob MIT. Hospede-os você mesmo, faça fine-tuning ou implante via Z.ai ou qualquer um dos mais de 10 provedores que o hospedam na OpenRouter.

Primeiro GLM-5 nativamente multimodal

Treinado em um corpus multimodal de 30T tokens, ele lê texto, imagens e vídeo diretamente — sem pipeline de visão separado, sem unir vários modelos.

Trabalho de fronteira, desempenho relâmpago

Um MoE de 320B de parâmetros que ativa apenas 18B por token entrega trabalho de nível de fronteira na velocidade de um agente.

No nível do Claude Opus 4.8

Índice de Inteligência da Artificial Analysis: 57 para o GLM-5.3-Flash e 57 para o Claude Opus 4.8. Índice Agêntico: 58, acima do Claude Opus 4.8, do Claude Fable 5 e do GPT-5.6 Sol.

Feito para código e agentes

Z.ai Code Bench (máximo esforço): 29.0, contra 29.5 do Claude Opus 4.8. DeepSWE v1.1: 63.4 — 17.2 pontos acima do GLM-5.2.

Uma única solicitação para texto, imagens e vídeo

Janela de contexto de 1.310.720 tokens com entrada multimodal nativa. Chartography: 78.0 contra 64.3 do DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 contra 69.4.

Respostas em menos de um segundo

Provedores na OpenRouter mediram um tempo mediano de primeiro token de 0.55s e pico de throughput de cerca de 134 tokens/s, com mais de 10 provedores para escolher.

Benchmarks oficiais da ficha do modelo

GLM-5.3-Flash vs. os melhores modelos de fronteira

Resultados oficiais da ficha do modelo da Z.ai: GLM-5.3-Flash contra GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra e Gemini 3.7 Flash, agosto de 2026. Quanto maior, melhor — o negrito marca a melhor pontuação de cada linha.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Coding

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agêntico

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Visão

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Fonte: ficha oficial do modelo da Z.ai, agosto de 2026. Valores autorreportados; os resultados podem variar conforme a configuração de avaliação.

Z.ai Code Bench (máximo esforço): 29.0 vs. 29.5 do Claude Opus 4.8 · Índice Agêntico da Artificial Analysis: 58, acima do Claude Opus 4.8

Ler o anúncio da Z.ai
Rankings independentes

GLM-5.3-Flash nos rankings de terceiros

Habilidade de design frontend no DesignArena e valor na fronteira de Pareto da Artificial Analysis.

DesignArena — Frontend geral (não agêntico)

DesignArena — Frontend geral (não agêntico)

O GLM-5.3-Flash chega a 1348 e 1345 no Elo de frontend do DesignArena — 5º e 6º no geral, atrás de Kimi K3, GPT-5.6 Sol e Claude Opus 5, e à frente de GLM-5.2, Gemini 3.7 Flash e Claude Sonnet 5.

Fonte: DesignArena da Intelligence · Elo Rating · Todos os modelos

Artificial Analysis — Fronteira de Pareto custo-desempenho

Artificial Analysis — Fronteira de Pareto custo-desempenho

57 pontos no Índice de Inteligência a $0.045 por tarefa — o GLM-5.3-Flash fica na fronteira de Pareto com GPT-5.6 Sol (max) e Claude Opus 5 (max), a uma fração do custo deles.

Fonte: Artificial Analysis, atualizado em 26 de agosto de 2026

Especificações técnicas

Os detalhes que importam quando você usa o GLM-5.3-Flash nos seus próprios fluxos de trabalho.

Contexto e saída

1.310.720 tokens de entrada (contexto 1M+)

48.000 tokens de saída máxima

Arquitetura

Mixture-of-Experts de 320B totais / 18B ativos, 45 camadas. Atenção híbrida esparsa + linear com IndexPool e Conexões Hiper-Restritas de Manifold (mHC).

Licença e pesos

Pesos abertos com licença MIT, treinados em um corpus multimodal de 30T tokens.

Velocidade

Latência mediana de primeiro token de 0.55s e pico de throughput de cerca de 134 tokens/s nos provedores da OpenRouter (medido em agosto de 2026).

Disponibilidade

No ar no Felo AI Search e na Felo API, além da plataforma da Z.ai e de mais de 10 provedores da OpenRouter.

Modalidades

Entrada nativa de texto, imagem e vídeo com saída em texto — o primeiro modelo nativamente multimodal da série GLM-5.

Um modelo, todos os tipos de entrada

Sem pipelines separados nem modelos unidos: o GLM-5.3-Flash lê texto, imagens e vídeo de forma nativa.

Texto e código

Analisa documentos longos, bases de código e dados estruturados em uma única passada — 63.4 no DeepSWE v1.1, 84.3 no Terminal-Bench 2.1.

Imagens e gráficos

Envie capturas, gráficos e diagramas para obter respostas embasadas: Chartography 78.0 vs. 64.3 do DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% vs. 48.9% do Claude Opus 4.8.

Vídeo

Analise vídeo junto de texto e imagens: MVBench 77.8%, à frente dos 69.4% do DeepSeek-V4-Flash-Vision-Exp.

Quem usa o GLM-5.3-Flash

De desenvolvedores solo a equipes que rodam a própria inferência: o GLM-5.3-Flash cobre código, pesquisa e trabalho multimodal em um único modelo aberto.

Código agêntico

63.4 no DeepSWE v1.1 e 48.8 no AutomationBench v1.0.6 fazem dele uma ótima escolha para agentes de código, edições em vários arquivos e longas cadeias de chamadas.

Trabalho de agente de longo horizonte

Toolathlon 78.4 e uma janela de 1.31M tokens mantêm uma única sessão viva por muitos passos, sem perder contexto.

Pesquisa multimodal

Combine documentos, capturas, gráficos e frames de vídeo em uma única solicitação para extrair respostas estruturadas com fontes.

Análise de vídeo e visual

MVBench 77.8 e Chartography 78.0 cobrem compreensão de vídeo, leitura de gráficos e análise de layout de documentos.

Hospedagem própria

A licença MIT e os 18B de parâmetros ativos permitem rodar os pesos você mesmo em fluxos sensíveis a dados ou com fine-tuning.

Agentes e pipelines do Felo

Chame-o pela Felo API para construir agentes, automações e pipelines de ferramentas legíveis por máquina.

Duas formas de usar o GLM-5.3-Flash

Use no Felo AI Search

Abra o Felo AI Search para fazer perguntas, buscar na web com IA e receber respostas citadas do GLM-5.3-Flash.

Abrir o Felo AI Search

Chame a Felo API

Obtenha uma chave da Felo API, defina a URL base e chame o modelo do Claude Code, Codex, Hermes Agent ou do seu próprio agente compatível com OpenAI.

Ver a Felo API

Perguntas frequentes

GLM-5.3-Flash é o modelo de fronteira de pesos abertos da Z.ai, lançado em 26 de agosto de 2026. É um modelo Mixture-of-Experts de 320B de parâmetros com 18B ativos, janela de contexto de 1.310.720 tokens, entrada nativa de texto, imagem e vídeo e atenção híbrida esparsa + linear. Ele é licenciado sob MIT.

Comece com o GLM-5.3-Flash no Felo

O modelo de fronteira aberto da Z.ai — contexto de 1.31M tokens, entrada multimodal nativa e código de nível agêntico em um só lugar.

Abrir o GLM-5.3-Flash no Felo AI Search

Também na plataforma da Z.ai e na Felo API