Licencja MIT · Otwarte wagi · Wydana 26 sierpnia 2026

GLM-5.3-FlashInteligencja przyszłości, otwarte wagi

GLM-5.3-Flash to otwarty model frontierowy od Z.ai, wydany 26 sierpnia 2026 r. na licencji MIT. W Indeksie inteligencji Artificial Analysis wyrównuje wyniki z Claude Opus 4.8, ma okno kontekstu 1,310,720 tokenów, natywne wprowadzanie tekstu, obrazów i wideo oraz MoE z 320B parametrów aktywującą tylko 18B. Wypróbuj go w Felo AI Search lub wywołaj przez Felo API.

Dostępny w Felo AI Search i przez Felo API.

Karta modelu

GLM-5.3-Flash w pigułce

Licencja
MIT · Otwarte wagi
Parametry
320B łącznie · 18B aktywnych
Okno kontekstu
1.31M tokenów
Maksymalne wyjście
48K tokenów
Wejście
Tekst · Obrazy · Wideo
Hybrydowa uwaga rzadka + liniowa: około 3× mniej obliczeń uwagi i 4.4× mniejszy KV cache niż w GLM-5.3.

57

Indeks inteligencji

Artificial Analysis · na poziomie Claude Opus 4.8

1M

Okno kontekstu

1,310,720 tokenów na wejściu

48K

Maksymalne wyjście

48,000 tokenów na odpowiedź

MIT

Licencja

MIT · otwarte wagi

Co wyróżnia tę architekturę

Z.ai przebudowało serię GLM-5 wokół hybrydowej architektury uwagi, dzięki czemu model klasy frontier stał się praktyczny we wdrożeniach.

Hybrydowa uwaga: rzadka + liniowa

Pierwsza otwarta model frontierowy łączący uwagi rzadką i liniową. Lekki IndexPool kompresuje indeksowy cache do ćwierci rozmiaru, a Manifold-Constrained Hyper-Connections (mHC) wzmacniają skalowanie — około 3× mniej obliczeń uwagi i 4.4× mniejszy KV cache niż w GLM-5.3, przy zachowaniu precyzji na długim kontekście.

Otwarte wagi, licencja MIT

Pełne wagi opublikowane na licencji MIT. Hostuj je samodzielnie, dostrajaj albo wdróż przez Z.ai lub dowolnego z 10+ dostawców, którzy hostują je na OpenRouter.

Pierwszy natywnie multimodalny model z serii GLM-5

Wytrenowany na multimodalnym korpusie 30T tokenów, czyta tekst, obrazy i wideo bezpośrednio — bez osobnego pipeline'u do przetwarzania obrazów i sklejania kilku modeli.

Zadania frontierowe z szybkością Flash

MoE z 320B parametrów, aktywująca tylko 18B na token, wykonuje zadania frontierowe z szybkością agenta.

Na poziomie Claude Opus 4.8

Indeks inteligencji Artificial Analysis: 57 dla GLM-5.3-Flash, 57 dla Claude Opus 4.8. Indeks agentowy: 58 — powyżej Claude Opus 4.8, Claude Fable 5 i GPT-5.6 Sol.

Stworzony do kodu i agentów

Z.ai Code Bench (max effort): 29.0 wobec 29.5 dla Claude Opus 4.8. DeepSWE v1.1: 63.4 — o 17.2 punktu wyżej niż GLM-5.2.

Jedno zapytanie: tekst, obrazy, wideo

Okno kontekstu 1,310,720 tokenów z natywnym multimodalnym wejściem. Chartography: 78.0 wobec 64.3 dla DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 wobec 69.4.

Odpowiedzi w ułamku sekundy

Dostawcy na OpenRouter zmierzyli medianowy czas do pierwszego tokena 0.55s i szczytową przepustowość około 134 tokens/s — do wyboru 10+ dostawców.

Oficjalne benchmarki z karty modelu

GLM-5.3-Flash kontra czołowe modele frontierowe

Oficjalne wyniki z karty modelu Z.ai: GLM-5.3-Flash kontra GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra i Gemini 3.7 Flash, sierpień 2026. Im wyżej, tym lepiej — pogrubienie oznacza najlepszy wynik w danym wierszu.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Kodowanie

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Zadania agentowe

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Zadania wizyjne

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Źródło: oficjalna karta modelu Z.ai, sierpień 2026. Dane samodzielnie raportowane; wyniki mogą się różnić w zależności od konfiguracji testów.

Z.ai Code Bench (max effort): 29.0 wobec 29.5 dla Claude Opus 4.8 · Indeks agentowy Artificial Analysis: 58, powyżej Claude Opus 4.8

Przeczytaj ogłoszenie Z.ai
Niezależne rankingi

GLM-5.3-Flash w rankingach zewnętrznych

Umiejętności frontendowe w DesignArena i wartość na granicy Pareto Artificial Analysis.

DesignArena — ogólny ranking frontend (nieagentowy)

DesignArena — ogólny ranking frontend (nieagentowy)

GLM-5.3-Flash zajmuje 1348 i 1345 w frontendowym Elo DesignArena — 5. i 6. miejsce ogółem, za Kimi K3, GPT-5.6 Sol i Claude Opus 5, a przed GLM-5.2, Gemini 3.7 Flash i Claude Sonnet 5.

Źródło: DesignArena by Intelligence · Elo Rating · All Models

Artificial Analysis — granica Pareto koszt/wydajność

Artificial Analysis — granica Pareto koszt/wydajność

57 punktów w Indeksie inteligencji przy $0.045 za zadanie — GLM-5.3-Flash leży na granicy Pareto z GPT-5.6 Sol (max) i Claude Opus 5 (max), za ułamek ich kosztu.

Źródło: Artificial Analysis, zaktualizowano 26 sierpnia 2026

Parametry techniczne

Szczegóły, które mają znaczenie, gdy używasz GLM-5.3-Flash we własnych workflowach.

Kontekst i wyjście

1,310,720 tokenów na wejściu (kontekst 1M+)

maksymalnie 48,000 tokenów na wyjściu

Architektura

320B łącznie / 18B aktywnych Mixture-of-Experts, 45 warstw. Hybrydowa uwaga rzadka + liniowa z IndexPool i Manifold-Constrained Hyper-Connections (mHC).

Licencja i wagi

Otwarte wagi na licencji MIT, trenowany na multimodalnym korpusie 30T tokenów.

Szybkość

Mediana opóźnienia do pierwszego tokena 0.55s i szczytowa przepustowość około 134 tokens/s u dostawców OpenRouter (pomiar: sierpień 2026).

Dostępność

Dostępny w Felo AI Search i w Felo API, a także na platformie Z.ai oraz przez 10+ dostawców na OpenRouter.

Modalności

Natywne wprowadzanie tekstu, obrazów i wideo z wyjściem tekstowym — pierwszy natywnie multimodalny model w serii GLM-5.

Jeden model — każde wejście

Żadnych osobnych pipeline'ów ani sklejanych modeli — GLM-5.3-Flash natywnie czyta tekst, obrazy i wideo.

Tekst i kod

Analizuje długie dokumenty, repozytoria i dane strukturalne w jednym przebiegu — 63.4 w DeepSWE v1.1, 84.3 w Terminal-Bench 2.1.

Obrazy i wykresy

Wgraj zrzuty ekranu, wykresy i diagramy, aby otrzymać uzasadnione odpowiedzi: Chartography 78.0 wobec 64.3 dla DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% wobec 48.9% dla Claude Opus 4.8.

Wideo

Analizuj wideo obok tekstu i obrazów: MVBench 77.8%, przed DeepSeek-V4-Flash-Vision-Exp z 69.4%.

Kto używa GLM-5.3-Flash

Od niezależnych deweloperów po zespoły z własnymi obliczeniami — GLM-5.3-Flash pokrywa kodowanie, badania i pracę multimodalną na jednym otwartym modelu.

Kodowanie agentowe

63.4 w DeepSWE v1.1 i 48.8 w AutomationBench v1.0.6 czynią go mocnym wyborem do agentów programistycznych, edycji wielu plików i długich łańcuchów wywołań.

Długie scenariusze agentowe

Toolathlon 78.4 plus okno 1.31M tokenów utrzymują jedną sesję przez wiele kroków bez gubienia kontekstu.

Badania multimodalne

Łącz dokumenty, zrzuty ekranu, wykresy i klatki wideo w jednym zapytaniu, aby wyciągać ustrukturyzowane odpowiedzi ze źródłami.

Analiza wideo i obrazów

MVBench 77.8 i Chartography 78.0 pokrywają rozumienie wideo, czytanie wykresów i analizę układu dokumentów.

Wdrożenia self-hosted

Licencja MIT i tylko 18B aktywnych parametrów oznaczają, że możesz uruchomić wagi samodzielnie — przy danych wrażliwych lub własnych dostrojeniach.

Agenci i pipeline'y Felo

Wywołuj go przez Felo API, aby tworzyć agentów, automatyzacje i maszynowe pipeline'y narzędziowe.

Dwa sposoby korzystania z GLM-5.3-Flash

Użyj go w Felo AI Search

Otwórz Felo AI Search: zadawaj pytania, szukaj w sieci z AI i odbieraj odpowiedzi GLM-5.3-Flash ze źródłami.

Otwórz Felo AI Search

Wywołaj Felo API

Zdobądź klucz Felo API, ustaw bazowy URL i wywołuj model z Claude Code, Codex, Hermes Agent lub własnego agenta zgodnego z OpenAI.

Zobacz Felo API

Najczęstsze pytania

GLM-5.3-Flash to otwarty model frontierowy Z.ai, wydany 26 sierpnia 2026 r. To Mixture-of-Experts z 320B parametrów, 18B aktywnych, oknem kontekstu 1,310,720 tokenów, natywnym wprowadzaniem tekstu, obrazów i wideo oraz hybrydową uwagą rzadką i liniową. Model jest objęty licencją MIT.

Zacznij od GLM-5.3-Flash na Felo

Otwarty model frontierowy od Z.ai — okno kontekstu 1.31M tokenów, natywne multimodalne wejście i kodowanie klasy agentowej w jednym miejscu.

Otwórz GLM-5.3-Flash w Felo AI Search

Również na platformie Z.ai i w Felo API