GLM-5.3-FlashInteligencja przyszłości, otwarte wagi
GLM-5.3-Flash to otwarty model frontierowy od Z.ai, wydany 26 sierpnia 2026 r. na licencji MIT. W Indeksie inteligencji Artificial Analysis wyrównuje wyniki z Claude Opus 4.8, ma okno kontekstu 1,310,720 tokenów, natywne wprowadzanie tekstu, obrazów i wideo oraz MoE z 320B parametrów aktywującą tylko 18B. Wypróbuj go w Felo AI Search lub wywołaj przez Felo API.
Dostępny w Felo AI Search i przez Felo API.
Karta modelu
GLM-5.3-Flash w pigułce
- Licencja
- MIT · Otwarte wagi
- Parametry
- 320B łącznie · 18B aktywnych
- Okno kontekstu
- 1.31M tokenów
- Maksymalne wyjście
- 48K tokenów
- Wejście
- Tekst · Obrazy · Wideo
57
Indeks inteligencji
Artificial Analysis · na poziomie Claude Opus 4.8
1M
Okno kontekstu
1,310,720 tokenów na wejściu
48K
Maksymalne wyjście
48,000 tokenów na odpowiedź
MIT
Licencja
MIT · otwarte wagi
Co wyróżnia tę architekturę
Z.ai przebudowało serię GLM-5 wokół hybrydowej architektury uwagi, dzięki czemu model klasy frontier stał się praktyczny we wdrożeniach.
Hybrydowa uwaga: rzadka + liniowa
Pierwsza otwarta model frontierowy łączący uwagi rzadką i liniową. Lekki IndexPool kompresuje indeksowy cache do ćwierci rozmiaru, a Manifold-Constrained Hyper-Connections (mHC) wzmacniają skalowanie — około 3× mniej obliczeń uwagi i 4.4× mniejszy KV cache niż w GLM-5.3, przy zachowaniu precyzji na długim kontekście.
Otwarte wagi, licencja MIT
Pełne wagi opublikowane na licencji MIT. Hostuj je samodzielnie, dostrajaj albo wdróż przez Z.ai lub dowolnego z 10+ dostawców, którzy hostują je na OpenRouter.
Pierwszy natywnie multimodalny model z serii GLM-5
Wytrenowany na multimodalnym korpusie 30T tokenów, czyta tekst, obrazy i wideo bezpośrednio — bez osobnego pipeline'u do przetwarzania obrazów i sklejania kilku modeli.
Zadania frontierowe z szybkością Flash
MoE z 320B parametrów, aktywująca tylko 18B na token, wykonuje zadania frontierowe z szybkością agenta.
Na poziomie Claude Opus 4.8
Indeks inteligencji Artificial Analysis: 57 dla GLM-5.3-Flash, 57 dla Claude Opus 4.8. Indeks agentowy: 58 — powyżej Claude Opus 4.8, Claude Fable 5 i GPT-5.6 Sol.
Stworzony do kodu i agentów
Z.ai Code Bench (max effort): 29.0 wobec 29.5 dla Claude Opus 4.8. DeepSWE v1.1: 63.4 — o 17.2 punktu wyżej niż GLM-5.2.
Jedno zapytanie: tekst, obrazy, wideo
Okno kontekstu 1,310,720 tokenów z natywnym multimodalnym wejściem. Chartography: 78.0 wobec 64.3 dla DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 wobec 69.4.
Odpowiedzi w ułamku sekundy
Dostawcy na OpenRouter zmierzyli medianowy czas do pierwszego tokena 0.55s i szczytową przepustowość około 134 tokens/s — do wyboru 10+ dostawców.
GLM-5.3-Flash kontra czołowe modele frontierowe
Oficjalne wyniki z karty modelu Z.ai: GLM-5.3-Flash kontra GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra i Gemini 3.7 Flash, sierpień 2026. Im wyżej, tym lepiej — pogrubienie oznacza najlepszy wynik w danym wierszu.
Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Kodowanie
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Zadania agentowe
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Zadania wizyjne
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Źródło: oficjalna karta modelu Z.ai, sierpień 2026. Dane samodzielnie raportowane; wyniki mogą się różnić w zależności od konfiguracji testów.
Z.ai Code Bench (max effort): 29.0 wobec 29.5 dla Claude Opus 4.8 · Indeks agentowy Artificial Analysis: 58, powyżej Claude Opus 4.8
Przeczytaj ogłoszenie Z.aiGLM-5.3-Flash w rankingach zewnętrznych
Umiejętności frontendowe w DesignArena i wartość na granicy Pareto Artificial Analysis.

DesignArena — ogólny ranking frontend (nieagentowy)
GLM-5.3-Flash zajmuje 1348 i 1345 w frontendowym Elo DesignArena — 5. i 6. miejsce ogółem, za Kimi K3, GPT-5.6 Sol i Claude Opus 5, a przed GLM-5.2, Gemini 3.7 Flash i Claude Sonnet 5.
Źródło: DesignArena by Intelligence · Elo Rating · All Models

Artificial Analysis — granica Pareto koszt/wydajność
57 punktów w Indeksie inteligencji przy $0.045 za zadanie — GLM-5.3-Flash leży na granicy Pareto z GPT-5.6 Sol (max) i Claude Opus 5 (max), za ułamek ich kosztu.
Źródło: Artificial Analysis, zaktualizowano 26 sierpnia 2026
Parametry techniczne
Szczegóły, które mają znaczenie, gdy używasz GLM-5.3-Flash we własnych workflowach.
Kontekst i wyjście
1,310,720 tokenów na wejściu (kontekst 1M+)
maksymalnie 48,000 tokenów na wyjściu
Architektura
320B łącznie / 18B aktywnych Mixture-of-Experts, 45 warstw. Hybrydowa uwaga rzadka + liniowa z IndexPool i Manifold-Constrained Hyper-Connections (mHC).
Licencja i wagi
Otwarte wagi na licencji MIT, trenowany na multimodalnym korpusie 30T tokenów.
Szybkość
Mediana opóźnienia do pierwszego tokena 0.55s i szczytowa przepustowość około 134 tokens/s u dostawców OpenRouter (pomiar: sierpień 2026).
Dostępność
Dostępny w Felo AI Search i w Felo API, a także na platformie Z.ai oraz przez 10+ dostawców na OpenRouter.
Modalności
Natywne wprowadzanie tekstu, obrazów i wideo z wyjściem tekstowym — pierwszy natywnie multimodalny model w serii GLM-5.
Jeden model — każde wejście
Żadnych osobnych pipeline'ów ani sklejanych modeli — GLM-5.3-Flash natywnie czyta tekst, obrazy i wideo.
Tekst i kod
Analizuje długie dokumenty, repozytoria i dane strukturalne w jednym przebiegu — 63.4 w DeepSWE v1.1, 84.3 w Terminal-Bench 2.1.
Obrazy i wykresy
Wgraj zrzuty ekranu, wykresy i diagramy, aby otrzymać uzasadnione odpowiedzi: Chartography 78.0 wobec 64.3 dla DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% wobec 48.9% dla Claude Opus 4.8.
Wideo
Analizuj wideo obok tekstu i obrazów: MVBench 77.8%, przed DeepSeek-V4-Flash-Vision-Exp z 69.4%.
Kto używa GLM-5.3-Flash
Od niezależnych deweloperów po zespoły z własnymi obliczeniami — GLM-5.3-Flash pokrywa kodowanie, badania i pracę multimodalną na jednym otwartym modelu.
Kodowanie agentowe
63.4 w DeepSWE v1.1 i 48.8 w AutomationBench v1.0.6 czynią go mocnym wyborem do agentów programistycznych, edycji wielu plików i długich łańcuchów wywołań.
Długie scenariusze agentowe
Toolathlon 78.4 plus okno 1.31M tokenów utrzymują jedną sesję przez wiele kroków bez gubienia kontekstu.
Badania multimodalne
Łącz dokumenty, zrzuty ekranu, wykresy i klatki wideo w jednym zapytaniu, aby wyciągać ustrukturyzowane odpowiedzi ze źródłami.
Analiza wideo i obrazów
MVBench 77.8 i Chartography 78.0 pokrywają rozumienie wideo, czytanie wykresów i analizę układu dokumentów.
Wdrożenia self-hosted
Licencja MIT i tylko 18B aktywnych parametrów oznaczają, że możesz uruchomić wagi samodzielnie — przy danych wrażliwych lub własnych dostrojeniach.
Agenci i pipeline'y Felo
Wywołuj go przez Felo API, aby tworzyć agentów, automatyzacje i maszynowe pipeline'y narzędziowe.
Dwa sposoby korzystania z GLM-5.3-Flash
Użyj go w Felo AI Search
Otwórz Felo AI Search: zadawaj pytania, szukaj w sieci z AI i odbieraj odpowiedzi GLM-5.3-Flash ze źródłami.
Otwórz Felo AI SearchWywołaj Felo API
Zdobądź klucz Felo API, ustaw bazowy URL i wywołuj model z Claude Code, Codex, Hermes Agent lub własnego agenta zgodnego z OpenAI.
Zobacz Felo APINajczęstsze pytania
GLM-5.3-Flash to otwarty model frontierowy Z.ai, wydany 26 sierpnia 2026 r. To Mixture-of-Experts z 320B parametrów, 18B aktywnych, oknem kontekstu 1,310,720 tokenów, natywnym wprowadzaniem tekstu, obrazów i wideo oraz hybrydową uwagą rzadką i liniową. Model jest objęty licencją MIT.
Zacznij od GLM-5.3-Flash na Felo
Otwarty model frontierowy od Z.ai — okno kontekstu 1.31M tokenów, natywne multimodalne wejście i kodowanie klasy agentowej w jednym miejscu.
Otwórz GLM-5.3-Flash w Felo AI SearchRównież na platformie Z.ai i w Felo API