Ліцензія MIT · Відкриті ваги · Випущена 26 серпня 2026

GLM-5.3-FlashПередовий інтелект, відкриті ваги

GLM-5.3-Flash — відкрита frontier-модель від Z.ai, випущена 26 серпня 2026 року за ліцензією MIT. Вона зрівнялася з Claude Opus 4.8 за Індексом інтелекту Artificial Analysis, має контекстне вікно на 1,310,720 токенів, нативне введення тексту, зображень і відео та MoE на 320B параметрів з 18B активних. Спробуйте її у Felo AI Search або викличте через Felo API.

Доступна у Felo AI Search та через Felo API.

Картка моделі

GLM-5.3-Flash одним поглядом

Ліцензія
MIT · Відкриті ваги
Параметри
320B загалом · 18B активних
Контекстне вікно
1.31M токенів
Максимальне виведення
48K токенів
Введення
Текст · Зображення · Відео
Гібридна увага: розріджена + лінійна — приблизно в 3× менше обчислень уваги та в 4.4× менший KV cache, ніж у GLM-5.3.

57

Індекс інтелекту

Artificial Analysis · на рівні Claude Opus 4.8

1M

Контекстне вікно

1,310,720 токенів на введення

48K

Максимальне виведення

48,000 токенів за відповідь

MIT

Ліцензія

MIT · відкриті ваги

Що робить цю архітектуру особливою

Z.ai перебудувала серію GLM-5 навколо гібридної архітектури уваги — так модель frontier-рівня стала практичною у розгортанні.

Гібридна увага: розріджена + лінійна

Перша відкрита frontier-модель, що поєднує розріджену та лінійну увагу. Легкий IndexPool зменшує індексний кеш до чверті розміру, а Manifold-Constrained Hyper-Connections (mHC) покращують масштабування — приблизно в 3× менше обчислень уваги та в 4.4× менший KV cache, ніж у GLM-5.3, при збереженні точності на довгих контекстах.

Відкриті ваги, ліцензія MIT

Повні ваги опубліковано за ліцензією MIT. Запускайте їх на власних серверах, донавчайте або розгортайте через Z.ai чи будь-якого з 10+ провайдерів, що розміщують модель на OpenRouter.

Перша нативно мультимодальна модель серії GLM-5

Навчена на мультимодальному корпусі в 30T токенів, вона читає текст, зображення та відео напряму — без окремого пайплайна обробки зображень і склеювання кількох моделей.

Завдання топ-рівня на швидкості Flash

MoE на 320B параметрів, що активує лише 18B на токен, виконує завдання frontier-рівня на агентській швидкості.

На рівні з Claude Opus 4.8

Індекс інтелекту Artificial Analysis: 57 у GLM-5.3-Flash та 57 у Claude Opus 4.8. Агентський індекс: 58 — вище за Claude Opus 4.8, Claude Fable 5 і GPT-5.6 Sol.

Створена для кодингу й агентів

Z.ai Code Bench (max effort): 29.0 проти 29.5 у Claude Opus 4.8. DeepSWE v1.1: 63.4 — на 17.2 пункта вище за GLM-5.2.

Один запит — текст, зображення, відео

Контекстне вікно на 1,310,720 токенів із нативним мультимодальним введенням. Chartography: 78.0 проти 64.3 у DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 проти 69.4.

Відповіді за частки секунди

Провайдери на OpenRouter зафіксували медіанний час до першого токена 0.55s та пікову пропускну здатність близько 134 tokens/s — на вибір 10+ провайдерів.

Офіційні бенчмарки моделі

GLM-5.3-Flash проти провідних frontier-моделей

Офіційні результати з картки моделі Z.ai: GLM-5.3-Flash проти GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra та Gemini 3.7 Flash, серпень 2026. Чим вище — тим краще: жирним позначено найкращий результат у кожному рядку.

Бенчмарк

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Кодинг

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Агентські задачі

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Візуальні задачі

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Джерело: офіційна картка моделі Z.ai, серпень 2026. Власні заміри; результати можуть відрізнятися залежно від умов оцінювання.

Z.ai Code Bench (max effort): 29.0 проти 29.5 у Claude Opus 4.8 · Агентський індекс Artificial Analysis: 58, вище за Claude Opus 4.8

Читати анонс Z.ai
Незалежні лідерборди

GLM-5.3-Flash у рейтингах сторонніх платформ

Навичка frontend-дизайну на DesignArena і цінність на парето-фронті Artificial Analysis.

DesignArena — загальний рейтинг frontend (неагентний)

DesignArena — загальний рейтинг frontend (неагентний)

GLM-5.3-Flash посідає 1348 і 1345 у frontend-рейтингу Elo DesignArena — 5-те і 6-те місця в загальному списку, позаду Kimi K3, GPT-5.6 Sol і Claude Opus 5, але попереду GLM-5.2, Gemini 3.7 Flash і Claude Sonnet 5.

Джерело: DesignArena by Intelligence · Elo Rating · All Models

Artificial Analysis — парето-фронт ціни та якості

Artificial Analysis — парето-фронт ціни та якості

57 балів в Індексі інтелекту за $0.045 на задачу — GLM-5.3-Flash перебуває на парето-фронті разом із GPT-5.6 Sol (max) і Claude Opus 5 (max), коштуючи в рази менше.

Джерело: Artificial Analysis, оновлено 26 серпня 2026

Технічні характеристики

Деталі, що мають значення, коли ви використовуєте GLM-5.3-Flash у власних робочих процесах.

Контекст і виведення

1,310,720 токенів на введення (контекст 1M+)

до 48,000 токенів максимального виведення

Архітектура

320B загалом / 18B активних Mixture-of-Experts, 45 шарів. Гібридна увага: розріджена + лінійна, з IndexPool і Manifold-Constrained Hyper-Connections (mHC).

Ліцензія та ваги

Відкриті ваги за ліцензією MIT, навчена на мультимодальному корпусі в 30T токенів.

Швидкість

Медіанна затримка до першого токена 0.55s і пікова пропускна здатність близько 134 tokens/s у провайдерів OpenRouter (заміри: серпень 2026).

Доступність

Працює у Felo AI Search та у Felo API, а також на платформі Z.ai й через 10+ провайдерів OpenRouter.

Модальності

Нативне введення тексту, зображень і відео з текстовим виведенням — перша нативно мультимодальна модель у серії GLM-5.

Одна модель — будь-який тип введення

Жодних окремих пайплайнів чи склеєних моделей — GLM-5.3-Flash нативно читає текст, зображення та відео.

Текст і код

Обробляє довгі документи, кодові бази та структуровані дані за один прохід — 63.4 на DeepSWE v1.1, 84.3 на Terminal-Bench 2.1.

Зображення та графіки

Завантажуйте скриншоти, графіки й діаграми — і отримуйте обґрунтовані відповіді: Chartography 78.0 проти 64.3 у DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% проти 48.9% у Claude Opus 4.8.

Відео

Аналізуйте відео разом із текстом і зображеннями: MVBench 77.8% — попереду DeepSeek-V4-Flash-Vision-Exp із 69.4%.

Хто використовує GLM-5.3-Flash

Від розробників-одинаків до команд із власним інференсом — GLM-5.3-Flash закриває кодинг, дослідження та мультимодальні задачі однією відкритою моделлю.

Агентський кодинг

63.4 на DeepSWE v1.1 та 48.8 на AutomationBench v1.0.6 — впевнений вибір для кодинг-агентів, багатофайлових правок і довгих ланцюжків викликів.

Довгі агентські сценарії

Toolathlon 78.4 плюс вікно на 1.31M токенів дозволяють вести одну сесію через десятки кроків, не втрачаючи контекст.

Мультимодальні дослідження

Об'єднуйте документи, скриншоти, графіки та кадри відео в одному запиті — і отримуйте структуровані відповіді з джерелами.

Відео та візуальний аналіз

MVBench 77.8 і Chartography 78.0 покривають розуміння відео, читання графіків та аналіз макета документів.

Розгортання на власних серверах

Ліцензія MIT і лише 18B активних параметрів означають, що ви можете запустити ваги самі — там, де потрібна приватність даних чи власне донавчання.

Агенти та пайплайни Felo

Викликайте її через Felo API, щоб будувати агентів, автоматизації та машиночитані інструментальні пайплайни.

Два способи використати GLM-5.3-Flash

Скористайтеся нею у Felo AI Search

Відкрийте Felo AI Search: ставте запитання, шукайте в інтернеті з ШІ та отримуйте відповіді GLM-5.3-Flash із джерелами.

Відкрити Felo AI Search

Викликайте через Felo API

Отримайте ключ Felo API, вкажіть базовий URL і викликайте модель із Claude Code, Codex, Hermes Agent або власного агента, сумісного з OpenAI.

Відкрити Felo API

Часті запитання

GLM-5.3-Flash — відкрита frontier-модель Z.ai, випущена 26 серпня 2026 року. Це Mixture-of-Experts на 320B параметрів із 18B активних, контекстним вікном на 1,310,720 токенів, нативним введенням тексту, зображень і відео та гібридною увагою (розріджена + лінійна). Вона розповсюджується за ліцензією MIT.

Почніть із GLM-5.3-Flash на Felo

Відкрита frontier-модель від Z.ai — контекст на 1.31M токенів, нативне мультимодальне введення та кодинг агентського класу в одному місці.

Відкрити GLM-5.3-Flash у Felo AI Search

Також на платформі Z.ai та у Felo API