Лицензия MIT · Открытые веса · Выпущена 26 августа 2026

GLM-5.3-FlashПередовой интеллект, открытые веса

GLM-5.3-Flash — открытая frontier-модель от Z.ai, выпущенная 26 августа 2026 года под лицензией MIT. На Индексе интеллекта Artificial Analysis она сравнялась с Claude Opus 4.8, получила контекстное окно на 1,310,720 токенов, нативный ввод текста, изображений и видео и MoE на 320B параметров с 18B активных. Попробуйте её в Felo AI Search или вызовите через Felo API.

Доступна в Felo AI Search и через Felo API.

Карточка модели

GLM-5.3-Flash в двух словах

Лицензия
MIT · Открытые веса
Параметры
320B всего · 18B активных
Контекстное окно
1.31M токенов
Максимальный вывод
48K токенов
Ввод
Текст · Изображения · Видео
Гибридное внимание (разреженное + линейное): примерно в 3× меньше вычислений внимания и в 4.4× меньший KV cache, чем у GLM-5.3.

57

Индекс интеллекта

Artificial Analysis · на уровне Claude Opus 4.8

1M

Контекстное окно

1,310,720 токенов на ввод

48K

Максимальный вывод

48,000 токенов за ответ

MIT

Лицензия

MIT · открытые веса

Что отличает эту архитектуру

Z.ai переработала серию GLM-5 вокруг гибридной архитектуры внимания — так модель frontier-уровня стала практичной в развертывании.

Гибридное внимание: разреженное + линейное

Первая открытая frontier-модель, объединившая разреженное и линейное внимание. Легкий IndexPool сжимает индексный кэш до четверти размера, а Manifold-Constrained Hyper-Connections (mHC) усиливают масштабирование — примерно в 3× меньше вычислений внимания и в 4.4× компактнее KV cache, чем у GLM-5.3, при сохранении точности на длинных контекстах.

Открытые веса, лицензия MIT

Полные веса опубликованы под лицензией MIT. Разворачивайте их на своих серверах, дообучайте или используйте через Z.ai или любого из 10+ провайдеров, которые размещают её на OpenRouter.

Первая нативно мультимодальная модель в серии GLM-5

Обученная на мультимодальном корпусе в 30T токенов, она напрямую читает текст, изображения и видео — без отдельного пайплайна обработки изображений и без склейки нескольких моделей.

Задачи топ-уровня на скорости Flash

MoE на 320B параметров, активирующая всего 18B на токен, справляется с задачами frontier-уровня на скорости агентов.

На одном уровне с Claude Opus 4.8

Индекс интеллекта Artificial Analysis: 57 у GLM-5.3-Flash и 57 у Claude Opus 4.8. Агентный индекс: 58 — выше Claude Opus 4.8, Claude Fable 5 и GPT-5.6 Sol.

Создана для кодинга и агентов

Z.ai Code Bench (max effort): 29.0 против 29.5 у Claude Opus 4.8. DeepSWE v1.1: 63.4 — на 17.2 пункта выше GLM-5.2.

Один запрос — текст, изображения, видео

Контекстное окно на 1,310,720 токенов с нативным мультимодальным вводом. Chartography: 78.0 против 64.3 у DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 против 69.4.

Ответы за доли секунды

Провайдеры на OpenRouter зафиксировали медианное время до первого токена 0.55s и пиковую пропускную способность около 134 tokens/s; на выбор 10+ провайдеров.

Официальные бенчмарки модели

GLM-5.3-Flash против ведущих frontier-моделей

Официальные результаты из карточки модели Z.ai: GLM-5.3-Flash против GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra и Gemini 3.7 Flash, август 2026. Чем выше — тем лучше: жирным выделен лучший результат в каждой строке.

Бенчмарк

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Кодинг

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Агентные задачи

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Визуальные задачи

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Источник: официальная карточка модели Z.ai, август 2026. Собственные замеры; результаты могут отличаться в зависимости от условий тестирования.

Z.ai Code Bench (max effort): 29.0 против 29.5 у Claude Opus 4.8 · Агентный индекс Artificial Analysis: 58, выше Claude Opus 4.8

Читать анонс Z.ai
Независимые лидерборды

GLM-5.3-Flash в рейтингах сторонних платформ

Навык frontend-дизайна на DesignArena и ценность на парето-фронте Artificial Analysis.

DesignArena — общий рейтинг frontend (не-агентный)

DesignArena — общий рейтинг frontend (не-агентный)

GLM-5.3-Flash занимает 1348 и 1345 в frontend-рейтинге Elo DesignArena — 5-е и 6-е места в общем списке: позади Kimi K3, GPT-5.6 Sol и Claude Opus 5, но впереди GLM-5.2, Gemini 3.7 Flash и Claude Sonnet 5.

Источник: DesignArena by Intelligence · Elo Rating · All Models

Artificial Analysis — парето-фронт цены и качества

Artificial Analysis — парето-фронт цены и качества

57 баллов в Индексе интеллекта при $0.045 за задачу — GLM-5.3-Flash находится на парето-фронте вместе с GPT-5.6 Sol (max) и Claude Opus 5 (max), при этом стоит в разы дешевле.

Источник: Artificial Analysis, обновлено 26 августа 2026

Технические характеристики

Детали, которые важны при использовании GLM-5.3-Flash в ваших рабочих процессах.

Контекст и вывод

1,310,720 токенов на ввод (контекст 1M+)

максимум 48,000 токенов на вывод

Архитектура

320B всего / 18B активных Mixture-of-Experts, 45 слоев. Гибридное внимание: разреженное + линейное, с IndexPool и Manifold-Constrained Hyper-Connections (mHC).

Лицензия и веса

Открытые веса под лицензией MIT, обучена на мультимодальном корпусе в 30T токенов.

Скорость

Медианная задержка до первого токена 0.55s и пиковая пропускная способность около 134 tokens/s у провайдеров OpenRouter (замеры: август 2026).

Доступность

Работает в Felo AI Search и в Felo API, а также на платформе Z.ai и через 10+ провайдеров OpenRouter.

Модальности

Нативный ввод текста, изображений и видео с текстовым выводом — первая нативно мультимодальная модель в серии GLM-5.

Одна модель — любой тип ввода

Никаких отдельных пайплайнов и склеенных моделей — GLM-5.3-Flash нативно читает текст, изображения и видео.

Текст и код

Обрабатывает длинные документы, кодовые базы и структурированные данные за один проход — 63.4 на DeepSWE v1.1 и 84.3 на Terminal-Bench 2.1.

Изображения и графики

Загружайте скриншоты, графики и диаграммы — и получайте обоснованные ответы: Chartography 78.0 против 64.3 у DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% против 48.9% у Claude Opus 4.8.

Видео

Анализируйте видео вместе с текстом и изображениями: MVBench 77.8% — впереди DeepSeek-V4-Flash-Vision-Exp с 69.4%.

Кто использует GLM-5.3-Flash

От разработчиков-одиночек до команд с собственным инференсом — GLM-5.3-Flash закрывает кодинг, исследования и мультимодальные задачи одной открытой моделью.

Агентный кодинг

63.4 на DeepSWE v1.1 и 48.8 на AutomationBench v1.0.6 — отличный выбор для кодинг-агентов, многофайловых правок и длинных цепочек вызовов.

Длительные агентные сценарии

Toolathlon 78.4 и окно на 1.31M токенов позволяют вести одну сессию через множество шагов, не теряя контекст.

Мультимодальные исследования

Соединяйте документы, скриншоты, графики и кадры видео в одном запросе — и извлекайте структурированные ответы с источниками.

Видео и визуальный анализ

MVBench 77.8 и Chartography 78.0 закрывают понимание видео, чтение графиков и анализ макета документов.

Развертывание на собственных серверах

Лицензия MIT и всего 18B активных параметров — веса можно запускать самостоятельно, когда нужна приватность данных или собственное дообучение.

Агенты и пайплайны Felo

Вызывайте её через Felo API, чтобы строить агентов, автоматизации и машиночитаемые инструментальные пайплайны.

Два способа использовать GLM-5.3-Flash

Используйте её в Felo AI Search

Откройте Felo AI Search: задавайте вопросы, ищите в интернете с помощью ИИ и получайте ответы GLM-5.3-Flash с источниками.

Открыть Felo AI Search

Вызывайте через Felo API

Получите ключ Felo API, укажите базовый URL и вызывайте модель из Claude Code, Codex, Hermes Agent или собственного агента, совместимого с OpenAI.

Открыть Felo API

Частые вопросы

GLM-5.3-Flash — открытая frontier-модель Z.ai, выпущенная 26 августа 2026 года. Это Mixture-of-Experts на 320B параметров с 18B активными, контекстное окно на 1,310,720 токенов, нативный ввод текста, изображений и видео и гибридное внимание (разреженное + линейное). Она распространяется по лицензии MIT.

Начните с GLM-5.3-Flash на Felo

Открытая frontier-модель Z.ai — контекст на 1.31M токенов, нативный мультимодальный ввод и кодинг агентского класса в одном месте.

Открыть GLM-5.3-Flash в Felo AI Search

Также на платформе Z.ai и в Felo API