GLM-5.3-Flash前沿智能,开放权重
GLM-5.3-Flash 是 Z.ai 于 2026 年 8 月 26 日以 MIT 协议发布的开放权重前沿模型。它配备 1,310,720 token 的上下文窗口、原生文本/图像/视频输入,以及 320B 参数混合专家模型(仅激活 18B),在 Artificial Analysis 的 Intelligence Index 上追平 Claude Opus 4.8。你可以在 Felo AI Search 上试用,也可以通过 Felo API 调用。
可在 Felo AI Search 和 Felo API 上使用。
模型卡片
GLM-5.3-Flash 一览
- 许可协议
- MIT · 开放权重
- 参数
- 总 320B · 激活 18B
- 上下文窗口
- 1.31M token
- 最大输出
- 48K token
- 输入
- 文本 · 图像 · 视频
57
Intelligence Index
Artificial Analysis · 与 Claude Opus 4.8 持平
1M
上下文窗口
输入 1,310,720 token
48K
最大输出
每次响应最多 48,000 token
MIT
许可协议
MIT · 开放权重
架构的不同之处
Z.ai 以混合注意力设计为核心重构 GLM-5 系列,让顶尖智能做到真正可落地、可服务。
混合稀疏 + 线性注意力
首个将稀疏注意力与线性注意力结合的开放前沿模型。轻量级 IndexPool 将索引缓存压缩到四分之一大小,Manifold-Constrained Hyper-Connections(mHC)则提升扩展能力——与 GLM-5.3 相比,注意力计算量约为 1/3,KV 缓存约为 1/4.4,同时在长上下文上保持精准。
开放权重,MIT 协议
完整权重已按 MIT 协议发布。自托管、微调,或通过 Z.ai 或 OpenRouter 上托管该模型的 10+ 个服务商部署,都由你决定。
GLM-5 系列首个原生多模态模型
基于 30T token 的多模态语料训练,可直接读取文本、图像和视频——无需单独的视觉流程,也不需要把多个模型拼接在一起。
前沿任务,闪速性能
320B 参数混合专家模型,每个 token 只激活 18B——前沿级的工作,以智能体级别的速度完成。
与 Claude Opus 4.8 持平
Artificial Analysis Intelligence Index:GLM-5.3-Flash 57,Claude Opus 4.8 57。Agentic Index:58,超过 Claude Opus 4.8、Claude Fable 5 和 GPT-5.6 Sol。
为编程与智能体而生
Z.ai Code Bench(max effort):29.0,Claude Opus 4.8 为 29.5。DeepSWE v1.1:63.4——比 GLM-5.2 高出 17.2 分。
一个请求搞定文本、图像与视频
1,310,720 token 的上下文窗口,支持原生多模态输入。Chartography:78.0(DeepSeek-V4-Flash-Vision-Exp 为 64.3);MVBench:77.8(69.4)。
亚秒级响应
OpenRouter 服务商实测首 token 时间中位数 0.55 秒,峰值吞吐约 134 token/s,可选服务商 10+ 家。
GLM-5.3-Flash 对比顶级前沿模型
Z.ai 官方模型卡数据:GLM-5.3-Flash 对比 GLM-5.2、DeepSeek-V4-Vision-Exp、Opus 4.8、GPT-5.6 Terra 和 Gemini 3.7 Flash,数据截至 2026 年 8 月。数值越高越好——加粗标出每行最佳成绩。
基准测试
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
编程
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
智能体
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
视觉
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
来源:Z.ai 官方模型卡,2026 年 8 月。自测结果,可能因评测环境不同而有所差异。
Z.ai Code Bench(max effort):29.0 vs. Claude Opus 4.8 的 29.5 · Artificial Analysis Agentic Index:58,超过 Claude Opus 4.8
阅读 Z.ai 公告GLM-5.3-Flash 在第三方排行榜上的表现
DesignArena 上的前端设计能力,以及 Artificial Analysis Pareto 前沿上的高性价比。

DesignArena —— 前端综合(非智能体)
GLM-5.3-Flash 在 DesignArena 前端 Elo 榜上得分分别为 1348 和 1345——总排名第 5、第 6,仅次于 Kimi K3、GPT-5.6 Sol 和 Claude Opus 5,领先 GLM-5.2、Gemini 3.7 Flash 和 Claude Sonnet 5。
来源:DesignArena by Intelligence · Elo 评分 · 全部模型

Artificial Analysis —— 性价比 Pareto 前沿
Intelligence Index 得分 57,每次任务成本仅 $0.045——GLM-5.3-Flash 与 GPT-5.6 Sol(max)和 Claude Opus 5(max)同处 Pareto 前沿,成本仅为它们的一小部分。
来源:Artificial Analysis,更新于 2026 年 8 月 26 日
技术规格
在自己的工作流中使用 GLM-5.3-Flash 时,这些细节才是关键。
上下文与输出
输入 1,310,720 token(100 万+ 上下文)
最大输出 48,000 token
架构
320B 总参 / 18B 激活的混合专家模型,45 层。采用 IndexPool 与 Manifold-Constrained Hyper-Connections(mHC)的混合稀疏 + 线性注意力。
协议与权重
MIT 协议开放权重,基于 30T token 多模态语料训练。
速度
OpenRouter 各服务商首 token 时延中位数 0.55 秒,峰值吞吐约 134 token/s(2026 年 8 月实测)。
获取方式
已在 Felo AI Search 和 Felo API 上线,另支持 Z.ai 平台和 10+ 个 OpenRouter 服务商。
输入模态
原生文本、图像、视频输入,文本输出——GLM-5 系列首个原生多模态模型。
一个模型,应付所有输入
没有单独的流程,也没有拼接的模型——GLM-5.3-Flash 原生读懂文本、图像和视频。
文本与代码
一次性解析长文档、代码库和结构化数据——DeepSWE v1.1 63.4,Terminal-Bench 2.1 84.3。
图像与图表
直接丢入截图、图表和示意图,得到有依据的回答:Chartography 78.0 vs. DeepSeek-V4-Flash-Vision-Exp 的 64.3;OfficeQA-Pro 62.4% vs. Claude Opus 4.8 的 48.9%。
视频
视频与文本、图像一起分析:MVBench 77.8%,领先 DeepSeek-V4-Flash-Vision-Exp 的 69.4%。
GLM-5.3-Flash 适合谁
从独立开发者到自建推理的团队,一个开源模型就覆盖编程、研究与多模态工作。
智能体编程
DeepSWE v1.1 63.4、AutomationBench v1.0.6 48.8——编程智能体、多文件修改和长调用链都能从容胜任。
长程智能体任务
Toolathlon 78.4 加上 1.31M token 窗口,单个会话可以一路跑完多步操作而不丢上下文。
多模态研究
把文档、截图、图表和视频帧打包进一次请求,带来源地提取结构化答案。
视频与视觉分析
MVBench 77.8、Chartography 78.0,视频理解、图表阅读、文档版面分析全覆盖。
自托管部署
MIT 协议加上 18B 激活参数,对数据敏感或需要微调的场景,直接用权重自己跑。
Felo 智能体与流程
通过 Felo API 调用,构建智能体、自动化流程和机器可读的工具链。
用上 GLM-5.3-Flash 的两种方式
调用 Felo API
获取 Felo API 密钥,设置 base URL,即可从 Claude Code、Codex、Hermes Agent 或你自己的 OpenAI 兼容智能体中直接调用。
查看 Felo API常见问题
GLM-5.3-Flash 是 Z.ai 于 2026 年 8 月 26 日发布的开放权重前沿模型。它由 320B 参数混合专家模型构成(激活参数 18B),拥有 1,310,720 token 的上下文窗口,原生支持文本、图像和视频输入,并采用混合稀疏 + 线性注意力。模型以 MIT 协议发布。
从 Felo 开始用 GLM-5.3-Flash
来自 Z.ai 的开放前沿模型——1.31M token 上下文、原生多模态输入、智能体级编程,一个地方全都有。
在 Felo AI Search 打开 GLM-5.3-Flash也可通过 Z.ai 平台和 Felo API 获取