GLM-5.3-Flash前沿智能,開放權重
GLM-5.3-Flash 是 Z.ai 於 2026 年 8 月 26 日以 MIT 授權發布的開放權重前沿模型。它具備 1,310,720 token 的上下文視窗、原生文字/圖片/影片輸入,以及 320B 參數的混合專家模型(僅啟用 18B),在 Artificial Analysis 的 Intelligence Index 上追平 Claude Opus 4.8。你可以在 Felo AI Search 上試用,也能透過 Felo API 呼叫。
可在 Felo AI Search 與 Felo API 上使用。
模型卡
GLM-5.3-Flash 一覽
- 授權
- MIT · 開放權重
- 參數
- 總計 320B · 啟用 18B
- 上下文視窗
- 1.31M token
- 最大輸出
- 48K token
- 輸入
- 文字 · 圖片 · 影片
57
Intelligence Index
Artificial Analysis · 與 Claude Opus 4.8 持平
1M
上下文視窗
輸入 1,310,720 token
48K
最大輸出
每次回應最多 48,000 token
MIT
授權
MIT · 開放權重
架構的與眾不同
Z.ai 圍繞混合注意力設計重塑 GLM-5 系列,讓頂尖水準的智能真正落地、能被實際服務。
混合稀疏 + 線性注意力
首款結合稀疏與線性注意力的開放前沿模型。輕量的 IndexPool 將索引快取壓縮到四分之一大小,Manifold-Constrained Hyper-Connections(mHC)則強化擴展性——相較 GLM-5.3,注意力運算量約為 1/3,KV 快取約為 1/4.4,同時在長上下文上維持精準。
開放權重,MIT 授權
完整權重已按 MIT 授權發布。可自行架設、微調,或透過 Z.ai 或 OpenRouter 上代管該模型的 10+ 家服務商部署。
GLM-5 系列首款原生多模態模型
以 30T token 的多模態語料訓練,可直接閱讀文字、圖片與影片——不需額外的視覺流程,也無須拼接多款模型。
前沿任務,閃速效能
320B 參數的混合專家模型,每個 token 僅啟用 18B——前沿級的工作,以代理等級的速度完成。
與 Claude Opus 4.8 持平
Artificial Analysis Intelligence Index:GLM-5.3-Flash 57,Claude Opus 4.8 也為 57。Agentic Index:58,高於 Claude Opus 4.8、Claude Fable 5 與 GPT-5.6 Sol。
為程式開發與代理而生
Z.ai Code Bench(max effort):29.0,Claude Opus 4.8 為 29.5。DeepSWE v1.1:63.4——比 GLM-5.2 高出 17.2 分。
一套請求,文字、圖片、影片全搞定
1,310,720 token 的上下文視窗,原生多模態輸入。Chartography:78.0(DeepSeek-V4-Flash-Vision-Exp 為 64.3);MVBench:77.8(69.4)。
次秒級回應
OpenRouter 服務商實測首次 token 回應時間中位數 0.55 秒,峰值吞吐量約 134 token/s,共 10+ 家服務商可選。
GLM-5.3-Flash 對比頂尖前沿模型
Z.ai 官方模型卡資料:GLM-5.3-Flash 對比 GLM-5.2、DeepSeek-V4-Vision-Exp、Opus 4.8、GPT-5.6 Terra 與 Gemini 3.7 Flash,資料截至 2026 年 8 月。數值愈高愈好——粗體標示每行最佳成績。
基準測試
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
程式開發
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
代理
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
視覺
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
來源:Z.ai 官方模型卡,2026 年 8 月。自評結果,可能因評測環境而有所差異。
Z.ai Code Bench(max effort):29.0 vs. Claude Opus 4.8 的 29.5 · Artificial Analysis Agentic Index:58,高於 Claude Opus 4.8
閱讀 Z.ai 公告GLM-5.3-Flash 在第三方排行榜的表現
DesignArena 上的前端設計能力,以及 Artificial Analysis Pareto 前沿上的高性價比。

DesignArena —— 前端綜合(非代理)
GLM-5.3-Flash 在 DesignArena 前端 Elo 得分為 1348 與 1345——總排名第 5、第 6,僅次於 Kimi K3、GPT-5.6 Sol 與 Claude Opus 5,領先 GLM-5.2、Gemini 3.7 Flash 與 Claude Sonnet 5。
來源:DesignArena by Intelligence · Elo 評分 · 所有模型

Artificial Analysis —— 性價比 Pareto 前沿
Intelligence Index 得分 57,每次任務成本僅 $0.045——GLM-5.3-Flash 與 GPT-5.6 Sol(max)、Claude Opus 5(max)同處 Pareto 前沿,成本僅為其一小部分。
來源:Artificial Analysis,更新於 2026 年 8 月 26 日
技術規格
把 GLM-5.3-Flash 用在自己的工作流程中,這些細節最關鍵。
上下文與輸出
輸入 1,310,720 token(100 萬+ 上下文)
最大輸出 48,000 token
架構
總計 320B / 啟用 18B 的混合專家模型,45 層。採用 IndexPool 與 Manifold-Constrained Hyper-Connections(mHC)的混合稀疏 + 線性注意力。
授權與權重
MIT 授權的開放權重,以 30T token 多模態語料訓練。
速度
OpenRouter 各服務商的首次 token 延遲中位數為 0.55 秒,峰值吞吐量約 134 token/s(2026 年 8 月實測)。
取得管道
已於 Felo AI Search 與 Felo API 上線,另支援 Z.ai 平台與 10+ 家 OpenRouter 服務商。
輸入模式
原生文字、圖片、影片輸入加上文字輸出——GLM-5 系列首款原生多模態模型。
一個模型,應付所有輸入
不需要額外流程,也無須拼接多款模型——GLM-5.3-Flash 原生讀懂文字、圖片與影片。
文字與程式碼
單次處理長文件、程式碼庫與結構化資料——DeepSWE v1.1 63.4,Terminal-Bench 2.1 84.3。
圖片與圖表
丟入螢幕截圖、圖表與示意圖,就能得到有依據的回答:Chartography 78.0 vs. DeepSeek-V4-Flash-Vision-Exp 的 64.3;OfficeQA-Pro 62.4% vs. Claude Opus 4.8 的 48.9%。
影片
影片與文字、圖片一起分析:MVBench 77.8%,領先 DeepSeek-V4-Flash-Vision-Exp 的 69.4%。
誰在使用 GLM-5.3-Flash
從獨立開發者到自行營運推論的團隊,一款開放模型就能涵蓋程式開發、研究與多模態工作。
代理式程式開發
DeepSWE v1.1 63.4、AutomationBench v1.0.6 48.8——程式開發代理、跨檔案修改與長呼叫鏈都是強項。
長時程代理工作
Toolathlon 78.4 加上 1.31M token 視窗,單一工作階段就能連續完成多個步驟而不掉上下文。
多模態研究
把文件、截圖、圖表與影片影格放入同一請求,取得帶來源的結構化答案。
影片與視覺分析
MVBench 77.8 與 Chartography 78.0——影片理解、圖表判讀、文件版面分析一次到位。
自行架設部署
MIT 授權加上 18B 啟用參數,資料敏感或需微調的工作流程,可以直接用自己的權重來跑。
Felo 代理與自動化流程
透過 Felo API 呼叫,建構代理、自動化,以及機器可讀的工具管線。
使用 GLM-5.3-Flash 的兩種方式
呼叫 Felo API
取得 Felo API 金鑰、設定 base URL,就能從 Claude Code、Codex、Hermes Agent 或自行打造的 OpenAI 相容代理直接呼叫。
查看 Felo API常見問題
GLM-5.3-Flash 是 Z.ai 於 2026 年 8 月 26 日發布的開放權重前沿模型。它由 320B 參數的混合專家模型組成(啟用參數 18B),擁有 1,310,720 token 的上下文視窗,原生支援文字、圖片與影片輸入,並採用混合稀疏 + 線性注意力架構。模型以 MIT 授權釋出。
從 Felo 開始體驗 GLM-5.3-Flash
來自 Z.ai 的開放前沿模型——1.31M token 上下文、原生多模態輸入、代理級程式開發,全都集中在一處。
在 Felo AI Search 開啟 GLM-5.3-Flash也可透過 Z.ai 平台與 Felo API 取得