MIT 授權 · 開放權重 · 2026 年 8 月 26 日發布

GLM-5.3-Flash前沿智能,開放權重

GLM-5.3-Flash 是 Z.ai 於 2026 年 8 月 26 日以 MIT 授權發布的開放權重前沿模型。它具備 1,310,720 token 的上下文視窗、原生文字/圖片/影片輸入,以及 320B 參數的混合專家模型(僅啟用 18B),在 Artificial Analysis 的 Intelligence Index 上追平 Claude Opus 4.8。你可以在 Felo AI Search 上試用,也能透過 Felo API 呼叫。

可在 Felo AI Search 與 Felo API 上使用。

模型卡

GLM-5.3-Flash 一覽

授權
MIT · 開放權重
參數
總計 320B · 啟用 18B
上下文視窗
1.31M token
最大輸出
48K token
輸入
文字 · 圖片 · 影片
混合稀疏 + 線性注意力:相較 GLM-5.3,注意力運算量約為 1/3,KV 快取約為 1/4.4。

57

Intelligence Index

Artificial Analysis · 與 Claude Opus 4.8 持平

1M

上下文視窗

輸入 1,310,720 token

48K

最大輸出

每次回應最多 48,000 token

MIT

授權

MIT · 開放權重

架構的與眾不同

Z.ai 圍繞混合注意力設計重塑 GLM-5 系列,讓頂尖水準的智能真正落地、能被實際服務。

混合稀疏 + 線性注意力

首款結合稀疏與線性注意力的開放前沿模型。輕量的 IndexPool 將索引快取壓縮到四分之一大小,Manifold-Constrained Hyper-Connections(mHC)則強化擴展性——相較 GLM-5.3,注意力運算量約為 1/3,KV 快取約為 1/4.4,同時在長上下文上維持精準。

開放權重,MIT 授權

完整權重已按 MIT 授權發布。可自行架設、微調,或透過 Z.ai 或 OpenRouter 上代管該模型的 10+ 家服務商部署。

GLM-5 系列首款原生多模態模型

以 30T token 的多模態語料訓練,可直接閱讀文字、圖片與影片——不需額外的視覺流程,也無須拼接多款模型。

前沿任務,閃速效能

320B 參數的混合專家模型,每個 token 僅啟用 18B——前沿級的工作,以代理等級的速度完成。

與 Claude Opus 4.8 持平

Artificial Analysis Intelligence Index:GLM-5.3-Flash 57,Claude Opus 4.8 也為 57。Agentic Index:58,高於 Claude Opus 4.8、Claude Fable 5 與 GPT-5.6 Sol。

為程式開發與代理而生

Z.ai Code Bench(max effort):29.0,Claude Opus 4.8 為 29.5。DeepSWE v1.1:63.4——比 GLM-5.2 高出 17.2 分。

一套請求,文字、圖片、影片全搞定

1,310,720 token 的上下文視窗,原生多模態輸入。Chartography:78.0(DeepSeek-V4-Flash-Vision-Exp 為 64.3);MVBench:77.8(69.4)。

次秒級回應

OpenRouter 服務商實測首次 token 回應時間中位數 0.55 秒,峰值吞吐量約 134 token/s,共 10+ 家服務商可選。

官方模型卡基準測試

GLM-5.3-Flash 對比頂尖前沿模型

Z.ai 官方模型卡資料:GLM-5.3-Flash 對比 GLM-5.2、DeepSeek-V4-Vision-Exp、Opus 4.8、GPT-5.6 Terra 與 Gemini 3.7 Flash,資料截至 2026 年 8 月。數值愈高愈好——粗體標示每行最佳成績。

基準測試

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

程式開發

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

代理

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

視覺

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

來源:Z.ai 官方模型卡,2026 年 8 月。自評結果,可能因評測環境而有所差異。

Z.ai Code Bench(max effort):29.0 vs. Claude Opus 4.8 的 29.5 · Artificial Analysis Agentic Index:58,高於 Claude Opus 4.8

閱讀 Z.ai 公告
獨立排行榜

GLM-5.3-Flash 在第三方排行榜的表現

DesignArena 上的前端設計能力,以及 Artificial Analysis Pareto 前沿上的高性價比。

DesignArena —— 前端綜合(非代理)

DesignArena —— 前端綜合(非代理)

GLM-5.3-Flash 在 DesignArena 前端 Elo 得分為 1348 與 1345——總排名第 5、第 6,僅次於 Kimi K3、GPT-5.6 Sol 與 Claude Opus 5,領先 GLM-5.2、Gemini 3.7 Flash 與 Claude Sonnet 5。

來源:DesignArena by Intelligence · Elo 評分 · 所有模型

Artificial Analysis —— 性價比 Pareto 前沿

Artificial Analysis —— 性價比 Pareto 前沿

Intelligence Index 得分 57,每次任務成本僅 $0.045——GLM-5.3-Flash 與 GPT-5.6 Sol(max)、Claude Opus 5(max)同處 Pareto 前沿,成本僅為其一小部分。

來源:Artificial Analysis,更新於 2026 年 8 月 26 日

技術規格

把 GLM-5.3-Flash 用在自己的工作流程中,這些細節最關鍵。

上下文與輸出

輸入 1,310,720 token(100 萬+ 上下文)

最大輸出 48,000 token

架構

總計 320B / 啟用 18B 的混合專家模型,45 層。採用 IndexPool 與 Manifold-Constrained Hyper-Connections(mHC)的混合稀疏 + 線性注意力。

授權與權重

MIT 授權的開放權重,以 30T token 多模態語料訓練。

速度

OpenRouter 各服務商的首次 token 延遲中位數為 0.55 秒,峰值吞吐量約 134 token/s(2026 年 8 月實測)。

取得管道

已於 Felo AI Search 與 Felo API 上線,另支援 Z.ai 平台與 10+ 家 OpenRouter 服務商。

輸入模式

原生文字、圖片、影片輸入加上文字輸出——GLM-5 系列首款原生多模態模型。

一個模型,應付所有輸入

不需要額外流程,也無須拼接多款模型——GLM-5.3-Flash 原生讀懂文字、圖片與影片。

文字與程式碼

單次處理長文件、程式碼庫與結構化資料——DeepSWE v1.1 63.4,Terminal-Bench 2.1 84.3。

圖片與圖表

丟入螢幕截圖、圖表與示意圖,就能得到有依據的回答:Chartography 78.0 vs. DeepSeek-V4-Flash-Vision-Exp 的 64.3;OfficeQA-Pro 62.4% vs. Claude Opus 4.8 的 48.9%。

影片

影片與文字、圖片一起分析:MVBench 77.8%,領先 DeepSeek-V4-Flash-Vision-Exp 的 69.4%。

誰在使用 GLM-5.3-Flash

從獨立開發者到自行營運推論的團隊,一款開放模型就能涵蓋程式開發、研究與多模態工作。

代理式程式開發

DeepSWE v1.1 63.4、AutomationBench v1.0.6 48.8——程式開發代理、跨檔案修改與長呼叫鏈都是強項。

長時程代理工作

Toolathlon 78.4 加上 1.31M token 視窗,單一工作階段就能連續完成多個步驟而不掉上下文。

多模態研究

把文件、截圖、圖表與影片影格放入同一請求,取得帶來源的結構化答案。

影片與視覺分析

MVBench 77.8 與 Chartography 78.0——影片理解、圖表判讀、文件版面分析一次到位。

自行架設部署

MIT 授權加上 18B 啟用參數,資料敏感或需微調的工作流程,可以直接用自己的權重來跑。

Felo 代理與自動化流程

透過 Felo API 呼叫,建構代理、自動化,以及機器可讀的工具管線。

使用 GLM-5.3-Flash 的兩種方式

在 Felo AI Search 上使用

開啟 Felo AI Search,就能提問、用 AI 搜尋網路,並從 GLM-5.3-Flash 取得帶引用的答案。

開啟 Felo AI Search

呼叫 Felo API

取得 Felo API 金鑰、設定 base URL,就能從 Claude Code、Codex、Hermes Agent 或自行打造的 OpenAI 相容代理直接呼叫。

查看 Felo API

常見問題

GLM-5.3-Flash 是 Z.ai 於 2026 年 8 月 26 日發布的開放權重前沿模型。它由 320B 參數的混合專家模型組成(啟用參數 18B),擁有 1,310,720 token 的上下文視窗,原生支援文字、圖片與影片輸入,並採用混合稀疏 + 線性注意力架構。模型以 MIT 授權釋出。

從 Felo 開始體驗 GLM-5.3-Flash

來自 Z.ai 的開放前沿模型——1.31M token 上下文、原生多模態輸入、代理級程式開發,全都集中在一處。

在 Felo AI Search 開啟 GLM-5.3-Flash

也可透過 Z.ai 平台與 Felo API 取得