GLM-5.3-FlashTrí tuệ tiên phong, trọng số mở
GLM-5.3-Flash là mô hình tiên phong trọng số mở của Z.ai, ra mắt ngày 26 tháng 8 năm 2026 theo giấy phép MIT. Mô hình ngang tầm Claude Opus 4.8 trên chỉ số Intelligence Index của Artificial Analysis với ngữ cảnh 1.310.720 token, đầu vào gốc cho văn bản, hình ảnh và video, cùng MoE 320B tham số chỉ kích hoạt 18B. Hãy dùng thử trên Felo AI Search, hoặc gọi mô hình qua Felo API.
Có sẵn trên Felo AI Search và Felo API
Thẻ mô hình
GLM-5.3-Flash sơ lược
- Giấy phép
- MIT · Trọng số mở
- Tham số
- 320B tổng · 18B hoạt động
- Cửa sổ ngữ cảnh
- 1,31 triệu token
- Đầu ra tối đa
- 48.000 token
- Đầu vào
- Văn bản · Hình ảnh · Video
57
Intelligence Index
Artificial Analysis · ngang tầm Claude Opus 4.8
1M
Cửa sổ ngữ cảnh
1.310.720 token đầu vào
48K
Đầu ra tối đa
48.000 token mỗi lượt trả lời
MIT
Giấy phép
MIT · trọng số mở
Điều gì khiến kiến trúc này khác biệt
Z.ai xây dựng lại dòng GLM-5 quanh thiết kế attention lai, đưa trí thông minh hạng tiên phong vào khả năng vận hành thực tế.
Attention lai sparse + tuyến tính
Mô hình mở tiên phong đầu tiên kết hợp attention sparse và tuyến tính. IndexPool nhẹ kéo cache chỉ mục xuống còn một phần tư kích thước, và Manifold-Constrained Hyper-Connections (mHC) giúp mở rộng tốt hơn — ít hơn khoảng 3× phép tính cho attention và KV cache nhỏ hơn 4,4× so với GLM-5.3, trong khi vẫn chính xác trên ngữ cảnh dài.
Trọng số mở, giấy phép MIT
Toàn bộ trọng số được công bố theo giấy phép MIT. Tự lưu trữ, tinh chỉnh hoặc triển khai qua Z.ai hoặc một trong 10+ nhà cung cấp đang lưu trữ mô hình trên OpenRouter.
GLM-5 đầu tiên đa phương thức native
Được huấn luyện trên kho dữ liệu đa phương thức 30T token, mô hình đọc trực tiếp văn bản, hình ảnh và video — không cần pipeline thị giác riêng, không phải ghép nhiều mô hình lại.
Trí tuệ tiên phong, hiệu năng tức thì
MoE 320B tham số chỉ kích hoạt 18B cho mỗi token giúp hoàn thành công việc hạng tiên phong với tốc độ của một agent.
Ngang tầm Claude Opus 4.8
Intelligence Index của Artificial Analysis: 57 điểm cho GLM-5.3-Flash, 57 điểm cho Claude Opus 4.8. Agentic Index: 58, vượt Claude Opus 4.8, Claude Fable 5 và GPT-5.6 Sol.
Được xây cho lập trình và agent
Z.ai Code Bench (max effort): 29,0, so với 29,5 của Claude Opus 4.8. DeepSWE v1.1: 63,4 — cao hơn GLM-5.2 tới 17,2 điểm.
Một yêu cầu cho văn bản, hình ảnh, video
Cửa sổ ngữ cảnh 1.310.720 token với đầu vào đa phương thức native. Chartography: 78,0 so với 64,3 của DeepSeek-V4-Flash-Vision-Exp; MVBench: 77,8 so với 69,4.
Phản hồi dưới một giây
Các nhà cung cấp trên OpenRouter đo được thời gian xuất token đầu tiên trung bình 0,55 giây và thông lượng đỉnh khoảng 134 token/giây, với 10+ nhà cung cấp để lựa chọn.
GLM-5.3-Flash so với các mô hình tiên phong hàng đầu
Kết quả chính thức từ thẻ mô hình của Z.ai: GLM-5.3-Flash so với GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra và Gemini 3.7 Flash, tháng 8 năm 2026. Điểm càng cao càng tốt — phần in đậm là điểm tốt nhất trong mỗi hàng.
Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Lập trình
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Agentic
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Thị giác
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Nguồn: thẻ mô hình chính thức của Z.ai, tháng 8 năm 2026. Tự công bố; kết quả có thể thay đổi theo cách thiết lập đánh giá.
Z.ai Code Bench (max effort): 29,0 so với 29,5 của Claude Opus 4.8 · Agentic Index của Artificial Analysis: 58, vượt Claude Opus 4.8
Đọc thông báo của Z.aiGLM-5.3-Flash trong các xếp hạng bên thứ ba
Kỹ năng thiết kế frontend trên DesignArena và giá trị trên biên Pareto của Artificial Analysis.

DesignArena — Frontend Tổng thể (Non-Agentic)
GLM-5.3-Flash đạt 1348 và 1345 trên Elo frontend của DesignArena — xếp hạng 5 và 6 tổng thể, sau Kimi K3, GPT-5.6 Sol và Claude Opus 5, và trước GLM-5.2, Gemini 3.7 Flash và Claude Sonnet 5.
Nguồn: DesignArena by Intelligence · Elo Rating · All Models

Artificial Analysis — Biên Pareto Giá–Hiệu năng
57 điểm trên chỉ số Intelligence Index với giá $0,045 mỗi tác vụ — GLM-5.3-Flash nằm trên biên Pareto cùng GPT-5.6 Sol (max) và Claude Opus 5 (max), với chi phí chỉ bằng một phần nhỏ của họ.
Nguồn: Artificial Analysis, cập nhật ngày 26 tháng 8 năm 2026
Thông số kỹ thuật
Các chi tiết quan trọng khi bạn dùng GLM-5.3-Flash trong công việc của riêng mình.
Ngữ cảnh & đầu ra
1.310.720 token đầu vào (ngữ cảnh 1M+)
Tối đa 48.000 token đầu ra
Kiến trúc
Mixture-of-Experts 320B tổng / 18B hoạt động, 45 lớp. Attention lai sparse + tuyến tính với IndexPool và Manifold-Constrained Hyper-Connections (mHC).
Giấy phép & trọng số
Trọng số mở theo giấy phép MIT, được huấn luyện trên kho dữ liệu đa phương thức 30T token.
Tốc độ
Độ trễ token đầu tiên trung bình 0,55 giây và thông lượng đỉnh khoảng 134 token/giây trên các nhà cung cấp OpenRouter (đo tháng 8 năm 2026).
Khả dụng
Đang hoạt động trên Felo AI Search và Felo API, cùng nền tảng Z.ai và 10+ nhà cung cấp OpenRouter.
Đa phương thức
Đầu vào native cho văn bản, hình ảnh và video với đầu ra văn bản — mô hình đa phương thức native đầu tiên trong dòng GLM-5.
Một mô hình, mọi loại đầu vào
Không pipeline riêng, không ghép mô hình — GLM-5.3-Flash đọc văn bản, hình ảnh và video một cách native.
Văn bản & mã nguồn
Phân tích tài liệu dài, codebase và dữ liệu có cấu trúc trong một lần xử lý — 63,4 trên DeepSWE v1.1, 84,3 trên Terminal-Bench 2.1.
Hình ảnh & biểu đồ
Đưa ảnh chụp màn hình, biểu đồ và sơ đồ vào để nhận câu trả lời có căn cứ: Chartography 78,0 so với 64,3 của DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62,4% so với 48,9% của Claude Opus 4.8.
Video
Phân tích video cùng với văn bản và hình ảnh: MVBench 77,8%, vượt 69,4% của DeepSeek-V4-Flash-Vision-Exp.
Ai đang sử dụng GLM-5.3-Flash
Từ lập trình viên cá nhân đến các đội tự chạy inference, GLM-5.3-Flash đáp ứng lập trình, nghiên cứu và công việc đa phương thức trên một mô hình mở duy nhất.
Lập trình agentic
63,4 trên DeepSWE v1.1 và 48,8 trên AutomationBench v1.0.6 khiến đây là lựa chọn mạnh mẽ cho agent lập trình, chỉnh sửa nhiều tệp và các chuỗi lệnh dài.
Công việc agent dài hơi
Toolathlon 78,4 cùng cửa sổ ngữ cảnh 1,31 triệu token giúp một phiên làm việc duy nhất chạy qua nhiều bước mà không mất ngữ cảnh.
Nghiên cứu đa phương thức
Kết hợp tài liệu, ảnh chụp màn hình, biểu đồ và khung video trong một yêu cầu để trích xuất câu trả lời có cấu trúc kèm nguồn.
Phân tích video & hình ảnh
MVBench 77,8 và Chartography 78,0 bao phủ hiểu video, đọc biểu đồ và phân tích bố cục tài liệu.
Triển khai tự lưu trữ
Giấy phép MIT và 18B tham số hoạt động nghĩa là bạn có thể tự chạy trọng số cho các công việc nhạy cảm dữ liệu hoặc cần tinh chỉnh.
Agent & pipeline Felo
Gọi mô hình qua Felo API để xây dựng agent, quy trình tự động hóa và pipeline công cụ dễ đọc cho máy.
Hai cách dùng GLM-5.3-Flash
Dùng ngay trên Felo AI Search
Mở Felo AI Search để đặt câu hỏi, tìm kiếm web bằng AI và nhận câu trả lời kèm nguồn từ GLM-5.3-Flash.
Mở Felo AI SearchGọi Felo API
Lấy khóa Felo API, cấu hình base URL rồi gọi mô hình từ Claude Code, Codex, Hermes Agent hoặc agent tương thích OpenAI của bạn.
Xem Felo APICác câu hỏi thường gặp
GLM-5.3-Flash là mô hình tiên phong trọng số mở của Z.ai, ra mắt ngày 26 tháng 8 năm 2026. Đây là mô hình Mixture-of-Experts 320B tham số với 18B tham số hoạt động, cửa sổ ngữ cảnh 1.310.720 token, đầu vào native cho văn bản, hình ảnh và video, cùng attention lai sparse + tuyến tính. Mô hình được cấp phép MIT.
Bắt đầu với GLM-5.3-Flash trên Felo
Mô hình tiên phong mở từ Z.ai — ngữ cảnh 1,31 triệu token, đầu vào đa phương thức native và khả năng lập trình cấp agent trong một nơi duy nhất.
Mở GLM-5.3-Flash trên Felo AI SearchCũng có trên nền tảng Z.ai và Felo API