Giấy phép MIT · Trọng số mở · Ra mắt 26 tháng 8, 2026

GLM-5.3-FlashTrí tuệ tiên phong, trọng số mở

GLM-5.3-Flash là mô hình tiên phong trọng số mở của Z.ai, ra mắt ngày 26 tháng 8 năm 2026 theo giấy phép MIT. Mô hình ngang tầm Claude Opus 4.8 trên chỉ số Intelligence Index của Artificial Analysis với ngữ cảnh 1.310.720 token, đầu vào gốc cho văn bản, hình ảnh và video, cùng MoE 320B tham số chỉ kích hoạt 18B. Hãy dùng thử trên Felo AI Search, hoặc gọi mô hình qua Felo API.

Có sẵn trên Felo AI Search và Felo API

Thẻ mô hình

GLM-5.3-Flash sơ lược

Giấy phép
MIT · Trọng số mở
Tham số
320B tổng · 18B hoạt động
Cửa sổ ngữ cảnh
1,31 triệu token
Đầu ra tối đa
48.000 token
Đầu vào
Văn bản · Hình ảnh · Video
Attention lai sparse + tuyến tính: ít hơn khoảng 3× phép tính cho attention và KV cache nhỏ hơn 4,4× so với GLM-5.3.

57

Intelligence Index

Artificial Analysis · ngang tầm Claude Opus 4.8

1M

Cửa sổ ngữ cảnh

1.310.720 token đầu vào

48K

Đầu ra tối đa

48.000 token mỗi lượt trả lời

MIT

Giấy phép

MIT · trọng số mở

Điều gì khiến kiến trúc này khác biệt

Z.ai xây dựng lại dòng GLM-5 quanh thiết kế attention lai, đưa trí thông minh hạng tiên phong vào khả năng vận hành thực tế.

Attention lai sparse + tuyến tính

Mô hình mở tiên phong đầu tiên kết hợp attention sparse và tuyến tính. IndexPool nhẹ kéo cache chỉ mục xuống còn một phần tư kích thước, và Manifold-Constrained Hyper-Connections (mHC) giúp mở rộng tốt hơn — ít hơn khoảng 3× phép tính cho attention và KV cache nhỏ hơn 4,4× so với GLM-5.3, trong khi vẫn chính xác trên ngữ cảnh dài.

Trọng số mở, giấy phép MIT

Toàn bộ trọng số được công bố theo giấy phép MIT. Tự lưu trữ, tinh chỉnh hoặc triển khai qua Z.ai hoặc một trong 10+ nhà cung cấp đang lưu trữ mô hình trên OpenRouter.

GLM-5 đầu tiên đa phương thức native

Được huấn luyện trên kho dữ liệu đa phương thức 30T token, mô hình đọc trực tiếp văn bản, hình ảnh và video — không cần pipeline thị giác riêng, không phải ghép nhiều mô hình lại.

Trí tuệ tiên phong, hiệu năng tức thì

MoE 320B tham số chỉ kích hoạt 18B cho mỗi token giúp hoàn thành công việc hạng tiên phong với tốc độ của một agent.

Ngang tầm Claude Opus 4.8

Intelligence Index của Artificial Analysis: 57 điểm cho GLM-5.3-Flash, 57 điểm cho Claude Opus 4.8. Agentic Index: 58, vượt Claude Opus 4.8, Claude Fable 5 và GPT-5.6 Sol.

Được xây cho lập trình và agent

Z.ai Code Bench (max effort): 29,0, so với 29,5 của Claude Opus 4.8. DeepSWE v1.1: 63,4 — cao hơn GLM-5.2 tới 17,2 điểm.

Một yêu cầu cho văn bản, hình ảnh, video

Cửa sổ ngữ cảnh 1.310.720 token với đầu vào đa phương thức native. Chartography: 78,0 so với 64,3 của DeepSeek-V4-Flash-Vision-Exp; MVBench: 77,8 so với 69,4.

Phản hồi dưới một giây

Các nhà cung cấp trên OpenRouter đo được thời gian xuất token đầu tiên trung bình 0,55 giây và thông lượng đỉnh khoảng 134 token/giây, với 10+ nhà cung cấp để lựa chọn.

Benchmark chính thức từ thẻ mô hình

GLM-5.3-Flash so với các mô hình tiên phong hàng đầu

Kết quả chính thức từ thẻ mô hình của Z.ai: GLM-5.3-Flash so với GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra và Gemini 3.7 Flash, tháng 8 năm 2026. Điểm càng cao càng tốt — phần in đậm là điểm tốt nhất trong mỗi hàng.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Lập trình

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agentic

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Thị giác

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Nguồn: thẻ mô hình chính thức của Z.ai, tháng 8 năm 2026. Tự công bố; kết quả có thể thay đổi theo cách thiết lập đánh giá.

Z.ai Code Bench (max effort): 29,0 so với 29,5 của Claude Opus 4.8 · Agentic Index của Artificial Analysis: 58, vượt Claude Opus 4.8

Đọc thông báo của Z.ai
Bảng xếp hạng độc lập

GLM-5.3-Flash trong các xếp hạng bên thứ ba

Kỹ năng thiết kế frontend trên DesignArena và giá trị trên biên Pareto của Artificial Analysis.

DesignArena — Frontend Tổng thể (Non-Agentic)

DesignArena — Frontend Tổng thể (Non-Agentic)

GLM-5.3-Flash đạt 1348 và 1345 trên Elo frontend của DesignArena — xếp hạng 5 và 6 tổng thể, sau Kimi K3, GPT-5.6 Sol và Claude Opus 5, và trước GLM-5.2, Gemini 3.7 Flash và Claude Sonnet 5.

Nguồn: DesignArena by Intelligence · Elo Rating · All Models

Artificial Analysis — Biên Pareto Giá–Hiệu năng

Artificial Analysis — Biên Pareto Giá–Hiệu năng

57 điểm trên chỉ số Intelligence Index với giá $0,045 mỗi tác vụ — GLM-5.3-Flash nằm trên biên Pareto cùng GPT-5.6 Sol (max) và Claude Opus 5 (max), với chi phí chỉ bằng một phần nhỏ của họ.

Nguồn: Artificial Analysis, cập nhật ngày 26 tháng 8 năm 2026

Thông số kỹ thuật

Các chi tiết quan trọng khi bạn dùng GLM-5.3-Flash trong công việc của riêng mình.

Ngữ cảnh & đầu ra

1.310.720 token đầu vào (ngữ cảnh 1M+)

Tối đa 48.000 token đầu ra

Kiến trúc

Mixture-of-Experts 320B tổng / 18B hoạt động, 45 lớp. Attention lai sparse + tuyến tính với IndexPool và Manifold-Constrained Hyper-Connections (mHC).

Giấy phép & trọng số

Trọng số mở theo giấy phép MIT, được huấn luyện trên kho dữ liệu đa phương thức 30T token.

Tốc độ

Độ trễ token đầu tiên trung bình 0,55 giây và thông lượng đỉnh khoảng 134 token/giây trên các nhà cung cấp OpenRouter (đo tháng 8 năm 2026).

Khả dụng

Đang hoạt động trên Felo AI Search và Felo API, cùng nền tảng Z.ai và 10+ nhà cung cấp OpenRouter.

Đa phương thức

Đầu vào native cho văn bản, hình ảnh và video với đầu ra văn bản — mô hình đa phương thức native đầu tiên trong dòng GLM-5.

Một mô hình, mọi loại đầu vào

Không pipeline riêng, không ghép mô hình — GLM-5.3-Flash đọc văn bản, hình ảnh và video một cách native.

Văn bản & mã nguồn

Phân tích tài liệu dài, codebase và dữ liệu có cấu trúc trong một lần xử lý — 63,4 trên DeepSWE v1.1, 84,3 trên Terminal-Bench 2.1.

Hình ảnh & biểu đồ

Đưa ảnh chụp màn hình, biểu đồ và sơ đồ vào để nhận câu trả lời có căn cứ: Chartography 78,0 so với 64,3 của DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62,4% so với 48,9% của Claude Opus 4.8.

Video

Phân tích video cùng với văn bản và hình ảnh: MVBench 77,8%, vượt 69,4% của DeepSeek-V4-Flash-Vision-Exp.

Ai đang sử dụng GLM-5.3-Flash

Từ lập trình viên cá nhân đến các đội tự chạy inference, GLM-5.3-Flash đáp ứng lập trình, nghiên cứu và công việc đa phương thức trên một mô hình mở duy nhất.

Lập trình agentic

63,4 trên DeepSWE v1.1 và 48,8 trên AutomationBench v1.0.6 khiến đây là lựa chọn mạnh mẽ cho agent lập trình, chỉnh sửa nhiều tệp và các chuỗi lệnh dài.

Công việc agent dài hơi

Toolathlon 78,4 cùng cửa sổ ngữ cảnh 1,31 triệu token giúp một phiên làm việc duy nhất chạy qua nhiều bước mà không mất ngữ cảnh.

Nghiên cứu đa phương thức

Kết hợp tài liệu, ảnh chụp màn hình, biểu đồ và khung video trong một yêu cầu để trích xuất câu trả lời có cấu trúc kèm nguồn.

Phân tích video & hình ảnh

MVBench 77,8 và Chartography 78,0 bao phủ hiểu video, đọc biểu đồ và phân tích bố cục tài liệu.

Triển khai tự lưu trữ

Giấy phép MIT và 18B tham số hoạt động nghĩa là bạn có thể tự chạy trọng số cho các công việc nhạy cảm dữ liệu hoặc cần tinh chỉnh.

Agent & pipeline Felo

Gọi mô hình qua Felo API để xây dựng agent, quy trình tự động hóa và pipeline công cụ dễ đọc cho máy.

Hai cách dùng GLM-5.3-Flash

Dùng ngay trên Felo AI Search

Mở Felo AI Search để đặt câu hỏi, tìm kiếm web bằng AI và nhận câu trả lời kèm nguồn từ GLM-5.3-Flash.

Mở Felo AI Search

Gọi Felo API

Lấy khóa Felo API, cấu hình base URL rồi gọi mô hình từ Claude Code, Codex, Hermes Agent hoặc agent tương thích OpenAI của bạn.

Xem Felo API

Các câu hỏi thường gặp

GLM-5.3-Flash là mô hình tiên phong trọng số mở của Z.ai, ra mắt ngày 26 tháng 8 năm 2026. Đây là mô hình Mixture-of-Experts 320B tham số với 18B tham số hoạt động, cửa sổ ngữ cảnh 1.310.720 token, đầu vào native cho văn bản, hình ảnh và video, cùng attention lai sparse + tuyến tính. Mô hình được cấp phép MIT.

Bắt đầu với GLM-5.3-Flash trên Felo

Mô hình tiên phong mở từ Z.ai — ngữ cảnh 1,31 triệu token, đầu vào đa phương thức native và khả năng lập trình cấp agent trong một nơi duy nhất.

Mở GLM-5.3-Flash trên Felo AI Search

Cũng có trên nền tảng Z.ai và Felo API