Lisensi MIT · Bobot Terbuka · Dirilis 26 Agustus 2026

GLM-5.3-FlashIntelijen Frontier, Bobot Terbuka

GLM-5.3-Flash adalah model frontier open-weight dari Z.ai yang dirilis pada 26 Agustus 2026 di bawah lisensi MIT. Model ini setara dengan Claude Opus 4.8 pada Intelligence Index milik Artificial Analysis, dengan jendela konteks 1.310.720 token, input teks, gambar, dan video native, serta MoE 320B parameter yang hanya mengaktifkan 18B. Coba di Felo AI Search, atau panggil melalui Felo API.

Tersedia di Felo AI Search dan Felo API

Kartu model

GLM-5.3-Flash sekilas

Lisensi
MIT · Bobot terbuka
Parameter
320B total · 18B aktif
Jendela konteks
1,31 juta token
Output maksimum
48.000 token
Input
Teks · Gambar · Video
Atensi hybrid sparse + linear: sekitar 3× lebih hemat komputasi atensi dan 4,4× lebih kecil KV cache dibanding GLM-5.3.

57

Intelligence Index

Artificial Analysis · setara dengan Claude Opus 4.8

1M

Jendela Konteks

1.310.720 token input

48K

Output Maksimum

48.000 token per respons

MIT

Lisensi

MIT · bobot terbuka

Yang Membuat Arsitektur Ini Berbeda

Z.ai merombak seri GLM-5 dengan desain atensi hybrid, sehingga kecerdasan kelas frontier menjadi praktis untuk dioperasikan.

Atensi Hybrid Sparse + Linear

Model frontier terbuka pertama yang menggabungkan atensi sparse dan linear. IndexPool yang ringan menekan index cache hingga seperempat ukurannya, dan Manifold-Constrained Hyper-Connections (mHC) meningkatkan skala — sekitar 3× lebih hemat komputasi atensi dan 4,4× lebih kecil KV cache daripada GLM-5.3, sekaligus tetap presisi pada konteks panjang.

Bobot Terbuka, Lisensi MIT

Bobot lengkap diterbitkan di bawah lisensi MIT. Jalankan sendiri (self-host), fine-tune, atau deploy melalui Z.ai atau salah satu dari 10+ penyedia yang menghostingnya di OpenRouter.

GLM-5 Pertama yang Multimodal Secara Native

Dilatih pada korpus multimodal 30T token, model ini membaca teks, gambar, dan video secara langsung — tanpa pipeline visi terpisah, tanpa merangkai beberapa model.

Kecerdasan Frontier, Performa Kilat

MoE 320B parameter yang hanya mengaktifkan 18B per token menyelesaikan pekerjaan kelas frontier dengan kecepatan agen.

Setara Claude Opus 4.8

Intelligence Index milik Artificial Analysis: 57 untuk GLM-5.3-Flash, 57 untuk Claude Opus 4.8. Agentic Index: 58, di atas Claude Opus 4.8, Claude Fable 5, dan GPT-5.6 Sol.

Dibuat untuk Coding dan Agen

Z.ai Code Bench (max effort): 29,0, dibanding 29,5 milik Claude Opus 4.8. DeepSWE v1.1: 63,4 — 17,2 poin di atas GLM-5.2.

Satu Permintaan untuk Teks, Gambar, Video

Jendela konteks 1.310.720 token dengan input multimodal native. Chartography: 78,0 berbanding 64,3 milik DeepSeek-V4-Flash-Vision-Exp; MVBench: 77,8 berbanding 69,4.

Respons di Bawah Satu Detik

Penyedia di OpenRouter mencatat median waktu token pertama 0,55 detik dan throughput puncak sekitar 134 token/detik, dengan 10+ penyedia untuk dipilih.

Benchmark Resmi Kartu Model

GLM-5.3-Flash vs. Model Frontier Teratas

Hasil resmi dari kartu model Z.ai: GLM-5.3-Flash berbanding GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra, dan Gemini 3.7 Flash, Agustus 2026. Semakin tinggi semakin baik — teks tebal menandai skor terbaik di setiap baris.

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Coding

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agentik

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Visi

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Sumber: kartu model resmi Z.ai, Agustus 2026. Dilaporkan sendiri; hasil dapat bervariasi tergantung pengaturan evaluasi.

Z.ai Code Bench (max effort): 29,0 vs. 29,5 milik Claude Opus 4.8 · Agentic Index milik Artificial Analysis: 58, di atas Claude Opus 4.8

Baca pengumuman Z.ai
Papan Peringkat Independen

GLM-5.3-Flash dalam Peringkat Pihak Ketiga

Keterampilan desain frontend di DesignArena dan nilai pada frontier Pareto milik Artificial Analysis.

DesignArena — Frontend Keseluruhan (Non-Agentik)

DesignArena — Frontend Keseluruhan (Non-Agentik)

GLM-5.3-Flash berada di 1348 dan 1345 pada Elo frontend DesignArena — peringkat 5 dan 6 keseluruhan, di belakang Kimi K3, GPT-5.6 Sol, dan Claude Opus 5, serta di depan GLM-5.2, Gemini 3.7 Flash, dan Claude Sonnet 5.

Sumber: DesignArena by Intelligence · Elo Rating · All Models

Artificial Analysis — Frontier Pareto Biaya-Performa

Artificial Analysis — Frontier Pareto Biaya-Performa

57 poin pada Intelligence Index seharga $0,045 per tugas — GLM-5.3-Flash berada di frontier Pareto bersama GPT-5.6 Sol (max) dan Claude Opus 5 (max), padahal biayanya hanya sebagian kecil dari keduanya.

Sumber: Artificial Analysis, diperbarui 26 Agustus 2026

Spesifikasi Teknis

Detail penting ketika Anda menggunakan GLM-5.3-Flash dalam alur kerja Anda sendiri.

Konteks & Output

1.310.720 token input (konteks 1M+)

Maksimum 48.000 token output

Arsitektur

Mixture-of-Experts 320B total / 18B aktif, 45 lapisan. Atensi hybrid sparse + linear dengan IndexPool dan Manifold-Constrained Hyper-Connections (mHC).

Lisensi & Bobot

Bobot terbuka berlisensi MIT, dilatih pada korpus multimodal 30T token.

Kecepatan

Median waktu token pertama 0,55 detik dan throughput puncak sekitar 134 token/detik di seluruh penyedia OpenRouter (diukur Agustus 2026).

Ketersediaan

Aktif di Felo AI Search dan Felo API, serta platform Z.ai dan 10+ penyedia OpenRouter.

Modalitas

Input native teks, gambar, dan video dengan output teks — model multimodal native pertama di seri GLM-5.

Satu Model, Semua Jenis Input

Tanpa pipeline terpisah atau model yang dirangkai — GLM-5.3-Flash membaca teks, gambar, dan video secara native.

Teks & Kode

Mengurai dokumen panjang, basis kode, dan data terstruktur dalam sekali proses — 63,4 di DeepSWE v1.1, 84,3 di Terminal-Bench 2.1.

Gambar & Grafik

Berikan screenshot, grafik, dan diagram untuk mendapat jawaban yang terverifikasi: Chartography 78,0 vs. 64,3 milik DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62,4% vs. 48,9% milik Claude Opus 4.8.

Video

Analisis video bersama teks dan gambar: MVBench 77,8%, di depan 69,4% milik DeepSeek-V4-Flash-Vision-Exp.

Siapa yang Menggunakan GLM-5.3-Flash

Dari developer solo hingga tim yang menjalankan inference sendiri, GLM-5.3-Flash mencakup coding, riset, dan pekerjaan multimodal dalam satu model terbuka.

Coding Agentik

63,4 di DeepSWE v1.1 dan 48,8 di AutomationBench v1.0.6 menjadikannya pilihan kuat untuk coding agent, pengeditan multi-file, dan rantai panggilan yang panjang.

Pekerjaan Agen Jangka Panjang

Toolathlon 78,4 ditambah jendela 1,31 juta token menjaga satu sesi tetap berjalan melewati banyak langkah tanpa kehilangan konteks.

Riset Multimodal

Gabungkan dokumen, screenshot, grafik, dan frame video dalam satu permintaan untuk mendapatkan jawaban terstruktur beserta sumbernya.

Analisis Video & Visual

MVBench 77,8 dan Chartography 78,0 mencakup pemahaman video, pembacaan grafik, dan analisis tata letak dokumen.

Deployment Mandiri (Self-Hosted)

Lisensi MIT dan 18B parameter aktif memungkinkan Anda menjalankan bobotnya sendiri untuk alur kerja yang sensitif data atau memerlukan fine-tuning.

Agen & Pipeline Felo

Panggil model ini melalui Felo API untuk membangun agen, otomasi, dan pipeline tool yang dapat dibaca mesin.

Dua Cara Menggunakan GLM-5.3-Flash

Gunakan di Felo AI Search

Buka Felo AI Search untuk mengajukan pertanyaan, cari di web dengan AI, dan dapatkan jawaban yang disertai sumber dari GLM-5.3-Flash.

Buka Felo AI Search

Panggil Felo API

Dapatkan kunci Felo API, atur base URL, lalu panggil model dari Claude Code, Codex, Hermes Agent, atau agen Anda sendiri yang kompatibel dengan OpenAI.

Lihat Felo API

Pertanyaan yang Sering Diajukan

GLM-5.3-Flash adalah model frontier open-weight dari Z.ai yang dirilis pada 26 Agustus 2026. Model ini adalah Mixture-of-Experts 320B parameter dengan 18B parameter aktif, jendela konteks 1.310.720 token, input native teks, gambar, dan video, serta atensi hybrid sparse-plus-linear. Berlisensi MIT.

Mulai dengan GLM-5.3-Flash di Felo

Model frontier terbuka dari Z.ai — konteks 1,31 juta token, input multimodal native, dan coding kelas agen dalam satu tempat.

Buka GLM-5.3-Flash di Felo AI Search

Juga tersedia di platform Z.ai dan Felo API