GLM-5.3-Flashבינה פרונטירית, משקלים פתוחים
GLM-5.3-Flash הוא מודל הפרונטיר של Z.ai במשקלים פתוחים, ששוחרר ב-26 באוגוסט 2026 ברישיון MIT. הוא משתווה ל-Claude Opus 4.8 במדד ה-Intelligence Index של Artificial Analysis, עם חלון הקשר של 1,310,720 טוקנים, קלט מקורי לטקסט, תמונות ווידאו, ו-MoE עם 320B פרמטרים שמפעיל רק 18B. נסו אותו ב-Felo AI Search או קראו לו דרך ה-Felo API.
זמין ב-Felo AI Search ובה-Felo API
כרטיס מודל
GLM-5.3-Flash במבט אחד
- רישיון
- MIT · משקלים פתוחים
- פרמטרים
- 320B בסך הכל · 18B פעילים
- חלון הקשר
- 1.31M טוקנים
- פלט מקסימלי
- 48K טוקנים
- קלט
- טקסט · תמונה · וידאו
57
Intelligence Index
Artificial Analysis · ברמה של Claude Opus 4.8
1M
חלון הקשר
קלט של 1,310,720 טוקנים
48K
פלט מקסימלי
48,000 טוקנים לכל תגובה
MIT
רישיון
MIT · משקלים פתוחים
מה מייחד את הארכיטקטורה
Z.ai בנתה מחדש את סדרת GLM-5 סביב עיצוב קשב היברידי, כך שהגשת בינה ברמה גבוהה הופכת למעשית.
קשב היברידי: sparse + linear
מודל הפרונטיר הפתוח הראשון שמשלב קשב sparse וקשב ליניארי. IndexPool קל משקל מצמצם את מטמון האינדקס לרבע מהגודל, וקישורי Manifold-Constrained Hyper-Connections (mHC) משפרים את ההתרחבות — כ-3× פחות חישוב קשב ו-4.4× KV cache קטן יותר מאשר GLM-5.3, עם דיוק מלא גם בהקשר ארוך.
משקלים פתוחים, רישיון MIT
כל המשקלים מפורסמים ברישיון MIT. הריצו אותם בעצמכם, כווננו אותם, או פרסו אותם דרך Z.ai או דרך אחד מ-10+ הספקים שמארחים אותו ב-OpenRouter.
ה-GLM-5 הראשון שרב-מודאלי מלידה
אומן על קורפוס מולטימודאלי של 30T טוקנים, והוא קורא טקסט, תמונות ווידאו ישירות — בלי צינור ראייה נפרד, בלי לתפור יחד כמה מודלים.
עבודות פרונטיר, ביצועים ברמת Flash
MoE עם 320B פרמטרים שמפעיל רק 18B לכל טוקן מבצע משימות ברמת פרונטיר במהירות של סוכן.
שווה ל-Claude Opus 4.8
Intelligence Index של Artificial Analysis: 57 ל-GLM-5.3-Flash, 57 ל-Claude Opus 4.8. Agentic Index: 58 — מעל Claude Opus 4.8, Claude Fable 5 ו-GPT-5.6 Sol.
בנוי לקוד וסוכנים
Z.ai Code Bench (מאמץ מקסימלי): 29.0 לעומת 29.5 של Claude Opus 4.8. DeepSWE v1.1: 63.4 — 17.2 נקודות מעל GLM-5.2.
בקשה אחת לטקסט, תמונות ווידאו
חלון הקשר של 1,310,720 טוקנים עם קלט מולטימודאלי מקורי. Chartography: 78.0 לעומת 64.3 של DeepSeek-V4-Flash-Vision-Exp; MVBench: 77.8 לעומת 69.4.
תגובות בפחות משנייה
הספקים ב-OpenRouter מדדו חציון של 0.55 שניות לזמן שבין בקשה לטוקן הראשון וקצב שיא של כ-134 טוקנים/שנייה, עם יותר מ-10 ספקים לבחירה.
GLM-5.3-Flash מול מודלי הפרונטיר המובילים
תוצאות רשמיות מכרטיס המודל של Z.ai: GLM-5.3-Flash מול GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra ו-Gemini 3.7 Flash, אוגוסט 2026. הערך הגבוה יותר עדיף — מודגש מסמן את התוצאה הטובה ביותר בכל שורה.
בנצ'מרק
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
קודינג
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
אייג'נטי
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
HLE w/ Tools
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
ראייה
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv Reasoning w/ Tools
89.4
-
80.4
89.9
88.0
88.7
Chartography w/ Tools
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
מקור: כרטיס המודל הרשמי של Z.ai, אוגוסט 2026. דיווח עצמי; התוצאות עשויות להשתנות לפי הגדרות ההערכה.
Z.ai Code Bench (מאמץ מקסימלי): 29.0 לעומת 29.5 של Claude Opus 4.8 · Agentic Index של Artificial Analysis: 58, מעל Claude Opus 4.8
קראו את ההכרזה של Z.aiGLM-5.3-Flash בדירוגים של צד שלישי
מיומנות עיצוב פרונטאנד ב-DesignArena, ותמורה לכסף בגבול ה-Pareto של Artificial Analysis.

DesignArena — פרונטאנד כללי (לא-אייג'נטי)
GLM-5.3-Flash מגיע ל-1348 ול-1345 ב-Elo הפרונטאנד של DesignArena — חמישי ושישי בסך הכול, אחרי Kimi K3, GPT-5.6 Sol ו-Claude Opus 5, ולפני GLM-5.2, Gemini 3.7 Flash ו-Claude Sonnet 5.
מקור: DesignArena by Intelligence · דירוג Elo · כל המודלים

Artificial Analysis — גבול Pareto של עלות-ביצועים
57 נקודות ב-Intelligence Index תמורת 0.045$ לכל משימה — GLM-5.3-Flash יושב על גבול Pareto לצד GPT-5.6 Sol (מקסימום) ו-Claude Opus 5 (מקסימום), בשבריר מהעלות שלהם.
מקור: Artificial Analysis, עודכן ב-26 באוגוסט 2026
מפרט טכני
הפרטים שחשובים כשמשתמשים ב-GLM-5.3-Flash בתוך זרימות עבודה משלכם.
הקשר ופלט
קלט של 1,310,720 טוקנים (הקשר של 1M+)
פלט מקסימלי של 48,000 טוקנים
ארכיטקטורה
320B בסך הכל / 18B פעילים של Mixture-of-Experts, 45 שכבות. קשב היברידי sparse + ליניארי עם IndexPool וקישורי Manifold-Constrained Hyper-Connections (mHC).
רישיון ומשקלים
משקלים פתוחים ברישיון MIT, שאומנו על קורפוס מולטימודאלי של 30T טוקנים.
מהירות
חציון השהייה עד הטוקן הראשון של 0.55 שניות וקצב שיא של כ-134 טוקנים/שנייה בקרב ספקי OpenRouter (נמדד באוגוסט 2026).
זמינות
פעיל ב-Felo AI Search ובה-Felo API, וכן בפלטפורמת Z.ai ודרך יותר מ-10 ספקים ב-OpenRouter.
מודאליות
קלט מקורי לטקסט, תמונות ווידאו עם פלט טקסט — המודל הראשון בסדרת GLM-5 שהוא מולטימודאלי מלידה.
מודל אחד, כל סוגי הקלט
בלי צינורות נפרדים או מודלים תפורים — GLM-5.3-Flash קורא טקסט, תמונות ווידאו באופן מקורי.
טקסט וקוד
מנתח מסמכים ארוכים, בסיסי קוד ונתונים מובנים במעבר אחד — 63.4 ב-DeepSWE v1.1, 84.3 ב-Terminal-Bench 2.1.
תמונות וגרפים
שלחו צילומי מסך, גרפים ותרשימים וקבלו תשובות מבוססות: Chartography 78.0 לעומת 64.3 של DeepSeek-V4-Flash-Vision-Exp; OfficeQA-Pro 62.4% לעומת 48.9% של Claude Opus 4.8.
וידאו
נתחו וידאו לצד טקסט ותמונות: MVBench 77.8%, לפני 69.4% של DeepSeek-V4-Flash-Vision-Exp.
מי משתמש ב-GLM-5.3-Flash
ממפתחי סולו ועד צוותים שמריצים אינפרנס בעצמם — GLM-5.3-Flash מכסה קוד, מחקר ועבודות רב-מודאליות במודל פתוח אחד.
קודינג אייג'נטי
63.4 ב-DeepSWE v1.1 ו-48.8 ב-AutomationBench v1.0.6 הופכים אותו לבחירה חזקה לסוכני קוד, עריכות מרובות קבצים ושרשראות קריאות ארוכות.
עבודת סוכנים ארוכת טווח
Toolathlon 78.4 יחד עם חלון של 1.31M טוקנים שומרים על סשן אחד לאורך שלבים רבים בלי לאבד הקשר.
מחקר רב-מודאלי
שלבו מסמכים, צילומי מסך, גרפים ופריימים של וידאו בבקשה אחת כדי לקבל תשובות מובנות עם מקורות.
ניתוח וידאו וויזואלי
MVBench 77.8 ו-Chartography 78.0 מכסים הבנת וידאו, קריאת גרפים וניתוח פריסת מסמכים.
פריסה עצמית
רישיון MIT ו-18B פרמטרים פעילים בלבד אומרים שאפשר להריץ את המשקלים בעצמכם לעבודות רגישות או מכווננות.
סוכני Felo ופייפליינים
קראו לו דרך ה-Felo API כדי לבנות סוכנים, אוטומציות ופייפליינים קריאים מכונה.
שתי דרכים להשתמש ב-GLM-5.3-Flash
השתמשו בו ב-Felo AI Search
פתחו את Felo AI Search כדי לשאול שאלות, לחפש באינטרנט עם AI ולקבל תשובות עם מקורות מ-GLM-5.3-Flash.
פתחו את Felo AI Searchקראו ל-Felo API
תשיגו מפתח Felo API, תגדירו את כתובת ה-base, וקראו למודל מ-Claude Code, Codex, Hermes Agent או כל סוכן תואם OpenAI.
צפו ב-Felo APIשאלות נפוצות
GLM-5.3-Flash הוא מודל הפרונטיר החדש של Z.ai במשקלים פתוחים, ששוחרר ב-26 באוגוסט 2026. זהו מודל Mixture-of-Experts עם 320B פרמטרים שמהם 18B פעילים, חלון הקשר של 1,310,720 טוקנים, קלט מקורי לטקסט, תמונות ווידאו, וקשב היברידי של sparse + ליניארי. הוא מופץ ברישיון MIT.
התחילו עם GLM-5.3-Flash ב-Felo
מודל הפרונטיר הפתוח של Z.ai — חלון הקשר של 1.31M טוקנים, קלט מולטימודאלי מקורי וקוד ברמת סוכנים במקום אחד.
פתחו את GLM-5.3-Flash ב-Felo AI Searchגם בפלטפורמת Z.ai ובה-Felo API