MIT 라이선스 · 오픈 웨이트 · 2026년 8월 26일 출시

GLM-5.3-Flash프론티어 지능, 오픈 웨이트

GLM-5.3-Flash는 Z.ai가 2026년 8월 26일 MIT 라이선스로 출시한 오픈 웨이트 프론티어 모델입니다. 1,310,720 토큰의 컨텍스트 윈도우, 텍스트·이미지·비디오 네이티브 입력, 320B 파라미터의 MoE(활성 18B)를 갖추고 Artificial Analysis의 Intelligence Index에서 Claude Opus 4.8과 동률을 기록했습니다. Felo AI Search에서 시도하거나 Felo API로 호출할 수 있습니다.

Felo AI Search와 Felo API에서 이용할 수 있습니다.

모델 카드

한눈에 보는 GLM-5.3-Flash

라이선스
MIT · 오픈 웨이트
파라미터
총 320B · 활성 18B
컨텍스트 윈도우
1.31M 토큰
최대 출력
48K 토큰
입력
텍스트 · 이미지 · 비디오
하이브리드 스파스 + 리니어 어텐션: GLM-5.3 대비 어텐션 연산 약 3배 절감, KV 캐시 약 4.4배 축소

57

Intelligence Index

Artificial Analysis · Claude Opus 4.8과 동률

1M

컨텍스트 윈도우

입력 1,310,720 토큰

48K

최대 출력

응답당 최대 48,000 토큰

MIT

라이선스

MIT · 오픈 웨이트

아키텍처, 무엇이 다른가

Z.ai는 하이브리드 어텐션 설계를 중심으로 GLM-5 시리즈를 재구축해, 최상위 수준의 지능을 실용적으로 서비스할 수 있게 만들었습니다.

하이브리드 스파스 + 리니어 어텐션

스파스 어텐션과 리니어 어텐션을 결합한 최초의 오픈 프론티어 모델입니다. 가벼운 IndexPool이 인덱스 캐시를 4분의 1 크기로 줄이고, Manifold-Constrained Hyper-Connections(mHC)가 확장성을 높입니다. GLM-5.3 대비 어텐션 연산은 약 3배, KV 캐시는 약 4.4배 줄어들면서도 긴 컨텍스트에서는 정확도를 유지합니다.

오픈 웨이트, MIT 라이선스

전체 웨이트가 MIT 라이선스로 공개되었습니다. 직접 호스팅하거나 파인튜닝하거나, Z.ai 또는 OpenRouter에서 호스팅하는 10개 이상의 프로바이더를 통해 배포할 수 있습니다.

GLM-5 시리즈 최초의 네이티브 멀티모달

30T 토큰의 멀티모달 코퍼스로 학습되어 텍스트·이미지·비디오를 바로 이해합니다. 별도의 비전 파이프라인도, 여러 모델을 이어 붙일 필요도 없습니다.

프론티어 작업, 플래시 성능

토큰당 18B만 활성화하는 320B 파라미터 MoE가 프론티어급 작업을 에이전트 속도로 수행합니다.

Claude Opus 4.8과 동률

Artificial Analysis Intelligence Index는 GLM-5.3-Flash가 57, Claude Opus 4.8이 57입니다. Agentic Index는 58로, Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol을 앞섭니다.

코딩과 에이전트에 최적화

Z.ai Code Bench(max effort) 29.0, Claude Opus 4.8은 29.5. DeepSWE v1.1에서는 63.4로 GLM-5.2보다 17.2포인트 높습니다.

텍스트·이미지·비디오를 한 번의 요청으로

1,310,720 토큰의 컨텍스트 윈도우에 네이티브 멀티모달 입력을 지원합니다. Chartography는 78.0(DeepSeek-V4-Flash-Vision-Exp는 64.3), MVBench는 77.8(69.4)입니다.

1초 미만의 응답

OpenRouter 프로바이더들이 측정한 첫 토큰 도착 시간 중앙값은 0.55초, 최대 처리량은 약 134 토큰/초이며 10개 이상의 프로바이더 중에서 선택할 수 있습니다.

공식 모델 카드 벤치마크

GLM-5.3-Flash vs. 최고 프론티어 모델

Z.ai 공식 모델 카드 결과: GLM-5.3-Flash와 GLM-5.2, DeepSeek-V4-Vision-Exp, Opus 4.8, GPT-5.6 Terra, Gemini 3.7 Flash의 비교(2026년 8월). 높을수록 우수하며, 굵은 글씨는 각 행의 최고 점수를 표시합니다.

벤치마크

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

코딩

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

에이전트

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

HLE w/ Tools

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

비전

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv Reasoning w/ Tools

89.4

-

80.4

89.9

88.0

88.7

Chartography w/ Tools

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

출처: Z.ai 공식 모델 카드(2026년 8월). 자체 평가 결과이며, 평가 환경에 따라 달라질 수 있습니다.

Z.ai Code Bench(max effort): 29.0 vs. Claude Opus 4.8의 29.5 · Artificial Analysis Agentic Index: 58, Claude Opus 4.8보다 높음

Z.ai 발표문 읽기
독립 리더보드

GLM-5.3-Flash의 타사 순위

DesignArena의 프론트엔드 디자인 역량, 그리고 Artificial Analysis Pareto 프론티어에서의 비용 대비 성능.

DesignArena — 종합 프론트엔드(비에이전트)

DesignArena — 종합 프론트엔드(비에이전트)

GLM-5.3-Flash는 DesignArena의 프론트엔드 Elo에서 1348점과 1345점을 기록해 종합 5위와 6위를 차지했습니다. Kimi K3, GPT-5.6 Sol, Claude Opus 5보다는 낮은 순위이지만, GLM-5.2, Gemini 3.7 Flash, Claude Sonnet 5보다는 높습니다.

출처: DesignArena by Intelligence · Elo 평가 · 전체 모델

Artificial Analysis — 비용 대비 성능 Pareto 프론티어

Artificial Analysis — 비용 대비 성능 Pareto 프론티어

Intelligence Index에서 57점, 태스크당 $0.045 — GLM-5.3-Flash는 GPT-5.6 Sol(max)과 Claude Opus 5(max)와 함께 Pareto 프론티어에 위치하며, 비용은 이들의 일부에 불과합니다.

출처: Artificial Analysis, 2026년 8월 26일 업데이트

기술 사양

GLM-5.3-Flash를 본인의 워크플로에 사용할 때 중요한 세부 사항입니다.

컨텍스트 및 출력

입력 1,310,720 토큰(100만 이상 컨텍스트)

최대 출력 48,000 토큰

아키텍처

총 320B / 활성 18B Mixture-of-Experts, 45개 레이어. IndexPool과 Manifold-Constrained Hyper-Connections(mHC)을 갖춘 하이브리드 스파스 + 리니어 어텐션.

라이선스 및 웨이트

MIT 라이선스 오픈 웨이트, 30T 토큰 멀티모달 코퍼스로 학습.

속도

OpenRouter 프로바이더들의 첫 토큰 지연 중앙값 0.55초, 최대 처리량 약 134 토큰/초(2026년 8월 측정).

제공 채널

Felo AI Search와 Felo API에서 제공되며, Z.ai 플랫폼과 OpenRouter의 10개 이상 프로바이더에서도 이용할 수 있습니다.

입력 모달리티

텍스트·이미지·비디오 네이티브 입력과 텍스트 출력. GLM-5 시리즈 최초의 네이티브 멀티모달 모델입니다.

하나의 모델, 모든 입력 타입

별도의 파이프라인이나 모델을 이어 붙일 필요 없이, GLM-5.3-Flash가 텍스트·이미지·비디오를 네이티브로 이해합니다.

텍스트 및 코드

긴 문서, 코드베이스, 구조화 데이터를 한 번에 파싱합니다. DeepSWE v1.1 63.4, Terminal-Bench 2.1 84.3.

이미지 및 차트

스크린샷, 차트, 다이어그램을 넣으면 근거 있는 답변을 받을 수 있습니다. Chartography 78.0 vs. DeepSeek-V4-Flash-Vision-Exp 64.3, OfficeQA-Pro 62.4% vs. Claude Opus 4.8 48.9%.

비디오

텍스트·이미지와 함께 비디오도 분석합니다. MVBench 77.8%로 DeepSeek-V4-Flash-Vision-Exp의 69.4%를 앞섭니다.

누가 GLM-5.3-Flash를 사용할까요

개인 개발자부터 직접 추론을 운영하는 팀까지, 하나의 오픈 모델로 코딩, 리서치, 멀티모달 작업을 모두 다룹니다.

에이전트형 코딩

DeepSWE v1.1 63.4, AutomationBench v1.0.6 48.8. 코딩 에이전트, 다중 파일 편집, 긴 호출 체인에 강한 선택입니다.

장기 에이전트 작업

Toolathlon 78.4와 1.31M 토큰 윈도우로, 문맥을 놓치지 않고 한 세션에서 여러 단계를 이어갈 수 있습니다.

멀티모달 리서치

문서, 스크린샷, 차트, 비디오 프레임을 한 번의 요청에 담아 출처가 있는 구조화된 답변을 뽑아냅니다.

비디오 및 시각 분석

MVBench 77.8과 Chartography 78.0 — 비디오 이해, 차트 판독, 문서 레이아웃 분석을 커버합니다.

자체 호스팅 배포

MIT 라이선스와 18B 활성 파라미터 덕분에 데이터 민감 또는 파인튜닝 목적의 워크플로를 위해 웨이트를 직접 운영할 수 있습니다.

Felo 에이전트 및 파이프라인

Felo API로 호출해 에이전트, 자동화, 기계가 읽을 수 있는 툴 파이프라인을 구축할 수 있습니다.

GLM-5.3-Flash를 사용하는 두 가지 방법

Felo AI Search에서 사용하기

Felo AI Search를 열면 질문하고, AI로 웹 검색을 하고, GLM-5.3-Flash로 출처가 있는 답변을 받을 수 있습니다.

Felo AI Search 열기

Felo API 호출하기

Felo API 키를 발급받아 베이스 URL을 설정하면, Claude Code, Codex, Hermes Agent 또는 직접 만든 OpenAI 호환 에이전트에서 호출할 수 있습니다.

Felo API 보기

자주 묻는 질문

GLM-5.3-Flash는 Z.ai가 2026년 8월 26일에 출시한 오픈 웨이트 프론티어 모델입니다. 18B 활성 파라미터를 가진 320B 파라미터 Mixture-of-Experts 모델로, 1,310,720 토큰의 컨텍스트 윈도우, 텍스트·이미지·비디오 네이티브 입력, 하이브리드 스파스 + 리니어 어텐션을 갖추고 있습니다. MIT 라이선스로 제공됩니다.

Felo에서 GLM-5.3-Flash 시작하기

Z.ai의 오픈 프론티어 모델. 1.31M 토큰 컨텍스트, 네이티브 멀티모달 입력, 에이전트급 코딩까지 한곳에서 만나세요.

Felo AI Search에서 GLM-5.3-Flash 열기

Z.ai 플랫폼과 Felo API에서도 만나볼 수 있습니다