MiMo V2.6 Pro가 Felo OpenAPI에 출시: 샤오미의 최고 오픈 웨이트 모델
샤오미의 MiMo V2.6 Pro는 Artificial Analysis 인덱스에서 최고 오픈 웨이트 모델로, Felo OpenAPI에서 백만 토큰당 $0.43/$0.87에 이용할 수 있습니다.
샤오미는 9월 22일 MiMo V2.6 Pro를 공개했고, 오픈 웨이트 테이블 최상단에 올랐습니다. Artificial Analysis Intelligence Index에서 46점을 기록하며 Kimi K3와 Qwen3.8 Max를 앞섰습니다. 샤오미는 웨이트, 기술 보고서, 학습 코드까지 함께 공개했습니다.
오늘부터 mimo-v2.6-pro가 Felo OpenAPI에서 사용 가능합니다. 기존 Claude, GPT, Grok 경로에서 쓰던 키 그대로 사용합니다. 동일한 기본 URL, 설정에서 한 줄만 바꾸면 됩니다.

이번 출시가 다시 볼 만한 이유는 벤치마크 점수 옆에 붙은 가격표입니다. 백만 입력 토큰당 $0.43, 백만 출력 토큰당 $0.87로 근접한 프런티어 추론을 제공하면서, 에이전트 루프가 할 수 있는 일의 범위가 달라집니다.
샤오미가 실제로 공개한 것
이번 발표는 플래그십 출시치고는 이례적으로 솔직하게 나왔습니다. 그래서 요약도 명확하게 할 수 있습니다.
MiMo V2.6 Pro는 샤오미의 조 단위 파라미터 플래그십 모델이며, 현재 보드에서 가장 강력한 오픈 웨이트 모델입니다. 샤오미는 이 점을 명확히 밝히고, 동시에 스스로 반론도 제시합니다. 아직 닫힌 모델인 Claude Fable 5.1, GPT-6 Astra와는 격차가 남아 있습니다. 대부분의 에이전트 벤치마크에서는 Claude Opus 5, GPT-5.6 Sol과 동등하다고 주장합니다.
이것은 벤더가 직접 내놓은 점수표입니다. 모든 출시 표와 마찬가지로 결과가 아니라 주장으로 받아들여야 합니다. 하지만 이번 출시는 벤치마크 주장과 달리 실제로 확인할 수 있는 두 가지가 있습니다.
웨이트가 공개되어 있습니다. MiMo V2.6 Pro와 Flash 모두 오픈 웨이트, 기술 보고서, 그리고 이를 만든 강화학습 코드까지 함께 공개했습니다. 직접 호스팅하거나 파인튜닝, 검증이 가능합니다.
학습 과정도 공개되었습니다. 샤오미는 RL 단계 전체를 약 6일간 실시간으로 진행했습니다. Pro와 Flash 각각 30회 학습 스텝을 완료했고, 두 모델 합쳐 약 75만 개의 트래젝터리를 수집했습니다. Pro만 따로 보면 약 $262만이 투입되었습니다. DeepSWE v1.1이라는 장기 소프트웨어 엔지니어링 벤치마크에서 Pro 모델은 48.8에서 65.7로 성능이 올랐습니다.
웨이트와 함께 샤오미는 소프트웨어 엔지니어링, 취약점 재현, 지식 집약적 작업, 웹 디자인 등 7,000개가 넘는 강화학습 태스크 환경도 오픈소스로 공개했습니다. 결과물뿐 아니라 학습 재료까지 모두 공개한 셈입니다.
스펙 시트
| 스펙 | MiMo V2.6 Pro |
|---|---|
| 모델 ID | mimo-v2.6-pro |
| 제조사 | 샤오미 |
| 스케일 | 조 단위 파라미터 플래그십 |
| 컨텍스트 윈도우 | 1,000,000 토큰 |
| 최대 출력 | 128,000 토큰 |
| 입력 | 텍스트, 이미지, 비디오, 오디오 |
| 출력 | 텍스트 |
| 기능 | 추론, 툴 호출, 구조화 출력, 스트리밍 |
| 인텔리전스 인덱스 | 46 (샤오미 발표 46.32) |
두 가지 항목이 특히 주목할 만합니다.
입력은 옴니모달입니다. 텍스트, 이미지, 비디오, 오디오 모두 같은 프롬프트로 입력할 수 있습니다. 이 가격대 모델 대부분은 텍스트, 많아야 스크린샷 정도만 읽습니다. 화면 녹화, 프레임 묶음, 오디오 트랙을 별도 전사 과정 없이 바로 입력하는 것은 다른 종류의 작업이며, 이 부분에 모델의 학습 노력이 집중되었습니다.
컨텍스트 윈도우가 백만 토큰입니다. 학습 과정 자체에서 1M 토큰 컨텍스트를 사용했고, 사후에 윈도우를 붙인 것이 아닙니다. 샤오미는 이 모델을 멀티모달, 멀티에이전트, 멀티하네스 작업에 맞춰 설계했습니다. 코드베이스 전체 질문, 1년치 문서, 긴 에이전트 스레드도 압축 없이 바로 입력할 수 있습니다.
샤오미는 사후 검증이 쉬운 작업도 시연했습니다. Period Three Implies Chaos의 주요 정리를 Lean 4로 6,000줄 넘게 완전 형식화했고, Lean 커널이 미증명 부분 없이 증명을 통과시켰습니다. 또 샤오미의 소재 연구진과 함께 PFAS 오염물질 포집용 금속-유기 프레임워크 후보도 설계했습니다. 벤치마크는 조작할 수 있지만, 컴파일되는 증명은 조작할 수 없습니다.
Felo OpenAPI의 추가 가치
모델 호출은 쉽습니다. MiMo V2.6 Pro를 Felo OpenAPI로 쓰는 이유는 이미 연결된 스택 안에 모델이 들어오기 때문입니다.
하나의 키, 세 가지 프로토콜. Felo OpenAPI는 클라이언트가 사용하는 모든 인터페이스에서 모델을 제공합니다.
| 인터페이스 | 엔드포인트 | 용도 |
|---|---|---|
| Chat Completions | https://openapi.felo.ai/api/v1/chat/completions | OpenAI 호환 앱 및 에이전트 |
| Responses | https://openapi.felo.ai/api/v1/responses | 에이전트 및 워크플로우 요청 |
| Messages | https://openapi.felo.ai/api/v1/messages | Anthropic 호환 클라이언트 |
기존 OpenAI SDK는 https://openapi.felo.ai/api/v1에, Claude 스타일 클라이언트는 https://openapi.felo.ai/api에 연결하고 모델 ID만 지정하면 됩니다. 별도 계정, 추가 청구, 벤더별 SDK 학습이 필요 없습니다.
기존 에이전트에 바로 적용됩니다. Felo OpenAPI는 MiMo V2.6 Pro를 Claude Code, Codex와 동일하게 사용할 수 있도록 제공합니다. 오늘 Felo에 연결된 에이전트가 있다면, 이 모델 추가는 설정 한 줄만 바꾸면 됩니다.
모델만 있는 게 아닙니다. 이것이 게이트웨이와 플랫폼의 차이입니다. 검색, 웹 패치, X 검색, 유튜브 자막, PPT 생성, 마인드맵, LiveDocs 메모리, SuperAgent 워크플로우가 같은 키 뒤에 있습니다. 백만 토큰 컨텍스트와 옴니모달 입력이 있어도, 최신 정보에 접근하고 결과물을 만들어낼 수 있어야 진짜 쓸모가 생깁니다. Felo에서는 이게 가능합니다.
이전 세대인 mimo-v2.5-pro도 이미 플랫폼에 있습니다. V2.6은 업그레이드이며, 둘 사이 전환은 설정만 바꾸면 됩니다.
실제로 어떻게 동작하는가
경쟁사 분석 브리프는 모든 기능이 동시에 필요한 좋은 테스트 케이스입니다. Felo OpenAPI에서는 하나의 키로 전체 루프를 처리합니다.
- Web Fetch가 세 경쟁사의 가격 페이지를 Markdown으로 가져옵니다.
- Search가 페이지에 없는 정보(자금, 인력, 최근 출시 등)를 채웁니다.
- MiMo V2.6 Pro가 모든 내용을 1M 토큰 컨텍스트로 읽고, 각 가격표 스크린샷과 함께 텍스트와 이미지를 동시에 추론합니다. OCR 전사 없이 바로 처리합니다.
- PPT API가 결론을 슬라이드로 만듭니다.
대안은 네 개 벤더, 네 개 키, 네 개 청구서, 그리고 직접 관리하는 중간 연결 계층입니다. 이 연결 계층이 바로 이 스택이 없애는 비용이며, 에이전트 데모가 실제 제품으로 이어지지 않는 가장 흔한 이유입니다.
빠른 시작
세 단계면 바로 응답을 받을 수 있습니다.
1. Felo API Platform 계정에서 API 키를 받아 환경 변수로 등록합니다.
export FELO_API_KEY="YOUR_API_KEY"
2. 첫 요청을 보냅니다. 모델 ID는 mimo-v2.6-pro입니다.
curl https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between sparse and dense attention."}
]
}'
또는 OpenAI SDK를 사용할 때는 base URL만 바꿉니다.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["FELO_API_KEY"],
base_url="https://openapi.felo.ai/api/v1",
)
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[{"role": "user", "content": "Explain the tradeoffs between sparse and dense attention."}],
max_tokens=1024,
)
print(completion.choices[0].message.content)
3. 스트리밍을 켜려면 stream: true를 추가합니다.
curl -N https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"stream": true,
"messages": [{"role": "user", "content": "Hello"}]
}'
멀티턴 작업에서 실용적인 팁: 이 모델은 추론형입니다. 프로토콜이나 경로가 추론 제어를 지원한다면, 반환되는 추론 메타데이터를 계속 전달해야 합니다. 대화 중간에 이 정보를 누락하면 모델의 실제 성능보다 낮게 보일 수 있습니다.

비용 계산
여기서 MiMo V2.6 Pro의 진가가 드러납니다. Felo OpenAPI의 공식 요금(백만 토큰 기준):
| 모델 | 입력 / M | 출력 / M |
|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 |
| Claude Opus 5.5 | $4.00 | $20.00 |
| GPT-6 Sol | $2.00 | $10.00 |
| MiMo V2.6 Pro | $0.43 | $0.87 |
| DeepSeek V4.1 Flash | $0.15 | $0.60 |
| GLM 5.3 Flash | $0.15 | $0.50 |
이 요금은 Felo OpenAPI 전체 카탈로그 기준이므로 비교가 공정합니다. 같은 플랫폼, 같은 키, 같은 청구서입니다. MiMo V2.6 Pro의 요금은 샤오미 공식 가격과 동일합니다. 입력 $0.435, 출력 $0.87. 경로에서 별도 마진 없이 그대로 전달합니다.
실제 에이전트 워크로드로 계산해 봅니다. 예를 들어, 루프가 20만 토큰짜리 저장소를 읽고, 2만 토큰의 변경사항을 만들며, 하루 50회 반복한다고 가정합니다.
- 하루 입력 1,000만 토큰, 출력 100만 토큰
- GPT-6 Astra: $100 + $50 = 하루 $150
- Claude Opus 5.5: $40 + $20 = 하루 $60
- MiMo V2.6 Pro: $4.30 + $0.87 = 하루 $5.17
동일한 작업에서 GPT-6 Astra 대비 약 29배 저렴합니다. 샤오미는 이 모델이 Claude Opus 5, GPT-5.6 Sol과 비슷한 위치라고 주장합니다. 주장은 벤더의 몫이지만, 가격은 사실입니다. 주장이 2/3만 맞아도 에이전트 운영 경제성이 달라집니다.
절감 자체보다 2차 효과가 더 중요합니다. 루프 비용이 하루 $5가 되면, 컨텍스트를 줄여서 비용을 아끼지 않습니다. 지루한 단계에서 약한 모델로 다운그레이드하지 않습니다. 더 큰 프롬프트로 다시 실행합니다. 대부분의 에이전트 품질 문제는 사실상 예산 문제입니다.
적합한 용도와 그렇지 않은 용도
이 모델을 써야 할 때: 이미지, 비디오, 오디오 등 멀티모달 추론이 필요할 때, 전체 문서를 한 번에 분석해야 할 때, 하루 종일 토큰을 소모하는 에이전트 작업, 비디오 이해, 행동을 검증할 수 있고 나중에 직접 호스팅할 수 있는 오픈 웨이트 모델이 필요할 때.
이 모델을 쓰지 말아야 할 때: 가장 어려운 추론에서 최고 성능이 필요하고 비용이 중요하지 않을 때. 샤오미도 인정합니다. Claude Fable 5.1, GPT-6 Astra가 여전히 더 앞서 있습니다. 하루에 한 번 고위험 작업만 한다면, 프런티어 모델에 비용을 지불하는 것이 맞습니다.
지연 시간에 민감한 엔드포인트로 전환하기 전에 한 가지는 미리 알아야 합니다. Felo는 이 경로의 지연을 딥으로 분류합니다. 즉, 답변 전에 추론을 거칩니다. 분석이나 에이전트 플래닝에는 적합하지만, 자동완성이나 실시간 채팅에는 빠른 티어가 더 적합합니다.
요약: 대부분의 품질을 대부분의 비용 없이 얻고 싶을 때 이 모델을 사용합니다. 비용이 누적되는 부분입니다.
자주 묻는 질문
MiMo V2.6 Pro와 MiMo V2.6 Flash는 같은 모델인가요?
아닙니다. Flash는 같은 릴리스에서 나온 더 저렴하고 빠른 모델이며, 현재 Felo OpenAPI에는 없습니다. Pro가 플래그십 경로입니다.
어떤 엔드포인트를 호출해야 하나요?
이미 OpenAI SDK를 사용 중이라면 https://openapi.felo.ai/api/v1/chat/completions의 Chat Completions를 사용하세요. Claude 스타일 클라이언트라면 https://openapi.felo.ai/api의 Anthropic 호환 인터페이스를 사용하세요. Responses 엔드포인트는 에이전트 및 워크플로우 요청에 적합합니다.
툴 호출과 구조화 출력이 지원되나요?
네. Felo OpenAPI는 이 경로에서 추론, 툴, JSON, 스트리밍, 비전 기능을 지원합니다. 툴 정의는 호환 스키마를 따르므로 기존 툴 호출 코드도 그대로 사용할 수 있습니다.
직접 호스팅도 가능한가요?
오픈 웨이트의 목적이 바로 그것입니다. 샤오미가 웨이트와 기술 보고서를 공개했으므로, 오늘 Felo를 통해 사용해도 내일 직접 호스팅으로 전환할 수 있습니다.
닫힌 플래그십 모델과 비교하면 어떤가요?
샤오미의 설명이 가장 공정합니다. 모든 오픈 웨이트 모델 중 가장 앞서 있지만, Claude Fable 5.1, GPT-6 Astra에는 아직 미치지 못합니다. 대부분의 에이전트 벤치마크에서는 Claude Opus 5, GPT-5.6 Sol과 비슷합니다. 마지막 열, 즉 가격 대비 성능이 가장 중요합니다.
MiMo V2.6 Pro 체험하기
Felo API Platform에서 키를 받고, base URL을 https://openapi.felo.ai/api/v1로 지정하고, 모델을 mimo-v2.6-pro로 설정한 뒤, 그동안 아껴 쓰던 워크로드를 실행하세요. 모델 페이지에서 전체 스펙, 최신 가격, TypeScript, Python, cURL, Claude Code 샘플을 바로 복사해 쓸 수 있습니다.
MiMo V2.6 Pro를 Felo OpenAPI에서 살펴보기 →
이 글은 다음 언어로도 읽을 수 있습니다: English, 简体中文, 日本語, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, Español, বাংলা, Português.