Skip to main content

MiMo V2.6 Pro agora está no Felo OpenAPI: o principal modelo open-weights da Xiaomi

· 12 minutos de leitura
Felo Search Tips Buddy
Committed to answers at your fingertips

MiMo V2.6 Pro da Xiaomi, o principal modelo open-weights no índice Artificial Analysis, está disponível no Felo OpenAPI por $0,43/$0,87 por milhão de tokens.

A Xiaomi lançou o MiMo V2.6 Pro em 22 de setembro, e ele ficou no topo da tabela de open-weights: 46 no Artificial Analysis Intelligence Index, à frente do Kimi K3 e do Qwen3.8 Max. A Xiaomi disponibilizou os pesos, o relatório técnico e o código de treinamento junto com o modelo.

A partir de hoje, mimo-v2.6-pro está disponível no Felo OpenAPI. A mesma chave que você já usa para as rotas do Claude, GPT e Grok. O mesmo URL base. Apenas uma linha muda na sua configuração.

MiMo V2.6 Pro no Felo OpenAPI: o principal modelo open-weights da Xiaomi com contexto de 1M tokens e entrada omni-modal

O que destaca esse lançamento é o preço ao lado do número do benchmark. Raciocínio próximo ao frontier por $0,43 por milhão de tokens de entrada e $0,87 por milhão de tokens de saída muda o que um loop de agente pode realizar.

O que a Xiaomi realmente entregou​

O anúncio é transparente para um lançamento de flagship, o que facilita o resumo.

MiMo V2.6 Pro é o flagship trilionário da Xiaomi, e é o modelo open-weights mais forte disponível atualmente. A Xiaomi afirma isso de forma direta, e também reconhece: ainda existe uma diferença em relação aos modelos fechados mais fortes, Claude Fable 5.1 e GPT-6 Astra. Em benchmarks de agentes, a Xiaomi aponta equivalência com Claude Opus 5 e GPT-5.6 Sol.

Esse é o placar do próprio fornecedor. Considere como qualquer tabela de lançamento, como uma afirmação e não como resultado. Mas dois pontos desse lançamento podem ser verificados de forma que benchmarks geralmente não permitem.

Os pesos são públicos. MiMo V2.6 Pro e Flash foram lançados com pesos abertos, relatório técnico e o código de reinforcement learning que os gerou. Você pode hospedar, ajustar ou verificar.

O treinamento também foi público. A Xiaomi executou a fase de RL ao vivo por cerca de seis dias. Pro e Flash completaram 30 etapas de treinamento cada, coletando quase 750.000 trajetórias; só a execução do Pro custou cerca de $2,62 milhões. No DeepSWE v1.1, um benchmark de engenharia de software de longo prazo fora da amostra, o modelo Pro foi de 48,8 para 65,7.

Junto com os pesos, a Xiaomi abriu mais de 7.000 ambientes de tarefas de reinforcement learning abrangendo engenharia de software, reprodução de vulnerabilidades, trabalhos intensivos em conhecimento e web design — o material de treinamento, não só o resultado.

A ficha técnica​

EspecificaçãoMiMo V2.6 Pro
Model IDmimo-v2.6-pro
FabricanteXiaomi
EscalaFlagship trilionário
Contexto1.000.000 tokens
Saída máxima128.000 tokens
EntradaTexto, imagem, vídeo, áudio
SaídaTexto
CapacidadesRaciocínio, uso de ferramentas, saída estruturada, streaming
Intelligence Index46 (Xiaomi relata 46,32)

Dois pontos merecem atenção.

A entrada é omni-modal. Texto, imagens, vídeo e áudio entram no mesmo prompt. A maioria dos modelos nessa faixa de preço lê texto e, talvez, uma captura de tela. Enviar uma gravação de tela, uma pilha de frames ou uma faixa de áudio sem transcrição é outro tipo de tarefa, e foi nisso que o treinamento do modelo se concentrou.

A janela de contexto é de um milhão de tokens. O próprio treinamento usou contexto de 1M tokens, sem adaptar a janela depois, e a Xiaomi posicionou o modelo para tarefas multimodais, multiagente e multi-harness. Perguntas sobre todo o código, conjuntos de documentos de um ano e threads longas de agentes cabem sem compressão.

A Xiaomi também demonstrou o modelo em tarefas fáceis de verificar depois. Ele produziu uma formalização completa em Lean 4 do teorema principal de Period Three Implies Chaos, com mais de 6.000 linhas de código-fonte cuja prova o kernel do Lean valida sem lacunas. Em outro caso, colaborou com pesquisadores de materiais da Xiaomi para projetar candidatos a frameworks metal-orgânicos para capturar poluentes PFAS. Benchmarks podem ser manipulados. Uma prova que compila não pode.

O que o Felo OpenAPI acrescenta​

Chamar um modelo é simples. O motivo para usar o MiMo V2.6 Pro pelo Felo OpenAPI, em vez de configurar outra conta de fornecedor, é que o modelo já está integrado a uma stack conectada.

Uma chave, três protocolos. O Felo OpenAPI expõe o modelo em todas as superfícies que seu cliente pode usar:

SuperfícieEndpointPara que serve
Chat Completionshttps://openapi.felo.ai/api/v1/chat/completionsApps e agentes compatíveis com OpenAI
Responseshttps://openapi.felo.ai/api/v1/responsesRequisições de agente e workflow
Messageshttps://openapi.felo.ai/api/v1/messagesClientes compatíveis com Anthropic

Aponte um SDK OpenAI existente para https://openapi.felo.ai/api/v1, ou um cliente estilo Claude para https://openapi.felo.ai/api, e defina o model ID. Não existe conta separada, nem segunda cobrança, nem SDK específico para aprender.

Entra nos agentes que você já utiliza. O Felo OpenAPI lista o MiMo V2.6 Pro como utilizável com Claude Code e Codex, do mesmo modo que as rotas do Claude e GPT. Se você já tem um agente apontando para o Felo, adicionar esse modelo é só uma alteração de configuração.

O modelo não está sozinho. Esse é o ponto que diferencia um gateway de uma plataforma. Busca, web fetch, busca no X, legendas do YouTube, geração de PPT, mapas mentais, memória LiveDocs e workflows SuperAgent ficam atrás da mesma chave. Um modelo com contexto de um milhão de tokens e entrada omni-modal só serve se também acessar informação atualizada e gerar algo ao final. No Felo, ele faz isso.

A geração anterior, mimo-v2.5-pro, já está na plataforma. A V2.6 é o upgrade, e alternar entre elas só exige uma edição.

Como isso funciona na prática​

Um briefing competitivo serve de teste, pois exige todas as capacidades ao mesmo tempo. No Felo OpenAPI, uma chave cobre todo o fluxo:

  1. Web Fetch busca três páginas de preços de concorrentes em Markdown.
  2. Busca preenche o que as páginas não informam — financiamento, equipe, lançamentos recentes.
  3. MiMo V2.6 Pro lê tudo em um único contexto de 1M tokens, junto com uma captura de tela de cada tabela de preços, e raciocina sobre texto e imagem juntos, sem depender de transcrição OCR.
  4. PPT API transforma a conclusão em uma apresentação.

A alternativa envolve quatro fornecedores, quatro chaves, quatro faturas e uma camada de integração que você mesmo mantém. Essa integração é o custo que essa stack elimina, e geralmente impede que um demo de agente vire produto.

Comece agora​

Três passos do zero até a resposta.

1. Obtenha uma chave de API na sua conta do Felo API Platform e exporte.

export FELO_API_KEY="YOUR_API_KEY"

2. Faça sua primeira requisição. O model ID é mimo-v2.6-pro.

curl https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between sparse and dense attention."}
]
}'

Ou pelo SDK OpenAI, mudando apenas o URL base:

import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ["FELO_API_KEY"],
base_url="https://openapi.felo.ai/api/v1",
)

completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[{"role": "user", "content": "Explain the tradeoffs between sparse and dense attention."}],
max_tokens=1024,
)
print(completion.choices[0].message.content)

3. Ative o streaming adicionando stream: true.

curl -N https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"stream": true,
"messages": [{"role": "user", "content": "Hello"}]
}'

Uma observação prática para trabalhos de múltiplas interações: este é um modelo de raciocínio. Se seu protocolo ou rota expõe controles de raciocínio, mantenha os metadados de raciocínio retornados e passe adiante ao continuar a conversa. Perder esses dados no meio da thread é a forma mais comum de prejudicar o desempenho do modelo.

Uma chave Felo API roteando para MiMo V2.6 Pro nos endpoints Chat Completions, Responses e Messages compatível com Anthropic

O cálculo do custo​

Aqui o MiMo V2.6 Pro se destaca. Tarifas publicadas do Felo OpenAPI, por milhão de tokens:

ModeloEntrada / MSaída / M
GPT-6 Astra$10,00$50,00
Claude Opus 5.5$4,00$20,00
GPT-6 Sol$2,00$10,00
MiMo V2.6 Pro$0,43$0,87
DeepSeek V4.1 Flash$0,15$0,60
GLM 5.3 Flash$0,15$0,50

Essas são as tarifas publicadas do Felo OpenAPI para todo o catálogo, tornando a comparação justa: mesma plataforma, mesma chave, mesma fatura. Para o MiMo V2.6 Pro, o valor corresponde ao preço de tabela da Xiaomi, $0,435 entrada e $0,87 saída. A rota repassa o modelo pelo preço de tabela, sem acréscimo.

Agora faça a conta para uma carga realista de agente. Suponha que seu loop lê um trecho de repositório de 200.000 tokens, gera 20.000 tokens de mudanças e roda 50 vezes por dia:

  • 10M tokens de entrada por dia, 1M tokens de saída por dia
  • No GPT-6 Astra: $100 + $50 = $150 por dia
  • No Claude Opus 5.5: $40 + $20 = $60 por dia
  • No MiMo V2.6 Pro: $4,30 + $0,87 = $5,17 por dia

Isso custa cerca de 29x menos que o GPT-6 Astra para o mesmo tipo de tarefa, em um modelo que a Xiaomi posiciona próximo do Claude Opus 5 e GPT-5.6 Sol em benchmarks de agentes. A afirmação é do fornecedor; o preço é um fato. Se a afirmação se confirmar em dois terços, a economia de rodar agentes muda.

O efeito secundário importa mais que a economia direta. Quando um loop custa $5 por dia em vez de $150, você para de cortar contexto para economizar. Você não precisa rebaixar para um modelo mais fraco nas etapas menos críticas. Você deixa rodar de novo com um prompt maior. A maioria dos problemas de qualidade de agentes tem origem no orçamento.

Onde encaixa, e onde não encaixa​

Use quando precisar de raciocínio multimodal sobre imagens, vídeo ou áudio; análise de longo contexto onde todo o documento precisa ficar visível; tarefas agenticas que consomem tokens o dia todo; compreensão de vídeo; ou quando quiser um modelo open-weights cujo funcionamento você pode inspecionar e hospedar depois.

Não use quando precisar do teto absoluto em raciocínio e custo não for o limite. A própria Xiaomi reconhece: Claude Fable 5.1 e GPT-6 Astra ainda estão à frente. Se você roda uma tarefa crítica por dia, pague pelo frontier.

Uma expectativa antes de migrar um endpoint sensível à latência: o Felo classifica a latência dessa rota como deep, ou seja, o modelo raciocina antes de responder. Essa é a troca certa para análise e planejamento de agentes, mas não para autocomplete ou chat em tempo real, onde uma camada rápida serve melhor.

Resumindo: este é o modelo para quem busca quase toda a qualidade sem quase toda a conta. A conta é o que pesa.

Perguntas frequentes​

MiMo V2.6 Pro é igual ao MiMo V2.6 Flash? Não. Flash é o irmão mais barato e rápido do mesmo lançamento, e não está disponível no Felo OpenAPI. Pro é a rota flagship.

Qual endpoint devo usar? Se você já usa um SDK OpenAI, utilize Chat Completions em https://openapi.felo.ai/api/v1/chat/completions. Se usa um cliente estilo Claude, utilize a superfície compatível com Anthropic em https://openapi.felo.ai/api. O endpoint Responses serve para agentes e workflows.

Suporta uso de ferramentas e saída estruturada? Sim. O Felo OpenAPI lista raciocínio, ferramentas, JSON, streaming e visão como capacidades suportadas nessa rota. Definições de ferramentas seguem o schema compatível, então o código de uso de ferramentas existente funciona.

Posso hospedar por conta própria? Esse é o objetivo dos pesos abertos. A Xiaomi publicou os pesos e o relatório técnico, então usar o Felo hoje não prende você amanhã.

Como se compara aos flagships fechados? A própria Xiaomi resume de forma justa: à frente de todos os modelos open-weights, ainda atrás do Claude Fable 5.1 e GPT-6 Astra, e próximo do Claude Opus 5 e GPT-5.6 Sol na maioria dos benchmarks de agentes. A coluna importante é a última: capacidade por dólar.

Experimente o MiMo V2.6 Pro​

Pegue uma chave no Felo API Platform, aponte seu URL base para https://openapi.felo.ai/api/v1, defina o modelo como mimo-v2.6-pro e rode a carga de trabalho que você vinha economizando. A página do modelo traz a ficha completa, preços atuais e exemplos prontos para TypeScript, Python, cURL e Claude Code.

Explore o MiMo V2.6 Pro no Felo OpenAPI →


Este post também está disponível em English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, Español and বাংলা.