MiMo V2.6 Pro est désormais disponible sur Felo OpenAPI : le meilleur modèle open-weights de Xiaomi
MiMo V2.6 Pro de Xiaomi, le meilleur modèle open-weights selon l'indice Artificial Analysis, est disponible sur Felo OpenAPI à 0,43 $/0,87 $ par million de tokens.
Xiaomi a lancé MiMo V2.6 Pro le 22 septembre, et il a pris la première place du classement open-weights : 46 sur l’Artificial Analysis Intelligence Index, devant Kimi K3 et Qwen3.8 Max. Xiaomi a publié les poids, le rapport technique et le code d’entraînement en même temps.
Dès aujourd’hui, mimo-v2.6-pro est disponible sur Felo OpenAPI. Même clé que pour Claude, GPT et Grok. Même URL de base. Une seule ligne à modifier dans votre configuration.

Ce qui rend cette sortie remarquable, c’est le prix affiché à côté du score de référence. Un raisonnement proche du frontier à 0,43 $ par million de tokens en entrée et 0,87 $ par million de tokens en sortie change la donne pour ce qu’une boucle d’agent peut réaliser.
Ce que Xiaomi a réellement livré
L’annonce se distingue par sa franchise, ce qui permet d’en faire un résumé fidèle.
MiMo V2.6 Pro est le modèle phare de Xiaomi avec un trillion de paramètres, et il occupe la première place parmi les modèles open-weights actuellement. Xiaomi l’affirme clairement, puis nuance : un écart subsiste avec les modèles fermés les plus puissants, Claude Fable 5.1 et GPT-6 Astra. Sur la plupart des benchmarks d’agents, Xiaomi revendique une performance équivalente à Claude Opus 5 et GPT-5.6 Sol.
Il s’agit là du tableau de scores du fournisseur. Considérez-le comme toute annonce de lancement, comme une revendication et non un résultat. Mais deux aspects de cette sortie peuvent se vérifier, contrairement à la plupart des benchmarks.
Les poids sont publics. MiMo V2.6 Pro et Flash ont été publiés avec des poids ouverts, un rapport technique et le code de reinforcement learning utilisé pour l’entraînement. Hébergez-le vous-même, affinez-le ou vérifiez-le.
L’entraînement a aussi été public. Xiaomi a mené la phase RL en direct pendant environ six jours. Pro et Flash ont effectué chacun 30 étapes d’entraînement, recueillant près de 750 000 trajectoires au total ; la session Pro seule aurait coûté environ 2,62 millions de dollars. Sur DeepSWE v1.1, un benchmark logiciel long-terme hors échantillon, le modèle Pro est passé de 48,8 à 65,7.
En plus des poids, Xiaomi a publié plus de 7 000 environnements de tâches de reinforcement learning couvrant l’ingénierie logicielle, la reproduction de vulnérabilités, les tâches à forte intensité de connaissances et la conception web — le matériel d’entraînement, pas seulement le résultat.
La fiche technique
| Spécification | MiMo V2.6 Pro |
|---|---|
| ID du modèle | mimo-v2.6-pro |
| Fabricant | Xiaomi |
| Échelle | Modèle phare à un trillion de paramètres |
| Fenêtre de contexte | 1 000 000 tokens |
| Sortie max | 128 000 tokens |
| Entrée | Texte, image, vidéo, audio |
| Sortie | Texte |
| Capacités | Raisonnement, appel d’outils, sortie structurée, streaming |
| Intelligence Index | 46 (Xiaomi indique 46,32) |
Deux points méritent l’attention.
L’entrée est omni-modale. Texte, images, vidéos et audio passent tous dans le même prompt. La plupart des modèles à ce prix lisent du texte et parfois une capture d’écran. Fournir un enregistrement d’écran, une pile d’images ou une piste audio sans étape de transcription constitue une tâche différente, et c’est là que l’effort d’entraînement du modèle s’est concentré.
La fenêtre de contexte atteint un million de tokens. L’entraînement a utilisé ce contexte de 1M tokens dès le départ, sans ajout ultérieur, et Xiaomi a conçu le modèle pour des usages multimodaux, multi-agents et multi-harness. Les questions à l’échelle d’une base de code, des ensembles de documents sur un an ou des fils d’agents longs tiennent sans compression.
Xiaomi a aussi montré le modèle sur des tâches vérifiables après coup. Il a produit une formalisation complète en Lean 4 du théorème principal de Period Three Implies Chaos, plus de 6 000 lignes de code dont la preuve est validée par le noyau Lean sans placeholder non prouvé. Par ailleurs, il a collaboré avec les chercheurs en matériaux de Xiaomi pour concevoir des candidats frameworks métal-organiques pour capter les polluants PFAS. Les benchmarks se manipulent. Une preuve qui compile ne trompe pas.
Ce que Felo OpenAPI apporte
Appeler un modèle reste simple. Utiliser MiMo V2.6 Pro via Felo OpenAPI plutôt que de créer un compte chez un autre fournisseur permet d’intégrer le modèle dans une pile déjà connectée.
Une clé, trois protocoles. Felo OpenAPI expose le modèle sur chaque surface compatible avec votre client :
| Surface | Endpoint | Utilisation |
|---|---|---|
| Chat Completions | https://openapi.felo.ai/api/v1/chat/completions | Applications et agents compatibles OpenAI |
| Responses | https://openapi.felo.ai/api/v1/responses | Requêtes d’agents et de workflows |
| Messages | https://openapi.felo.ai/api/v1/messages | Clients compatibles Anthropic |
Pointez un SDK OpenAI existant vers https://openapi.felo.ai/api/v1, ou un client style Claude vers https://openapi.felo.ai/api, et définissez l’ID du modèle. Aucun compte séparé, aucune facturation supplémentaire, aucun SDK spécifique à apprendre.
Il s’intègre aux agents déjà en place. Felo OpenAPI liste MiMo V2.6 Pro comme utilisable avec Claude Code et Codex, comme pour les routes Claude et GPT. Si un agent pointe déjà vers Felo, ajouter ce modèle ne demande qu’un changement de configuration.
Le modèle n’est pas isolé. C’est ce qui distingue une passerelle d’une plateforme. Recherche, récupération web, recherche X, sous-titres YouTube, génération de PPT, mindmaps, mémoire LiveDocs et workflows SuperAgent sont accessibles avec la même clé. Un modèle avec un contexte d’un million de tokens et une entrée omni-modale n’a d’intérêt que s’il accède aussi à de l’information fraîche et produit un résultat. Sur Felo, c’est le cas.
La génération précédente, mimo-v2.5-pro, est déjà sur la plateforme. V2.6 représente la mise à niveau, et passer de l’un à l’autre ne coûte qu’une modification.
À quoi ressemble l’ensemble du flux
Un brief concurrentiel constitue un bon test, car il mobilise toutes les capacités à la fois. Sur Felo OpenAPI, une seule clé couvre tout le processus :
- Web Fetch récupère trois pages de tarifs concurrents au format Markdown.
- Search complète les informations manquantes — financement, effectifs, lancements récents.
- MiMo V2.6 Pro lit l’ensemble dans un contexte unique de 1M tokens, avec une capture d’écran de chaque tableau de prix, et raisonne sur texte et image ensemble sans passer par une transcription OCR.
- PPT API transforme la conclusion en présentation.
L’alternative implique quatre fournisseurs, quatre clés, quatre factures et une couche de glue à maintenir. Cette glue représente la taxe que cette pile supprime, et explique souvent pourquoi une démo d’agent ne devient jamais un produit.
Démarrage rapide
Trois étapes pour obtenir une réponse.
1. Obtenez une clé API depuis votre compte Felo API Platform et exportez-la.
export FELO_API_KEY="YOUR_API_KEY"
2. Faites votre première requête. L’ID du modèle est mimo-v2.6-pro.
curl https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between sparse and dense attention."}
]
}'
Ou via le SDK OpenAI, seul l’URL de base change :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["FELO_API_KEY"],
base_url="https://openapi.felo.ai/api/v1",
)
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[{"role": "user", "content": "Explain the tradeoffs between sparse and dense attention."}],
max_tokens=1024,
)
print(completion.choices[0].message.content)
3. Activez le streaming en ajoutant stream: true.
curl -N https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"stream": true,
"messages": [{"role": "user", "content": "Hello"}]
}'
Une remarque pratique pour les échanges multi-tours : il s’agit d’un modèle de raisonnement. Si votre protocole ou route expose des contrôles de raisonnement, conservez les métadonnées de raisonnement renvoyées et transmettez-les lors de la poursuite de la conversation. Les perdre en cours de fil est la cause la plus fréquente d’une baisse de performance apparente.

Le calcul du coût
C’est ici que MiMo V2.6 Pro se distingue. Tarifs Felo OpenAPI publiés, par million de tokens :
| Modèle | Entrée / M | Sortie / M |
|---|---|---|
| GPT-6 Astra | 10,00 $ | 50,00 $ |
| Claude Opus 5.5 | 4,00 $ | 20,00 $ |
| GPT-6 Sol | 2,00 $ | 10,00 $ |
| MiMo V2.6 Pro | 0,43 $ | 0,87 $ |
| DeepSeek V4.1 Flash | 0,15 $ | 0,60 $ |
| GLM 5.3 Flash | 0,15 $ | 0,50 $ |
Ce sont les tarifs Felo OpenAPI pour tout le catalogue, ce qui rend la comparaison équitable : même plateforme, même clé, même facture. Pour MiMo V2.6 Pro, le tarif correspond à celui de Xiaomi, 0,435 $ en entrée et 0,87 $ en sortie. La route transmet le modèle au prix catalogue, sans majoration.
Faites le calcul sur une charge d’agent réaliste. Supposons que votre boucle lise une tranche de dépôt de 200 000 tokens, produise 20 000 tokens de modifications, et tourne 50 fois par jour :
- 10M tokens en entrée par jour, 1M tokens en sortie par jour
- Sur GPT-6 Astra : 100 $ + 50 $ = 150 $ par jour
- Sur Claude Opus 5.5 : 40 $ + 20 $ = 60 $ par jour
- Sur MiMo V2.6 Pro : 4,30 $ + 0,87 $ = 5,17 $ par jour
Cela revient à environ 29 fois moins cher que GPT-6 Astra pour le même type de tâche, sur un modèle que Xiaomi place au niveau de Claude Opus 5 et GPT-5.6 Sol sur les benchmarks d’agents. La revendication vient du fournisseur ; le prix, lui, reste un fait. Si la revendication s’avère même aux deux tiers, l’économie des agents change.
L’effet secondaire compte plus que l’économie brute. Quand une boucle coûte 5 $ par jour au lieu de 150 $, on arrête de réduire le contexte pour économiser. On ne rétrograde plus vers un modèle plus faible pour les étapes routinières. On relance avec un prompt plus large. La plupart des problèmes de qualité des agents proviennent d’un budget trop serré.
Où il s’intègre, et où il ne s’intègre pas
Utilisez-le quand il faut du raisonnement multimodal sur images, vidéos ou audio ; de l’analyse longue où tout le document doit rester visible ; des tâches agentiques gourmandes en tokens ; de la compréhension vidéo ; ou quand vous souhaitez un modèle open-weights dont le comportement reste inspectable et auto-hébergeable.
Ne l’utilisez pas quand il faut le sommet absolu du raisonnement et que le coût ne limite pas. Xiaomi le dit : Claude Fable 5.1 et GPT-6 Astra gardent une avance. Pour une tâche critique par jour, payez le frontier.
Un point à anticiper avant de basculer un endpoint sensible à la latence : Felo classe la latence de cette route comme deep, c’est-à-dire que le modèle raisonne avant de répondre. Ce choix convient à l’analyse et à la planification d’agents, mais pas à l’autocomplétion ou au chat temps réel, où un niveau rapide sert mieux.
En résumé : ce modèle fournit la majeure partie de la qualité sans la majeure partie de la facture. C’est la facture qui s’accumule.
Questions fréquentes
MiMo V2.6 Pro est-il identique à MiMo V2.6 Flash ? Non. Flash est la version plus rapide et moins chère de la même génération, et il n’est pas disponible sur Felo OpenAPI. Pro reste la version phare.
Quel endpoint utiliser ?
Si vous utilisez déjà un SDK OpenAI, utilisez Chat Completions à https://openapi.felo.ai/api/v1/chat/completions. Pour un client style Claude, utilisez la surface compatible Anthropic à https://openapi.felo.ai/api. L’endpoint Responses convient aux requêtes d’agents et de workflows.
Supporte-t-il l’appel d’outils et la sortie structurée ? Oui. Felo OpenAPI indique le raisonnement, les outils, le JSON, le streaming et la vision comme capacités supportées pour cette route. Les définitions d’outils suivent le schéma compatible, donc le code d’appel d’outils existant fonctionne.
Puis-je toujours l’auto-héberger ? C’est tout l’intérêt des poids ouverts. Xiaomi a publié les poids et le rapport technique, donc utiliser Felo aujourd’hui ne vous enferme pas demain.
Comment se compare-t-il aux modèles fermés phares ? La présentation de Xiaomi reste la plus juste : devant tous les autres modèles open-weights, encore derrière Claude Fable 5.1 et GPT-6 Astra, à peu près au niveau de Claude Opus 5 et GPT-5.6 Sol sur la plupart des benchmarks d’agents. La colonne à lire reste la dernière : capacité par dollar.
Essayez MiMo V2.6 Pro
Obtenez une clé sur Felo API Platform, pointez votre URL de base vers https://openapi.felo.ai/api/v1, définissez le modèle sur mimo-v2.6-pro, et lancez la charge de travail que vous limitiez jusqu’ici. La page du modèle contient la fiche complète, les tarifs à jour et des exemples prêts à copier-coller en TypeScript, Python, cURL et Claude Code.
Explorer MiMo V2.6 Pro sur Felo OpenAPI →
Cet article est également disponible en English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, Español, বাংলা and Português.