Skip to main content

MiMo V2.6 Pro ya está en Felo OpenAPI: el modelo open-weights líder de Xiaomi

· 13 min de lectura
Felo Search Tips Buddy
Committed to answers at your fingertips

MiMo V2.6 Pro de Xiaomi, el modelo open-weights líder en el índice Artificial Analysis, está disponible en Felo OpenAPI por $0.43/$0.87 por millón de tokens.

Xiaomi lanzó MiMo V2.6 Pro el 22 de septiembre y alcanzó el primer puesto en la tabla de open-weights: 46 en el Artificial Analysis Intelligence Index, por delante de Kimi K3 y Qwen3.8 Max. Xiaomi publicó los pesos, el informe técnico y el código de entrenamiento junto con el modelo.

Desde hoy, mimo-v2.6-pro está disponible en Felo OpenAPI. Se usa la misma clave que ya funciona para las rutas de Claude, GPT y Grok. La misma URL base. Solo se cambia una línea en la configuración.

MiMo V2.6 Pro en Felo OpenAPI: el modelo open-weights líder de Xiaomi con contexto de 1M tokens y entrada omni-modal

Lo que hace que este lanzamiento merezca atención es el precio junto al número del benchmark. Razonamiento cercano al frontier por $0.43 por millón de tokens de entrada y $0.87 por millón de tokens de salida cambia lo que un agente puede permitirse hacer.

Qué entregó realmente Xiaomi​

El anuncio resulta inusualmente directo para un lanzamiento insignia, lo que permite resumirlo con claridad.

MiMo V2.6 Pro es el modelo insignia de un billón de parámetros de Xiaomi, y es el modelo open-weights más potente disponible ahora mismo. Xiaomi lo afirma de forma clara y también señala el contrapunto: todavía existe una diferencia respecto a los modelos cerrados más fuertes, Claude Fable 5.1 y GPT-6 Astra. En la mayoría de los benchmarks de agentes, Xiaomi afirma paridad con Claude Opus 5 y GPT-5.6 Sol.

Esa es la tabla del propio fabricante. Conviene tratarla como cualquier tabla de lanzamiento, como una afirmación y no como un resultado. Pero dos aspectos de este lanzamiento pueden comprobarse de una forma que los benchmarks normalmente no permiten.

Los pesos son públicos. MiMo V2.6 Pro y Flash se publicaron con pesos abiertos, un informe técnico y el código de refuerzo que los generó. Se puede auto-hospedar, ajustar o verificar.

La ejecución del entrenamiento también fue pública. Xiaomi realizó la fase de RL en directo durante unos seis días. Pro y Flash completaron 30 pasos de entrenamiento cada uno, recogiendo cerca de 750,000 trayectorias entre ambos; solo la ejecución de Pro costó unos $2.62 millones. En DeepSWE v1.1, un benchmark de ingeniería de software de largo plazo y fuera de muestra, el modelo Pro pasó de 48.8 a 65.7.

Junto a los pesos, Xiaomi liberó más de 7,000 entornos de tareas de aprendizaje por refuerzo que abarcan ingeniería de software, reproducción de vulnerabilidades, trabajos de conocimiento intensivo y diseño web: el material de entrenamiento, no solo el resultado.

La hoja de especificaciones​

EspecificaciónMiMo V2.6 Pro
Model IDmimo-v2.6-pro
MakerXiaomi
EscalaInsignia de un billón de parámetros
Ventana de contexto1,000,000 tokens
Salida máxima128,000 tokens
EntradaTexto, imagen, video, audio
SalidaTexto
CapacidadesRazonamiento, uso de herramientas, salida estructurada, streaming
Intelligence Index46 (Xiaomi informa 46.32)

Dos filas merecen atención.

La entrada es omni-modal. Texto, imágenes, video y audio entran en el mismo prompt. La mayoría de modelos en este rango de precio solo leen texto y quizá una captura de pantalla. Ingresar una grabación de pantalla, una pila de frames o una pista de audio sin transcripción previa representa otro tipo de tarea, y ahí se enfocó el entrenamiento del modelo.

La ventana de contexto es de un millón de tokens. El entrenamiento utilizó contexto de 1M tokens en vez de añadir la ventana después, y Xiaomi posicionó el modelo para tareas multimodales, multi-agente y multi-harness. Preguntas sobre todo el código, conjuntos de documentos de un año o hilos largos de agentes caben sin compresión.

Xiaomi también mostró el modelo en trabajos que se pueden verificar después. Generó una formalización completa en Lean 4 del teorema principal de Period Three Implies Chaos, más de 6,000 líneas de código fuente cuya demostración el kernel de Lean valida sin huecos. Por otro lado, colaboró con investigadores de materiales de Xiaomi para diseñar candidatos de marcos metal-orgánicos para capturar contaminantes PFAS. Los benchmarks pueden manipularse. Una demostración que compila no.

Qué aporta Felo OpenAPI​

Llamar a un modelo resulta sencillo. El motivo para usar MiMo V2.6 Pro a través de Felo OpenAPI en vez de conectar otra cuenta de proveedor es que el modelo se integra en una pila ya conectada.

Una clave, tres protocolos. Felo OpenAPI expone el modelo en todas las superficies que puede usar tu cliente:

SuperficieEndpointPara qué sirve
Chat Completionshttps://openapi.felo.ai/api/v1/chat/completionsApps y agentes compatibles con OpenAI
Responseshttps://openapi.felo.ai/api/v1/responsesSolicitudes de agentes y flujos de trabajo
Messageshttps://openapi.felo.ai/api/v1/messagesClientes compatibles con Anthropic

Apunta un SDK de OpenAI existente a https://openapi.felo.ai/api/v1, o un cliente estilo Claude a https://openapi.felo.ai/api, y establece el model ID. No hay cuenta separada, ni segunda facturación, ni SDK específico de proveedor que aprender.

Se integra en los agentes que ya usas. Felo OpenAPI lista MiMo V2.6 Pro como utilizable con Claude Code y Codex, igual que las rutas de Claude y GPT. Si tienes un agente apuntando a Felo hoy, añadir este modelo solo requiere un cambio en la configuración.

El modelo no está solo. Aquí es donde una puerta de enlace se diferencia de una plataforma. Búsqueda, obtención web, búsqueda en X, subtítulos de YouTube, generación de PPT, mapas mentales, memoria LiveDocs y flujos de trabajo SuperAgent funcionan con la misma clave. Un modelo con contexto de un millón de tokens y entrada omni-modal solo resulta útil si también accede a información fresca y puede producir algo al final. En Felo lo hace.

La generación anterior, mimo-v2.5-pro, ya está en la plataforma. V2.6 es la mejora, y cambiar entre ellas solo requiere editar.

Así se ve de principio a fin​

Un informe competitivo sirve como buen caso de prueba, porque necesita todas las capacidades a la vez. En Felo OpenAPI, una sola clave cubre todo el flujo:

  1. Web Fetch extrae tres páginas de precios de competidores como Markdown.
  2. Search completa lo que las páginas no dicen — financiación, plantilla, lanzamientos recientes.
  3. MiMo V2.6 Pro lee todo en un solo contexto de 1M tokens, junto a una captura de cada tabla de precios, y razona sobre texto e imagen juntos en vez de sobre una transcripción OCR.
  4. PPT API convierte la conclusión en una presentación.

La alternativa implica cuatro proveedores, cuatro claves, cuatro facturas y una capa de integración que mantienes tú. Esa integración es el coste que elimina esta pila, y suele ser la razón por la que una demo de agente no se convierte en producto.

Inicio rápido​

Tres pasos desde cero hasta una respuesta.

1. Obtén una clave de API desde tu cuenta en Felo API Platform y expórtala.

export FELO_API_KEY="YOUR_API_KEY"

2. Haz tu primera solicitud. El model ID es mimo-v2.6-pro.

curl https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between sparse and dense attention."}
]
}'

O usando el SDK de OpenAI, cambiando solo la URL base:

import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ["FELO_API_KEY"],
base_url="https://openapi.felo.ai/api/v1",
)

completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[{"role": "user", "content": "Explain the tradeoffs between sparse and dense attention."}],
max_tokens=1024,
)
print(completion.choices[0].message.content)

3. Activa el streaming añadiendo stream: true.

curl -N https://openapi.felo.ai/api/v1/chat/completions \
-H "Authorization: Bearer $FELO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"stream": true,
"messages": [{"role": "user", "content": "Hello"}]
}'

Un apunte práctico para trabajos multi-turno: este modelo razona. Si tu protocolo o ruta expone controles de razonamiento, conserva los metadatos de razonamiento que recibes y pásalos al continuar la conversación. Perderlos a mitad del hilo es la forma más común de que un modelo de razonamiento rinda peor de lo que puede.

Una clave de Felo API enruta a MiMo V2.6 Pro en los endpoints Chat Completions, Responses y Messages compatibles con Anthropic

El cálculo de costes​

Aquí es donde MiMo V2.6 Pro se gana su lugar. Tarifas publicadas de Felo OpenAPI, por millón de tokens:

ModeloEntrada / MSalida / M
GPT-6 Astra$10.00$50.00
Claude Opus 5.5$4.00$20.00
GPT-6 Sol$2.00$10.00
MiMo V2.6 Pro$0.43$0.87
DeepSeek V4.1 Flash$0.15$0.60
GLM 5.3 Flash$0.15$0.50

Esas son las tarifas publicadas de Felo OpenAPI para todo el catálogo, lo que permite una comparación justa: misma plataforma, misma clave, misma factura. Para MiMo V2.6 Pro, el número coincide con el precio de lista de Xiaomi, $0.435 entrada y $0.87 salida. La ruta pasa el modelo a precio de lista, sin recargo.

Ahora calcula con una carga de trabajo realista de agente. Supón que tu bucle lee un fragmento de repositorio de 200,000 tokens, produce 20,000 tokens de cambios y ejecuta 50 veces al día:

  • 10M tokens de entrada por día, 1M tokens de salida por día
  • En GPT-6 Astra: $100 + $50 = $150 al día
  • En Claude Opus 5.5: $40 + $20 = $60 al día
  • En MiMo V2.6 Pro: $4.30 + $0.87 = $5.17 al día

Eso cuesta unas 29 veces menos que GPT-6 Astra para el mismo tipo de trabajo, en un modelo que Xiaomi afirma que se sitúa cerca de Claude Opus 5 y GPT-5.6 Sol en benchmarks de agentes. La afirmación es del fabricante; el precio es un hecho. Si la afirmación se cumple aunque sea en dos tercios, la economía de los agentes cambia.

El efecto secundario importa más que el ahorro en sí. Cuando un bucle cuesta $5 al día en vez de $150, dejas de recortar contexto para ahorrar. Dejas de bajar a un modelo más débil para los pasos rutinarios. Permites que corra de nuevo con un prompt más grande. La mayoría de los problemas de calidad de agentes son problemas de presupuesto disfrazados.

Dónde encaja y dónde no​

Úsalo cuando necesites razonamiento multimodal sobre imágenes, video o audio; análisis de largo contexto donde todo el documento debe permanecer visible; tareas de agente que consumen tokens todo el día; comprensión de video; o cuando busques un modelo open-weights cuyo comportamiento puedas inspeccionar y cuyos pesos puedas auto-hospedar después.

No lo uses cuando necesites el máximo nivel en razonamiento y el coste no sea el límite. Xiaomi lo dice: Claude Fable 5.1 y GPT-6 Astra siguen por delante. Si ejecutas una tarea crítica al día, paga por el frontier.

Una advertencia antes de cambiar un endpoint sensible a latencia: Felo clasifica la latencia de esta ruta como deep, lo que significa que razona antes de responder. Es la decisión adecuada para análisis y planificación de agentes, y la equivocada para autocompletar o chat en tiempo real, donde una capa rápida resulta mejor.

En resumen: este es el modelo para obtener la mayor parte de la calidad sin la mayor parte de la factura. La factura es lo que se acumula.

Preguntas frecuentes​

¿MiMo V2.6 Pro es igual que MiMo V2.6 Flash? No. Flash es la versión más barata y rápida de la misma generación, y no está disponible actualmente en Felo OpenAPI. Pro es la ruta insignia.

¿Qué endpoint debo usar? Si ya usas un SDK de OpenAI, utiliza Chat Completions en https://openapi.felo.ai/api/v1/chat/completions. Si usas un cliente estilo Claude, usa la superficie compatible con Anthropic en https://openapi.felo.ai/api. El endpoint Responses sirve para solicitudes de agentes y flujos de trabajo.

¿Soporta uso de herramientas y salida estructurada? Sí. Felo OpenAPI lista razonamiento, herramientas, JSON, streaming y visión como capacidades soportadas para esta ruta. Las definiciones de herramientas siguen el esquema compatible, así que el código de tool-calling existente funciona.

¿Puedo seguir auto-hospedando el modelo? Ese es el objetivo de los pesos abiertos. Xiaomi publicó los pesos y el informe técnico, así que usar la ruta de Felo hoy no te ata mañana.

¿Cómo se compara con los modelos cerrados insignia? La propia Xiaomi lo resume bien: por delante de cualquier otro modelo open-weights, aún por detrás de Claude Fable 5.1 y GPT-6 Astra, y más o menos al nivel de Claude Opus 5 y GPT-5.6 Sol en la mayoría de benchmarks de agentes. La columna clave es la última: capacidad por dólar.

Prueba MiMo V2.6 Pro​

Consigue una clave en Felo API Platform, apunta tu URL base a https://openapi.felo.ai/api/v1, establece el modelo en mimo-v2.6-pro y ejecuta la carga de trabajo que has estado racionando. La página del modelo tiene la especificación completa, precios actuales y ejemplos listos para copiar en TypeScript, Python, cURL y Claude Code.

Explora MiMo V2.6 Pro en Felo OpenAPI →


Esta publicación también está disponible en English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, বাংলা and Português.