Cómo convertir imágenes de GPT Image 2.5 en video con Felo
GPT Image 2.5 crea un primer fotograma confiable. Cómo animarlo con la IA de Imagen a Video de Felo: indicaciones de movimiento, primeros y últimos fotogramas, y costos reales.
Un generador de video aporta movimiento. No entrega el fotograma.
Eso funciona para tomas abstractas. Se rompe cuando el clip debe mostrar tu producto, tu personaje, tu calle o un titular legible. El texto a video pide al modelo que invente tu mundo y lo mueva en una sola pasada, y el mundo inventado cambia entre tomas.
El video a partir de imagen invierte el orden. Construyes el fotograma, lo revisas, lo corriges y solo entonces lo animas. Una imagen entra, una toma sale.
GPT Image 2.5, lanzado por OpenAI el 8 de septiembre de 2026, hace posible este flujo. Su fortaleza es mantener el sujeto estable — el mismo rostro, la misma botella, el mismo titular — y eso es lo que necesita un primer fotograma. La IA de Imagen a Video de Felo toma ese fotograma y lo pone en movimiento.
Esta guía recorre todo el proceso: genera la imagen fija, dirige la toma, controla el final y conoce el costo antes de pulsar generar.

La imagen de portada de este post fue generada con GPT Image 2.5 en Felo. Sin superposiciones de diseño.
Por qué la imagen fija va primero
Un modelo de video lee el fotograma inicial como un contrato. La identidad del sujeto, la composición, los materiales y la dirección del color provienen de la imagen. La indicación solo define qué cambia después.
Esa división explica por qué los flujos de trabajo basados en imagen ganan en trabajos comerciales. Cada propiedad visible en la imagen — la etiqueta del frasco, la forma de la zapatilla, el corte de una chaqueta — permanece porque nadie pidió al modelo de video que la imaginara. El modelo solo mueve.
GPT Image 2.5 encaja en este trabajo por sus mejoras. Las fotos de referencia se mantienen reconocibles entre generaciones. Las ediciones solo modifican lo solicitado, así que una ronda de revisiones aterriza donde apuntas. La luz y la textura se leen como materiales, no solo como superficies, lo que reduce las deformaciones que antes hacían que el video IA resultara extraño. OpenAI redujo la latencia de generación hasta un 50% frente a Images 2.0, y la variante Flare funciona entre 2 y 4 veces más rápido que GPT Image 2 en pruebas internas.
El flujo ya no se limita a recolectar indicaciones; ahora se usa en producción. El patrón aparece donde un equipo ya tiene visuales aprobados: una página de producto que necesita una versión animada para redes, un visual clave de campaña que debe correr en vertical para Reels, un pitch que requiere avances animados de tomas seleccionadas. La imagen fija es el recurso. El video es el formato de entrega.

La imagen fija que inicia el ejemplo de esta guía. Generada con GPT Image 2.5 en Felo. Sin superposiciones de diseño.
El flujo de trabajo de un vistazo
- Crea el fotograma. Genera la imagen inicial en la relación de aspecto en la que vas a publicar. Aquí es donde la fidelidad de GPT Image 2.5 marca la diferencia.
- Pásala a Imagen a Video IA. Sube la imagen, etiqueta lo que controla y describe la toma.
- Elige duración y calidad. La duración y la resolución determinan el precio; ambas aparecen antes de generar.
- Cambia una variable por ronda. Rango de movimiento, velocidad de cámara o pose final. Una por vez.
El resto de la guía desglosa cada paso.
Paso 1: Genera el primer fotograma con GPT Image 2.5
El fotograma que animas define casi todo el resultado, así que trata su generación como el trabajo creativo principal.
Lo que necesita un primer fotograma:
- Un sujeto legible. La persona, el producto o el lugar deben identificarse de inmediato. El modelo de video preserva lo que puede interpretar.
- Espacio para el movimiento. Si el sujeto llena el encuadre y nada más es visible, el vapor no tiene por dónde subir y la cámara no tiene hacia dónde moverse. Deja superficies, cielo o fondo para la acción.
- La relación de aspecto correcta. La imagen adjunta manda: la generación de imagen a video mantiene el encuadre de la foto. ¿Quieres un Reel o un TikTok? Genera en vertical. ¿Un spot de YouTube o un hero para web? Genera en ancho antes de animar.
- Texto corto y claro. GPT Image 2.5 reproduce titulares y etiquetas cortas con precisión real. Limita el texto en pantalla a pocas palabras, porque el texto en cuadro es lo primero que el movimiento suaviza.
Si buscas cómo crear buenas imágenes fijas, la guía de indicaciones para GPT Image 2.5 cubre la estructura en siete partes y doce indicaciones listas para usar. El workspace de Felo ejecuta el modelo gratis en el navegador, sin clave API, sin marca de agua, hasta 4K y con derechos comerciales incluidos.
Un cambio de mentalidad ayuda aquí: la página de la herramienta lo resume — trata la imagen fuente como el primer fotograma, no como un moodboard suelto. Un moodboard deja al modelo adivinando. Un primer fotograma le dice dónde empieza la toma.
Paso 2: Da un rol al fotograma en Imagen a Video IA
Abre Imagen a Video IA y comienza con la imagen fija. La herramienta está disponible para usuarios Pro, y los créditos se descuentan según la duración y calidad del clip generado.
Una sola imagen cubre el caso común: define el sujeto, la composición y el fotograma inicial. La indicación dirige qué se mueve y cómo sigue la cámara.
La herramienta también resuelve situaciones que solo funcionan cuando el material fuente es preciso:
- Primer y último fotograma. Sube una imagen inicial y una final, luego describe la transición. Aquí GPT Image 2.5 demuestra su valor, y la siguiente sección muestra el proceso en detalle.
- Múltiples referencias. Hasta nueve imágenes pueden definir un personaje, detalles de producto, vestuario, escenario, estilo visual o fotograma final. Indica qué aporta cada imagen numerada.
- Imagen, video y audio juntos. Un video de referencia puede aportar movimiento o trabajo de cámara, y el audio puede aportar voz, sonido o ritmo. Una solicitud puede incluir hasta doce archivos de referencia.
El hábito de etiquetar importa más que cualquier ajuste. Una instrucción breve que nombra el rol de cada recurso — "Imagen 1 es el fotograma inicial, Imagen 2 es el fotograma final, Imagen 3 define la ropa del personaje" — resulta más fácil para el modelo y para ti al revisar cuando una toma sale mal.
Paso 3: Escribe la indicación de movimiento como una toma
La página de la herramienta distingue dos tipos de indicaciones. Una pide una acción. La otra describe una toma.
Demasiado abierta: Haz que el vapor del café se mueva.
Toma dirigida: El vapor sube desde la boquilla de una jarra negra mate para café sobre una barra de nogal oscuro al amanecer y se convierte en un remolino lento que atrapa la luz de la ventana. La cámara avanza de un encuadre abierto a un primer plano y se detiene. La luz pasa de gris-azul fría a ámbar cálido mientras avanza la toma, y las dos tazas se llenan de café oscuro. Toma continua, ritmo calmado, termina en un fotograma heroico estable.
La segunda versión responde cinco preguntas que la primera ignora: qué hace el sujeto, hacia dónde va la cámara, qué cambia en el entorno, a qué ritmo avanza la toma y dónde termina.
Dos reglas mantienen las revisiones bajo control:
- Dirige el cambio con la indicación; ancla la identidad con la imagen. La imagen fija define quién y qué aparece. La indicación define lo que sucede después.
- Breve mejor que exhaustivo. Una indicación con un solo movimiento claro resulta más fácil de juzgar y corregir que una lista de cinco acciones en competencia.
Paso 4: Elige duración, calidad y qué cambiar después
Los clips duran entre cuatro y quince segundos, y la duración elegida determina el costo. Hay dos niveles de calidad:
- 768P a 86 créditos por segundo. Aproximadamente US$0.09 por segundo. Nivel de trabajo para redes y borradores.
- 2K a 138 créditos por segundo. Aproximadamente US$0.14 por segundo. Para tomas principales, páginas de producto y cualquier uso donde el cliente hará zoom.
La generación tarda varios minutos y cada solicitud produce un video. Ese ritmo cambia la forma de iterar. En vez de repetir la misma indicación, revisa la toma y cambia solo una cosa: el rango de movimiento, la velocidad de cámara o la pose final. Una variable por ronda te muestra qué causó la diferencia.
Avanzado: deja que GPT Image 2.5 dirija el final
El flujo de primer fotograma anima un momento. El flujo de primer y último fotograma monta una transición — un paquete que se abre, un producto que se ensambla, una escena que pasa de día a noche — y es el mejor argumento para generar ambos fotogramas con GPT Image 2.5.
Así funciona. Genera el fotograma inicial. Luego genera el fotograma final a partir de él como referencia: misma jarra, misma barra, misma posición de cámara, ahora con el vapor en remolino y la luz cálida. Como el modelo conserva el sujeto entre generaciones, los dos fotogramas se leen como un solo momento continuo, no como dos imágenes parecidas.

El fotograma final, generado usando el inicial como referencia. Sube ambos en Imagen a Video IA y describe la transición entre ellos.
Luego describe el trayecto, no el destino: qué cambia, a qué ritmo y qué hace la cámara mientras ocurre. La página de la herramienta sugiere revelados de producto, transformaciones y cambios de escena como los usos ideales — una toma controlada de escenas que antes requerían equipo, slider y una tarde.
Avanzado: storyboard para secuencia
Un solo clip es una toma. Una secuencia es una historia, y los flujos de storyboard con GPT Image 2.5 cierran esa brecha sin tableta de dibujo.

Storyboard de seis paneles generado con GPT Image 2.5 en Felo. Cada panel se convierte en una toma: genera los paneles, anímalos uno a uno y luego monta los clips.
Dale al modelo una escena y una referencia de personaje, y devuelve una cuadrícula de paneles con ángulos y ambiente — storyboards cinematográficos, cuadrículas 3x3 y hojas de personaje son flujos integrados en el workspace. Los paneles mantienen coherencia porque el modelo sostiene estilo y sujeto entre generaciones.
Desde ahí, el flujo es mecánico. Anima el panel uno, el dos, el tres. Mantén cada clip en un solo momento continuo. Móntalos y tendrás una secuencia donde cada fotograma fue aprobado antes de moverse.
Cuánto cuesta
La generación de imágenes en el workspace de GPT Image 2.5 comienza gratis — créditos diarios, sin tarjeta, sin marca de agua, derechos comerciales incluidos. La generación de video es una función Pro y cada clip consume créditos por segundo:
| Duración del video | 2K | 768P |
|---|---|---|
| 5 segundos | 690 créditos · aprox. US$0.69 | 430 créditos · aprox. US$0.43 |
| 10 segundos | 1,380 créditos · aprox. US$1.38 | 860 créditos · aprox. US$0.86 |
| 15 segundos | 2,070 créditos · aprox. US$2.07 | 1,290 créditos · aprox. US$1.29 |
La tabla usa aproximadamente 1,000 créditos como US$1, y las tarifas mostradas son ofertas por tiempo limitado. Tu workspace muestra la estimación antes de generar.
Compara esos números con la ruta tradicional. Una toma de producto de diez segundos con equipo, locación y edición cuesta más que lo que la mayoría de equipos gasta en un mes de software — y toma una semana, no una tarde de iteraciones. Un clip de diez segundos en 768P aquí cuesta unos US$0.86.
Una imagen fija aprobada cuesta menos de corregir que un video equivocado. Esa es toda la razón para generar primero el fotograma.
Preguntas frecuentes
¿GPT Image 2.5 es gratis? Sí. El modelo funciona gratis en Felo con créditos diarios y sin tarjeta. La generación de video está disponible para usuarios Pro y consume créditos según la duración y calidad del clip.
¿Qué relación de aspecto debe tener la imagen fuente? El encuadre de la imagen fija manda. La generación de imagen a video mantiene la composición de la foto, así que genera en vertical para Reels, Shorts y TikTok, y en ancho para YouTube, anuncios y hero web.
¿Cuánto tarda un clip? Varios minutos. Una solicitud produce un video, y el resultado aparece en tu workspace cuando está listo.
¿Puedo mantener el mismo personaje o producto en varios clips? Sí. Adjunta imágenes de referencia — hasta nueve — e indica qué controla cada una. Este es el uso más fuerte de la fidelidad de referencia de GPT Image 2.5: crea el personaje una vez y lleva esa identidad a cada toma.
Empieza con una imagen fija
El modelo de video solo puede mover lo que le da el fotograma. Así que haz que cuente: sujeto nítido, espacio para moverse, la forma adecuada para el canal y texto lo bastante corto para sobrevivir al movimiento.
Genera el primer fotograma gratis en Felo — luego llévalo a Imagen a Video IA y dirige los próximos cinco segundos.
Esta publicación también está disponible en English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, বাংলা and Português.