Skip to main content

Cách biến ảnh GPT Image 2.5 thành video trên Felo

· 14 phút đọc
Felo Search Tips Buddy
Committed to answers at your fingertips

GPT Image 2.5 tạo ra khung hình đầu tiên đáng tin cậy. Cách tạo chuyển động cho nó với AI Image to Video của Felo — hướng dẫn chuyển động, khung hình đầu và cuối, và chi phí thực tế.

Trình tạo video mang lại chuyển động. Nó không tạo ra khung hình.

Điều này phù hợp với cảnh trừu tượng. Nhưng khi đoạn phim cần thể hiện sản phẩm, nhân vật, con phố hoặc tiêu đề rõ ràng, cách này không còn hiệu quả. Text-to-video yêu cầu mô hình tự tạo thế giới của bạn và chuyển động trong một lần, và thế giới đó thay đổi giữa các lần tạo.

Video bắt đầu từ ảnh đảo ngược quy trình. Bạn tạo khung hình, kiểm tra, chỉnh sửa, rồi mới chuyển sang bước tạo chuyển động. Một ảnh vào, một cảnh quay ra.

GPT Image 2.5, do OpenAI phát hành ngày 8 tháng 9 năm 2026, là mô hình giúp quy trình này thực tế hơn. Điểm mạnh của nó là giữ chủ thể ổn định — cùng khuôn mặt, cùng chai nước, cùng tiêu đề — và đó là điều khung hình đầu tiên cần. AI Image to Video của Felo nhận khung hình này và tạo chuyển động cho nó.

Hướng dẫn này đi qua toàn bộ quy trình: tạo ảnh tĩnh, chỉ đạo cảnh quay, kiểm soát kết thúc, và biết chi phí trước khi nhấn tạo.

Ảnh bìa: bản in ảnh bình pha cà phê, điện thoại phát cùng cảnh, và dải phim các khung hình liên tiếp trên bàn tối

Ảnh bìa của bài viết này được tạo bằng GPT Image 2.5 trên Felo. Không có lớp thiết kế chồng lên.

Vì sao cần tạo ảnh tĩnh trước

Mô hình video xem khung hình đầu như một cam kết. Danh tính chủ thể, bố cục, chất liệu, hướng màu sắc đều lấy từ ảnh. Prompt chỉ quyết định điều gì thay đổi tiếp theo.

Sự phân chia này giúp quy trình bắt đầu từ ảnh phù hợp với công việc thương mại. Mọi chi tiết bạn thấy trên ảnh tĩnh — nhãn trên lọ, dáng giày, kiểu áo khoác — đều giữ lại vì không ai yêu cầu mô hình video tự tưởng tượng. Mô hình chỉ có một nhiệm vụ: tạo chuyển động.

GPT Image 2.5 phù hợp với nhiệm vụ này nhờ các cải tiến. Ảnh tham chiếu giữ nguyên nhận diện qua nhiều lần tạo. Chỉnh sửa chỉ thay đổi đúng ý bạn, nên mỗi vòng sửa đều đi đúng hướng. Ánh sáng và chất liệu thể hiện rõ vật liệu, không còn cảm giác méo mó như trước đây. OpenAI giảm thời gian tạo ảnh tới 50% so với Images 2.0, và bản Flare chạy nhanh hơn GPT Image 2 khoảng 2 đến 4 lần trong thử nghiệm nội bộ.

Quy trình đã vượt qua giai đoạn thử prompt, chuyển sang sản xuất thực tế. Mô hình này xuất hiện ở nơi đội ngũ đã có hình ảnh duyệt: trang sản phẩm cần bản chuyển động cho quảng cáo, key visual chiến dịch cần chạy dọc trên Reels, phim giới thiệu cần preview chuyển động cho các cảnh chọn lọc. Ảnh tĩnh là tài sản. Video là định dạng chuyển giao.

Khung hình mở đầu cho hướng dẫn này: bình pha cà phê đen nhám trên mặt bàn gỗ óc chó tối lúc bình minh, ánh sáng xanh dịu từ cửa sổ, làn hơi nước mỏng

Ảnh tĩnh mở đầu ví dụ trong hướng dẫn này. Tạo bằng GPT Image 2.5 trên Felo. Không có lớp thiết kế chồng lên.

Quy trình tổng quan

  1. Tạo khung hình. Tạo ảnh mở đầu theo tỷ lệ bạn định xuất bản. Đây là bước GPT Image 2.5 phát huy độ chính xác.
  2. Chuyển sang AI Image to Video. Tải ảnh lên, gắn nhãn vai trò, mô tả cảnh quay.
  3. Chọn độ dài và chất lượng. Thời lượng và độ phân giải quyết định giá; cả hai đều hiển thị trước khi tạo.
  4. Chỉ thay đổi một yếu tố mỗi lần. Phạm vi chuyển động, tốc độ camera, hoặc tư thế kết thúc. Mỗi lần một yếu tố.

Phần còn lại của hướng dẫn sẽ phân tích từng bước.

Bước 1: Tạo khung hình đầu với GPT Image 2.5

Khung hình bạn chọn để tạo chuyển động quyết định phần lớn kết quả, nên hãy xem việc tạo ảnh là công đoạn sáng tạo chính.

Khung hình đầu cần có:

  • Chủ thể rõ ràng. Người, sản phẩm hoặc địa điểm phải nhận diện ngay. Mô hình video sẽ giữ lại những gì nó nhận ra.
  • Không gian cho chuyển động. Nếu chủ thể chiếm hết khung hình, không còn chỗ cho hơi nước bốc lên hay camera di chuyển. Để lại bề mặt, bầu trời hoặc nền cho hành động.
  • Tỷ lệ phù hợp. Ảnh đính kèm quyết định: chuyển ảnh thành video giữ nguyên bố cục. Muốn làm Reel hoặc TikTok? Tạo ảnh dọc. Quảng cáo YouTube hoặc banner trang web? Tạo ảnh ngang trước khi chuyển động.
  • Chữ ngắn, dễ đọc. GPT Image 2.5 thể hiện tiêu đề và nhãn ngắn rất chính xác. Giữ nội dung trên màn hình chỉ vài từ, vì chữ trong khung là thứ đầu tiên bị mờ khi chuyển động.

Nếu bạn muốn học cách viết prompt cho ảnh tĩnh đẹp, hướng dẫn prompt GPT Image 2.5 trình bày khung bảy phần và mười hai prompt mẫu. Workspace Felo cho phép chạy mô hình miễn phí trên trình duyệt, không cần API key, không watermark, xuất tối đa 4K, và có quyền thương mại.

Một thay đổi tư duy quan trọng: trang công cụ đã nói rõ — hãy xem ảnh nguồn là khung hình đầu, không phải mood board. Mood board khiến mô hình đoán mò. Khung hình đầu chỉ rõ điểm bắt đầu của cảnh quay.

Bước 2: Giao nhiệm vụ cho ảnh trong AI Image to Video

Mở Image to Video AI và bắt đầu với ảnh tĩnh. Công cụ này dành cho người dùng Pro, tính phí theo độ dài và chất lượng clip bạn tạo.

Một ảnh duy nhất đáp ứng trường hợp phổ biến: xác định chủ thể, bố cục, khung hình mở đầu. Prompt sẽ chỉ đạo chuyển động tiếp theo và cách camera di chuyển.

Công cụ cũng hỗ trợ các thiết lập cần nguồn ảnh chính xác:

  • Khung hình đầu và cuối. Tải lên ảnh mở đầu và ảnh kết thúc, rồi mô tả chuyển đổi. Đây là lúc GPT Image 2.5 phát huy tác dụng, phần tiếp theo sẽ hướng dẫn chi tiết.
  • Nhiều ảnh tham chiếu. Tối đa chín ảnh có thể xác định nhân vật, chi tiết sản phẩm, trang phục, bối cảnh, phong cách hình ảnh hoặc khung hình kết thúc. Nêu rõ vai trò từng ảnh.
  • Kết hợp ảnh, video, âm thanh. Video tham chiếu có thể cung cấp chuyển động hoặc góc máy, âm thanh cung cấp giọng nói, nhạc nền hoặc nhịp điệu. Một yêu cầu có thể đính kèm tối đa mười hai tệp tham chiếu.

Thói quen gắn nhãn quan trọng hơn mọi thiết lập. Một chỉ dẫn ngắn nêu rõ vai trò từng tài sản — "Ảnh 1 là khung hình mở đầu, Ảnh 2 là khung hình kết thúc, Ảnh 3 xác định trang phục nhân vật" — giúp mô hình dễ hiểu và bạn dễ sửa khi kết quả chưa đúng.

Bước 3: Viết prompt chuyển động như một cảnh quay

Trang công cụ phân biệt hai loại prompt. Một loại chỉ yêu cầu hành động. Loại còn lại mô tả cảnh quay.

Quá chung chung: Làm cho hơi cà phê chuyển động.

Cảnh quay có chỉ đạo: Hơi nước bốc lên từ vòi bình pha cà phê đen nhám trên bàn gỗ óc chó tối lúc bình minh, tạo thành vòng xoáy chậm bắt ánh sáng cửa sổ. Camera tiến từ góc rộng đến cận cảnh, rồi giữ nguyên. Ánh sáng chuyển từ xanh xám sang vàng ấm khi cảnh phát triển, hai tách đầy cà phê đen. Một cảnh quay liên tục, nhịp độ chậm, kết thúc bằng khung hình hero ổn định.

Phiên bản thứ hai trả lời năm câu hỏi mà phiên bản đầu bỏ qua: chủ thể làm gì, camera di chuyển ra sao, môi trường thay đổi thế nào, tốc độ phát triển cảnh, và điểm kết thúc.

Hai quy tắc giúp tiết kiệm chi phí chỉnh sửa:

  • Chỉ đạo thay đổi bằng prompt; giữ nhận diện bằng ảnh. Ảnh tĩnh quyết định ai và cái gì xuất hiện. Prompt quyết định điều gì xảy ra tiếp theo.
  • Ngắn gọn hơn là đầy đủ. Prompt chỉ có một chuyển động rõ ràng sẽ dễ đánh giá và sửa hơn danh sách năm hành động cạnh tranh.

Bước 4: Chọn độ dài, chất lượng và yếu tố cần thay đổi

Clip kéo dài từ bốn đến mười lăm giây, độ dài bạn chọn quyết định chi phí. Có hai mức chất lượng:

  • 768P với 86 credit mỗi giây. Khoảng 0,09 USD mỗi giây. Phù hợp cho bản nháp, cắt cho mạng xã hội.
  • 2K với 138 credit mỗi giây. Khoảng 0,14 USD mỗi giây. Dùng cho cảnh hero, trang sản phẩm, hoặc bất kỳ nơi nào khách hàng cần phóng to.

Thời gian tạo mất vài phút, mỗi yêu cầu tạo ra một video. Quy trình này thay đổi cách bạn lặp lại. Thay vì lặp lại cùng prompt, hãy xem kết quả và thay đổi một yếu tố: phạm vi chuyển động, tốc độ camera, hoặc tư thế kết thúc. Mỗi lần chỉ thay đổi một biến để biết nguyên nhân khác biệt.

Nâng cao: để GPT Image 2.5 chỉ đạo kết thúc

Quy trình bắt đầu từ khung hình đầu tạo chuyển động cho một khoảnh khắc. Quy trình dùng cả khung hình đầu và cuối dàn dựng chuyển đổi — mở hộp, lắp ráp sản phẩm, chuyển cảnh ngày sang đêm — và đây là lý do nên tạo cả hai khung hình bằng GPT Image 2.5.

Cách thực hiện: Tạo khung hình mở đầu. Sau đó tạo khung hình kết thúc từ ảnh này làm tham chiếu: cùng bình cà phê, cùng bàn, cùng góc máy, giờ hơi nước xoáy lên và ánh sáng chuyển sang ấm. Vì mô hình giữ chủ thể qua nhiều lần tạo, hai khung hình liền mạch như một khoảnh khắc thay vì hai ảnh rời rạc.

Khung hình kết thúc khớp: cùng bình và bàn, hơi nước xoáy trong ánh sáng vàng ấm, tách đã đầy cà phê

Khung hình kết thúc, tạo từ khung hình mở đầu làm tham chiếu. Tải cả hai lên Image to Video AI và mô tả chuyển đổi giữa chúng.

Sau đó mô tả hành trình, không phải điểm đến: điều gì thay đổi, tốc độ ra sao, camera làm gì trong quá trình đó. Trang công cụ gợi ý các cảnh lột xác sản phẩm, biến đổi, chuyển cảnh — cách kiểm soát những cảnh từng cần cả ê-kíp, slider và nguyên buổi chiều.

Nâng cao: storyboard thành chuỗi cảnh

Một clip là một cảnh quay. Một chuỗi là một câu chuyện, và quy trình storyboard với GPT Image 2.5 giúp tạo chuỗi mà không cần bảng vẽ.

Storyboard sáu khung: cùng cảnh bình cà phê từ sáu góc — toàn cảnh, trung cảnh, cận cảnh, từ trên xuống, rót cà phê, và hero

Storyboard sáu khung tạo bằng GPT Image 2.5 trên Felo. Mỗi khung thành một cảnh: tạo các khung, chuyển động từng cái, rồi ghép clip lại.

Cung cấp cho mô hình một cảnh và ảnh tham chiếu nhân vật, mô hình trả về lưới storyboard với góc máy và cảm xúc — storyboard điện ảnh, lưới 3x3, và sheet nhân vật là quy trình có sẵn trên workspace. Các khung nhất quán vì mô hình giữ phong cách và chủ thể qua nhiều lần tạo.

Từ đó quy trình trở nên cơ học. Chuyển động khung một, khung hai, khung ba. Mỗi clip chỉ một khoảnh khắc liên tục. Ghép lại, bạn có chuỗi cảnh mà từng khung đều được duyệt trước khi chuyển động.

Chi phí

Tạo ảnh trên workspace GPT Image 2.5 miễn phí — credit hàng ngày, không cần thẻ, không watermark, có quyền thương mại. Tạo video là tính năng Pro, mỗi clip tính phí theo giây:

Độ dài video2K768P
5 giây690 credit · khoảng 0,69 USD430 credit · khoảng 0,43 USD
10 giây1.380 credit · khoảng 1,38 USD860 credit · khoảng 0,86 USD
15 giây2.070 credit · khoảng 2,07 USD1.290 credit · khoảng 1,29 USD

Bảng giá quy đổi khoảng 1.000 credit thành 1 USD, mức giá trên là ưu đãi giới hạn thời gian. Workspace của bạn sẽ hiển thị ước tính trước khi tạo.

So sánh với cách truyền thống. Một cảnh sản phẩm 10 giây với ê-kíp quay, địa điểm, hậu kỳ tốn nhiều hơn cả tháng dùng phần mềm — và mất cả tuần, không phải một buổi chiều thử nghiệm. Một clip 10 giây 768P ở đây chỉ khoảng 0,86 USD.

Một ảnh tĩnh đã duyệt sửa rẻ hơn một video sai. Đó là lý do nên tạo khung hình trước.

FAQ

GPT Image 2.5 có miễn phí không? Có. Mô hình chạy miễn phí trên Felo với credit hàng ngày, không cần thẻ. Tạo video dành cho người dùng Pro và tính phí theo độ dài, chất lượng clip.

Tỷ lệ ảnh nguồn nên là gì? Bố cục ảnh tĩnh quyết định. Chuyển ảnh thành video giữ nguyên bố cục, nên tạo ảnh dọc cho Reels, Shorts, TikTok, và ảnh ngang cho YouTube, quảng cáo, banner trang web.

Một clip mất bao lâu? Vài phút. Mỗi yêu cầu tạo một video, kết quả sẽ xuất hiện trong workspace khi sẵn sàng.

Có giữ được cùng nhân vật hoặc sản phẩm qua nhiều clip không? Có. Đính kèm tối đa chín ảnh tham chiếu và nêu rõ vai trò từng ảnh. Đây là điểm mạnh nhất của GPT Image 2.5 về độ nhất quán: tạo nhân vật một lần, dùng cho mọi cảnh quay.

Bắt đầu từ ảnh tĩnh

Mô hình video chỉ có thể chuyển động những gì khung hình cung cấp. Hãy đầu tư cho khung hình: chủ thể sắc nét, không gian chuyển động, tỷ lệ phù hợp kênh, và chữ đủ ngắn để không bị mờ khi chuyển động.

Tạo khung hình đầu miễn phí trên Felo — sau đó chuyển sang Image to Video AI và chỉ đạo năm giây tiếp theo.


Bài viết này cũng có sẵn bằng English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Türkçe, Italiano, ไทย, Español, বাংলা and Português.