Công bố ngày 30 tháng 9 năm 2026 · Triển khai theo từng giai đoạn

Gemini 4 Argonnghiên cứu dài, viết ra trọn vẹn

Mô hình hàng đầu đầu tiên của Google kể từ Gemini 3, được xây cho suy luận sâu trong những việc dài, nhiều bước. Nó nâng trần đầu ra từ 64K token lên 1M, và các con số Google công bố nổi bật ở công việc tri thức hơn là lập trình.

Felo API đang trong giai đoạn beta kín — quyền truy cập Gemini 4 Argon sẽ sớm được mở.

Hình chủ đạo của Gemini 4 Argon: tên mô hình bên cạnh con số 4 lớn trên nền chuyển sắc xanh dương
Hình ảnh từ thông báo của Google. Argon ra mắt theo một hệ thống đặt tên mới chứ không phải bản cập nhật của dòng Gemini 4.0, nên tên không kèm số phiên bản.
1M
Token đầu ra tối đa
Tăng từ 64K — một báo cáo đầy đủ được tạo ra trong một mạch.
2 $ / 10 $
Giá API giai đoạn đầu
Mỗi triệu token đầu vào và đầu ra. Đầu vào lưu đệm giảm 95%.
77.9%
DeepSWE v1.1
Điểm Google báo cáo, cao hơn Claude Opus 5.5 và GPT-6 Astra.
15%
Tỷ lệ ảo giác
Mức thấp nhất mà Artificial Analysis đo được trong nhóm mô hình hàng đầu.

Hình ảnh và biểu đồ trên trang này đến từ các tổ chức đã công bố chúng, gồm Google, Arena.ai và Artificial Analysis; tất cả đều được giữ nguyên, không chỉnh sửa.

Trạng thái triển khai

Argon chưa mở cho tất cả. Đây là thứ tự nó xuất hiện.

Google phát hành Argon theo từng giai đoạn, và giai đoạn đầu không dành cho công chúng. Quyền truy cập trong Felo đang được chuẩn bị song song với đợt triển khai này.

Đã có

Đội phòng thủ an ninh mạng được chọn

Các đối tác được chọn trong Fairwind Program của Google nhận Argon trước tiên, và nhận mà không có rào chắn an ninh mạng.

Công bố tiếp theo

Khách hàng API trả phí và Google AI Ultra

Google cho biết quyền truy cập rộng hơn bắt đầu từ đây. Chưa có ngày cụ thể, và chỉ có gói đăng ký thì hôm nay vẫn chưa được dùng.

Chưa có lịch

Nhà phát triển, doanh nghiệp và người dùng

Nối tiếp các bậc trả phí. Google chưa cam kết mốc thời gian cho việc mở rộng đại chúng.

Quyền truy cập Argon trong Felo Search đang được triển khai. Trang này sẽ được cập nhật khi mở.

Thế mạnh

Một mô hình làm xong việc dài, không phải để trả lời nhanh

Những điểm mạnh được công bố của Argon tập trung vào đọc, suy luận và viết dài. Đó là hình dạng khác với các mô hình hàng đầu lấy lập trình làm trọng tâm mà nó hay được đem ra so.

Suy luận trụ được qua một việc dài

Google định vị Argon cho việc nhiều bước kéo dài hàng giờ, nơi các mô hình trước đó lệch hướng hoặc dừng quá sớm.

1M token đầu ra trong một lượt

Lý do Google đưa ra: một mô hình có chỗ để nghĩ dài có thể giải bài khó trong một mạch thay vì nhiều vòng qua lại.

Công việc tri thức dẫn đầu, không phải lập trình

Khoảng cách được báo cáo rộng nhất nằm ở Harvey's Legal Agent Benchmark và Vals Finance Agent v2 — phân tích pháp lý và tài chính thật, không phải bài tập tổng hợp.

Truy xuất ngữ cảnh dài vẫn vững

Trên GraphWalks, bài kiểm tra xem mô hình có thực sự dùng được ngữ cảnh 256K đến 1M hay không, Google báo cáo mức dẫn trước hơn mười điểm so với các mô hình đầu bảng khác.

Hiểu video dài

LVBench, bài đo mức hiểu video dài, được báo cáo ở 91.7% — điểm cao nhất Google liệt kê cho Argon.

Biểu đồ cột của Harvey's Legal Agent Benchmark: Gemini 4 Argon 19.6%, Claude Fable 5.1 6.7%, GPT-6 Astra 5.4%, Claude Opus 5.5 3.8%
Công việc pháp lý dài hơi. Mức 19.6% của Argon gần gấp ba mô hình kế tiếp, và đây là khoảng cách rộng nhất trong bộ số liệu Google công bố.
Biểu đồ cột của Vals Finance Agent v2: Gemini 4 Argon 65.4%, Claude Fable 5.1 58.9%, Claude Opus 5.5 58.6%, GPT-6 Astra 53.5%
Nghiên cứu và phân tích tài chính, đạt 65.4% so với nhóm 53.5–58.9%. Mức dẫn trước hẹp hơn so với công việc pháp lý, nhưng thứ tự vẫn vậy.

Số liệu đã công bố

Argon đứng ở đâu trên chính các benchmark của Google

Đây là kết quả do nhà cung cấp báo cáo. Google chưa công bố thiết lập thinking hay effort cho các điểm số chính, và chưa phòng thí nghiệm độc lập nào lặp lại được.

Benchmark
Đo điều gì
Argon
So sánh gần nhất
DeepSWE v1.1
Kỹ thuật phần mềm dài hơi
77.9%
Opus 5.5 ở 74.2%, GPT-6 Astra ở 74.1%
CWE-bench v1
Tìm và vá lỗ hổng
68%
Đồng hạng nhất
AutomationBench
Việc doanh nghiệp đầu-cuối, từ Zapier
51.3%
Xếp thứ nhất
LVBench
Hiểu video dài
91.7%
Điểm cao nhất Google báo cáo cho Argon

Hãy coi đây là chỉ dấu về hướng. Benchmark của nhà cung cấp hiếm khi giữ nguyên khi gặp khối lượng công việc thật, và Bloomberg đưa tin rằng một số nhân viên Google cũng hoài nghi liệu lợi thế benchmark có chuyển thành việc thật hay không.

Biểu đồ cột của DeepSWE v1.1: Gemini 4 Argon 77.9%, Claude Opus 5.5 74.2%, GPT-6 Astra 74.1%, Claude Fable 5.1 67.4%
Kỹ thuật phần mềm dài hơi. Con số nổi bật 77.9%, với cả hai đối thủ gần nhất đều nằm trong khoảng bốn điểm.
Biểu đồ cột của AutomationBench: Gemini 4 Argon 51.3%, Claude Opus 5.5 42.5%, GPT-6 Astra 41.4%, Claude Fable 5.1 31.4%
Việc doanh nghiệp đầu-cuối do Zapier xây dựng. Argon vượt mốc 50% trong khi mọi mô hình khác trong phần so sánh đều chỉ ở mức ba mươi hoặc đầu bốn mươi.
Bảng xếp hạng CWE-bench v1: Gemini 4 Argon, Grok và GPT-6 Astra đồng hạng ở 68%, Claude Opus 5.5 ở 67%, giảm dần đến Inkling ở 37%
Phát hiện lỗ hổng ở Pass@1. Argon đồng hạng ở đỉnh của một bảng xếp hạng dày đặc chứ không tạo ra khoảng cách, đó là lý do bảng phía trên gọi đây là đồng hạng nhất.
Bảng kết quả đầy đủ của Gemini 4 Argon do Google công bố trên 16 benchmark, chia thành công việc tri thức, lập trình agent, kỹ thuật ML, khoa học và toán, ngữ cảnh dài, sử dụng máy tính, hiểu đa phương thức và an ninh mạng
Bảng đầy đủ từ thông báo, với các ô Argon dẫn đầu màu xanh dương và các ô đối thủ dẫn đầu màu xám. Những hàng Argon không dẫn đầu là FrontierSWE v2, Terminal-Bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 và OSWorld-2.0.
Biểu đồ cột tỷ lệ ảo giác AA-Omniscience của Artificial Analysis trên 36 mô hình, xếp từ thấp đến cao: Gemini 4 Argon (High) ở 15%, tiếp theo là MiniMax-M3 ở 18%, Kimi K2.5 ở 26%, và tăng dần đến DeepSeek-V4 Flash ở 96%
Đo lường độc lập của Artificial Analysis, và là con số duy nhất trên trang này không do nhà cung cấp nào đưa ra: tần suất mỗi mô hình trả lời sai thay vì từ chối trả lời. Con số 15% của Argon là thấp nhất trong 36 mô hình được đưa vào biểu đồ; thang đo kéo dài đến 96%.
Bảng xếp hạng Text Arena và Code Arena: WebDev của Arena.ai đặt cạnh nhau: Gemini 4 Argon đứng thứ 1 ở Text Arena với 1625, và thứ 8 ở Code Arena: WebDev với 1679
Hai thứ hạng mà đoạn văn trên dựa vào, đến từ bảng xếp hạng do cộng đồng bình chọn của Arena.ai. Argon đứng đầu trong 25 mô hình được liệt kê của Text Arena; ở Code Arena: WebDev, nó đứng thứ tám, sau bốn mô hình Claude và ba mô hình thuộc dòng GPT-6 của OpenAI.

Trên Felo

Quy trình nghiên cứu trông thế nào với một mô hình viết 1M token

Felo ghép tìm kiếm với hiểu tài liệu, nên một mô hình đầu ra dài thay đổi những gì một phiên làm việc tạo ra.

Nghiên cứu kết thúc bằng một tài liệu

Thu thập nguồn, rồi để mô hình viết phần tổng hợp trong một lượt thay vì ghép từng mục qua nhiều câu lệnh.

Cả bộ tài liệu trong một tác vụ

Truy xuất ngữ cảnh dài là năng lực mạnh nhất của Argon, và đó là thứ khiến các bộ hợp đồng, hồ sơ nộp và báo cáo dài trở nên xử lý được.

Viết nháp khi giọng điệu quan trọng

Hồ sơ được báo cáo của Argon — văn bản mạnh, lập trình ở mức vừa — hợp với những nhóm cần câu chữ đọc như được viết ra, không phải ghép lại.

Chi phí

Argon tốn bao nhiêu, và điều gì thay đổi về sau

Google công bố một mức giá giai đoạn đầu và một mức giá niêm yết cao hơn, mà không nói khi nào chuyển. Hãy lập ngân sách theo con số cao hơn.

Loại token
Giai đoạn đầu
Về sau
Đầu vào
2.00 $ / M
4.00 $ / M
Đầu vào lưu đệm
giảm 95%
giảm 95%
Đầu ra
10.00 $ / M
20.00 $ / M

Để so sánh, mức giá giai đoạn đầu tương đương GPT-6.1 Sol và Sonnet 5.5, và bằng khoảng một phần năm GPT-6 Astra. Đây là giá niêm yết, không phải chi phí đo được cho mỗi tác vụ — Argon trả lời câu hỏi khó hơn, nên một lượt chạy vẫn có thể tốn hơn.

Cách làm việc với Argon trên Felo

01

Đưa cả câu hỏi vào

Đưa cho Felo cả bộ tài liệu hoặc cả mạch trao đổi dài, không phải bản tóm tắt. Lợi thế của Argon bắt đầu từ chỗ ngữ cảnh không còn vừa một câu lệnh.

02

Xin thẳng sản phẩm hoàn chỉnh

Với trần đầu ra 1M token, bạn có thể yêu cầu cả báo cáo hay bản nháp đầy đủ trong một chỉ dẫn thay vì chia từng phần.

03

Đối chiếu với nguồn

Felo giữ trích dẫn gắn với câu trả lời, và đó là thứ khiến một tài liệu dài do mô hình tạo ra có thể kiểm chứng được.

Quyền truy cập Argon trong Felo Search đang được triển khai. Trước khi mở, mọi mô hình khác trong danh sách của Felo đã dùng được ngay.

Mở Felo AI Search

Gemini 4 Argon: câu hỏi thường gặp

Chưa phổ thông. Google phát hành Argon trước cho các đối tác được chọn trong Fairwind Program, và cho biết quyền truy cập rộng hơn sẽ bắt đầu từ khách hàng API trả phí cùng người dùng Google AI Ultra. Chưa có ngày nào được công bố cho giai đoạn đó, và gói trả phí hôm nay vẫn chưa mở được quyền truy cập.

Dùng thử các mô hình hàng đầu của Google trên Felo

Tìm, đọc và viết bằng mô hình hợp với việc. Argon sẽ vào danh sách khi đợt triển khai tới Felo.

Mở Felo AI Search

Không cần thẻ tín dụng để dùng Felo AI Search.