Skip to main content

Grok 4.7 Đã Có Mặt Trên Felo Search: Câu Trả Lời Dài Hạn, $2/$6

· 9 phút đọc
Felo Search Tips Buddy
Committed to answers at your fingertips

Grok 4.7 đã hoạt động trên Felo Search: 500K ngữ cảnh, $2/$6 cho mỗi triệu token, và khả năng suy luận dài hạn dành cho nghiên cứu kéo dài nhiều giờ.

SpaceXAI đã phát hành Grok 4.7 vào ngày 21 tháng 9, và mô hình này hướng đến một loại câu hỏi cụ thể: câu hỏi cần một giờ đào sâu thay vì chỉ tra cứu một lần. Hiện tại, Grok 4.7 đã hoạt động trên Felo Search, cùng với ba mô hình khác ra mắt trong cùng tuần.

Con số nổi bật nằm ở phía đầu ra. Grok 4.7 có giá $2 cho mỗi triệu token đầu vào và $6 cho mỗi triệu token đầu ra, bằng với giá của Grok 4.6, trong khi nhà cung cấp cho biết tốc độ gấp đôi các mô hình cùng loại. Một câu trả lời tìm kiếm trên Felo không chỉ là một lần gọi mô hình. Nó đọc các nguồn, kiểm tra chéo, tổng hợp lại, và quay lại khi có sự bất đồng. Giá đầu ra phản ánh chi phí thực tế của một quá trình điều tra kéo dài.

Grok 4.7 in Felo Search: a 500K-token context window over a long-horizon research task

Grok 4.7 Thực Sự Là Gì​

SpaceXAI (trước đây là xAI) giới thiệu Grok 4.7 là "mô hình mạnh nhất cho lập trình và công việc tri thức." Phần thú vị nằm ở nửa sau của mô tả này. Ba phiên bản Grok trước tập trung vào lập trình; phiên bản này được huấn luyện với thời gian tăng cường dài hơn, ưu tiên các nhiệm vụ mất nhiều giờ để hoàn thành.

Việc huấn luyện đó thể hiện ở hai điểm có thể cảm nhận rõ từ hộp tìm kiếm: tự kiểm tra và quản lý ngữ cảnh dài. Mô hình được huấn luyện để kiểm tra lại các bước trung gian thay vì chốt ngay phương án hợp lý đầu tiên, và ghi nhớ những gì đã xác lập từ hai mươi bước trước.

Thông sốGrok 4.7
Model IDgrok-4.7
MakerSpaceXAI
Released21 tháng 9, 2026
Context window500,000 token
InputVăn bản, hình ảnh
OutputVăn bản
Reasoning effortthấp / trung bình / cao (mặc định) / rất cao
Price$2 cho mỗi triệu đầu vào, $6 cho mỗi triệu đầu ra
Cached input$0.50 cho mỗi triệu token
Knowledge cutoffTháng 6/2026, bổ sung huấn luyện đến tháng 8/2026

Cửa sổ ngữ cảnh 500.000 token là nhỏ nhất trong bốn mô hình ra mắt tuần này. Tuy nhiên, nó đã đủ cho một nhiệm vụ tìm kiếm: hàng trăm tài liệu dài, một quý báo cáo tài chính, hoặc toàn bộ chuỗi nghiên cứu với mọi nguồn vẫn còn trong ngữ cảnh. Cửa sổ lớn hơn chỉ thực sự cần thiết khi muốn mô hình giữ cả một kho mã hoặc một năm tài liệu mà không cần truy xuất lại. Đó là trường hợp của các mô hình 1 triệu token trong bảng dưới đây.

Ý Nghĩa Đối Với Tìm Kiếm AI​

Một câu trả lời tìm kiếm có hai kiểu thất bại. Đầu tiên là không tìm thấy nguồn. Thứ hai là tìm thấy nguồn, đọc sai, rồi khẳng định sai lầm đó một cách chắc chắn. Kiểu thứ hai nguy hiểm hơn, vì nó trông giống hệt một câu trả lời đúng.

Huấn luyện dài hạn nhằm vào kiểu thất bại thứ hai. Khi mô hình được thưởng cho việc hoàn thành đúng các nhiệm vụ kéo dài nhiều giờ, các chiến lược đơn giản không còn hiệu quả. So khớp mẫu với tài liệu hợp lý đầu tiên, bỏ qua nguồn mâu thuẫn với câu trả lời đang hình thành, bỏ rơi ràng buộc đã xác lập từ đầu: không chiến lược nào tồn tại qua một nhiệm vụ kéo dài hàng giờ. Thói quen còn lại là quay lại kiểm tra.

Điểm số công bố của Grok 4.7 cũng cho thấy điều này. Trên GDPval, thước đo chất lượng sản phẩm chuyên nghiệp thực tế, nhà cung cấp báo cáo Elo 1.695, tăng từ 1.605 của Grok 4.6. Trên AA Briefcase v1.1, một chuẩn đánh giá công việc tri thức, điểm tăng từ 1.546 lên 1.657. HealthBench Professional tăng từ 48,5% lên 56,7%, và Harvey Legal Agent Benchmark từ 15,8% lên 19,6%.

Đây là số liệu do nhà cung cấp công bố, đánh giá ở các mức nỗ lực và bộ harness khác nhau, nên hãy xem như một tuyên bố chứ không phải kết quả. So sánh đáng tin nhất là trong cùng một dòng sản phẩm: 4.7 vượt 4.6, nhất quán, ở các nhiệm vụ giống nghiên cứu.

1. Mở bộ chọn mô hình. Bắt đầu tìm kiếm trên Felo và chọn Grok 4.7. Quy trình làm việc không thay đổi: cùng một hộp, cùng nguồn, cùng không gian làm việc.

2. Đặt câu hỏi thường phải chia thành bốn. Mô hình dài hạn phát huy giá trị ở các yêu cầu mơ hồ, nhiều ràng buộc. Thay vì "thời gian biểu của Đạo luật AI EU là gì" hãy hỏi "nghĩa vụ nào của Đạo luật AI EU áp dụng đầu tiên cho công ty bán mô hình đa năng vào EU, và nghĩa vụ nào đã có hướng dẫn thực thi." Một prompt, nhiều câu hỏi phụ.

3. Để mô hình tự mâu thuẫn. Hỏi tiếp "nguồn nào của bạn mâu thuẫn về điểm này, và nguồn nào đáng tin hơn?" Mô hình được huấn luyện tự kiểm tra xử lý thử thách này tốt hơn mô hình chỉ hướng đến một câu trả lời chắc chắn.

4. Đổi mức nỗ lực khi câu hỏi thay đổi. Grok 4.7 có bốn mức nỗ lực suy luận. Trung bình phù hợp cho nghiên cứu thông thường; tăng lên khi câu hỏi có chuỗi phụ thuộc dài, giảm xuống khi chỉ tóm tắt nội dung đã tin tưởng.

5. Đẩy câu trả lời tiến xa hơn. Cùng một cửa sổ ngữ cảnh giữ cả nghiên cứu và sản phẩm đầu ra. Yêu cầu bản ghi nhớ, dàn ý slide, hoặc email. Tài liệu nguồn vẫn còn trước mắt mô hình.

Grok 4.7 không đến một mình. Bốn mô hình tiên phong ra mắt trong vòng khoảng ba mươi sáu giờ, và cả bốn đều đã chạy trên Felo Search.

ModelReleased byPrice per million tokensContextBuilt for
Grok 4.7SpaceXAI$2 in / $6 out500KSuy luận dài hạn và công việc tri thức
Claude Opus 5.5Anthropic$4 in / $20 out1MCâu trả lời vượt qua kiểm tra xác minh
GPT-6 LunaOpenAI$0.10 in / $0.50 out1.05MTìm kiếm khối lượng lớn với chi phí thấp nhất mỗi lần gọi
GPT-6 SolOpenAI$2 in / $10 out1.05MVòng lặp tác vụ và gọi lặp lại với giá tầm trung

Chênh lệch giữa các mô hình khoảng hai mươi lần về giá đầu vào và năm mươi lần về chi phí cho một cuộc điều tra đầy đủ. Lựa chọn theo từng câu hỏi giờ là đòn bẩy lớn nhất cho cả chất lượng câu trả lời lẫn số lượng nghiên cứu có thể thực hiện.

Nên Thử Gì Đầu Tiên​

Một câu hỏi có đáp án gây tranh cãi. Hỏi về chủ đề mà các nguồn uy tín bất đồng: hiệu quả của một loại thực phẩm chức năng, chi phí thực sự của một cuộc di chuyển, ước tính quy mô thị trường. Sau đó yêu cầu Grok 4.7 tách biệt điểm các nguồn đồng thuận và điểm chỉ một nguồn nêu ra. Đó là dạng nhiệm vụ mà huấn luyện dài hạn hướng đến.

Một tài liệu cần phản biện. Dán hợp đồng, chính sách, hoặc đặc tả và hỏi nội dung không được đề cập. Câu hỏi về sự vắng mặt là nơi mô hình dừng lại ở cách hiểu hợp lý đầu tiên dễ thất bại nhất.

So sánh giữa hai nguồn. Đưa hai báo cáo từ công ty đối thủ và yêu cầu so sánh như một nhà phân tích, kèm số liệu mỗi bên cố tình né tránh.

Dự báo có ràng buộc. Mô hình dài hạn xử lý tốt hơn các yêu cầu "đây là tám ràng buộc, tìm phương án đáp ứng tất cả" so với các ý tưởng mở.

Grok 4.7 đã hoạt động trên Felo Search, với cửa sổ ngữ cảnh 500.000 token, bốn mức nỗ lực suy luận, và giá $2/$6. Giá không đổi so với mô hình trước, nghĩa là nâng cấp miễn phí ở cấp độ token.

Open Grok 4.7 in Felo Search →


Bài viết này cũng có sẵn bằng English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Türkçe, Italiano, ไทย, Español, বাংলা and Português.