Skip to main content

Grok 4.7 現已登陸 Felo Search:長時推理答案,$2/$6

· 閱讀時間約 7 分鐘
Felo Search Tips Buddy
Committed to answers at your fingertips

Grok 4.7 已在 Felo Search 上線:50 萬字元上下文,百萬字元 $2/$6,專為需數小時研究的長時推理打造。

SpaceXAI 於 9 月 21 日推出 Grok 4.7,這款模型專為需要花費一小時深度挖掘、而非單次查詢的問題設計。現在已可在 Felo Search 使用,與同週上線的其他三款模型並列。

這次的重點在於輸出端。Grok 4.7 的價格為 每百萬輸入字元 $2、每百萬輸出字元 $6,與 Grok 4.6 相同,但廠商聲稱速度為同級模型的兩倍。在 Felo 的搜尋答案並非單次模型呼叫。它會讀取來源、相互比對、撰寫綜合內容,若出現矛盾則回頭檢查。輸出價格才是長時間調查的實際花費。

Grok 4.7 in Felo Search: a 500K-token context window over a long-horizon research task

Grok 4.7 是什麼​

SpaceXAI(前身為 xAI)將 Grok 4.7 定位為「最強大的程式與知識工作模型」。這個描述的重點在於知識工作。前三代 Grok 主要聚焦於程式應用;這一代則以更長時間的強化學習訓練,偏重於需數小時才能完成的任務。

這樣的訓練在搜尋體驗上體現在兩個方面:自我驗證與長上下文管理。模型會檢查自己的中間步驟,而非直接採納第一個看似合理的路徑,並能記住二十步前建立的依據。

規格Grok 4.7
Model IDgrok-4.7
MakerSpaceXAI
ReleasedSeptember 21, 2026
Context window500,000 tokens
InputText, image
OutputText
Reasoning effortlow / medium / high (default) / xhigh
Price$2 per million input, $6 per million output
Cached input$0.50 per million tokens
Knowledge cutoffJune 2026, with supplemental training through August 2026

這週上線的四款模型中,50 萬字元的上下文視窗是最小的。但對搜尋任務來說已經足夠:可容納上百份長文件、一季財報、或完整的研究討論串,所有來源都在上下文內。更大視窗的價值在於模型能同時保留整個程式庫或一整年文件,無需檢索步驟。下表中的百萬字元模型即為此用途。

這對 AI 搜尋有什麼意義​

搜尋答案有兩種失敗方式。第一種找不到來源。第二種找到來源卻誤讀,還自信地陳述錯誤。第二種更糟,因為它看起來就像正確答案。

長時訓練針對第二種失敗。當模型因正確完成多小時任務而獲得獎勵時,取巧策略失效。只比對第一個看似合理的文件、忽略與答案矛盾的來源、遺漏早期建立的限制:這些方法在長時間任務下無法通過。經過這樣訓練後,模型會養成回頭檢查的習慣。

Grok 4.7 公布的分數也反映這一點。在 GDPval(衡量專業交付品質)上,廠商報告 Elo 分數為 1,695,較 Grok 4.6 的 1,605 提升。在 AA Briefcase v1.1(知識工作基準)上,從 1,546 提升至 1,657。HealthBench Professional 從 48.5% 提升至 56.7%,Harvey Legal Agent Benchmark 從 15.8% 提升至 19.6%。

這些數據由廠商提供,評估時的努力設定與測試環境各異,因此應視為主張而非結果。值得信任的比較在同系列內:4.7 在類似研究的任務上持續勝過 4.6。

如何在 Felo Search 使用 Grok 4.7​

1. 開啟模型選擇器。 在 Felo 開始搜尋並選擇 Grok 4.7。其他操作不變:同一輸入框、同一來源、同一工作區。

2. 提問時合併原本會拆成四個的問題。 長時模型在模糊、多重限制的請求下展現價值。與其問「歐盟 AI 法案時程為何」,不如問「一家銷售通用模型到歐盟的公司,哪些歐盟 AI 法案義務最早生效,哪些已有實施指引?」一個提示,涵蓋多個子問題。

3. 讓模型自我矛盾。 追問「你的來源在這點上有何衝突?哪個更具權威?」受過自我驗證訓練的模型,面對這種挑戰表現優於只追求單一自信答案的模型。

4. 問題型態變化時切換推理強度。 Grok 4.7 提供四種推理強度。中等適合一般研究;當問題有長依賴鏈時提高,總結已信任內容時降低。

5. 推進答案產出。 同一上下文視窗同時保留研究過程與最終產出。可直接要求備忘錄、簡報大綱或郵件,來源資料仍在眼前。

其他三款現已上線的模型​

Grok 4.7 並非單獨上線。約三十六小時內有四款前沿模型同時推出,現皆可在 Felo Search 運行。

ModelReleased byPrice per million tokensContextBuilt for
Grok 4.7SpaceXAI$2 in / $6 out500K長時推理與知識工作
Claude Opus 5.5Anthropic$4 in / $20 out1M通過驗證的答案
GPT-6 LunaOpenAI$0.10 in / $0.50 out1.05M低成本高頻搜尋
GPT-6 SolOpenAI$2 in / $10 out1.05M中價位代理循環與重複呼叫

這些模型在輸入價格上相差約二十倍,完整調查的總成本相差五十倍。根據問題選擇模型,成為影響答案品質與研究成本的最大槓桿。

建議的第一步嘗試​

有爭議的問題。 詢問嚴肅來源意見分歧的議題:某補充品的效用、遷移的實際成本、市場規模預估。然後請 Grok 4.7 區分來源共識與單一來源主張。這正是長時訓練針對的任務。

需要反駁的文件。 貼上一份合約、政策或規格,詢問它未涵蓋哪些內容。證據缺席型問題,最容易讓只停在第一個合理解讀的模型失誤。

跨來源比對。 提供兩家競爭公司文件,請模型做出分析師會做的比較,並指出各自刻意避談的數字。

有多重限制的預測。 長時模型在「這裡有八個限制,找出能同時滿足的方案」這類問題上表現優於開放式腦力激盪。

立即在 Felo Search 體驗 Grok 4.7​

Grok 4.7 現已在 Felo Search 上線,擁有 50 萬字元上下文視窗、四種推理強度設定,以及 $2/$6 價格。與前代價格相同,升級後每字元成本不變。

在 Felo Search 開啟 Grok 4.7 →


本文也提供以下語言版本:English、简体中文、日本語、한국어、हिन्दी、Français、العربية、Русский、اردو、Bahasa Indonesia、Deutsch、Tiếng Việt、Türkçe、Italiano、ไทย、Español、বাংলা、Português。