Anthropic 於 2026 年 7 月 24 日發布 Opus 5

Claude Opus 5為經得起檢驗的工作而生

自發布起,Felo PRO 用戶可免費試用 Claude Opus 5 7 天。

Anthropic Claude Opus 5 official illustration framed in Felo blue
圖片來源:Anthropic。Felo 僅加入邊框,未改變原圖元素。

現已加入 Felo Search

提出更難的問題,得到經得起檢驗的搜尋答案。

Claude Opus 5 現已在 Felo Search 提供,用於需要更深入調查、更強來源整合,以及必須根據證據核對最終答案的問題。

在 Felo Search 試用 Opus 5

01

追溯真正的問題

梳理模糊請求背後的限制條件,而不是停在第一個看似合理的理解上。

02

權衡相互衝突的證據

把競爭性的來源和說法帶入同一項調查,再找出證據在哪些地方一致、哪些地方並不一致。

03

帶著更少未解事項返回

把答案作為可用於決策的起點,同時保留推理、注意事項和開放問題。

快速導覽

在 Felo 切換至 Claude Opus 5

開啟模型選擇器,選擇 Claude Opus 5,然後在同一工作區開始任務。

7 月 24 日

2026 年發布

Anthropic 最新的 Opus 模型

$5 / $25

API 輸入 / 輸出

每 100 萬 token,與 Opus 4.8 的基本價格相同

約 2.5 倍

Fast mode 速度

在 Anthropic 平台上,價格為基本價格的 2 倍

驗證 + 修訂

長時間任務

規劃、工具使用、檢查與迭代

Opus 的不同之處

不要在第一次能用時就停止。

Anthropic 將 Opus 5 定位為適合持續判斷的工作:辨識底層問題、驗證結果,並在證據站不住腳時重新檢視工作。

01

追溯底層問題

面對棘手的 bug 和含糊的任務,應從證據、限制和真正根因開始,而不是做表面的修補。

02

交付前檢查工作

使用能檢視自身輸出、測試假設,並在人們日後發現之前捕捉問題的模型。

03

跨修訂維持脈絡

把程式碼、來源資料、工具結果和新限制放入同一個較長的任務,而不是把工作縮減成互不相干的提示詞。

模型選擇

比較 token 的成本,也比較做錯的成本。

以下價格是官方公開 API 費率,不是 Felo 的訂閱或使用價格。它們讓取捨清晰可見,但不假裝不相關廠商的延遲測試可以直接比較。

決策因素
Claude Opus 5
GPT-5.6 Sol
Kimi K3
Claude Opus 4.8
API 價格 / 100 萬 token
$5 輸入 / $25 輸出
$5 輸入 / $0.50 快取 / $30 輸出
$3 輸入 / $0.30 快取 / $15 輸出
$5 輸入 / $25 輸出
速度與容量
預設速度;或使用 Fast mode,速度約為 2.5 倍,價格為基本價格的 2 倍。
OpenAI 將 Sol 標示為 Fast;上下文視窗為 105 萬 token。
上下文為 1,048,576 token;吞吐量隨帳戶速率限制等級而異。
上一代 Opus 基準。請在你的工作流程中比較即時可用性與延遲。
最適合
需要驗證和審慎迭代、結果影響重大的長時間工作。
需要快速旗艦模型回應與超大上下文視窗的複雜專業工作。
希望以較低公開 token 價格處理長程程式開發與端到端知識工作。
既有 Opus 工作流程中,延續性比立即遷移更重要的情況。
選擇它的時機
任務必須完成、核對並經得起辯護,而不只是寫出草稿。
你需要 OpenAI 的旗艦層級,且其速度與上下文特性適合任務。
你需要 100 萬 token 上下文,並想以快取與推理強度控制成本。
你正從成熟的上一代基準評估受控遷移。

官方公開 API 價格於 2026 年 7 月 25 日核查。總任務成本也取決於輸出長度、快取輸入、推理設定、工具呼叫、重試與人工審核。

官方基準圖表

Anthropic 的成本與效能圖表說明了什麼

這些官方圖表繪製不同 effort level 下的模型效能與報告的評測成本。它們為成本決策提供實用脈絡,但屬於廠商發布結果,並非 Felo 獨立測試。

Anthropic 官方 Claude Opus 5 基準能力概覽,比較 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol 在程式開發、知識工作、搜尋、電腦使用、商務工作流程、健康與生物學領域的表現

跨基準類別的官方能力概覽

Anthropic 的跨任務矩陣比較 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol 在程式開發、知識工作、搜尋、電腦使用、商務工作流程等領域的公開結果。

Anthropic 官方依 effort level 劃分的 Agentic 程式開發圖表,按每項任務成本比較 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol

依 effort level 劃分的 Agentic 程式開發

Artificial Analysis Coding Agent Index:官方圖表比較可用 effort setting 的分數和每項任務的報告成本。

Anthropic 官方依 effort level 劃分的 Agentic 電腦使用效能圖表,按每項任務成本比較 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol

依 effort level 劃分的 Agentic 電腦使用

OSWorld 2.0:官方圖表比較各 effort setting 的電腦使用效能和每項任務的報告成本。

Anthropic 官方依 effort level 劃分的真實世界知識任務圖表,按基準成本比較 Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol

依 effort level 劃分的真實世界知識任務

GDPval-AA v2:官方圖表比較各 effort setting 的 Elo 分數和完整基準的報告成本。

Anthropic 官方依 effort level 劃分的 Agentic 搜尋 DeepSearchQA 圖表,按每項任務成本比較 Opus 5、Fable 5 和 Opus 4.8

依 effort level 劃分的 Agentic 搜尋

DeepSearchQA:官方圖表比較可用 effort setting 的搜尋任務通過率和每項任務的報告成本。

圖表與基準標籤來自 Anthropic 的 Claude Opus 5 公告。Felo 只新增外部展示邊框,圖表內容保留發布時的原貌。

更好的起點

把值得第二次檢查的工作交給 Opus 5。

當驗證會改變結果時,這個模型才展現價值。這不是泛泛的聊天提示詞,而是多步驟工作:遺漏依賴關係、缺乏支持的主張或未測試的邊界情況,都會在日後耗費時間。

正式環境程式碼與 QA

調查回歸問題、重現它、檢查周邊程式碼、實作聚焦的修正,並測試快速修補通常會漏掉的路徑。

財務與文件分析

核對表格、測試假設、比較來源文件,並提出保留證據與注意事項的建議。

需要嚴格檢視的研究

閱讀競爭來源、揭露開放問題、權衡證據,並區分自信的回答與真正有支持的回答。

長時間 Agent 任務

使用工具、保留任務限制、從部分結果中恢復,並以刻意設計的檢查點持續推進大型任務。

試一個有後果的任務

01

帶入真實脈絡

加入有用答案必須考量的程式碼、文件、需求與證據。

02

要求驗證計畫

不只說明要產出什麼,也指明在認定工作完成前必須檢查什麼。

03

比較最終產物

在 Felo 中用同一任務測試主流模型。不只檢視答案,也檢視背後的測試、注意事項與判斷。

當 Claude Opus 5 出現在你帳戶的即時模型選擇器時,請選擇它。

開啟 Felo LLM Playground

Claude Opus 5 FAQ

Claude Opus 5 是 Anthropic 於 2026 年 7 月 24 日發布的 Opus 級模型。Anthropic 將它定位為適合長時間運作的 agent、複雜軟體工程、專業知識工作,以及能受益於驗證與審慎迭代的任務。

使用會檢查工作的模型。

在 Felo 中把 Claude Opus 5 放在其他頂級模型旁,然後在一個僅有看似合理答案還不夠的任務上測試它。

在 Felo 試用 Opus 5

從 Felo AI Search 開始,並在可用時選擇模型。