Anthropic 於 2026 年 9 月 22 日發布 Opus 5.5

Claude Opus 5.5同樣的活,更少的 token

Anthropic Claude 5.5 家族的首款模型。它在多數任務上達到 Claude Fable 5.1 的水準,執行成本比 Opus 5 低 40%,輸出速度提升超過 30%。

9 月 22 日
2026 年發布
Claude 5.5 家族首款模型
4 / 20 美元
API 輸入 / 輸出
每百萬 token,低於 Opus 5 的 5 / 25 美元
medium
預設 effort 等級
比預設 high 的 Opus 5 低一級
100 萬 / 12.8 萬
上下文 / 最大輸出
視窗與 Opus 5 一致,知識截止 2026 年 6 月

現已接入 Felo 搜尋

把整組文件丟進去,再提問。

Claude Opus 5.5 已在 Felo 搜尋中上線,適合處理長輸入的任務:跨檔案核對數字、把結論追溯回出處,最後交出一份可以直接轉給別人的答案。

在 Felo 搜尋中試用 Opus 5.5

01

一次裝下全部脈絡

100 萬 token 上下文視窗,知識截止到 2026 年 6 月。長對話、整個程式碼倉庫或一整套文件都能留在同一個任務裡。

02

核對數字,而不只是看結論

在 Anthropic 的內部測試中,18 份報告有 16 份通過品質門檻;該任務只要出現一個捏造的數字或引文就會判定失敗。

03

說清做了什麼、還缺什麼

Anthropic 重寫了模型的表達方式:最重要的資訊放在最前面,報告會直接說明已完成什麼、發現了什麼、還有什麼沒解決。

快速上手

在 Felo 中切換到 Claude Opus 5.5

Claude Opus 5.5 會與其他領先模型一起出現在你帳號的模型選擇器中。

打開模型選擇器,選中 Claude Opus 5.5,然後在同一個工作區裡開始任務。

Opus 5.5 的不同之處

成本下降本身就是賣點。

Anthropic 這次強調的是效率,而不是更高的跑分:每個任務消耗的 token 更少,單價更低,典型工作負載的成本下降 40%。正是這一點讓長時間執行的代理任務變得負擔得起。

01

把龐大的活做完

Anthropic 提到一位早期測試者用不到三小時稽核並修復了 20 萬行程式碼庫,而 Opus 5 花了 20 多個小時,token 用量還是它的 2.5 倍。

02

在合併前抓到 bug

Deloitte 報告指出,Opus 5.5 在最低 effort 等級下於程式碼審查中發現了 72% 的已知 bug,而 Opus 5 在 high 等級下為 56%,且誤報更少。

03

留下一份人能直接用的報告

它的文字更短、結構更清楚。Box 報告指出答案冗長程度降低 40% 而準確率不變,token 用量只有 Opus 5 的三分之一。

模型選擇

把 token 的成本和出錯的成本放在一起比。

下表是官方公開 API 價格,按每百萬 token 計,不是 Felo 的訂閱或用量價格。effort 那一列和價格一樣重要:同一個提示詞,各模型起點不同,花費可能相差很大。

對比面向
Claude Opus 5.5
Claude Fable 5.1
Claude Opus 5
GPT-6 Astra
API 價格 / 每百萬 token
輸入 4 美元 / 輸出 20 美元
輸入 10 美元 / 輸出 50 美元
輸入 5 美元 / 輸出 25 美元
輸入 10 美元 / 輸出 50 美元
快取讀取 / 每百萬 token
0.20 美元,為輸入價的 0.05 倍
0.25 美元,為輸入價的 0.025 倍
0.50 美元,即標準 0.1 倍
依服務商與快取層級而異
預設 effort 等級
medium。自適應思考始終開啟,無法關閉。
high。自適應思考始終開啟。
high。在 high 及以下等級可以關閉思考。
由呼叫方依請求設定
適合的場景
以中階價格承擔長時間執行的代理程式開發、程式碼審查與知識工作。
最難的推理與最長的代理任務,前提是在 Opus 5.5 上調高 effort 後評測仍不達標。
上一代 Opus 基準。請在自有流量上比較它的實際可用性與延遲。
OpenAI 的旗艦等級,定價位於區間頂部。

以上公開 API 價格與預設等級於 2026 年 9 月 23 日核對自 Anthropic 的 Claude Opus 5.5 發布公告、Claude Platform 模型頁以及 OpenAI 的 GPT-6 Astra 頁面。token 單價只是任務總成本的一部分;Anthropic 自己的效率說法是典型工作負載成本下降 40%,這個數字同時包含單價下降與單一任務 token 用量減少。

Anthropic 公布的成績

Opus 5.5 領先在哪,又沒領先在哪。

Anthropic 把自己的成績與 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol 並列公布。下面四張圖中有兩張畫的是準確率與單一任務成本的關係,而不是單純的準確率,因為這才是 Anthropic 想做的對比。

Anthropic 公布的 Claude Opus 5.5 對比表,對照 Fable 5.1、Opus 5、GPT-6 Astra 與 GPT-5.6 Sol

完整的官方對比

涵蓋代理程式開發、知識工作、業務流程、跨領域推理、科研、電腦操作與圖表辨識,涵蓋 Anthropic 測量的全部五款模型。

Anthropic 公布的 Claude Opus 5.5 代理程式開發圖表

代理程式開發

Terminal-Bench 4.0、FrontierCode v1.1 與 CursorBench 4.0,橫軸為單一任務成本,縱軸為準確率。

Anthropic 公布的 Claude Opus 5.5 知識工作圖表

知識工作

涵蓋 44 種職業的 GDPval-AA v2.1、AutomationBench,以及 Perplexity 的資料蒐集基準 WANDR。

Anthropic 公布的 Claude Opus 5.5 電腦操作與推理圖表

電腦操作與推理

OSWorld 2.0、Humanity's Last Exam 與 Chartography,其中最後一項衡量的是從圖表中讀取數值的準確度。

Anthropic 公布的 Claude Opus 5.5 準確率與單一任務成本圖表

準確率與單一任務成本

Anthropic 的核心主張不是在任何成本下都拿到更高分,而是在成本降到零頭的同時拿到持平或更好的成績。

廠商公布資料。除另有說明外,Anthropic 在 max effort 下啟用自適應思考執行 Opus 5.5,並在生產防護開啟的情況下評測;當防護介入時,網路安全任務由 Opus 4.8 完成,生物學任務由 Opus 5 完成,這很可能壓低了 Opus 5.5 在這些基準上的公布成績。GPT-6 Astra 與 GPT-5.6 Sol 的資料來自 OpenAI 公布值。跨廠商的跑分差距只能作為現實差異的弱參考,這也是 Anthropic 自己對這組數字的說明。

如果你已經在跑 Opus 5

四處會直接讓現有程式碼報錯的變更。

Anthropic 列出了四項針對已在 Claude Opus 5 上執行的整合的破壞性變更,另外還有一項會改變回應結構但不會讓請求失敗。換模型 ID 之前值得先讀一遍,因為其中三項會直接回傳 400 錯誤,而不是悄悄降級。

01

思考無法再關閉

在 Opus 5 上,high 及以下等級可以關閉思考。Opus 5.5 始終開啟,關閉寫法與手動 token 預算都會回傳 400 錯誤。effort 成了唯一的控制手段,預設等級也從 high 變成 medium。

thinking: {"type": "disabled"} -> 400 invalid_request_error

02

強制工具呼叫被拒絕

tool_choice 設為 "any" 或指定某個工具名稱都會回傳 400 錯誤,token 計數端點同樣如此。改用 auto 搭配嚴格工具呼叫或結構化輸出,並在提示詞裡說明何時該用該工具。

tool_choice: {"type": "tool", "name": "..."} -> 400 invalid_request_error

03

思考區塊與產出它的模型綁定

每個思考區塊都會記錄產出它的模型。Opus 5.5 可以讀取 Opus 5 及更早的 Opus、Sonnet、Haiku 模型的思考區塊,但讀不了 Fable 與 Mythos 的。如果路由把對話切到其他模型,後續輪次將不再帶上先前的推理。

Opus 5.5 -> Fable 5.1 / Mythos 5.1 保留思考;其他模型會丟棄

04

舊版電腦操作工具已不可用

在 Claude API 與 Google Cloud 上,computer_20251124 工具會回傳 400 錯誤。請改用 computer_toolset_20260801 工具集,移除 beta 標頭,並讓代理迴圈適合成員 tool_use 區塊。在 Amazon Bedrock 上舊工具仍可使用。

computer_20251124 -> computer_toolset_20260801

effort 現在是唯一的思考控制項

既然思考無法關閉,可調的就是 effort。Opus 5.5 支援全部五個等級,預設 medium,比 Opus 5 低一級。Anthropic 的建議是在自己的評測集上重新跑一輪等級掃描,而不是沿用舊設定;同時在高等級下把 max_tokens 設得足夠大,因為即使不回傳思考文字,思考 token 也計入其中。

等級
是否預設
Anthropic 建議的用途
low
否
最省 token 的等級,能力會有所下降。Anthropic 建議用於較簡單的任務與子代理。
medium
是
Opus 5.5 的預設等級。Anthropic 稱其在程式開發與知識工作評測上達到或超過 high 等級的 Opus 5。
high
否
多數其他 Claude 模型的預設等級。適合複雜推理與高難度程式問題。
xhigh
否
執行超過 30 分鐘、token 預算達百萬級的長週期代理與程式任務。
max
否
可用的最深推理,不限制 token 消耗。留給已經實測出品質提升的任務。

effort 是行為訊號,而不是硬性 token 預算:在較低等級下,模型面對真正困難的問題仍會思考,只是比高等級少。Anthropic 還指出,在同一等級下 Opus 5.5 每輪思考量普遍多於 Opus 5,在 xhigh 與 max 下尤其明顯,因此沿用 Opus 5 的設定會讓每輪更長、更貴。

適用場景

那些長到沒辦法一直盯著的活。

當任務要跑幾個小時、涉及的檔案多到一個人裝不下,或者產出需要第二個人複核時,Opus 5.5 才真正體現出價值。以下場景來自 Anthropic 及其早期測試者的描述,不是泛泛的聊天提示詞。

全程式碼庫遷移與稽核

把一處改動貫穿整個大型倉庫直到測試通過,而不是停在第一個看起來可行的補丁上。Anthropic 提到一位測試者用不到一天完成了 68 萬行的遷移。

能揪出真問題的程式碼審查

Anthropic 的測試方 Column 報告指出,它透過查閱外部文件,發現了一個在好幾個提交之前就被建模錯誤的第三方整合 bug。

財務與文件分析

先建模型,再寫一頁紙的結論,並把前提與保留意見保留下來。Anthropic 報告指出一起併購分析用時 63 分鐘,Opus 5 為 93 分鐘,成本只有一半。

長時間執行的代理團隊

它會把任務分派給子代理,並依時間預算安排節奏。Anthropic 的建議是給多代理框架提供已耗時訊號,讓它並行推進而不是串行等待。

拿一個要跑很久的任務試試

01

把真實脈絡帶上

把程式碼倉庫、文件和需求都放進去,這些是答案必須考慮到的內容。100 萬 token 視窗正是為此存在。

02

說明完成條件

講清楚什麼條件滿足才算做完。Anthropic 對無人值守執行的建議是:把任務的各個部分放進一份清單,讓模型持續更新。

03

對比最終產出

在 Felo 裡把同一個任務分別交給 Opus 5.5、Opus 5 和 Fable 5.1。比的不只是答案,還有測試、保留意見和 token 消耗。

當你的帳號模型選擇器中出現 Claude Opus 5.5 時選中它即可。

在 Felo 試用 Opus 5.5

Claude Opus 5.5 常見問題

Claude Opus 5.5 是 Anthropic 針對長時間執行的代理程式開發與知識工作推出的模型,於 2026 年 9 月 22 日發布,是 Claude 5.5 家族的首款模型。Anthropic 稱它在多數任務上達到 Claude Fable 5.1 的水準,而執行成本比 Claude Opus 5 低 40%。

用更低的價格跑那個長任務。

在 Felo 裡把 Claude Opus 5.5 和其他領先模型放在一起,然後拿那個因為要跑幾個小時而一直拖著沒做的任務來試。

在 Felo 試用 Opus 5.5

從 Felo AI 搜尋開始,在可用時選中該模型。