Skip to main content

Claude Opus 5 現已登陸 Felo:功能、價格與 7 天免費試用

· 閱讀時間約 18 分鐘
Felo Search Tips Buddy
Committed to answers at your fingertips

Felo 現已支援 Claude Opus 5。深入了解其功能、基準測試、安全性與價格,並免費試用 Anthropic 的 agentic 編碼模型 7 天。

Felo 現已支援 Claude Opus 5,這是 Anthropic 推出的全新 Opus 級模型,專為 agentic 編碼、專業分析及長時間運行的工作而設計。當你的任務不僅需要一個強大的第一答案,還需要研究、驗證、反覆修正,以及一個你能自信審查的成果時,可以在 Felo 中選擇這個模型。

為慶祝上線,Felo Pro 訂閱用戶可於新模型發布日起,免費試用 Claude Opus 5 七天。無論是棘手的程式錯誤、證據相互矛盾的研究簡報、多步驟分析,還是需要多次潤飾的文件,都可以交給它處理,並以你真正關心的工作來評判它的表現。

Claude Opus 5 launch announcement from Anthropic, shown unchanged with a gray border

封面圖片:來自 Anthropic Claude Opus 5 公告 的原創藝術作品。視覺內容未經更動,僅由 Felo 加上灰色邊框。

這不僅僅是一則發佈說明。下文將以圖文方式介紹 Opus 5 的設計用途、Anthropic 在評測中報告的表現、模型的限制,以及如何在 Felo 以真實工作情境進行測試。

準備好試用嗎? 立即於 Felo 開啟你的 7 天 Claude Opus 5 試用 ->

Claude Opus 5 功能:模型的設計目標

Anthropic 於 2026 年 7 月 24 日發佈 Claude Opus 5,定位為日常高效能模型,適用於長時間運行的代理、軟體工程及專業知識型工作。Anthropic 表示,這一代的關鍵改變不僅是更好的第一反應,而是讓 Opus 5 能更有計劃地工作:驗證中間結果、維持複雜任務的脈絡,並在第一次嘗試未能解決問題時進行反覆修正。

這種差異在實際工作中非常重要。例行問題可能只需快速簡明的答案;但較大的任務則可能需要模型閱讀原始資料、判斷還需哪些資訊、執行計算或工具、比較選項、檢查輸出並解釋結果。這些情境正是 Opus 級模型最值得選用的時候。

Anthropic 強調三大重疊優勢:

  • Agentic 編碼: 較大功能開發、困難的除錯、根本原因分析、重構,以及跨多個檔案或工具的任務。
  • 知識型工作與分析: 對密集資料的結構化推理、數值與表格處理、盡職調查、研究與決策支援。
  • 電腦操作與自動化流程: 完成一連串步驟,而非僅產生單一孤立答案。

這些優勢並不代表模型可以完全不經檢查,但確實意味著它能在人工審查決策、證據與最終行動前,完成更完整的初稿。

Claude Opus 5 基準測試與能力

模型基準測試是有用的參考指標,但不能保證模型在每個專案中表現一致。結果會受到任務、測試工具、設定與評分方式影響。不過,Anthropic 的發佈說明仍提供了 Opus 5 針對問題類型的有用輪廓。

在軟體工程方面,Anthropic 報告 Opus 5 在其內部執行的 Frontier-Bench v0.1 測試中領先,且每個任務的成本低於 Opus 4.8,表現提升超過兩倍。下圖具體展現了這種取捨:橘色的 Opus 5 曲線在各種努力設定下都超越先前 Opus 結果,而非僅在最高成本時才領先。

Anthropic's Frontier-Bench v0.1 chart comparing agentic coding score with cost per attempt, shown unchanged with a gray border

來源:Anthropic,Introducing Claude Opus 5。原圖未經更動,僅由 Felo 加上灰色邊框。圖註:Frontier-Bench 測試採用 mini-SWE-agent 工具、GKE 後端,每個任務平均五次嘗試的分數。

CursorBench 3.2 測試中,Anthropic 指出該模型在最大努力下的分數僅比 Claude Fable 5 的峰值低 0.5%,但每個任務成本僅為其一半。這也是為什麼 Opus 5 對於那些低品質初稿會帶來更多後續工作的任務最具吸引力:如跨代碼庫除錯、端到端功能開發,或追查根本原因而非僅修補表面問題。

在更廣泛的問題解決與辦公型工作方面,Anthropic 報告 Opus 5:

  • ARC-AGI 3(新型問題解決評測)中,分數為次佳模型的三倍;
  • Zapier AutomationBench(端到端商業自動化測試)中,以相同成本達到約 1.5 倍的通過率;
  • OSWorld 2.0(電腦操作基準)中,以相近成本超越其他模型;
  • 並且在 ARC-AGI 3、GDPval-AA v2、HLE、AutomationBench 與 DeepSearchQA 等相關評測中,表現最佳且最具成本效益。

這些成果不僅限於程式碼。Anthropic 的 GDPval-AA v2 圖表追蹤了不同努力層級下的真實世界知識型任務,說明了為什麼 Opus 5 對於研究、金融、法律、營運等需要經過審查的答案特別有價值,而不僅僅是初稿看起來流暢。

Anthropic's GDPval-AA v2 chart comparing real-world knowledge task scores by effort level, shown unchanged with a gray border

來源:Anthropic,Introducing Claude Opus 5。原圖未經更動,僅由 Felo 加上灰色邊框。

這些都是Anthropic 公布的結果,包括內部評測與部分早期用戶回饋,而非獨立的通用排名。最有效的閱讀方式,是將其視為模型測試指引:適合有長依賴鏈、需求模糊、需用工具、需驗證,且淺層答案會帶來實質後果的任務。

Claude Opus 5 功能:為什麼「努力」會改變體驗

Opus 5 支援不同的努力(effort)設定。簡單來說,努力值讓你能在回應速度與 token 使用量,與額外推理時間之間做取捨。Anthropic 的圖表比較了模型在多種努力層級下的表現,從節省 token 的低努力,到高、極高與最大努力。

這很實用,因為不是每個請求都值得投入相同資源。對於快速分類、提綱或小幅修訂,可用較低努力;當任務有多重限制、需整合多方資料來源,或需診斷前次失敗原因時,則可提高努力值。對於高風險輸出,也建議將省下的時間用於審查:請模型找出假設、引用來源、測試邊界情境,或解釋哪些情況會改變建議。

本次發佈還在 Anthropic 自家平台引入了可選的快速模式(Fast mode)。Anthropic 表示該模式速度約為標準的 2.5 倍,費率則為基礎價的兩倍。不同產品的可用性與控制方式可能不同,因此在 Felo 中,請依據工作區顯示的設定操作,不要假設所有 Anthropic 選項都會以相同形式出現。

差異體現在自我檢查的方式

這次發佈最有趣的主題是驗證能力。Anthropic 描述了一個評測:Opus 5 收到一個機械零件的繪圖,但無法直接查看圖像。模型並未就此止步,而是據稱寫出一個電腦視覺流程,從像素恢復幾何資訊,並以 3D FreeCAD 模型重建該零件。另一個例子中,Anthropic 指出模型找到了真實套件管理器錯誤的根本原因,並處理了社群修補程式遺漏的邊界情境。

這類例子應視為模型開發者的示範,而非承諾。但它們為 Felo 提供了具體的提示模式:不要只要求答案,也要要求工作流程。

調查問題,然後提出修正建議。
在定案前,請根據既定需求驗證修正內容,
列出所有假設,並指出可能推翻修正的測試或證據。
將最終建議與工作紀錄分開回報。

對於研究任務,同樣的方法能將寬泛的提示轉化為可審查的流程:收集最新資料來源、區分事實與推論、尋找反證,並產出簡明的決策簡報。當相關資料分布於多種語言時,Felo 的多語言工作流程尤其有幫助;必要時可要求保留原文並附上清晰的英文摘要。

Anthropic 也報告了在 OSWorld 2.0(多步驟介面電腦操作基準)上的強勁表現。這提醒我們 agentic 工作往往不是「一問一答」,而是一連串檢查狀態、選擇下一步、驗證結果是否真正達標的過程。

Anthropic's OSWorld 2.0 chart comparing agentic computer-use performance with cost per task, shown unchanged with a gray border

來源:Anthropic,Introducing Claude Opus 5。原圖未經更動,僅由 Felo 加上灰色邊框。

表現不是唯一考量:安全性與限制

Anthropic 報告其部署前行為審查發現,Opus 5 是近期最符合對齊要求的模型。據稱,該模型在整體不對齊行為、欺瞞行為上表現更低,對於濫用提示的抵抗力也高於多個近期 Claude 模型。公司同時指出,Opus 5 在生物學與攻擊性網路安全測試中,並未擴展高風險雙重用途能力的邊界。

下圖是這一主張最清晰的視覺總結。在 Anthropic 的 1-10 不對齊行為量表中,分數越低越好;Opus 5 以 2.30 分低於其他近期模型。這是內部安全評估,應作為參考,而非取代對重要工作的嚴謹人工控管。

Anthropic's automated behavioral audit chart showing Opus 5 with the lowest misaligned-behavior score among the compared models, shown unchanged with a gray border

來源:Anthropic,Introducing Claude Opus 5。原圖未經更動,僅由 Felo 加上灰色邊框。

實務上最重要的是,安全防護仍是產品的一部分。Anthropic 表示 Opus 5 能協助發現原始碼漏洞,但對某些網路安全活動(如二進位漏洞掃描、滲透測試、漏洞利用生成)設有更嚴格的防護。觸發這些防護的請求可能會被阻擋,或在部分 Anthropic 產品中自動切換至其他模型。

對於其他所有工作,請維持你對任何強大模型都應有的良好習慣:

  • 在依賴前,審查事實陳述、計算、引用、程式碼與最終行動。
  • 不要將流暢度視為證據。要求原始資料並親自檢查。
  • 重大法律、財務、醫療、安全等決策,必須由人類負責。
  • 給模型明確的成功條件與不可逾越的界線。

Anthropic 也指出,Opus 5 在長時間自主研究任務上仍有重要限制。能力不等於自主性,設計良好的人為審查流程仍是強大工作流程的一環。

Claude Opus 5 價格與 Felo 免費試用

Anthropic 公布 Claude Opus 5 的 API 價格為每百萬輸入 token 5 美元每百萬輸出 token 25 美元,與 Opus 4.8 相同。第三方平台、訂閱與功能的價格可能不同,請以你所用產品顯示的價格與用量資訊為準。

對 Felo Pro 訂閱用戶來說,當前重點更簡單:**Claude Opus 5 自發佈日起七天內可免費試用。**這讓你能以真實任務評估其表現,再決定是否納入日常模型組合。合理的比較方式不只是「哪個模型初稿寫得最好?」請用你目前的模型處理同一個難題,然後比較完整度、錯誤率、後續需求、資料來源處理品質,以及每個結果需要多少審查時間。

如何在 Felo Pro 免費試用 Claude Opus 5 七天

  1. 登入你的 Felo Pro 帳號。
  2. 在你平常用於研究、寫作、分析或 agentic 工作的 Felo 工作區開啟新任務。
  3. 在模型選擇器中選擇 Claude Opus 5
  4. 指派一個有明確交付成果、相關檔案或脈絡,以及明確驗證步驟的任務。
  5. 審查結果,必要時優化指令,並在七天上線優惠期間與你現有工作流程比較。

建議從能展現模型優勢的工作著手:需要權衡取捨的專案計畫、複雜的試算表或報告、困難的程式碼審查、多來源研究問題,或必須經得起追問的分析。目標不是用巧妙提示讓模型看起來厲害,而是要發現它是否讓你的真實工作更清晰、更可靠、更容易完成。

將優惠用在真正重要的任務上: 立即於 Felo 開啟你的 Claude Opus 5 試用 ->

Claude Opus 5 值得一試嗎?

Claude Opus 5 為 Felo 帶來了新選擇,適合那些需要堅持、細緻推理與驗證的任務。其公開結果顯示在 agentic 編碼、自動化、電腦操作與專業分析領域有實質進步,同時安全限制與模型侷限仍是重要考量。

未來七天,Felo Pro 訂閱用戶可無額外模型費用評估其表現。帶上一個你真正重視的任務,請它展示並檢查自己的工作,然後根據結果決定 Claude Opus 5 是否值得成為你工作流程的常駐成員。

立即於 Felo 開啟你的 7 天 Claude Opus 5 試用 ->


來源與延伸閱讀


本文也提供以下語言版本:English简体中文日本語한국어हिन्दीFrançaisالعربيةРусскийاردوBahasa IndonesiaDeutschTiếng ViệtTürkçeItalianoไทยEspañolবাংলাPortuguês