Anthropic 于 2026 年 7 月 24 日发布 Opus 5

Claude Opus 5为经得起检验的工作而生

自发布起,Felo PRO 用户可免费试用 Claude Opus 5 7 天。

Anthropic Claude Opus 5 official illustration framed in Felo blue
图片来源:Anthropic。Felo 仅添加边框,未改变原图元素。

现已上线 Felo Search

提出更难的问题,得到经得起检验的搜索答案。

Claude Opus 5 现已加入 Felo Search,适合需要更深入调查、更强来源综合,以及必须依据证据核查最终答案的问题。

在 Felo Search 试用 Opus 5

01

追溯真正的问题

梳理模糊请求背后的限制条件,而不是停在第一个看似合理的理解上。

02

权衡相互冲突的证据

将竞争性的来源和说法放入同一项调查,再指出证据在哪些地方一致、哪些地方并不一致。

03

带着更少遗留问题返回

把答案作为可用于决策的起点,同时保留推理过程、注意事项和开放问题。

快速演示

在 Felo 切换到 Claude Opus 5

打开模型选择器,选择 Claude Opus 5,然后在同一工作区开始任务。

7 月 24 日

2026 年发布

Anthropic 最新的 Opus 模型

$5 / $25

API 输入 / 输出

每 100 万 token,与 Opus 4.8 的基础价格相同

约 2.5 倍

Fast mode 速度

在 Anthropic 平台上,价格为基础价格的 2 倍

验证 + 修订

长时任务

规划、工具使用、检查和迭代

Opus 的不同之处

不要在第一次能用时就停下来。

Anthropic 将 Opus 5 定位为适合持续判断的工作:找出底层问题、验证结果,并在证据站不住脚时回看工作。

01

追溯底层问题

面对棘手的 bug 和含糊的任务,应从证据、约束和真正的根因开始,而不是做表面的补丁。

02

交付前检查工作

使用能够审视自身输出、检验假设,并在人们日后发现问题之前捕捉问题的模型。

03

在多轮修订中保持脉络

把代码、源材料、工具结果和新约束带入同一个更长的任务,而不是把工作拆成彼此无关的提示词。

模型选择

比较 token 的成本,也比较出错的成本。

以下价格为官方公开 API 费率,而不是 Felo 的订阅或使用价格。它们让取舍更清晰,但并不假装不同厂商的延迟测试可以直接比较。

决策因素
Claude Opus 5
GPT-5.6 Sol
Kimi K3
Claude Opus 4.8
API 价格 / 100 万 token
$5 输入 / $25 输出
$5 输入 / $0.50 缓存 / $30 输出
$3 输入 / $0.30 缓存 / $15 输出
$5 输入 / $25 输出
速度与容量
默认速度;或使用 Fast mode,速度约为 2.5 倍,价格为基础价格的 2 倍。
OpenAI 将 Sol 标注为 Fast;上下文窗口为 105 万 token。
上下文为 1,048,576 token;吞吐量因账号限速档位而异。
上一代 Opus 基线。请在你的工作流中比较其实时可用性和延迟。
最适合
需要验证与谨慎迭代、后果较重的长时工作。
需要快速旗舰模型响应和超大上下文窗口的复杂专业工作。
希望以较低公开 token 价格处理长程编程和端到端知识工作。
延续既有 Opus 工作流比立即迁移更重要的场景。
选择它的时机
任务必须完成、核查并经得起辩护,而不只是写出草稿。
你需要 OpenAI 的旗舰层级,且其速度和上下文特征适合任务。
你需要 100 万 token 上下文,并希望用缓存和推理强度控制成本。
你正在从成熟的上一代基线评估一次可控迁移。

官方公开 API 价格于 2026 年 7 月 25 日核查。总任务成本还取决于输出长度、缓存输入、推理设置、工具调用、重试和人工审核。

官方基准图表

Anthropic 的成本与性能图表说明了什么

这些官方图表绘制了不同 effort level 下的模型性能与报告的评测成本。它们可为成本决策提供参考,但属于厂商发布结果,并非 Felo 独立测试。

Anthropic 官方 Claude Opus 5 基准能力概览,对比 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol 在编程、知识工作、搜索、计算机使用、业务流程、健康和生物学领域的表现

跨基准类别的官方能力概览

Anthropic 的跨任务矩阵比较了 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol 在编程、知识工作、搜索、计算机使用、业务流程等领域的公开结果。

Anthropic 官方按 effort level 划分的 Agentic 编程图表,按每项任务成本对比 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol

按 effort level 划分的 Agentic 编程

Artificial Analysis Coding Agent Index:官方图表比较不同 effort setting 下的得分和每项任务的报告成本。

Anthropic 官方按 effort level 划分的 Agentic 计算机使用表现图表,按每项任务成本对比 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol

按 effort level 划分的 Agentic 计算机使用

OSWorld 2.0:官方图表比较不同 effort setting 下的计算机使用表现和每项任务的报告成本。

Anthropic 官方按 effort level 划分的真实世界知识任务图表,按基准成本对比 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol

按 effort level 划分的真实世界知识任务

GDPval-AA v2:官方图表比较不同 effort setting 下的 Elo 得分和完整基准的报告成本。

Anthropic 官方按 effort level 划分的 Agentic 搜索 DeepSearchQA 图表,按每项任务成本对比 Opus 5、Fable 5 和 Opus 4.8

按 effort level 划分的 Agentic 搜索

DeepSearchQA:官方图表比较不同 effort setting 下的搜索任务通过率和每项任务的报告成本。

图表及基准标签来自 Anthropic 的 Claude Opus 5 公告。Felo 仅添加了外部展示边框,图表内容按原发布内容保留。

更好的起点

把值得二次检查的工作交给 Opus 5。

当验证会改变结果时,这个模型才真正有价值。这不是泛泛的聊天提示词,而是多步骤工作:遗漏依赖、缺乏支持的主张或未测试的边缘情况,都会在日后耗费时间。

生产代码与 QA

调查回归问题、复现它、检查周边代码、实施有针对性的修复,并测试快速补丁通常会遗漏的路径。

财务与文档分析

核对表格、检验假设、比较源文件,并提出保留证据和注意事项的建议。

需要严格审查的研究

阅读相互竞争的来源、揭示开放问题、权衡证据,并区分看似自信的答案和真正有依据的答案。

长时 Agent 任务

使用工具、保留任务约束、从部分结果中恢复,并带着明确的检查点持续推进更大的任务。

试一个会带来后果的任务

01

带入真实上下文

加入一份有用答案必须考虑的代码、文档、要求和证据。

02

要求给出验证计划

不仅说明要产出什么,也明确在认定工作完成前必须检查什么。

03

比较最终产物

在 Felo 中用同一任务测试主流模型。不要只审阅答案,也要审阅其背后的测试、注意事项和判断。

当 Claude Opus 5 出现在你账号的实时模型选择器中时,请选择它。

打开 Felo LLM Playground

Claude Opus 5 FAQ

Claude Opus 5 是 Anthropic 于 2026 年 7 月 24 日发布的 Opus 层级模型。Anthropic 将其定位为适合长时运行的 agent、复杂软件工程、专业知识工作,以及能从验证和谨慎迭代中获益的任务。

使用会检查工作的模型。

在 Felo 中将 Claude Opus 5 与其他顶级模型并排比较,然后在一个仅有看似合理答案还不够的任务上测试它。

在 Felo 试用 Opus 5

从 Felo AI Search 开始,并在可用时选择该模型。