01
追溯真正的问题
梳理模糊请求背后的限制条件,而不是停在第一个看似合理的理解上。
Anthropic 于 2026 年 7 月 24 日发布 Opus 5
自发布起,Felo PRO 用户可免费试用 Claude Opus 5 7 天。

现已上线 Felo Search
Claude Opus 5 现已加入 Felo Search,适合需要更深入调查、更强来源综合,以及必须依据证据核查最终答案的问题。
01
梳理模糊请求背后的限制条件,而不是停在第一个看似合理的理解上。
02
将竞争性的来源和说法放入同一项调查,再指出证据在哪些地方一致、哪些地方并不一致。
03
把答案作为可用于决策的起点,同时保留推理过程、注意事项和开放问题。
快速演示
打开模型选择器,选择 Claude Opus 5,然后在同一工作区开始任务。
7 月 24 日
2026 年发布
Anthropic 最新的 Opus 模型
$5 / $25
API 输入 / 输出
每 100 万 token,与 Opus 4.8 的基础价格相同
约 2.5 倍
Fast mode 速度
在 Anthropic 平台上,价格为基础价格的 2 倍
验证 + 修订
长时任务
规划、工具使用、检查和迭代
Opus 的不同之处
Anthropic 将 Opus 5 定位为适合持续判断的工作:找出底层问题、验证结果,并在证据站不住脚时回看工作。
01
面对棘手的 bug 和含糊的任务,应从证据、约束和真正的根因开始,而不是做表面的补丁。
02
使用能够审视自身输出、检验假设,并在人们日后发现问题之前捕捉问题的模型。
03
把代码、源材料、工具结果和新约束带入同一个更长的任务,而不是把工作拆成彼此无关的提示词。
模型选择
以下价格为官方公开 API 费率,而不是 Felo 的订阅或使用价格。它们让取舍更清晰,但并不假装不同厂商的延迟测试可以直接比较。
官方公开 API 价格于 2026 年 7 月 25 日核查。总任务成本还取决于输出长度、缓存输入、推理设置、工具调用、重试和人工审核。
官方基准图表
这些官方图表绘制了不同 effort level 下的模型性能与报告的评测成本。它们可为成本决策提供参考,但属于厂商发布结果,并非 Felo 独立测试。

跨基准类别的官方能力概览
Anthropic 的跨任务矩阵比较了 Opus 5、Fable 5、Opus 4.8 和 GPT-5.6 Sol 在编程、知识工作、搜索、计算机使用、业务流程等领域的公开结果。

按 effort level 划分的 Agentic 编程
Artificial Analysis Coding Agent Index:官方图表比较不同 effort setting 下的得分和每项任务的报告成本。

按 effort level 划分的 Agentic 计算机使用
OSWorld 2.0:官方图表比较不同 effort setting 下的计算机使用表现和每项任务的报告成本。

按 effort level 划分的真实世界知识任务
GDPval-AA v2:官方图表比较不同 effort setting 下的 Elo 得分和完整基准的报告成本。

按 effort level 划分的 Agentic 搜索
DeepSearchQA:官方图表比较不同 effort setting 下的搜索任务通过率和每项任务的报告成本。
图表及基准标签来自 Anthropic 的 Claude Opus 5 公告。Felo 仅添加了外部展示边框,图表内容按原发布内容保留。
更好的起点
当验证会改变结果时,这个模型才真正有价值。这不是泛泛的聊天提示词,而是多步骤工作:遗漏依赖、缺乏支持的主张或未测试的边缘情况,都会在日后耗费时间。
调查回归问题、复现它、检查周边代码、实施有针对性的修复,并测试快速补丁通常会遗漏的路径。
核对表格、检验假设、比较源文件,并提出保留证据和注意事项的建议。
阅读相互竞争的来源、揭示开放问题、权衡证据,并区分看似自信的答案和真正有依据的答案。
使用工具、保留任务约束、从部分结果中恢复,并带着明确的检查点持续推进更大的任务。
01
加入一份有用答案必须考虑的代码、文档、要求和证据。
02
不仅说明要产出什么,也明确在认定工作完成前必须检查什么。
03
在 Felo 中用同一任务测试主流模型。不要只审阅答案,也要审阅其背后的测试、注意事项和判断。
当 Claude Opus 5 出现在你账号的实时模型选择器中时,请选择它。
打开 Felo LLM PlaygroundClaude Opus 5 是 Anthropic 于 2026 年 7 月 24 日发布的 Opus 层级模型。Anthropic 将其定位为适合长时运行的 agent、复杂软件工程、专业知识工作,以及能从验证和谨慎迭代中获益的任务。
在 Felo 中将 Claude Opus 5 与其他顶级模型并排比较,然后在一个仅有看似合理答案还不够的任务上测试它。
在 Felo 试用 Opus 5从 Felo AI Search 开始,并在可用时选择该模型。