Claude Opus 5现已登陆Felo:功能、价格及7天免费试用
Felo现已支持Claude Opus 5。探索功能、基准测试、安全性和价格,免费体验Anthropic的agentic编码模型7天。
Felo现已支持Claude Opus 5,这是Anthropic推出的全新Opus级模型,适用于agentic编码、专业分析和长时间运行的任务。当你的任务不仅需要一个强有力的初步答案,还需要调研、验证、迭代,以及一个你可以自信审查的结果时,可以在Felo中选择它。
为庆祝上线,**Felo Pro订阅用户可在发布日起七天内免费使用Claude Opus 5,无需额外费用。**无论是顽固的bug、证据相互矛盾的调研简报、多步骤分析,还是需要多次修改才能完善的文档,都可以交给它,并用你真正关心的工作来评判它的表现。

封面图片:来自Anthropic的Claude Opus 5公告的原创艺术作品。视觉内容未做更改,仅由Felo添加了灰色边框。
这不仅仅是一份发布说明。下文将以图文方式介绍Opus 5的设计用途、Anthropic在评估中的报告、模型的局限,以及如何在Felo中用真实工作进行测试。
准备好体验了吗? 在Felo开启你的7天Claude Opus 5试用 ->
Claude Opus 5功能:模型的设计目标
Anthropic于2026年7月24日发布Claude Opus 5,将其定位为日常高能力模型,适用于长时间运行的智能体、软件工程和专业知识工作。Anthropic自己描述的关键变化并不仅仅是更好的初步响应。Opus 5旨在更有条理地工作:验证中间结果、保持复杂任务的线索,并在第一次尝试未能解决实际问题时进行迭代。
这种区别在实际工作中尤为重要。常规问题可能只需要快速简洁的答案。更大的任务则可能要求模型阅读源材料、判断还需要了解什么、运行计算或工具、比较方案、检查输出并解释结果。这些场景正是Opus级模型最值得选择的地方。
Anthropic强调了三大重叠优势:
- **agentic编码:**实现更大功能、困难调试、根因分析、重构,以及跨多个文件或工具的任务。
- **知识工作与分析:**对密集材料进行结构化推理、数值和表格处理、尽职调查、调研和决策支持。
- **计算机使用与自动化流程:**完成一系列步骤,而非仅仅给出单一孤立答案。
这些优势并不意味着模型可以不经检查直接使用。但它确实能在人工审查决策、证据和最终行动前,完成更完整的困难工作草稿。
Claude Opus 5基准测试与能力
模型基准测试是有用的参考信号,但并不能保证模型在每个项目中都表现一致。它们取决于任务、测试工具、设置和评分方式。不过,Anthropic的发布为Opus 5所针对的问题提供了有益的图景。
在软件工程方面,Anthropic报告称Opus 5在其内部Frontier-Bench v0.1测试中领先,并且以更低的任务成本将Opus 4.8的性能提升了两倍以上。下图很有参考价值,因为它将权衡具体化:橙色的Opus 5系列在各个努力设置下都高于之前的Opus结果,而不仅仅是在最昂贵的点上。

来源:Anthropic,Introducing Claude Opus 5。原图未变,仅由Felo添加灰色边框。图表注明Frontier-Bench测试使用了mini-SWE-agent工具、GKE后端,每个任务平均奖励取五次尝试。
在CursorBench 3.2上,Anthropic表示该模型在最大努力下距离Claude Fable 5的最高分仅差0.5%,而每个任务的成本仅为其一半。这也是Opus 5最适合那些低质量初次尝试会带来更多工作量的任务:如跨代码库调试、端到端功能开发,或追踪根因而非仅仅修补表面问题。
在更广泛的问题解决和办公类工作中,Anthropic报告Opus 5:
- 在ARC-AGI 3(新颖问题解决评估)中得分是次优模型的三倍;
- 在Zapier AutomationBench(端到端业务自动化测试)中,以相同任务成本达到约1.5倍的次优通过率;
- 在OSWorld 2.0(计算机使用基准)中以相似成本优于其他模型;
- 并且在ARC-AGI 3、GDPval-AA v2、HLE、AutomationBench和DeepSearchQA等相关评估中,是其表现最好且最具成本效益的模型。
这些不仅限于代码。Anthropic的GDPval-AA v2图表跟踪了不同努力水平下的真实世界知识任务。这有助于解释为何Opus 5在调研、金融、法律、运营等需要答案经得起审查的工作中同样适用,而不仅仅是初次阅读效果好。

来源:Anthropic,Introducing Claude Opus 5。原图未变,仅由Felo添加灰色边框。
这些都是Anthropic发布的结果,包括内部评估和部分早期反馈,而非独立的通用排名。最有效的阅读方式是作为模型测试指引:适用于依赖链长、需求模糊、工具使用、验证,以及浅层答案可能带来重大后果的任务。
Claude Opus 5功能:“努力”如何改变体验
Opus 5支持不同的努力设置。简单来说,努力让你可以在响应速度和token使用之间权衡更多推理时间。Anthropic的图表比较了模型在多个努力水平下的表现,从节省token的低努力,到高、极高和最大努力。
这很有用,因为并非每个请求都值得同样的预算。快速分类、提纲或小范围修改时可用低努力。任务有多个约束、需要模型整合信息源或诊断失败原因时则应提高努力。对于高风险输出,也要花时间做审查:让模型识别假设、引用来源、测试边界情况,或说明哪些因素会改变其建议。
此次发布还通过Anthropic平台引入了可选的快速模式。Anthropic称其速度约为标准的2.5倍,成本为基础费率的两倍。不同产品的可用性和控制方式可能不同,因此在Felo中应以工作区显示的设置为准,而不是假定所有Anthropic选项都以同样形式出现。
差异体现在自我检查方式
此次发布最有趣的主题是验证。Anthropic描述了一项评估:Opus 5收到一个机械零件的图纸,但无法直接查看。模型没有止步于此,而是据称编写了计算机视觉流程,从原始像素恢复几何信息,并用FreeCAD重建了3D模型。在另一个例子中,Anthropic称模型找到了真实包管理器bug的根因,并修复了社区补丁遗漏的边界情况。
这些例子应视为模型制造商的演示,而非承诺。但它们为Felo提供了具体的提示模式:不要只要求答案,要要求工作流程。
调查问题,然后提出修复建议。
在最终确定前,针对已说明的需求验证修复,
列出所有假设,并指出可能推翻它的测试或证据。
将最终建议与工作笔记分开返回。
对于调研,同样的方法可以将宽泛提示转化为可审查流程:收集当前资料、区分事实与推断、寻找反证,并生成简明决策简报。Felo的多语言流程在相关资料跨语言时尤其有用;如有需要,可要求保留源语言并提供清晰的英文总结。
Anthropic还报告了在OSWorld 2.0上的强劲表现,这是一个通过多步骤界面操作计算机的基准。这提醒我们agentic工作往往不是“一次提示,一次答案”,而是检查状态、选择下一步、验证结果是否真正达成目标的序列。

来源:Anthropic,Introducing Claude Opus 5。原图未变,仅由Felo添加灰色边框。
性能不是唯一考量:安全与限制
Anthropic报告称其部署前行为审计发现Opus 5是近期最符合预期的模型。模型表现出更低的整体不对齐行为、更低的欺骗行为,以及比其他Claude模型更强的抗滥用提示能力。公司还表示Opus 5在生物学和攻击性网络安全测试中,并未扩展高风险双重用途能力的边界。
下图是该声明最清晰的视觉总结。在Anthropic的1-10不对齐行为评分中,分数越低越好;Opus 5得分2.30,低于对比的其他模型。该图为内部安全评估,因此应作为参考,而非替代重要工作的人工审查。

来源:Anthropic,Introducing Claude Opus 5。原图未变,仅由Felo添加灰色边框。
重要的实际点是,安全措施仍是产品的一部分。Anthropic称Opus 5可帮助发现源代码漏洞,但对某些网络活动(如基于二进制的漏洞扫描、渗透测试和漏洞生成)设置了更强的防护。触发这些安全措施的请求可能被拦截,或在部分Anthropic产品中回退到其他模型。
对于其他工作,仍需保持与任何强大模型相同的好习惯:
- 在依赖前审查事实声明、计算、引用、代码和最终操作。
- 不要把流畅表达当作证据。要求原始资料并检查。
- 法律、金融、医疗、安全等重要决策必须由人负责。
- 给模型明确的成功条件和不可逾越的边界。
Anthropic还指出,Opus 5在长时间自主调研任务上仍有重要限制。能力不等于自主性,设计良好的人工审查流程仍是强大工作流的一部分。
Claude Opus 5价格及Felo免费试用
Anthropic通过Claude API列出的Claude Opus 5价格为每百万输入token 5美元,每百万输出token 25美元,与Opus 4.8的基础费率相同。第三方平台、订阅和功能的价格可能不同,因此请以你所在产品显示的价格和用量信息为准。
对于Felo Pro订阅用户,最直接的信息更简单:**Claude Opus 5自发布日起七天内可免费试用。**这让你可以用真实任务评估它,决定是否纳入常用模型组合。合理的比较不仅仅是“哪个模型写的初稿最好?”可以用你当前模型做同样的困难任务,然后比较完整性、错误率、后续需求、资料处理质量,以及每个结果需要多少审查时间。
如何在Felo Pro免费体验Claude Opus 5七天
- 登录你的Felo Pro账号。
- 在你常用于调研、写作、分析或agentic工作的Felo工作区新建任务。
- 在模型选择器中选择Claude Opus 5。
- 给它一个有明确交付物、相关文件或上下文,并包含显式验证步骤的任务。
- 审查结果,必要时优化指令,并在七天上线期间与当前工作流进行比较。
建议从能体现模型优势的工作开始:需要权衡的项目计划、复杂的表格或报告、困难的代码审查、多资料来源的调研问题,或必须经得起追问的分析。目标不是用巧妙提示让模型看起来厉害,而是判断它是否让你的真实工作更清晰、更可靠、更容易完成。
用这次机会处理重要任务: 在Felo开启你的Claude Opus 5试用 ->
Claude Opus 5值得一试吗?
Claude Opus 5为Felo带来了新选择,适用于需要坚持、细致推理和验证的任务。其发布结果显示agentic编码、自动化、计算机使用和专业分析方面的显著进步,同时安全约束和局限仍是重要背景。
未来七天,Felo Pro订阅用户可免费评估,无需额外模型费用。带来真正重要的任务,让它展示并检查自己的工作,然后根据结果决定Claude Opus 5是否值得在你的工作流中长期使用。
来源与延伸阅读
- Anthropic, "Introducing Claude Opus 5", 2026年7月24日。
- Anthropic, "Prompting Claude Opus 5"。
- Anthropic, Claude Platform pricing。
本文还提供以下语言版本:English、日本語、한국어、繁體中文、हिन्दी、Français、العربية、Русский、اردو、Bahasa Indonesia、Deutsch、Tiếng Việt、Türkçe、Italiano、ไทย、Español、বাংলা、Português。