01
一次装下全部上下文
100 万 token 上下文窗口,知识截止到 2026 年 6 月。长对话、整个代码仓库或一整套文档都能留在同一个任务里。
Anthropic 于 2026 年 9 月 22 日发布 Opus 5.5
Anthropic Claude 5.5 家族的首款模型。它在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%,输出速度提升超过 30%。
现已接入 Felo 搜索
Claude Opus 5.5 已在 Felo 搜索中上线,适合处理长输入的任务:跨文件核对数字、把结论追溯到出处,最后交出一份可以直接转给别人的答案。
01
100 万 token 上下文窗口,知识截止到 2026 年 6 月。长对话、整个代码仓库或一整套文档都能留在同一个任务里。
02
在 Anthropic 的内部测试中,18 份报告有 16 份通过了质量线;该任务只要出现一个编造的数字或引文就会判定失败。
03
Anthropic 重写了模型的表达方式:最重要的信息放在最前面,报告会直接说明已完成什么、发现了什么、还有什么没解决。
快速上手
Claude Opus 5.5 会与其他领先模型一起出现在你账号的模型选择器中。
Opus 5.5 的不同之处
Anthropic 这次强调的是效率,而不是更高的跑分:每个任务消耗的 token 更少,单价更低,典型工作负载的成本下降 40%。正是这一点让长时间运行的智能体任务变得负担得起。
01
Anthropic 提到一位早期测试者用不到三小时审计并修复了 20 万行代码库,而 Opus 5 花了 20 多个小时,token 用量还是它的 2.5 倍。
02
Deloitte 报告称,Opus 5.5 在最低 effort 档位下于代码审查中发现了 72% 的已知 bug,而 Opus 5 在 high 档位下为 56%,且误报更少。
03
它的文字更短、结构更清楚。Box 报告称答案啰嗦程度降低 40% 而准确率不变,token 用量只有 Opus 5 的三分之一。
模型选择
下表是官方公开 API 价格,按每百万 token 计,不是 Felo 的订阅或用量价格。effort 那一行和价格一样重要:同一个提示词,各模型起点不同,花费可能相差很大。
以上公开 API 价格与默认档位于 2026 年 9 月 23 日核对自 Anthropic 的 Claude Opus 5.5 发布公告、Claude Platform 模型页以及 OpenAI 的 GPT-6 Astra 页面。token 单价只是任务总成本的一部分;Anthropic 自己的效率说法是典型工作负载成本下降 40%,这一数字同时包含单价下降与单任务 token 用量减少。
Anthropic 公布的成绩
Anthropic 把自己的成绩与 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol 并列公布。下面四张图中有两张画的是准确率与单任务成本的关系,而不是单纯的准确率,因为这才是 Anthropic 想做的对比。

完整的官方对比
涵盖智能体编程、知识工作、业务流程、跨学科推理、科研、计算机操作与图表识别,覆盖 Anthropic 测量的全部五款模型。

智能体编程
Terminal-Bench 4.0、FrontierCode v1.1 与 CursorBench 4.0,横轴为单任务成本,纵轴为准确率。

知识工作
覆盖 44 个职业的 GDPval-AA v2.1、AutomationBench,以及 Perplexity 的数据采集基准 WANDR。

计算机操作与推理
OSWorld 2.0、Humanity's Last Exam 与 Chartography,其中最后一项衡量的是从图表中读取数值的准确度。

准确率与单任务成本
Anthropic 的核心主张不是在任何成本下都拿到更高分,而是在成本降到零头的同时拿到持平或更好的成绩。
厂商公布数据。除另有说明外,Anthropic 在 max effort 下启用自适应思考运行 Opus 5.5,并在生产防护开启的情况下评测;当防护介入时,网络安全任务由 Opus 4.8 完成,生物学任务由 Opus 5 完成,这很可能压低了 Opus 5.5 在这些基准上的公布成绩。GPT-6 Astra 与 GPT-5.6 Sol 的数据来自 OpenAI 公布值。跨厂商的跑分差距只能作为现实差异的弱参考,这也是 Anthropic 自己对这组数字的说明。
如果你已经在跑 Opus 5
Anthropic 列出了四项针对已在 Claude Opus 5 上运行的集成的破坏性变更,另外还有一项会改变响应结构但不会让请求失败。换模型 ID 之前值得先读一遍,因为其中三项会直接返回 400 错误,而不是悄悄降级。
01
在 Opus 5 上,high 及以下档位可以关闭思考。Opus 5.5 始终开启,关闭写法与手动 token 预算都会返回 400 错误。effort 成了唯一的控制手段,默认档位也从 high 变成 medium。
thinking: {"type": "disabled"} -> 400 invalid_request_error
02
tool_choice 设为 "any" 或指定某个工具名都会返回 400 错误,token 计数接口同样如此。改用 auto 搭配严格工具调用或结构化输出,并在提示词里说明何时该用该工具。
tool_choice: {"type": "tool", "name": "..."} -> 400 invalid_request_error
03
每个思考块都会记录产出它的模型。Opus 5.5 可以读取 Opus 5 及更早的 Opus、Sonnet、Haiku 模型的思考块,但读不了 Fable 与 Mythos 的。如果路由把对话切到其他模型,后续轮次将不再带上此前的推理。
Opus 5.5 -> Fable 5.1 / Mythos 5.1 保留思考;其他模型会丢弃
04
在 Claude API 与 Google Cloud 上,computer_20251124 工具会返回 400 错误。请改用 computer_toolset_20260801 工具集,去掉 beta 头,并让智能体循环适配成员 tool_use 块。在 Amazon Bedrock 上旧工具仍可使用。
computer_20251124 -> computer_toolset_20260801
既然思考无法关闭,可调的就是 effort。Opus 5.5 支持全部五档,默认 medium,比 Opus 5 低一档。Anthropic 的建议是在自己的评测集上重新跑一轮档位扫描,而不是沿用旧设置;同时在高档位下把 max_tokens 设得足够大,因为即使不返回思考文本,思考 token 也计入其中。
effort 是行为信号,而不是硬性 token 预算:在较低档位下,模型面对真正困难的问题仍会思考,只是比高档位少。Anthropic 还指出,在同一档位下 Opus 5.5 每轮思考量普遍多于 Opus 5,在 xhigh 与 max 下尤其明显,因此沿用 Opus 5 的设置会让每轮更长、更贵。
适用场景
当任务要跑几个小时、涉及的文件多到一个人装不下,或者产出需要第二个人复核时,Opus 5.5 才真正体现出价值。以下场景来自 Anthropic 及其早期测试者的描述,不是泛泛的聊天提示词。
把一处改动贯穿整个大型仓库直到测试通过,而不是停在第一个看起来可行的补丁上。Anthropic 提到一位测试者用不到一天完成了 68 万行的迁移。
Anthropic 的测试方 Column 报告称,它通过查阅外部文档,发现了一个在好几个提交之前就被建模错误的第三方集成 bug。
先建模型,再写一页纸的结论,并把前提和保留意见保留下来。Anthropic 报告称一起并购分析用时 63 分钟,Opus 5 为 93 分钟,成本只有一半。
它会把任务分派给子智能体,并依据时间预算安排节奏。Anthropic 的建议是给多智能体框架提供已耗时信号,让它并行推进而不是串行等待。
01
把代码仓库、文档和需求都放进去,这些是答案必须考虑到的内容。100 万 token 窗口正是为此存在。
02
讲清楚什么条件满足才算做完。Anthropic 对无人值守运行的建议是:把任务的各个部分放进一份清单,让模型持续更新。
03
在 Felo 里把同一个任务分别交给 Opus 5.5、Opus 5 和 Fable 5.1。比的不只是答案,还有测试、保留意见和 token 消耗。
当你的账号模型选择器中出现 Claude Opus 5.5 时选中它即可。
在 Felo 试用 Opus 5.5Claude Opus 5.5 是 Anthropic 面向长时间运行的智能体编程与知识工作的模型,于 2026 年 9 月 22 日发布,是 Claude 5.5 家族的首款模型。Anthropic 称它在多数任务上达到 Claude Fable 5.1 的水平,而运行成本比 Claude Opus 5 低 40%。
在 Felo 里把 Claude Opus 5.5 和其他领先模型放在一起,然后拿那个因为要跑几个小时而一直拖着没做的任务来试。
在 Felo 试用 Opus 5.5从 Felo AI 搜索开始,在可用时选中该模型。