Anthropic 于 2026 年 9 月 22 日发布 Opus 5.5

Claude Opus 5.5同样的活,更少的 token

Anthropic Claude 5.5 家族的首款模型。它在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%,输出速度提升超过 30%。

9 月 22 日
2026 年发布
Claude 5.5 家族首款模型
4 / 20 美元
API 输入 / 输出
每百万 token,低于 Opus 5 的 5 / 25 美元
medium
默认 effort 档位
比默认 high 的 Opus 5 低一档
100 万 / 12.8 万
上下文 / 最大输出
窗口与 Opus 5 一致,知识截止 2026 年 6 月

现已接入 Felo 搜索

把整套文档丢进去,再提问。

Claude Opus 5.5 已在 Felo 搜索中上线,适合处理长输入的任务:跨文件核对数字、把结论追溯到出处,最后交出一份可以直接转给别人的答案。

在 Felo 搜索中试用 Opus 5.5

01

一次装下全部上下文

100 万 token 上下文窗口,知识截止到 2026 年 6 月。长对话、整个代码仓库或一整套文档都能留在同一个任务里。

02

核对数字,而不只是看结论

在 Anthropic 的内部测试中,18 份报告有 16 份通过了质量线;该任务只要出现一个编造的数字或引文就会判定失败。

03

说清做了什么、还缺什么

Anthropic 重写了模型的表达方式:最重要的信息放在最前面,报告会直接说明已完成什么、发现了什么、还有什么没解决。

快速上手

在 Felo 中切换到 Claude Opus 5.5

Claude Opus 5.5 会与其他领先模型一起出现在你账号的模型选择器中。

打开模型选择器,选中 Claude Opus 5.5,然后在同一个工作区里开始任务。

Opus 5.5 的不同之处

成本下降本身就是卖点。

Anthropic 这次强调的是效率,而不是更高的跑分:每个任务消耗的 token 更少,单价更低,典型工作负载的成本下降 40%。正是这一点让长时间运行的智能体任务变得负担得起。

01

把庞大的活干完

Anthropic 提到一位早期测试者用不到三小时审计并修复了 20 万行代码库,而 Opus 5 花了 20 多个小时,token 用量还是它的 2.5 倍。

02

在合并前抓到 bug

Deloitte 报告称,Opus 5.5 在最低 effort 档位下于代码审查中发现了 72% 的已知 bug,而 Opus 5 在 high 档位下为 56%,且误报更少。

03

留下一份人能直接用的报告

它的文字更短、结构更清楚。Box 报告称答案啰嗦程度降低 40% 而准确率不变,token 用量只有 Opus 5 的三分之一。

模型选择

把 token 的成本和出错的成本放在一起比。

下表是官方公开 API 价格,按每百万 token 计,不是 Felo 的订阅或用量价格。effort 那一行和价格一样重要:同一个提示词,各模型起点不同,花费可能相差很大。

对比维度
Claude Opus 5.5
Claude Fable 5.1
Claude Opus 5
GPT-6 Astra
API 价格 / 每百万 token
输入 4 美元 / 输出 20 美元
输入 10 美元 / 输出 50 美元
输入 5 美元 / 输出 25 美元
输入 10 美元 / 输出 50 美元
缓存读取 / 每百万 token
0.20 美元,为输入价的 0.05 倍
0.25 美元,为输入价的 0.025 倍
0.50 美元,即标准 0.1 倍
随服务商与缓存档位变化
默认 effort 档位
medium。自适应思考始终开启,无法关闭。
high。自适应思考始终开启。
high。在 high 及以下档位可以关闭思考。
由调用方按请求设置
适合的场景
以中端价格承担长时间运行的智能体编程、代码审查与知识工作。
最难的推理与最长的智能体任务,前提是在 Opus 5.5 上加大 effort 后评测仍不达标。
上一代 Opus 基准。请在自有流量上比较它的实际可用性与延迟。
OpenAI 的旗舰档位,定价处于区间顶部。

以上公开 API 价格与默认档位于 2026 年 9 月 23 日核对自 Anthropic 的 Claude Opus 5.5 发布公告、Claude Platform 模型页以及 OpenAI 的 GPT-6 Astra 页面。token 单价只是任务总成本的一部分;Anthropic 自己的效率说法是典型工作负载成本下降 40%,这一数字同时包含单价下降与单任务 token 用量减少。

Anthropic 公布的成绩

Opus 5.5 领先在哪,又没领先在哪。

Anthropic 把自己的成绩与 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol 并列公布。下面四张图中有两张画的是准确率与单任务成本的关系,而不是单纯的准确率,因为这才是 Anthropic 想做的对比。

Anthropic 公布的 Claude Opus 5.5 对比表,对照 Fable 5.1、Opus 5、GPT-6 Astra 与 GPT-5.6 Sol

完整的官方对比

涵盖智能体编程、知识工作、业务流程、跨学科推理、科研、计算机操作与图表识别,覆盖 Anthropic 测量的全部五款模型。

Anthropic 公布的 Claude Opus 5.5 智能体编程图表

智能体编程

Terminal-Bench 4.0、FrontierCode v1.1 与 CursorBench 4.0,横轴为单任务成本,纵轴为准确率。

Anthropic 公布的 Claude Opus 5.5 知识工作图表

知识工作

覆盖 44 个职业的 GDPval-AA v2.1、AutomationBench,以及 Perplexity 的数据采集基准 WANDR。

Anthropic 公布的 Claude Opus 5.5 计算机操作与推理图表

计算机操作与推理

OSWorld 2.0、Humanity's Last Exam 与 Chartography,其中最后一项衡量的是从图表中读取数值的准确度。

Anthropic 公布的 Claude Opus 5.5 准确率与单任务成本图表

准确率与单任务成本

Anthropic 的核心主张不是在任何成本下都拿到更高分,而是在成本降到零头的同时拿到持平或更好的成绩。

厂商公布数据。除另有说明外,Anthropic 在 max effort 下启用自适应思考运行 Opus 5.5,并在生产防护开启的情况下评测;当防护介入时,网络安全任务由 Opus 4.8 完成,生物学任务由 Opus 5 完成,这很可能压低了 Opus 5.5 在这些基准上的公布成绩。GPT-6 Astra 与 GPT-5.6 Sol 的数据来自 OpenAI 公布值。跨厂商的跑分差距只能作为现实差异的弱参考,这也是 Anthropic 自己对这组数字的说明。

如果你已经在跑 Opus 5

四处会直接让现有代码报错的变更。

Anthropic 列出了四项针对已在 Claude Opus 5 上运行的集成的破坏性变更,另外还有一项会改变响应结构但不会让请求失败。换模型 ID 之前值得先读一遍,因为其中三项会直接返回 400 错误,而不是悄悄降级。

01

思考无法再关闭

在 Opus 5 上,high 及以下档位可以关闭思考。Opus 5.5 始终开启,关闭写法与手动 token 预算都会返回 400 错误。effort 成了唯一的控制手段,默认档位也从 high 变成 medium。

thinking: {"type": "disabled"} -> 400 invalid_request_error

02

强制工具调用被拒绝

tool_choice 设为 "any" 或指定某个工具名都会返回 400 错误,token 计数接口同样如此。改用 auto 搭配严格工具调用或结构化输出,并在提示词里说明何时该用该工具。

tool_choice: {"type": "tool", "name": "..."} -> 400 invalid_request_error

03

思考块与产出它的模型绑定

每个思考块都会记录产出它的模型。Opus 5.5 可以读取 Opus 5 及更早的 Opus、Sonnet、Haiku 模型的思考块,但读不了 Fable 与 Mythos 的。如果路由把对话切到其他模型,后续轮次将不再带上此前的推理。

Opus 5.5 -> Fable 5.1 / Mythos 5.1 保留思考;其他模型会丢弃

04

旧版计算机操作工具已不可用

在 Claude API 与 Google Cloud 上,computer_20251124 工具会返回 400 错误。请改用 computer_toolset_20260801 工具集,去掉 beta 头,并让智能体循环适配成员 tool_use 块。在 Amazon Bedrock 上旧工具仍可使用。

computer_20251124 -> computer_toolset_20260801

effort 现在是唯一的思考控制项

既然思考无法关闭,可调的就是 effort。Opus 5.5 支持全部五档,默认 medium,比 Opus 5 低一档。Anthropic 的建议是在自己的评测集上重新跑一轮档位扫描,而不是沿用旧设置;同时在高档位下把 max_tokens 设得足够大,因为即使不返回思考文本,思考 token 也计入其中。

档位
是否默认
Anthropic 建议的用途
low
否
最省 token 的档位,能力会有所下降。Anthropic 建议用于较简单的任务和子智能体。
medium
是
Opus 5.5 的默认档位。Anthropic 称其在编程与知识工作评测上达到或超过 high 档位的 Opus 5。
high
否
多数其他 Claude 模型的默认档位。适合复杂推理与高难度编程问题。
xhigh
否
运行超过 30 分钟、token 预算达百万级的长周期智能体与编程任务。
max
否
可用的最深推理,不限制 token 消耗。留给已经实测出质量提升的任务。

effort 是行为信号,而不是硬性 token 预算:在较低档位下,模型面对真正困难的问题仍会思考,只是比高档位少。Anthropic 还指出,在同一档位下 Opus 5.5 每轮思考量普遍多于 Opus 5,在 xhigh 与 max 下尤其明显,因此沿用 Opus 5 的设置会让每轮更长、更贵。

适用场景

那些长到没法一直盯着的活。

当任务要跑几个小时、涉及的文件多到一个人装不下,或者产出需要第二个人复核时,Opus 5.5 才真正体现出价值。以下场景来自 Anthropic 及其早期测试者的描述,不是泛泛的聊天提示词。

全代码库迁移与审计

把一处改动贯穿整个大型仓库直到测试通过,而不是停在第一个看起来可行的补丁上。Anthropic 提到一位测试者用不到一天完成了 68 万行的迁移。

能揪出真问题的代码审查

Anthropic 的测试方 Column 报告称,它通过查阅外部文档,发现了一个在好几个提交之前就被建模错误的第三方集成 bug。

财务与文档分析

先建模型,再写一页纸的结论,并把前提和保留意见保留下来。Anthropic 报告称一起并购分析用时 63 分钟,Opus 5 为 93 分钟,成本只有一半。

长时间运行的智能体团队

它会把任务分派给子智能体,并依据时间预算安排节奏。Anthropic 的建议是给多智能体框架提供已耗时信号,让它并行推进而不是串行等待。

拿一个要跑很久的任务试试

01

把真实上下文带上

把代码仓库、文档和需求都放进去,这些是答案必须考虑到的内容。100 万 token 窗口正是为此存在。

02

说明完成条件

讲清楚什么条件满足才算做完。Anthropic 对无人值守运行的建议是:把任务的各个部分放进一份清单,让模型持续更新。

03

对比最终产物

在 Felo 里把同一个任务分别交给 Opus 5.5、Opus 5 和 Fable 5.1。比的不只是答案,还有测试、保留意见和 token 消耗。

当你的账号模型选择器中出现 Claude Opus 5.5 时选中它即可。

在 Felo 试用 Opus 5.5

Claude Opus 5.5 常见问题

Claude Opus 5.5 是 Anthropic 面向长时间运行的智能体编程与知识工作的模型,于 2026 年 9 月 22 日发布,是 Claude 5.5 家族的首款模型。Anthropic 称它在多数任务上达到 Claude Fable 5.1 的水平,而运行成本比 Claude Opus 5 低 40%。

用更低的价格跑那个长任务。

在 Felo 里把 Claude Opus 5.5 和其他领先模型放在一起,然后拿那个因为要跑几个小时而一直拖着没做的任务来试。

在 Felo 试用 Opus 5.5

从 Felo AI 搜索开始,在可用时选中该模型。