Anthropic は 2026 年 9 月 22 日に Opus 5.5 を公開

Claude Opus 5.5同じ仕事を、より少ないトークンで

Anthropic の Claude 5.5 ファミリー最初のモデルです。多くの作業で Claude Fable 5.1 と同等の性能を持ち、実行コストは Opus 5 より 40% 低く、出力速度は 30% 以上向上しています。

9 月 22 日
2026 年リリース
Claude 5.5 ファミリー最初のモデル
$4 / $20
API 入力 / 出力
100 万トークンあたり。Opus 5 の $5 / $25 から値下げ
medium
既定の effort
既定が high の Opus 5 より一段低い
1M / 128K
コンテキスト / 最大出力
ウィンドウは Opus 5 と同じ、知識カットオフは 2026 年 6 月

Felo 検索で利用可能

資料一式をまとめて渡してから、質問する。

Claude Opus 5.5 が Felo 検索で使えるようになりました。長い入力を扱う作業に向いています。ファイルをまたいだ数値の突き合わせ、主張の出典までの追跡、そのまま他の人に渡せる回答の作成などです。

Felo 検索で Opus 5.5 を試す

01

文脈をまるごと保持する

100 万トークンのコンテキストウィンドウと 2026 年 6 月の知識カットオフ。長いスレッド、リポジトリ全体、資料一式をひとつのタスクに収められます。

02

結論だけでなく数値を検証する

Anthropic の社内テストでは、18 件のレポートのうち 16 件が品質基準を通過しました。捏造した数値や引用がひとつでもあれば失敗するタスクです。

03

何をしたか、何が必要かを明示する

Anthropic はモデルの伝え方を作り直しました。重要な情報が先頭に来て、完了したこと、判明したこと、未解決のことがそのまま書かれます。

クイックガイド

Felo で Claude Opus 5.5 に切り替える

Claude Opus 5.5 は、アカウントの他の主要モデルと並んでモデル選択に表示されます。

モデル選択を開き、Claude Opus 5.5 を選んでから、同じワークスペースでタスクを始めます。

Opus 5.5 の違い

コスト削減そのものが売りです。

Anthropic が打ち出しているのは、ベンチマークの点数を上げることではなく効率です。タスクあたりのトークン数が減り、トークン単価も下がり、典型的なワークロードでコストが 40% 下がります。長時間動かし続けるエージェント作業を現実的な費用で回せるのは、この点によります。

01

大規模な作業を最後まで終える

Anthropic によると、初期テスターは 20 万行のコードベースを 3 時間足らずで監査・修正しました。Opus 5 では 20 時間以上かかり、トークン消費も 2.5 倍でした。

02

マージ前にバグを捕まえる

Deloitte の報告では、最低の effort 設定でもコードレビューで既知のバグの 72% を検出しました。Opus 5 の high 設定では 56% で、誤検知もより多く出ていました。

03

人がそのまま使える報告を残す

文章は短く、構成も明快です。Box の報告では、精度を落とさずに冗長さが 40% 減り、トークン消費は Opus 5 の 3 分の 1 でした。

モデル選定

トークンのコストと、間違えるコストを並べて比べる。

以下の価格は 100 万トークンあたりの公式な公開 API 料金で、Felo のサブスクリプションや利用料金ではありません。effort の行は価格の行と同じくらい重要です。同じプロンプトでも、各モデルの出発点が違えば費用は大きく変わります。

比較項目
Claude Opus 5.5
Claude Fable 5.1
Claude Opus 5
GPT-6 Astra
API 価格 / 100 万トークン
入力 $4 / 出力 $20
入力 $10 / 出力 $50
入力 $5 / 出力 $25
入力 $10 / 出力 $50
キャッシュ読み取り / 100 万トークン
$0.20。入力価格の 0.05 倍
$0.25。入力価格の 0.025 倍
$0.50。標準の 0.1 倍
提供元とキャッシュ階層により異なる
既定の effort
medium。適応型思考は常時有効で無効化できません。
high。適応型思考は常時有効です。
high。high 以下なら思考を無効化できます。
呼び出し側がリクエストごとに設定
力を発揮する場面
中価格帯で長時間動かすエージェント型コーディング、コードレビュー、ナレッジワーク。
最も難しい推論と最長のエージェント作業。Opus 5.5 で effort を上げても評価が届かない場合に。
前世代の Opus 基準。実際の可用性と遅延は自社トラフィックで比較してください。
OpenAI のフラッグシップ帯。価格はレンジの最上位です。

上記の公開 API 料金と既定値は、2026 年 9 月 23 日時点で Anthropic の Claude Opus 5.5 発表、Claude Platform のモデルページ、OpenAI の GPT-6 Astra ページと照合しました。トークン単価はタスク総コストの一部にすぎません。Anthropic 自身の効率の主張は典型的なワークロードで 40% のコスト削減で、これはトークン単価の低下とタスクあたりのトークン数削減の両方を含みます。

Anthropic の公開結果

Opus 5.5 が上回る点と、上回らない点。

Anthropic は自社の数値を Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol と並べて公開しました。以下の 4 つのグラフのうち 2 つは、精度そのものではなく精度とタスクあたりコストの関係を示しています。Anthropic が行っている比較がまさにそれだからです。

Anthropic が公開した Claude Opus 5.5 の比較表。Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol との対比

公開された比較の全体

エージェント型コーディング、ナレッジワーク、業務ワークフロー、学際的推論、科学研究、コンピュータ操作、図表認識を、Anthropic が測定した 5 モデルすべてについて示しています。

Anthropic が公開した Claude Opus 5.5 のエージェント型コーディングのグラフ

エージェント型コーディング

Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 を、タスクあたりコストに対する精度として示しています。

Anthropic が公開した Claude Opus 5.5 のナレッジワークのグラフ

ナレッジワーク

44 職種を対象とする GDPval-AA v2.1、AutomationBench、Perplexity のデータ収集ベンチマーク WANDR。

Anthropic が公開した Claude Opus 5.5 のコンピュータ操作と推論のグラフ

コンピュータ操作と推論

OSWorld 2.0、Humanity's Last Exam、Chartography。最後のものはグラフから数値を読み取る精度を測ります。

Anthropic が公開した Claude Opus 5.5 の精度とタスクあたりコストのグラフ

精度とタスクあたりコスト

Anthropic の主張の中心は、どんな費用を払っても高い点数を取ることではなく、費用を桁違いに下げても同等以上の点数を取ることです。

ベンダー公開の数値です。特に断りのない限り、Anthropic は max effort で適応型思考を有効にして Opus 5.5 を実行し、本番用のセーフガードを有効にして評価しています。セーフガードが介入した場合、サイバーセキュリティのタスクは Opus 4.8 が、生物学のタスクは Opus 5 が完了しており、これらのベンチマークで公開された Opus 5.5 の数値は低く出ている可能性があります。GPT-6 Astra と GPT-5.6 Sol の数値は OpenAI の公表値です。ベンダーをまたいだスコア差は実世界の差の弱い手がかりにすぎない、というのが Anthropic 自身の説明です。

すでに Opus 5 を動かしている場合

既存コードを壊す 4 つの変更。

Anthropic は、すでに Claude Opus 5 で動いている統合向けの破壊的変更を 4 つ挙げています。加えて、リクエストは失敗させないままレスポンスの形を変える変更が 1 つあります。モデル ID を差し替える前に読む価値があります。4 つのうち 3 つは静かに劣化するのではなく、400 エラーを返すからです。

01

思考を無効化できなくなった

Opus 5 では high 以下で思考を無効化できました。Opus 5.5 では常時有効で、無効化の指定も手動のトークン予算も 400 エラーを返します。制御できるのは effort だけで、既定値も high から medium に変わりました。

thinking: {"type": "disabled"} -> 400 invalid_request_error

02

強制ツール使用が拒否される

tool_choice を "any" にするか、ツール名を指定すると 400 エラーを返します。トークン計数エンドポイントも同様です。auto と strict なツール使用または構造化出力を組み合わせ、ツールを使うべき場面はプロンプトで伝えてください。

tool_choice: {"type": "tool", "name": "..."} -> 400 invalid_request_error

03

思考ブロックは生成したモデルに紐づく

各思考ブロックは、それを生成したモデルを記録します。Opus 5.5 は Opus 5 およびそれ以前の Opus、Sonnet、Haiku のブロックは読めますが、Fable と Mythos のものは読めません。ルーターが会話を他のモデルへ移すと、以降のターンは以前の推論なしで実行されます。

Opus 5.5 -> Fable 5.1 / Mythos 5.1 は思考を保持、他のモデルは破棄

04

旧コンピュータ操作ツールが使えない

Claude API と Google Cloud では computer_20251124 ツールが 400 エラーを返します。代わりに computer_toolset_20260801 ツールセットを宣言し、ベータヘッダーを外し、エージェントループをメンバーの tool_use ブロックに対応させてください。Amazon Bedrock では旧ツールも引き続き動作します。

computer_20251124 -> computer_toolset_20260801

思考を制御する手段は effort だけになった

思考を無効化できない以上、調整するのは effort です。Opus 5.5 は 5 段階すべてに対応し、既定は medium で Opus 5 より一段低くなっています。Anthropic の指針は、以前の設定を持ち越さず自社の評価で改めてスイープすること、そして高めの設定では max_tokens を大きく取ることです。思考テキストが返らない場合でも思考トークンは上限に計上されるためです。

レベル
既定
Anthropic の推奨用途
low
いいえ
最もトークン効率が高く、能力はいくらか低下します。Anthropic は単純なタスクやサブエージェント向けとしています。
medium
はい
Opus 5.5 の既定値です。Anthropic によれば、コーディングとナレッジワークの評価で high 設定の Opus 5 と同等以上です。
high
いいえ
他の多くの Claude モデルの既定値です。複雑な推論や難度の高いコーディング問題に向きます。
xhigh
いいえ
30 分を超えて走る長期的なエージェント作業やコーディングで、トークン予算が数百万に及ぶ場合。
max
いいえ
利用可能な最も深い推論で、トークン消費を制限しません。品質向上を実測できた作業に取っておいてください。

effort は厳密なトークン予算ではなく行動のシグナルです。低い設定でも、本当に難しい問題では思考します。ただし高い設定よりは少なくなります。Anthropic はまた、同じ設定でも Opus 5.5 は Opus 5 より 1 ターンあたりの思考量が多く、xhigh と max で特に顕著だと述べています。Opus 5 の設定を持ち越すと、ターンが長く高くつきます。

向いている作業

ずっと見張っていられないほど長い仕事。

数時間かかる、扱うファイルが一人では把握しきれない、あるいは成果物を別の人が確認する必要がある。そんなときに Opus 5.5 は力を発揮します。以下は Anthropic と初期テスターが挙げた具体的な作業で、一般的なチャットのプロンプトではありません。

コードベース全体の移行と監査

最初に見つかった動きそうなパッチで止めず、テストが通るまで変更を大きなリポジトリ全体に通します。Anthropic によれば、あるテスターは 68 万行の移行を 1 日足らずで終えました。

本当のバグを見つけるコードレビュー

Anthropic のテスターである Column は、数コミット前に誤ってモデル化されていたサードパーティ連携について、外部ドキュメントを確認してバグを発見したと報告しています。

財務・文書分析

モデルを組み、次に 1 枚の要約を書き、前提と留保を保ったまま仕上げます。Anthropic によれば、ある買収分析は 63 分で完了し、Opus 5 の 93 分に対してコストは半分でした。

長時間動くエージェントチーム

サブエージェントに委任し、時間予算に合わせて進め方を調整します。Anthropic は、マルチエージェント構成に経過時間のシグナルを与えると、直列化せず並列化すると説明しています。

長く走るタスクで試す

01

実際の文脈を持ち込む

リポジトリ、文書、要件など、役に立つ回答が考慮すべきものを入れます。100 万トークンのウィンドウはそのためにあります。

02

完了条件を書く

何が満たされれば完了と言えるかを明示します。Anthropic の無人実行向けの指針は、タスクの各項目をチェックリストにしてモデルに更新させることです。

03

完成した成果物を比べる

同じタスクを Felo で Opus 5.5、Opus 5、Fable 5.1 に実行させます。答えだけでなく、テスト、留保、トークン数まで比べてください。

アカウントのモデル選択に Claude Opus 5.5 が表示されたら選択してください。

Felo で Opus 5.5 を試す

Claude Opus 5.5 よくある質問

Claude Opus 5.5 は、長時間動くエージェント型コーディングとナレッジワーク向けの Anthropic のモデルで、2026 年 9 月 22 日に Claude 5.5 ファミリーの最初のモデルとして公開されました。Anthropic によれば、多くの作業で Claude Fable 5.1 と同等の性能を持ちながら、実行コストは Claude Opus 5 より 40% 低くなっています。

あの長いタスクを、より低い費用で。

Felo で Claude Opus 5.5 を他の主要モデルと並べ、何時間もかかるからと後回しにしてきた仕事で試してみてください。

Felo で Opus 5.5 を試す

Felo AI 検索から始め、利用可能な場合はモデルを選択してください。