基本スペック
| 項目 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 公開日 | 2026年9月22日 | — |
| モデルID | claude-opus-5-5 | claude-opus-5 |
| 入力 100万トークン | 4ドル | 5ドル |
| 出力 100万トークン | 20ドル | 25ドル |
| バッチ処理 | 50%引き | 50%引き |
| キャッシュ読み込み | 0.20ドル | — |
| コンテキスト | 100万トークン | 100万トークン |
| 最大出力 | 12万8千トークン | 12万8千トークン |
| 既定の effort | medium | high |
| 知識のカットオフ | 2026年6月 | — |
| 提供終了の下限 | 2027年9月22日以降 | — |
公式は「典型的なワークロードで Opus 5 より40%安い」と説明しています(Introducing Claude Opus 5.5)。価格の2割引きに、同じ仕事に使うトークンの2割減が乗った結果です。出力の速度も3割上がっています。
提供先は Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS です。キャッシュ読み込みは入力価格の5%まで下がり、Opus 5 と比べて6割安くなりました(モデル概要)。
何が 変わったか
Claude Opus 5 から移る場合、効いてくる変更は次のとおりです(What's new in Claude Opus 5.5)。
- 価格が下がった:入力4ドル/出力20ドル。バッチ処理は半額、キャッシュ読み込みは0.20ドル
- 既定の effort が medium になった:指定しなければ、以前より浅く考えて速く返る
- 出力が3割速くなった:同じ内容を返すまでの時間が短い
- 入出力トークンが2割減った:同じ仕事を、より少ないトークンで終える
- 思考をオフにできなくなった:無効化するとエラーになる。深さの調整は effort で行う
- ツールの強制呼び出しが使えなくなった:tool_choice の any と tool はエラーになる
- チャートや図の読み取りが上がった:密な図から値を読むのに、画像ツールを補助に使う必要が減った
公式が挙げた例では、20万行のコードベースの監査と修正が3時間以内に終わっています。Opus 5 では20時間以上かかり、トークンも2.5倍必要だった作業です。
ベンチマークは 「9勝2敗」では 読めない
まず、公開されたベンチマーク比較を見ます。

9項目のうち7項目で Opus 5.5 が首位です。エージェント型のコーディング3種(Terminal-Bench 4.0 で66.4%、FrontierCode v1.1 で54.4%、CursorBench 4.0 で57.8%)、知識労働(GDPval-AA v2.1 で1846)、分野横断の推論、コンピュータ操作、チャート読み取りで先頭に立っています。
一方、業務ワークフロー(AutomationBench)は GPT-6 Astra の41.4%に対して40.0%、エージェント型の科学研究(Terminal-Bench-Science 0.1)は64.6%に対して58.7%で、いずれも負けています。
ここで大事なのは、数字が測定条件で動くという点です。脚注には、読み飛ばせない但し書きが並んでいます。
- 標準誤差がある:Terminal-Bench 4.0 は Opus 5.5 で±2.6ポイント、他の Claude モデルで±1.6〜2ポイント。1〜2ポイントの差は誤差に埋もれる
- 安全機構が作動した分、スコアが下がっている:介入が起きた課題は旧モデルが代わりに解いており、公式は「Opus 5.5 のスコアを下げていると考えられる」と明記している
- 条件が揃っていない項目がある:AutomationBench は Zapier による測定で、代替モデルなしで走らせたため、安全機構の介入がそのまま失敗として数えられている
- effort の水準が違う:Terminal-Bench 4.0 は Opus 5.5 が xhigh、GPT-6 Astra が high での結果。それぞれの最高点どうしを並べている
つまりこの表は「どちらが賢いか」ではなく、「各社が自分の最良の設定で出した点数」の一覧です。実務で意味を持つのは、次の図です。
同じ モデルが、 設定しだいで 38%から 66%まで 動く
こちらは Terminal-Bench 4.0 のスコアを、1回あたりのコストに対して並べた図です。横軸は対数目盛りのドル、縦軸は正答率です。

Opus 5.5 の線を追うと、effort を上げるにつれてスコアが動きます。
| effort | コスト | スコア |
|---|---|---|
| low | 約1.3ドル | 38.5% |
| medium | 約3ドル | 57.7% |
| high | 約4ドル | 64.2% |
| xhigh | 約7.5ドル | 66.4% |
| max | 約11ドル | 64.8% |
コストは1回あたりの概算です。それぞれの想定用途は公式の effort ドキュメントに示されています。
- low:単純な作業、サブエージェント
- medium:速度・コスト・性能の均衡(既定)
- high:複雑な推論、難しいコーディング
- xhigh:30分を超える長時間のエージェント作業
- max:最も深い推論が要る課題
読み取れることは3つあります。
第一に、モデルの銘柄より、設定のほうが結果を左右します。同じ Opus 5.5 が、effort ひとつで38.5%から66.4%まで動いています。この幅は、モデル間の差よりずっと大きいものです。
第二に、価格対性能の段差がはっきり出ています。Opus 5.5 は medium(約3ドル)の時点で57.7%に達しており、GPT-6 Astra の最良点(約7.5ドルで58.2%)とほぼ並びます。公式も「FrontierCode では既定の effort で GPT-6 Astra の最高スコアを、1タスクあたり約5分の1のコストで上回る」「Terminal-Bench 4.0 では約40%のコストで並ぶ」と説明しています。旧世代の Opus 5 は、最も高い設定(約16ドル)でようやく52.3%でした。
第三に、上げるほど良くなるわけではありません。max(約11ドル)の64.8%は、xhigh(約7.5ドル)の66.4%を下回っています。コストを1.5倍払って、スコアは下がっています。
X での反応
いいね 100 件以上の投稿から · いいね順
もしかしてClaude Codeの /advisor コマンドで、指定のモデルをアドバイザーにできる機能が標準搭載されているの知られていない??
Mac限定だけどClaude Codeに直接編集させられる動画編集ソフト出たらしい オープンソースで、自分のClaudeのAPIキーかMCP接続で使えるみたい
Claude Code はこのプラグインを入れないと 全く使い物にならないんです。 Anthropic の公式プラグインの インストールが必須です 👇 claude-code-setup どんな自動化をセットアップ できるかを教えてくれて
キャラ崩れ、終わったやん ・絵コンテ→Claude Code ・世界観→GPT image2 ・動画生成→Seedance2.0 ・作詞作曲→Claude Code ・音楽→Suno v5.5 ・編集→Claude Code 制作時間:実測30分 キャラが101秒、一度も崩れてないコツは「三面図を全カットのプロンプトに埋める」これだけ
【公式がしれっと出してきた】 Claude Codeがごちゃついてる人ほど、 まず入れた方がいいpluginが話題😳 claude-code-setup。 https://t.co/vSgcx4TE4w これ、何がエグいかというと👇 ・project structureを読んでくれる ・dependenciesとcode patternsを見る ・MCP serversを提案 ・Skillsを提案
深く 考えさせる ほど、 トークンは 跳ね上がる
もう1枚、運用に直結する図があります。Artificial Analysis が公開している、1タスクを終えるのに使う出力トークン数の比較です。濃い色が回答、薄い色が思考にあたります。

Claude Opus 5.5 の位置を追うと、effort による差が一目でわかります。
- medium:1タスクあたり約26,000トークン
- high:約36,000トークン
- xhigh:約66,000トークン
- max:約119,000トークン
medium と max では4.6倍のトークン差があります。先ほどの図でスコアが数ポイントしか変わらなかったことを思い出すと、この差は割に合いません。
そして出力トークンは、料金であると同時に待ち時間でもあります。トークンを4.6倍使うということは、返ってくるまでの時間もおおむねそれだけ延びるということです。人が画面の前で待つ作業では、この差が体感を決めます。
なお、この図は Artificial Analysis の Intelligence Index という別の課題群での測定です。Terminal-Bench とは課題の中身が違うため、前の図と直接つなげて読むことはできません。「effort を上げるとトークンが急増する」という傾向の確認に使ってください。
実務では、 どの 設定を 選ぶべきか
ここまでの3枚から導かれる方針は、はっきりしています。
- 既定の medium から始める。公式が既定を high から medium へ下げたこと自体が、推奨設定の変更です。medium の57.7%という水準は、多くの実務で十分に使えます
- 上げるのは難所だけにする。大規模な移行作業や、原因の見えない不具合の調査など、難易度の高い場面だけ high や xhigh に上げます。会話の途中で effort を変える機能(ベータ)もあり、プロンプトキャッシュを保ったまま切り替えられます
- max は常用しない。コストとトークンが跳ね上がるわりに、スコアが xhigh を下回る場合すらあります。max は保険であって既定値ではないと考えてください
- 自社の課題で一度だけ測る。公式も「自分のトラフィックの一部で2つか3つの effort を試し、曲線から答えを読め」と案内しています。典型的な作業を3つほど選び、medium と high で1回ずつ走らせて、所要時間とコストと結果を記録してください
ひとつ前の世代でも、同じ傾向が数字で示されています。Claude Opus 5 のコストと知能の最適化ガイドによれば、SWE-bench Pro では medium がおよそ2ポイントを手放す代わりにコストが半分、low はおよそ8ポイントを手放す代わりにコストが4分の1でした。調査系の課題では、low でも1〜3ポイントしか落ちずにコストが3〜5割減っています。
なお Opus 5.5 は、同じ effort でも Opus 5 より多く考える傾向があり、特に xhigh と max で顕著だと公式が明記しています。Opus 5 で使っていた設定をそのまま持ち込まず、測り直してください。上位の effort では、思考と本文の合計に上限がかかるため、max_tokens を大きめに取る必要もあります。
移行時に 引っかかる 4つの 変更
コードを書き換えずに移行できるわけではありません。既存の実装が壊れる変更が4つあります(移行ガイド)。
- 思考を無効にできない。無効化の指定はエラーになります。浅くしたい場合は effort を下げます
- ツールの強制呼び出しが使えない。tool_choice の any と tool はエラーになります。厳密なJSONが必要なら、strict なツール利用か構造化出力に移します
- 思考ブロックがモデルと会話に紐づく。Opus 5 からの引き継ぎはできますが、Fable 系・Mythos 系との間では引き継げません
- 旧いコンピュータ操作ツールが使えない。computer_20251124 は Claude API と Google Cloud では受け付けられません(Amazon Bedrock では引き続き動きます)
もう1点、エラーにならないぶん気づきにくい変更があります。ツール呼び出しの合間に出ていた短い進捗メッセージが、思考ブロックに変わりました。これを画面に流していたアプリは、設定を変えるまで、ツールを呼んでいる間だけ静かになります。
よく ある 質問
Claude Opus 5.5 とは 何ですか。
Claude Opus 5 から 乗り換えるべきですか。
effort は どれを 選べば よいですか。
ベンチマークの スコアは 信じて よいですか。
料金は どれくらい かかりますか。
参考文献
- Anthropic「Introducing Claude Opus 5.5」 - Claude Platform Docs「Claude Opus 5.5 モデル概要」 - Claude Platform Docs「What's new in Claude Opus 5.5」 - Claude Platform Docs「Claude Opus 5.5 移行ガイド」 - Claude Platform Docs「Effort」 - Claude Platform Docs「Optimizing for cost and intelligence」 - Claude Platform Docs「Prompting Claude Opus 5.5」 - Anthropic「Claude Opus 5.5 System Card」 - Artificial Analysis「Output Tokens per Intelligence Index Task」









