ブログ

Claude Opus 5.5の価格とeffort設定|同じ品質を安く出す

Claudecode 研修 編集部

監修: 株式会社ZETTAi

最終更新 2026年9月22日16 分で読了
Claude CodeClaude Opus 5.5料金ベンチマークAI開発

Sec.01

基本スペック

項目Claude Opus 5.5Claude Opus 5
公開日2026年9月22日
モデルIDclaude-opus-5-5claude-opus-5
入力 100万トークン4ドル5ドル
出力 100万トークン20ドル25ドル
バッチ処理50%引き50%引き
キャッシュ読み込み0.20ドル
コンテキスト100万トークン100万トークン
最大出力12万8千トークン12万8千トークン
既定の effortmediumhigh
知識のカットオフ2026年6月
提供終了の下限2027年9月22日以降

公式は「典型的なワークロードで Opus 5 より40%安い」と説明しています(Introducing Claude Opus 5.5)。価格の2割引きに、同じ仕事に使うトークンの2割減が乗った結果です。出力の速度も3割上がっています。

提供先は Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS です。キャッシュ読み込みは入力価格の5%まで下がり、Opus 5 と比べて6割安くなりました(モデル概要)。

Sec.02

何が変わったか

Claude Opus 5 から移る場合、効いてくる変更は次のとおりです(What's new in Claude Opus 5.5)。

  • 価格が下がった:入力4ドル/出力20ドル。バッチ処理は半額、キャッシュ読み込みは0.20ドル
  • 既定の effort が medium になった:指定しなければ、以前より浅く考えて速く返る
  • 出力が3割速くなった:同じ内容を返すまでの時間が短い
  • 入出力トークンが2割減った:同じ仕事を、より少ないトークンで終える
  • 思考をオフにできなくなった:無効化するとエラーになる。深さの調整は effort で行う
  • ツールの強制呼び出しが使えなくなった:tool_choice の any と tool はエラーになる
  • チャートや図の読み取りが上がった:密な図から値を読むのに、画像ツールを補助に使う必要が減った

公式が挙げた例では、20万行のコードベースの監査と修正が3時間以内に終わっています。Opus 5 では20時間以上かかり、トークンも2.5倍必要だった作業です。

Sec.03

ベンチマークは「9勝2敗」では読めない

まず、公開されたベンチマーク比較を見ます。

Claude Opus 5.5 のベンチマーク比較表。Opus 5.5、Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol の9項目のスコア
Claude Opus 5.5 のベンチマーク比較表。Opus 5.5、Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol の9項目のスコア(クリックで拡大)

9項目のうち7項目で Opus 5.5 が首位です。エージェント型のコーディング3種(Terminal-Bench 4.0 で66.4%、FrontierCode v1.1 で54.4%、CursorBench 4.0 で57.8%)、知識労働(GDPval-AA v2.1 で1846)、分野横断の推論、コンピュータ操作、チャート読み取りで先頭に立っています。

一方、業務ワークフロー(AutomationBench)は GPT-6 Astra の41.4%に対して40.0%、エージェント型の科学研究(Terminal-Bench-Science 0.1)は64.6%に対して58.7%で、いずれも負けています。

ここで大事なのは、数字が測定条件で動くという点です。脚注には、読み飛ばせない但し書きが並んでいます。

  • 標準誤差がある:Terminal-Bench 4.0 は Opus 5.5 で±2.6ポイント、他の Claude モデルで±1.6〜2ポイント。1〜2ポイントの差は誤差に埋もれる
  • 安全機構が作動した分、スコアが下がっている:介入が起きた課題は旧モデルが代わりに解いており、公式は「Opus 5.5 のスコアを下げていると考えられる」と明記している
  • 条件が揃っていない項目がある:AutomationBench は Zapier による測定で、代替モデルなしで走らせたため、安全機構の介入がそのまま失敗として数えられている
  • effort の水準が違う:Terminal-Bench 4.0 は Opus 5.5 が xhigh、GPT-6 Astra が high での結果。それぞれの最高点どうしを並べている

つまりこの表は「どちらが賢いか」ではなく、「各社が自分の最良の設定で出した点数」の一覧です。実務で意味を持つのは、次の図です。

Sec.04

同じモデルが、設定しだいで38%から66%まで動く

こちらは Terminal-Bench 4.0 のスコアを、1回あたりのコストに対して並べた図です。横軸は対数目盛りのドル、縦軸は正答率です。

Terminal-Bench 4.0 のスコアを1回あたりのコストに対して並べた図。Opus 5.5 は低コスト側で他モデルを上回る
Terminal-Bench 4.0 のスコアを1回あたりのコストに対して並べた図。Opus 5.5 は低コスト側で他モデルを上回る(クリックで拡大)

Opus 5.5 の線を追うと、effort を上げるにつれてスコアが動きます。

effortコストスコア
low約1.3ドル38.5%
medium約3ドル57.7%
high約4ドル64.2%
xhigh約7.5ドル66.4%
max約11ドル64.8%

コストは1回あたりの概算です。それぞれの想定用途は公式の effort ドキュメントに示されています。

  • low:単純な作業、サブエージェント
  • medium:速度・コスト・性能の均衡(既定)
  • high:複雑な推論、難しいコーディング
  • xhigh:30分を超える長時間のエージェント作業
  • max:最も深い推論が要る課題

読み取れることは3つあります。

第一に、モデルの銘柄より、設定のほうが結果を左右します。同じ Opus 5.5 が、effort ひとつで38.5%から66.4%まで動いています。この幅は、モデル間の差よりずっと大きいものです。

第二に、価格対性能の段差がはっきり出ています。Opus 5.5 は medium(約3ドル)の時点で57.7%に達しており、GPT-6 Astra の最良点(約7.5ドルで58.2%)とほぼ並びます。公式も「FrontierCode では既定の effort で GPT-6 Astra の最高スコアを、1タスクあたり約5分の1のコストで上回る」「Terminal-Bench 4.0 では約40%のコストで並ぶ」と説明しています。旧世代の Opus 5 は、最も高い設定(約16ドル)でようやく52.3%でした。

第三に、上げるほど良くなるわけではありません。max(約11ドル)の64.8%は、xhigh(約7.5ドル)の66.4%を下回っています。コストを1.5倍払って、スコアは下がっています。

X での反応

いいね 100 件以上の投稿から · いいね順

Oikon@oikon48
もしかしてClaude Codeの /advisor コマンドで、指定のモデルをアドバイザーにできる機能が標準搭載されているの知られていない??
2,695好評Xで見る
松丸 彗吾(keigo matsumaru)@k_matsumaru
Mac限定だけどClaude Codeに直接編集させられる動画編集ソフト出たらしい オープンソースで、自分のClaudeのAPIキーかMCP接続で使えるみたい
2,483好評Xで見る
Claude code研究ラボ@claudecode84
Claude Code はこのプラグインを入れないと 全く使い物にならないんです。 Anthropic の公式プラグインの インストールが必須です 👇 claude-code-setup どんな自動化をセットアップ できるかを教えてくれて
1,173懸念・慎重Xで見る
Sec.05

深く考えさせるほど、トークンは跳ね上がる

もう1枚、運用に直結する図があります。Artificial Analysis が公開している、1タスクを終えるのに使う出力トークン数の比較です。濃い色が回答、薄い色が思考にあたります。

Artificial Analysis による、1タスクあたりの出力トークン数の比較。effort が上がるほどトークン数が急増する
Artificial Analysis による、1タスクあたりの出力トークン数の比較。effort が上がるほどトークン数が急増する(クリックで拡大)

Claude Opus 5.5 の位置を追うと、effort による差が一目でわかります。

  • medium:1タスクあたり約26,000トークン
  • high:約36,000トークン
  • xhigh:約66,000トークン
  • max:約119,000トークン

medium と max では4.6倍のトークン差があります。先ほどの図でスコアが数ポイントしか変わらなかったことを思い出すと、この差は割に合いません。

そして出力トークンは、料金であると同時に待ち時間でもあります。トークンを4.6倍使うということは、返ってくるまでの時間もおおむねそれだけ延びるということです。人が画面の前で待つ作業では、この差が体感を決めます。

なお、この図は Artificial Analysis の Intelligence Index という別の課題群での測定です。Terminal-Bench とは課題の中身が違うため、前の図と直接つなげて読むことはできません。「effort を上げるとトークンが急増する」という傾向の確認に使ってください。

Sec.06

実務では、どの設定を選ぶべきか

ここまでの3枚から導かれる方針は、はっきりしています。

  1. 既定の medium から始める。公式が既定を high から medium へ下げたこと自体が、推奨設定の変更です。medium の57.7%という水準は、多くの実務で十分に使えます
  2. 上げるのは難所だけにする。大規模な移行作業や、原因の見えない不具合の調査など、難易度の高い場面だけ high や xhigh に上げます。会話の途中で effort を変える機能(ベータ)もあり、プロンプトキャッシュを保ったまま切り替えられます
  3. max は常用しない。コストとトークンが跳ね上がるわりに、スコアが xhigh を下回る場合すらあります。max は保険であって既定値ではないと考えてください
  4. 自社の課題で一度だけ測る。公式も「自分のトラフィックの一部で2つか3つの effort を試し、曲線から答えを読め」と案内しています。典型的な作業を3つほど選び、medium と high で1回ずつ走らせて、所要時間とコストと結果を記録してください

ひとつ前の世代でも、同じ傾向が数字で示されています。Claude Opus 5 のコストと知能の最適化ガイドによれば、SWE-bench Pro では medium がおよそ2ポイントを手放す代わりにコストが半分、low はおよそ8ポイントを手放す代わりにコストが4分の1でした。調査系の課題では、low でも1〜3ポイントしか落ちずにコストが3〜5割減っています。

なお Opus 5.5 は、同じ effort でも Opus 5 より多く考える傾向があり、特に xhigh と max で顕著だと公式が明記しています。Opus 5 で使っていた設定をそのまま持ち込まず、測り直してください。上位の effort では、思考と本文の合計に上限がかかるため、max_tokens を大きめに取る必要もあります。

Sec.07

移行時に引っかかる4つの変更

コードを書き換えずに移行できるわけではありません。既存の実装が壊れる変更が4つあります(移行ガイド)。

  1. 思考を無効にできない。無効化の指定はエラーになります。浅くしたい場合は effort を下げます
  2. ツールの強制呼び出しが使えない。tool_choice の any と tool はエラーになります。厳密なJSONが必要なら、strict なツール利用か構造化出力に移します
  3. 思考ブロックがモデルと会話に紐づく。Opus 5 からの引き継ぎはできますが、Fable 系・Mythos 系との間では引き継げません
  4. 旧いコンピュータ操作ツールが使えない。computer_20251124 は Claude API と Google Cloud では受け付けられません(Amazon Bedrock では引き続き動きます)

もう1点、エラーにならないぶん気づきにくい変更があります。ツール呼び出しの合間に出ていた短い進捗メッセージが、思考ブロックに変わりました。これを画面に流していたアプリは、設定を変えるまで、ツールを呼んでいる間だけ静かになります。

Sec.08

よくある質問

Claude Opus 5.5 とは何ですか。
Anthropic が2026年9月22日に公開した最新のモデルで、長時間のエージェント型コーディングと知識労働に向けて作られています。価格は100万トークンあたり入力4ドル・出力20ドル、コンテキストは100万トークン、最大出力は12万8千トークンです。思考は常に有効で、深さは effort(low/medium/high/xhigh/max)で調整します。
Claude Opus 5 から乗り換えるべきですか。
価格が2割下がり、同じ仕事に使うトークンも2割減っているため、コスト面では乗り換える理由があります。ただし、思考の無効化やツールの強制呼び出しを使っている実装は書き換えが必要です。まず小さな範囲で移行し、効果を測ってから広げてください。
effort はどれを選べばよいですか。
既定の medium から始めてください。公式が既定を high から medium へ下げたこと自体が、推奨設定の変更です。自社の典型的な作業で medium と high を1回ずつ試し、結果が変わらなければ medium のまま運用します。公式も、設定を過去のモデルから引き継がず、自分の評価環境で測り直すよう案内しています。
ベンチマークのスコアは信じてよいですか。
条件を確認したうえで参考にしてください。今回の表には標準誤差があり、安全機構の介入でスコアが下がっている項目、代替モデルなしで測定された項目もあります。1〜2ポイントの差は誤差の範囲です。
料金はどれくらいかかりますか。
100万トークンあたり入力4ドル・出力20ドルです。バッチ処理なら半額、キャッシュを読む場合は0.20ドルまで下がります。1回あたりで見ると、Terminal-Bench 4.0 の測定では medium で約3ドル、max で約11ドルでした。
Sec.09

参考文献

この記事をシェア

For your team

Claude Code を 10日で実装力に。

未経験者でも 10 日後に自部署の業務ツールを本番導入。研修は Eラーニング 5万円/人・対面2日間 10万円/人 から(税抜)。 まずは実際の画面を見られる無料セミナーからどうぞ。個別のご相談は 30 分の無料相談で承ります。

完走率 100%満足度 4.8/5.0
株式会社ZETTAi

Published by

株式会社ZETTAi

未経験特化の CLAUDE CODE 研修を運営しながら、「CLAUDE CODE を日本で一番使える集団」を目指しています。Claude Code の導入・人材育成・内製化でお困りのことがあれば、お気軽にご連絡ください。

関連タグ

Claude CodeClaude Opus 5.5料金ベンチマークAI開発
この記事を書いた人Claudecode 研修 編集部
Claudecode 研修 編集部

未経験特化の CLAUDE CODE 研修を運営する、株式会社ZETTAiの編集チームです。研修の現場で毎週 Claude Code を教えている講師陣の知見をもとに、アップデート情報から業務での使いこなしまで、初めての方にも分かりやすい記事づくりを心がけています。

編集部が書いた記事をもっと見る

おすすめ記事のご紹介