Claude Media
Claude Opus 5.5「40%安い」の実際の節約幅を検証する

Claude Opus 5.5「40%安い」の実際の節約幅を検証する

Opus 5.5の「40%安い」は単価一律の値下げではない。入力/出力は20%引き、キャッシュ読み出しだけ60%引きで、実際の節約幅はキャッシュへの依存度で変わる。

Claude Opus 5.5は本当に「40%安い」のか

Anthropicは2026年9月にClaude Opus 5.5を発表し、公式ブログで「典型的なワークロードでOpus 5より40%安く動く」と表記しました。この数字だけを見ると、全てのトークンが一律40%値下げされたように読めます。

実際の単価表を見ると違います。入力トークンと出力トークンは20%引き、キャッシュ読み出しだけが60%引きです。値下げ幅は一律ではなく、セッションがどれだけキャッシュ読み出しに依存しているかで決まります。40%はAnthropicが「典型的な」条件で見積もった数字であって、すべてのセッションに当てはまる固定値ではありません。

単価表の内訳 — 入力/出力は20%引き、キャッシュ読み出しだけ60%引き

公式発表の単価表(100万トークンあたり)は次のとおりです。

項目Opus 5.5Opus 5値下げ率
入力トークンOpus 5.5$4Opus 5$5値下げ率20%
出力トークンOpus 5.5$20Opus 5$25値下げ率20%
キャッシュ読み出しOpus 5.5$0.20Opus 5$0.50値下げ率60%
キャッシュ書き込み(5分)Opus 5.5$5Opus 5$6.25値下げ率20%

入力・出力・キャッシュ書き込みはすべて同じ20%引きです。単価の上で値下げ率が違うのはキャッシュ読み出しだけです。Anthropicの発表文も「キャッシュ読み出しはエージェント的な作業とコーディング作業のコストの大半を占める」と説明しており、この行の値下げ幅が全体の節約率を左右します。Claude Opus 5.5の全体像は料金体系や破壊的変更を含めて別記事にまとめているので、ここでは値下げ幅の内訳に絞ります。

実際の節約幅はキャッシュ依存度で20%〜60%に分かれる

claude.comのブログ「What a task costs on Opus 5.5」は、この幅をそのまま言葉にしています。

キャッシュ読み出しが大半を占めるセッションは、入力コストを最大60%節約できます。キャッシュなしで長い回答を返す短い質問は、出力が支配的なため最大20%の節約に留まります。ほとんどのClaude Codeのタスクはその中間に位置します。

つまり、Anthropicが公式に示している節約幅の理論上の下限は20%、上限は60%です。40%という数字はこの範囲のどこかにある「典型値」の見積もりであって、実際にどこに着地するかはセッションのキャッシュ依存度で決まります。

同じブログは具体的な内訳も公開しています。入力220万トークン(91%をキャッシュから読み出し)、出力6万トークンという典型的なClaude Codeセッションを同じトークン数のままOpus 5とOpus 5.5で比較した例です。

項目Opus 5Opus 5.5
フレッシュ入力(約20万トークン)Opus 5$0.99Opus 5.5$0.79
キャッシュ読み出し(約200万トークン)Opus 5$1.00Opus 5.5$0.40
出力(6万トークン)Opus 5$1.50Opus 5.5$1.20
合計Opus 5$3.50Opus 5.5$2.40

このケースでの節約率は(3.50-2.40)÷3.50で約31%です。トークンの使い方自体は変えず単価だけを置き換えた計算なので、これはトークン量の減少効果を含まない「価格改定だけ」の効果です。ブログはOpus 5.5がタスクあたりで使うトークン数自体も減る可能性があると述べており、実測ではこの31%からさらに下がることもあります。

キャッシュ読み出しの比率が高く出力トークンが少ないセッションほど60%に近づきますが、60%そのものは入力がすべてキャッシュ読み出しで出力がゼロという極限値です(1M×$0.50→1M×$0.20の単価差から計算すると60%)。キャッシュを使わず出力トークンが多いセッションほど20%に近づきます。単価表の20%と60%という2つの理論値の間でセッションごとに結果が変わる、という構造そのものは公式ソースで確認できます。

キャッシュ書き込みのコストも見落とせない

節約幅を左右するもう一つの要素がキャッシュ書き込みです。自動プロンプトキャッシュが多ターン会話でどう動くかを踏まえると、書き込みと読み出しの頻度はセッションの続け方次第で変わります。同ブログによると、Opus 5.5でのキャッシュ読み出しはフレッシュ入力の5%の価格ですが、書き込みは5分キャッシュでフレッシュ入力の1.25倍、1時間キャッシュで2倍かかります。120Kトークンのコンテキストで5分キャッシュへの書き込みは約$0.60、読み出しは約$0.02とされており、1回の書き込みは25回分の読み出しに相当するコストです。

キャッシュ書き込みが発生するのは、キャッシュの有効期限(APIキーやクラウド経由では既定5分、Claude Codeのサブスクリプションでは1時間)を超えて間隔が空いたとき、エフォートレベルを変更したとき(Bedrock・Google CloudのAgent Platform・ゲートウェイ経由の場合)、高速モードを会話の途中で初めてオンにしたとき、MCPサーバーを接続・切断したとき、モデルを切り替えたとき、コンパクションが走ったときなどです。セッションを頻繁に中断したりモデルを切り替えたりするワークフローでは、キャッシュ書き込みの再発生がキャッシュ読み出しの節約分を相殺し、実際の節約率を20%引きに近い側へ引き戻します。キャッシュTTLが短縮された過去の事例のように、有効期限の扱いが変わるだけでもこの比率は動きます。

40%はどんなセッションを想定した見積もりか

「40%安い」は、マーケティング上のキャッチコピーではありますが、根拠のない誇張ではありません。単価表の20%〜60%という実測可能なレンジの中で、Anthropicが典型的な使い方を想定して置いた見積もり値です。同じ発表内では、Opus 5.5がOpus 5と同品質をターン数・出力トークンともに約半分で達成し、あるワークロードのコストを40〜50%削減したという顧客の声も引用されています。ただしこれはトークン使用量そのものが減った効果であり、単価改定による節約幅とは別物として区別する必要があります。

ただし、この数字を自分のセッションにそのまま当てはめてよいかは別問題です。キャッシュ依存度が低い使い方(短い質問への長い回答、モデルやエフォートを頻繁に切り替えるセッション)では20%に近づき、キャッシュ読み出しの比率が高く出力が少ないセッションでは60%側に近づきます(60%そのものに届くのは入力が全てキャッシュ読み出しで出力ゼロの極限だけです)。「40%安い」という見出しだけで判断せず、自分のワークロードがそのレンジのどちら寄りかを確かめておきましょう。

ワークロードの型ごとの目安

節約幅を決めるのは「キャッシュ読み出しの比率が高く、出力トークンが少ないほど60%に近づき、出力トークンの比率が高いほど20%に近づく」という単価表の構造です。入力95%・出力ゼロという高キャッシュ依存のケースでも約46%に留まり、60%そのものは入力が全てキャッシュ読み出しで出力がゼロという極限値です。キャッシュ読み出しの比率がこれより下がれば、節約幅も46%よりさらに20%側へ近づきます。公式ブログが示す2つの理論値(20%と60%)と、実際の内訳例(約31%)、そして単価表からの試算値(約46%)を並べると、この構造が数値で確認できます。

ワークロードの型キャッシュ読み出しの比率節約幅根拠
キャッシュなし・出力中心の短い質問キャッシュ読み出しの比率0%節約幅20%(理論上の下限)根拠公式ブログの記述
実際の内訳例(入力91%がキャッシュ)キャッシュ読み出しの比率91%節約幅約31%根拠公式ブログの数値例
入力95%がキャッシュ読み出し・出力ゼロキャッシュ読み出しの比率95%節約幅約46%(試算)根拠単価表からの試算: Opus 5 = 5万×$5/M+95万×$0.50/M=$0.725、Opus 5.5 = 5万×$4/M+95万×$0.20/M=$0.39、(0.725-0.39)÷0.725≒46%
入力が全てキャッシュ読み出し・出力ゼロ(理論上の極限)キャッシュ読み出しの比率100%節約幅60%(理論上の上限)根拠単価表からの試算: Opus 5 = 100万×$0.50/M=$0.50、Opus 5.5 = 100万×$0.20/M=$0.20、(0.50-0.20)÷0.50=60%

キャッシュ書き込みが頻発する運用(モデルやエフォートの切り替え、長い中断)では、この試算よりも節約幅が20%側に寄ります。セッションを区切らずに続けるか、途中でモデルを切り替えるかによって、この表の行が変わる点には注意が必要です。

サブスクリプションと高速モードは別枠で考える

ここまでの数字はAPIのリスト価格が対象です。Pro・Max・Teamのサブスクリプションでは請求そのものは発生しませんが、安くなった単価が使用量上限にも反映され、キャッシュされたコンテキストを含めてOpus 5より約25%長く使えます。単価の値下げ幅(20%〜60%)と、上限の伸び幅(約25%)は別の数字です。

もう一つ別枠なのが高速モードです。Claude CodeとClaude Platformで使える高速モードは、入力$8・出力$40という個別料金で、通常のOpus 5.5より高い単価に設定されています。処理速度が最大2.5倍になる代わりに単価も上がるため、「40%安い」という表記はこの高速モード料金には適用されません。速度を優先して高速モードを使う場合は、値下げ幅の計算から切り離して考える必要があります。

エフォートレベルも節約幅に影響します。エフォートは思考・ツール呼び出し・出力のトークン量を左右するため、レベルを上げるほど出力側のコスト比重が増え、キャッシュ読み出しの節約効果を打ち消す方向に働きます。claude.comのブログが紹介する社内ベンチマーク(サポートチケット44件)では、Opus 4.8からOpus 5.5(low effort)への移行だけでコストが約18%下がり、プロンプトの書き方を見直す/claude-api prompt-auditの実行でさらに9%削減できたとしています。これは単価の値下げとは別に、トークン使用量そのものを減らす効果です。

自分のワークロードでの節約幅を確認する方法

Claude Codeでは、セッション終了時に/usageを実行すると入力・出力・キャッシュそれぞれのトークン数が表示されます。この内訳を使えば、自分のセッションが単価表のどこに位置するかを計算できます。

/usage

/usageが示すキャッシュ読み出しの比率が高いほど60%引きの恩恵を受けやすく、フレッシュ入力や出力の比率が高いほど20%引きに近づきます。セッション終了後の集計だけでなく、statuslineでprompt_cacheのhit_ratioを常時表示するようにしておくと、キャッシュ劣化の兆候を作業中に確認できます。Opus 5からOpus 5.5への移行前後で同じタスクを実行し、この内訳を比較すれば、公式が示す40%という数字が自分の環境で妥当かどうかを検証できます。

まとめ

「40%安い」という表記の実体は、入力・出力トークンの20%値下げと、キャッシュ読み出しトークンの60%値下げという2種類の値下げ率が混ざった結果です。理論上の節約幅は公式ブログが示すとおり20%(キャッシュなしで出力中心のセッション)から60%(入力が全てキャッシュ読み出しで出力がゼロという極限)の間に分かれ、単価表から試算すると入力95%・出力ゼロでも約46%に留まります。Anthropicが公表する内訳例では約31%という具体的な数字も確認できます。自分のセッションがどちらに近いかは/usageのキャッシュ比率で確認でき、キャッシュ書き込みが頻発する使い方では節約幅が20%側に寄ることも踏まえておきましょう。

この記事を共有:XはてブLinkedIn