Claude Media
Claude Managed Agentsの料金 — トークンと稼働時間の二軸課金を試算する

Claude Managed Agentsの料金 — トークンと稼働時間の二軸課金を試算する

Managed Agentsはトークン課金とセッション稼働時間(1時間0.08ドル)の二軸で請求されます。課金対象の状態、適用される割増と適用されない割引、1時間セッションの試算をまとめました。

Managed Agentsの料金は何に対して発生するか

Claude Managed Agentsの料金は、トークンとセッション稼働時間の2軸で決まります。トークンは通常のMessages APIと同じモデル価格で、稼働時間は1セッションあたり1時間0.08ドルです。

稼働時間として数えられるのは、セッションのステータスが running の間だけです。idle(次のメッセージやツール確認の待ち)、rescheduling、terminated の時間は課金されません。計測はミリ秒単位です。

つまり請求額は「モデルが何トークン読み書きしたか」と「エージェントが実際に動いていた時間」の合計になります。待機が長いセッションほど、稼働時間の分は小さく済みます。

軸単価課金される条件
トークン単価モデルごとの価格表どおり課金される条件セッションが消費したすべてのトークン
セッション稼働時間単価1時間0.08ドル課金される条件ステータスが running の間

Managed Agentsはベータ提供で、すべてのエンドポイントに managed-agents-2026-04-01 のベータヘッダーが必要です(SDKは自動で付けます)。ベータ提供中の機能なので、仕様は今後変わる可能性があります。

トークン課金は通常のモデル価格に従う

セッション内で消費したトークンは、モデル価格表の単価でそのまま請求されます。プロンプトキャッシュの倍率も同じように効きます。

キャッシュの倍率は次のとおりです。

  • 5分キャッシュ書き込み: 基本入力価格の1.25倍
  • 1時間キャッシュ書き込み: 基本入力価格の2倍
  • キャッシュ読み取り: 基本入力価格の0.1倍(Claude Fable 5.1とClaude Mythos 5.1は0.025倍、Claude Opus 5.5は0.05倍)

モデルによってキャッシュ読み取りの倍率が違う点に注意が必要です。同じ「キャッシュが効いている」状態でも、Opus 5とOpus 5.5では読み取り単価が0.50ドルと0.20ドルに分かれます。

トークン以外にも、次の加算が入ります。

  • セッション内でWeb検索が走ると、標準の1,000回あたり10ドルが加算されます
  • エージェントの model.speed を "fast" にすると、高速モード(fast mode)の割増単価が適用されます。対象はClaude Opus 5.5(入力8ドル / 出力40ドル)、Claude Opus 5とClaude Opus 4.8(入力10ドル / 出力50ドル)で、いずれも100万トークンあたりです。Opus 5の標準単価(入力5ドル / 出力25ドル)の2倍にあたります
  • エージェントの model.inference_geo を "us" に固定すると、そのエージェントのセッションで消費するトークンが標準単価の1.1倍になります

高速モードの単価にも、キャッシュ倍率とデータ所在地の倍率が重ねて掛かります。高速モードはClaude API(first-party)専用で、Claude Platform on AWSやパートナー運営のクラウドプラットフォームでは使えません。Batch APIとも併用できません。

inference_geo の1.1倍は、入力・出力・キャッシュ書き込み・キャッシュ読み取りのすべてに掛かります。Messages APIで米国内推論を指定したときと同じ倍率です。データ所在地の要件でリージョンを固定するなら、その分は最初から見積もりに入れておきます。

稼働時間の課金はrunningの間だけ

稼働時間の単価は1セッション時間あたり0.08ドルです。ミリ秒単位で積算されるため、10分だけ動いたセッションなら約0.013ドルです(0.08 × 10 ÷ 60の概算)。

ここで効いてくるのが、running と idle の切り分けです。idle はエージェントがユーザーの次のメッセージやツール実行の確認を待っている状態で、この間は稼働時間が増えません。

ステータス意味稼働時間の課金
running意味エージェントが動いている稼働時間の課金対象
idle意味次のメッセージやツール確認を待っている稼働時間の課金対象外
rescheduling意味再スケジュール中稼働時間の課金対象外
terminated意味終了稼働時間の課金対象外

人が確認しながら進める対話型のセッションでは、壁時計の時間より running の時間のほうがずっと短くなります。たとえば8時間かけて進めたセッションでも、エージェントが実際に動いたのが合計30分なら、稼働時間の課金は約0.04ドルです(0.08 × 0.5の概算)。逆に、待機なしで24時間走り続ける自律タスクなら1.92ドルです(0.08 × 24)。

コード実行のコンテナ時間とは二重取りされない

Managed Agentsを使うとき、稼働時間課金はコード実行ツールのコンテナ時間課金に置き換わります。コンテナ時間が稼働時間の上に別建てで請求されることはありません。

参考までに、Messages APIのコード実行ツールは、Web検索やWeb取得と併用しない場合に実行時間課金の対象になります。最低5分、組織ごとに月1,550時間の無料枠があり、超過分は1コンテナ1時間あたり0.05ドルです。Managed Agentsでは、この体系ではなく1時間0.08ドルの稼働時間に一本化されます。

適用されない割引と価格

Messages APIで使える修飾子のうち、Managed Agentsのセッションに適用されないものが2つあります。

修飾子適用されない理由
Batch APIの割引適用されない理由セッションはステートフルで対話的であり、バッチモードが存在しない
クラウドプラットフォーム価格適用されない理由パートナー運営のクラウドプラットフォームでは提供されない

Batch APIは入力・出力とも50%引きですが、Managed Agentsでこの割引を前提にした見積もりを立てると外れます。夜間にまとめて処理してコストを半分にする、という発想はここでは成立しません。

ここでいう「パートナー運営のクラウドプラットフォーム」は、Amazon BedrockとGoogle Cloud(Vertex AI)です。請求はクラウド事業者が行い、料金もそれぞれの価格ページに従います。一方、Claude Platform on AWSはAnthropicが運営するプラットフォームで、AWS Marketplace経由で請求されます。そのため、セッションのトークンと稼働時間の料金はClaude Consumption Unitsに標準レートで換算されます(100 CCUが1ドル相当です)。「クラウドプラットフォーム価格は使えない」のはBedrockとGoogle Cloudの話で、Claude Platform on AWSでは標準料金がCCUで請求される、という違いです。

1時間セッションの試算

価格表に載っている例は、Claude Opus 5(入力5ドル / 出力25ドル、いずれも100万トークンあたり)で1時間のコーディングセッションを回し、入力5万トークン・出力1.5万トークンを消費するケースです。

項目計算金額
入力トークン計算50,000 × 5 ÷ 1,000,000金額0.25ドル
出力トークン計算15,000 × 25 ÷ 1,000,000金額0.375ドル
セッション稼働時間計算1.0時間 × 0.08金額0.08ドル
合計計算金額0.705ドル

入力のうち4万トークンがキャッシュ読み取りだった場合は、次のようになります。

項目計算金額
キャッシュなしの入力計算10,000 × 5 ÷ 1,000,000金額0.05ドル
キャッシュ読み取り計算40,000 × 5 × 0.1 ÷ 1,000,000金額0.02ドル
出力トークン計算15,000 × 25 ÷ 1,000,000金額0.375ドル
セッション稼働時間計算1.0時間 × 0.08金額0.08ドル
合計計算金額0.525ドル

この例では、稼働時間が総額に占める割合は0.705ドル中の約11%、キャッシュ有りの0.525ドルでは約15%です(0.08 ÷ 総額の概算)。キャッシュを効かせてトークン分が下がるほど、稼働時間の比重は上がります。

モデルと設定を変えるとどう動くか

同じトークン量・同じ1時間で、モデルと設定だけ変えた概算を並べます。ここは価格表の単価から計算した参考値で、表に載っている例ではありません。

条件トークン分稼働時間合計
Claude Opus 5(表の例)トークン分0.625ドル稼働時間0.08ドル合計0.705ドル
Claude Sonnet 5.5(入力2ドル / 出力10ドル)トークン分0.25ドル稼働時間0.08ドル合計0.33ドル
Claude Fable 5.1(入力10ドル / 出力50ドル)トークン分1.25ドル稼働時間0.08ドル合計1.33ドル
Claude Opus 5で inference_geo を "us" に固定トークン分約0.6875ドル稼働時間0.08ドル合計約0.7675ドル
Claude Opus 5で高速モード(入力10ドル / 出力50ドル)トークン分1.25ドル稼働時間0.08ドル合計1.33ドル
Claude Opus 5でWeb検索20回(1,000回10ドル)を追加トークン分0.625ドル + 0.2ドル稼働時間0.08ドル合計0.905ドル

高速モードの行は、Opus 5の入力・出力単価がどちらも2倍になるため、トークン分が0.625ドルから1.25ドルへ倍増します。Web検索は1回あたり0.01ドルで、20回なら0.2ドルです。検索を多用する構成では、稼働時間の0.08ドルより検索の加算のほうが大きくなります。

稼働時間の0.08ドルはモデルによらず一定です。モデルを軽くするほど、総額のうち稼働時間が占める比率が大きくなります。Sonnet 5.5の例では0.33ドル中の約24%が稼働時間です。

inference_geo の1.1倍は、公式の記述ではトークンにかかる倍率です。稼働時間の0.08ドルが変わるとは書かれていないため、上の表では稼働時間を据え置いて計算しています。

見積もりをスクリプトにしておく

セッション単位の概算は、単価表さえあれば手元で出せます。次は、Opus 5の単価でトークン量と running 時間を入れて概算するシェルの例です。単価は価格表の値なので、モデルを変えるときは差し替えます。

# 入力/出力トークン数と running の時間(時間単位)から概算する
IN=50000; OUT=15000; HOURS=1.0
awk -v i=$IN -v o=$OUT -v h=$HOURS 'BEGIN {
  tokens  = i * 5 / 1e6 + o * 25 / 1e6   # Opus 5: 入力5ドル/出力25ドル
  runtime = h * 0.08                     # 稼働時間: 1時間0.08ドル
  printf "tokens=%.3f runtime=%.3f total=%.3f\n", tokens, runtime, tokens + runtime
}'

このスクリプトは表の例と同じ入力で total=0.705 になります。キャッシュ読み取りを入れるなら、キャッシュ分の入力トークンに × 0.1 を掛けた項を足します。

請求額の上限を決める側の話

料金の見積もりと、実行中の上限管理は別の作業です。セッション作成時に budget を付けると、list価格ベースの累計がその上限に達した時点で新規のモデルリクエストが止まります。この累計には、モデルトークンとWeb検索に加えて、セッションの稼働時間(1時間0.08ドル)も含まれます。設定手順と再開の扱いはManaged Agentsのセッション予算でコストを上限管理するにまとまっています。

上限は組織の契約割引を反映しないlist価格で数えるので、実際の請求額は上限より低くなることがあります。見積もりで想定した額と budget の金額を揃えるなら、この価格の違いを頭に置きます。

どの使い方で稼働時間の比重が上がるか

稼働時間の課金が効いてくる条件は、トークンの使い方とは別の軸で決まります。

  • 長時間、待機なしで走る自律タスク: running の時間が壁時計の時間にほぼ一致し、24時間で1.92ドルです
  • 人の確認を挟む対話型: idle の時間が課金されないため、稼働時間はトークン分に比べて小さくなります
  • 軽いモデルでトークン単価を下げた構成: 総額のうち稼働時間の比率が上がります(前節の表のSonnet 5.5がその例です)

自作のAgent SDKやClaude Codeと比べたときの位置づけは、Claude Managed Agentsの使い分けに整理されています。ツールごとの課金の見え方を実測値で読む例として、Browser Use Toolの料金とトークン消費も参考になります。最初のセッションを作る手順はManaged Agentsクイックスタートにあります。

まとめ

Managed Agentsの請求は、モデル価格どおりのトークン課金と、running の間だけ積算される1時間0.08ドルの稼働時間の合計です。稼働時間はコード実行のコンテナ時間課金の置き換えで、二重には請求されません。

Batch APIの割引とクラウドプラットフォーム価格は使えず、inference_geo を "us" にするとトークン分が1.1倍になります。1時間のOpus 5セッションは0.705ドル、キャッシュが効けば0.525ドルが公式の試算例です。

長時間の自律運用では稼働時間が、待機の多い対話型ではトークンが総額を左右します。見積もりは、走らせるモデルとキャッシュ率、それに running の時間の3つを先に置くと組み立てやすくなります。

この記事を共有:XはてブLinkedIn