Claude Haiku 5.5の料金は10万トークンで切り替わる — 単価表と試算
Haiku 5.5は1リクエストのプロンプトが10万トークンを超えると、入力$0.10が$0.50、出力$0.50が$2.50に上がります。キャッシュ・Batch・US限定推論との関係を金額で試算します。
Claude Haiku 5.5の料金は、1リクエストのプロンプトが10万トークンを超えた瞬間に切り替わります。入力は$0.10から$0.50(100万トークンあたり、以下MTok)、出力は$0.50から$2.50です。どちらも5倍になります。
Haiku 5.5は1Mトークンのコンテキストウィンドウを持ちますが、全域が同じ単価ではありません。「Haikuだから安い」と見積もったまま長文を流すと、請求が予想の数倍に振れます。この記事では単価表、境界の数え方、キャッシュやBatchとの掛け合わせを、具体的な金額で確かめます。
Haiku 5.5だけが、プロンプト長で単価を変える
料金ページの長文課金の節は、モデルごとの扱いを次のように分けています。
1Mコンテキストの料金の掛かり方
Haiku 5.5
プロンプトが10万トークン以下か、超えるかで単価が変わります。リクエスト単位で判定されます。
Claude 4.6以降の他モデル
1Mトークンまで標準単価です。900kトークンのリクエストも9kトークンのリクエストも、トークンあたりの単価は同じです。
Haiku 5.5のモデル紹介ページにも、1Mトークンのコンテキストウィンドウと128k出力が新機能として載っています。その直後に「長いプロンプトは高い単価で課金される」と注記が付いており、窓の広さと単価はセットで読む仕様です。
単価表:標準・キャッシュ・Batch・US限定推論
料金ページの値を、10万トークン以下の枠と超える枠に分けて並べます。単位はいずれもUSD/MTokです。
| 区分 | 10万以下 入力 | 10万以下 出力 | 超過 入力 | 超過 出力 |
|---|---|---|---|---|
| 標準 | 10万以下 入力$0.10 | 10万以下 出力$0.50 | 超過 入力$0.50 | 超過 出力$2.50 |
| Batch API | 10万以下 入力$0.05 | 10万以下 出力$0.25 | 超過 入力$0.25 | 超過 出力$1.25 |
| US限定推論(標準に1.1倍) | 10万以下 入力$0.11 | 10万以下 出力$0.55 | 超過 入力$0.55 | 超過 出力$2.75 |
US限定推論の行は、料金ページの「Haiku 5.5では超過枠の高単価にも1.1倍が掛かる」という記述から出した計算値です。Batchの行は料金ページのBatch表に載っている値そのままです。
キャッシュの単価も、枠ごとに分かれます。
| キャッシュ操作 | 10万以下 | 超過 |
|---|---|---|
| 5分キャッシュ書き込み | 10万以下$0.125 | 超過$0.625 |
| 1時間キャッシュ書き込み | 10万以下$0.20 | 超過$1 |
| キャッシュ読み取り | 10万以下$0.01 | 超過$0.05 |
倍率の関係は他モデルと変わらず、読み取りは入力の0.1倍、5分書き込みは1.25倍、1時間書き込みは2倍です。変わるのは基準になる入力単価のほうです。
境界の10万トークンは、何を数えるのか
判定の対象は、そのリクエストのプロンプトに含まれる入力トークンの全部です。料金ページは、キャッシュ読み取りとキャッシュ書き込みも数えると明記しています。
ここから、次の3点が読み取れます。
- 10万ちょうどは安い枠です。表の見出しが「up to 100,000」と「over 100,000」になっているため、10万1トークンから高い枠に入ります
- 一部がキャッシュにヒットしても、全体が10万を超えれば超えた分だけでなく全入力が高単価です
- 判定は1リクエストごとで、会話の途中で超えても、それ以前のリクエストは当時の単価のまま確定しています
出力トークンは判定に入りません。長い回答を引き出すだけでは枠は切り替わらず、枠を決めるのは入力側です。
試算:10万トークンの前後で、1リクエストはいくら跳ぶか
出力を2,000トークンに固定し、入力だけを変えた1リクエストの費用です(標準・キャッシュなし。筆者計算)。
| 入力トークン | 1リクエスト | 1,000リクエスト |
|---|---|---|
| 50,000 | 1リクエスト$0.006 | 1,000リクエスト$6 |
| 100,000 | 1リクエスト$0.011 | 1,000リクエスト$11 |
| 100,001 | 1リクエスト$0.055 | 1,000リクエスト$55 |
| 200,000 | 1リクエスト$0.105 | 1,000リクエスト$105 |
| 500,000 | 1リクエスト$0.255 | 1,000リクエスト$255 |
| 1,000,000 | 1リクエスト$0.505 | 1,000リクエスト$505 |
100,000と100,001の差は、わずか1トークンで$0.011から$0.055、ちょうど5倍です。
高い枠に入っても、他モデルより安い関係は崩れません。同じ入力10万1トークン・出力2,000トークンのリクエストを、Sonnet 5.5($2 / $10)で払うと約$0.22です。Haiku 5.5の$0.055は、その4分の1に当たります。Haiku 5.5の超過枠は、入力も出力もSonnet 5.5のちょうど4分の1の単価です。
つまり「Haiku 5.5の長文は割高」ではなく、「短い枠が突出して安い」という構造です。10万トークンを意識するのは、安さの恩恵を受け続けるための設計項目になります。
キャッシュを使っても、高単価の枠からは出られない
見落としやすいのが、キャッシュ読み取りも長さに数えられる点です。具体例で確かめます。15万トークンのプロンプトのうち14万トークンがキャッシュ読み取り、1万トークンが新規入力、出力が1,000トークンだとします。
- 実際の請求(超過枠): 14万×$0.05 + 1万×$0.50 + 1,000×$2.50 = 約$0.0145
- 短い枠の単価で誤算した場合: 14万×$0.01 + 1万×$0.10 + 1,000×$0.50 = 約$0.0029
- キャッシュなしの超過枠: 15万×$0.50 + 1,000×$2.50 = 約$0.0775
誤算との差は5倍です。ただしキャッシュなしと比べれば約8割は下がるので、キャッシュ自体の効果は消えていません。効くのは、キャッシュの読み取りで枠を判断し直す必要がある、という点です。
逆に、10万トークン以下に収まるリクエストなら、キャッシュはさらに強力です。たとえば8万トークンをキャッシュ読み取り、1万トークンを新規入力、出力500トークンの場合は約$0.002で済みます。
キャッシュの寿命の選び方はClaude APIの1時間キャッシュはいつ使うべきか、Batchと組み合わせたヒット率の上げ方はバッチ処理でプロンプトキャッシュのヒット率を上げる方法にあります。
分割して10万以下に収める発想の算数
300kトークンの資料を1リクエストで読ませると、入力だけで300k×$0.50=$0.15です。7.5万トークンずつ4つに分け、それぞれ別リクエストにすると、4×7.5万×$0.10=$0.03です。入力側の単価だけで5倍の差が出ます。
ただし、各リクエストに指示文を載せ直す分のトークンが増え、チャンクを跨ぐ文脈は失われ、出力も4回分になります。単価の算数が成り立つことと、品質と手間が見合うことは別の話です。分割が効くのは、章ごとに独立して処理できる分類・抽出・要約のような作業だと考えられます。
4.5から移すときは、トークン数の増加も計算に入れる
Haiku 5.5は新しいトークナイザーを使うため、同じ文章がHaiku 4.5より約30%多いトークンになります(増え方は内容で変わります)。
この増加は境界の位置に効きます。4.5で約7.7万トークンだった文章は、5.5では約10万トークンになる計算です(100,000÷1.3、筆者計算)。4.5のログで「10万を超えるリクエストは少ない」と読んでも、5.5では閾値を超える割合が増えます。
それでも単価の差は大きく、4.5の入力$1に対して、5.5の高い枠でも1.3倍のトークンで$0.65相当です。移行の手順はClaude Haiku 5.5へ移行する手順に、4.5側の料金と仕様はClaude Haiku 4.5の料金と仕様にまとまっています。
4.5の200kトークン枠と同じ資料で比べる
Haiku 4.5のコンテキストウィンドウは200kトークンで、5.5の1Mとは桁が違います。4.5で15万トークンだった資料を例に、入力側だけ比べます(筆者計算、トークン数は約30%増で換算)。
| モデル | トークン数 | 入力単価 | 入力費用 |
|---|---|---|---|
| Haiku 4.5 | トークン数150,000 | 入力単価$1 | 入力費用$0.15 |
| Haiku 5.5 | トークン数約195,000 | 入力単価$0.50(超過枠) | 入力費用約$0.098 |
10万の壁を越えても、5.5のほうが約35%安い計算です。4.5では入らなかった20万トークン超の資料も、5.5なら1リクエストで扱えます。高い枠に入ることは、4.5より高くなることとは違います。
移行前の見積もりは、この順で組む
Haiku 5.5の費用を見積もる手順
- 1
実際の入力をHaiku 5.5で数える
4.5の測定値は流用せず、
modelをclaude-haiku-5-5にしてトークン数を数え直します。 - 2
リクエストの長さの分布を取る
平均ではなく、10万トークンを超える割合を見ます。超過分だけ単価が5倍になるためです。
- 3
超過リクエストをキャッシュ読み取りまで含めて再計算する
キャッシュにヒットしていても、超えていれば高い枠の単価で計算します。
- 4
Batchが使える処理を切り分ける
即時性が要らない処理は、短い枠も超過枠も半額です。
日本語のトークン数の見積もり方はToken Count APIで日本語コンテンツの費用を事前に見積もるに、1Mトークンを実務で扱うときの注意はClaude 1Mコンテキストの実務活用にあります。
手元で閾値を見張るコード
請求額を事前に見積もる関数を、リクエストの入力内訳から組みます。トークン数はHaiku 5.5向けに数え直した値を使います。4.5で測った数字の流用は避けます。
PRICE = { # USD/MTok: (入力, 5分書込, 読取, 出力)
"short": (0.10, 0.125, 0.01, 0.50),
"long": (0.50, 0.625, 0.05, 2.50),
}
def cost(fresh, read, write, out, batch=False, us=False):
total = fresh + read + write # 判定は全入力の合計
tier = "long" if total > 100_000 else "short"
i, w, r, o = PRICE[tier]
usd = (fresh * i + write * w + read * r + out * o) / 1e6
return usd * (0.5 if batch else 1) * (1.1 if us else 1)
print(cost(10_000, 140_000, 0, 1_000)) # 0.0145このコードの計算結果は、上のキャッシュの試算と一致します。Batchの0.5倍とUS限定推論の1.1倍は、料金ページがキャッシュ倍率や他の修飾と重ねて適用されると述べている前提で掛けています。
Claude Haiku 5.5の料金に関するよくある疑問
出力が長いと高い単価になりますか
なりません。判定はプロンプト、つまり入力側の長さだけです。出力の単価が上がるのは、入力が10万トークンを超えたリクエストの出力です。
BedrockやGoogle Cloudでも同じ2段階ですか
料金ページには、この2段階がAnthropicのAPIの価格として載っています。AWS上のClaude Platform on AWSとMicrosoft Foundryは、Claude APIと同じ単価でトークンを算出してから換算する説明です。BedrockとGoogle Cloudは別料金で、それぞれの料金ページを見る必要があります。
まとめ
Haiku 5.5の安さは「10万トークン以下」の枠にある、という言い方がもっとも正確です。判定は入力全体で、キャッシュ読み書きも含み、リクエストごとに行われます。
処理のほとんどが短い入力なら、Haiku 5.5の単価は他のモデルを大きく下回ります。長文を頻繁に流す用途では、その枠の外で払う前提で見積もり直し、一覧で比べるならClaudeモデル一覧の価格列にこの2段階を足して読むのが近道です。