Claude Media
Anthropicの安全性研究はClaude製品のどこに入っているか — 論文から出荷までの5経路

Anthropicの安全性研究はClaude製品のどこに入っているか — 論文から出荷までの5経路

Constitutional Classifiersは実運用の分類器に、サンドボックス研究はClaude Codeの/sandboxになりました。安全性研究がClaude製品のどの部品として出荷されているかを5つの経路で対応づけます。

Anthropicの安全性研究は、論文の中では完結していません。jailbreak防御の研究は実運用の入出力分類器になり、封じ込めのエンジニアリングはClaude Codeの/sandboxコマンドになり、憲法(constitution)の研究はClaudeの応答の性格そのものを形づくっています。「研究→製品機能」の対応関係を5つの経路で追うと、普段使っているClaudeのどの部品が研究の産物なのかが見えてきます。

研究と製品の対応表 — 5つの経路

出どころ製品側の実装利用者への現れ方
Constitutional AI(憲法による訓練)製品側の実装Claude本体の訓練プロセス利用者への現れ方応答の価値判断と拒否の仕方
Constitutional Classifiers(2025年2月)製品側の実装入出力を実時間で監視するASL-3の分類器(2025年5月〜)利用者への現れ方CBRN関連のごく狭い遮断
Responsible Scaling Policy(RSP)製品側の実装ASL-3のセキュリティ統制利用者への現れ方モデル重みの流出対策(間接的)
サンドボックス研究・封じ込め設計製品側の実装Claude Codeの/sandboxとWeb版の隔離実行利用者への現れ方権限プロンプト84%減と鍵の分離
分類器という同じ形の部品製品側の実装auto mode(Claude Codeの権限モード)利用者への現れ方承認疲れの解消と危険操作の遮断

最後の行だけは性格が違います。auto modeの分類器とConstitutional Classifiersに共通するのは、本体とは別の小さなモデルが判定するという構造です。順に、それぞれの経路で何が研究から製品へ渡ったのかを見ます。

Constitutional AIはClaudeの応答そのものに入っている

最も深い層にあるのがConstitutional AIです。人間のフィードバックで暗黙に価値観を教え込む代わりに、明文化された原則のリスト(憲法)を使ってモデルを訓練する手法で、訓練は2段階で憲法を参照します(Constitutional AI論文の仕組みに手法の詳細があります)。第1段階でモデルが自分の応答を原則に照らして批判・修正し、第2段階では人間ではなくAIのフィードバックで強化学習を回します。国連の世界人権宣言やAppleの利用規約、DeepMindのSparrow原則などから引かれた原則群が、どの質問に応じてどこで線を引くかを決めています。

これは「安全機能」として画面に見える類のものではありません。Claudeがどの依頼を断り、どういうトーンで断るか、その振る舞い自体が実装先です。憲法は改訂され続けており、2026年1月21日には新しい版が公開されました。原則が文章として公開されているので、振る舞いの根拠を検査でき、改訂の履歴も追えます。

Constitutional Classifiersは論文から数カ月で実運用に載った

2025年2月に公開されたConstitutional Classifiersは、憲法の考え方をjailbreak防御に応用した研究です。許可・不許可のコンテンツ分類を原則として書き、そこから合成データを大量生成して、入力と出力の両方を監視する分類器を訓練します。論文の数字は次のとおりです。

数字

論文が示した分類器の効果とコスト

  • レッドチーム

    183人・3,000時間超

    2か月の実験期間で、全質問を突破するユニバーサルjailbreakは出なかった

  • jailbreak成功率

    86% → 4.4%

    防御なしでは86%、分類器ありでは4.4%

  • 無害な質問の拒否率

    +0.38%

    5,000会話の無作為抽出で、統計的に有意ではない

  • 計算コスト

    +23.7%

    防御なしのモデルに対する増加分

防御なしの Claude との比較。人間のレッドチームはプロトタイプ、他の数字は自動評価の更新版

人間のレッドチームを受けたのはプロトタイプで、拒否率と計算コストが高いという弱点がありました。Anthropicが2023年から積み重ねてきたフロンティア脅威のレッドチーム体制は、Claudeのレッドチームがフロンティア脅威を追う理由にまとめています。

この研究は同じ年の5月、Claude Opus 4のリリースと同時に実運用へ入りました。RSPのAI Safety Level 3(ASL-3)を発動する際の中核措置として、CBRN(化学・生物・放射性物質・核)関連の狭い領域を実時間で監視する分類器に採用されたのです。手法の詳細はConstitutional Classifiersの解説記事が詳しく扱っています。

出荷後は「誤検知を減らす」仕事になる

出荷後も調整は続いています。2026年8月7日、Fable 5の生物学関連の分類器が更新されました。Fable 5では分類器が発火すると、リクエストはOpus 5へ振り替えられます(フォールバック)。検査結果の読み方や症状の説明といった日常的な質問まで振り替えられていた状態を、更新で約85%減らしたというのが発表の内容です。

面ごとの差も出ています。生物学以外の理由も含めたフォールバック総数の見込みは、Claude.aiで約67%減、Coworkで約55%減、Claude Codeで約17%減、Claude Platformで約7%減です。生物学の質問が多い面ほど効く更新で、コード中心のClaude Codeでは変化が小さくなります。

更新の中身にも憲法が出てきます。分類器の「憲法」(守る内容と通す内容を分ける規則集)を書き直し、無害な用途を細かく切り出したうえで再訓練したと説明されています。ウイルス学・毒性学・分子設計のようなデュアルユース領域は、更新後もOpus 5へ振り替えられたままです。経緯はFable 5のバイオセーフガード更新の記事にまとまっています。

RSPは「いつ守りを強めるか」をリリース判断に接続する

Responsible Scaling Policy(RSP)は論文ではなく方針文書ですが、研究と製品をつなぐ配管として働いています。RSPの進捗はFrontier Safety Roadmap進捗にまとめています。モデルの能力が定めた閾値に達したら(あるいは達していないと言い切れなくなったら)、より強い保護基準へ引き上げる、という条件付きの約束です。Claude Opus 4では「ASL-3が必要と確定したから」ではなく、「不要と言い切れなくなったから」という予防的な理由で発動されました。

ASL-3は2本柱です。デプロイ側は前述の分類器によるCBRN対策で、ごく狭い話題以外では拒否を増やさない設計とされています。検知側にはバグバウンティ(分類器を攻撃してもらう報奨金制度)も組み合わされ、新しいjailbreakは合成データで再現して分類器の再訓練に回します。

セキュリティ側はモデル重みの盗難対策で、100超の統制を組み合わせます。特徴的なのは外向き帯域の制御です。モデル重みのデータサイズが大きいことを逆手に取り、異常な帯域使用を検知して流出を止めます。利用者から直接は見えませんが、重みが盗まれて保護のない複製が出回るリスクを抑える層として製品の裏に入っています。

対象の外も決まっています。ASL-3のデプロイ措置はCBRN以外の問題や、通常の(ユニバーサルでない)jailbreak、広く知られた単発の情報の抽出を狙うものではありません。新規でない攻撃手順を除く国家レベルの攻撃と、高度な内部不正も、ASL-3セキュリティ基準の範囲外です。

サンドボックス研究はClaude Codeの/sandboxになった

エージェントが任意のコマンドを実行する時代の安全対策は、モデルの応答ではなく実行環境の設計に移ります。Anthropicのエンジニアリングチームは、ファイルシステム分離とネットワーク分離の両方を備えたサンドボックスランタイムを開発し、Claude CodeのBashツールに組み込みました。macOSのSeatbelt、LinuxのbubblewrapといったOSレベルの仕組みで境界を強制し、ネットワークはプロキシ経由の許可制にします。社内利用の計測では、安全性を保ったまま権限プロンプトが84%減ったと報告されています。

片方だけでは守れない、という設計判断が要点です。ネットワーク分離が無ければ侵害されたエージェントがSSH鍵を外へ送れてしまい、ファイル分離が無ければサンドボックス自体を書き換えて逃げられます。オープンソースの@anthropic-ai/sandbox-runtimeとしても公開されました。クラウド側でも同じ思想が使われ、Claude Code on the webではgit認証情報をサンドボックスの外に置き、専用プロキシが検証してからGitHubへ中継します。VMやコンテナを含む隔離設計の全体像は「Claudeを封じ込める」3パターンの解説で確認できます。

手元で境界を確かめる

既定の状態を知っておくと、製品として何が守られるかが分かります。サンドボックスは既定でオフで、/sandboxを実行するか、設定のsandbox.enabledをtrueにして有効にします。書き込めるのは作業ディレクトリと一時ディレクトリなどで、読み取りは~/.sshや~/.aws/credentialsを含むマシンの大部分に開いたままです。許可ドメインの一覧は空から始まります。

手順

サンドボックスが効いているかを確かめる

  1. 1

    Claudeにprobeを実行させる

    Claudeにtouch ~/sandbox-probeを実行してもらいます。サンドボックス内ならmacOSではOperation not permitted、LinuxとWSL2ではRead-only file systemで失敗します。

  2. 2

    ネットワークの経路を確かめる

    次にcurl --noproxy '*' https://example.comを実行してもらいます。プロキシを迂回する経路が無いので、Could not resolve hostで失敗するのが正常です。

  3. 3

    自分で打たない

    !プロンプトに自分で打ったコマンドは、多くのセッションでサンドボックスの外で動きます。テストとしては成立しないので、必ずClaudeに実行させます。

守りの外側も決まっています。サンドボックスが包むのはシェルコマンドだけで、Read・Edit・Writeなどのファイルツール、MCPサーバー、フックはその外で動きます。サンドボックスが起動できない環境では、既定ではサンドボックスなしでコマンドが走ります。起動失敗で止めたい組織はsandbox.failIfUnavailableをtrueにします。

分類器という道具は「悪用防止」から「権限判定」へ向きを変えた

5つ目は、同じ形の部品が別の仕事に就いた例です。Claude Codeのauto modeでは、ユーザーの代わりに分類器がツール呼び出しを審査し、不可逆・破壊的・環境の外向きと判定した操作だけを止めます。v2.1.283以降は、対話型のターミナルとVS Codeのセッションが始まる既定の権限モードです。それより前のバージョンでは、既定になるのはPro・Max・Teamプランだけでした。

くらべる

同じ「小さな判定役」でも守る相手が違う

入出力を見る

ASL-3の分類器

モデルへの入力と出力の内容を監視し、CBRN関連の悪用を遮断します。外の攻撃者からモデルを守る側で、利用者は設定を変えられません(審査を経た一部の研究用途に例外の枠はあります)。

ツール実行を見る

auto modeの分類器

エージェントのツール呼び出しを審査し、危険な操作だけを止めます。エージェントの行動からユーザーの環境を守る側で、信頼先を書き足せます。

auto modeには、組織が調整できる面が用意されています。信頼するリポジトリやドメインを自然文で渡すautoMode.environmentが中心で、既定では作業ディレクトリと現在のリポジトリのリモートしか信頼されません。分類器が読むのは、~/.claude/settings.json・管理設定・--settingsのautoModeで、プロジェクト内の.claude/settings.jsonに書いたautoModeは読みません。リポジトリに同梱された設定が、自分に都合のよい許可ルールを注入できないようにするためです。

人の確認を残したい操作には、分類器より先に評価されるpermissions.askを使います。たとえばBash(git push *)を登録すると、git pushで始まるコマンドはauto modeでも実行前に必ず確認が出ます。git -C <dir> pushのような書き方は一致しないため、拾うにはPreToolUseフックを使います。何が止まり何が通るかはauto mode分類器が何を止めているかの解説で掘り下げています。

研究が製品に降りるときの共通パターン

5つの経路を並べると、繰り返し現れる型が見えます。①原則を明文化する(憲法・RSP・autoModeのルールはどれも自然文の規範)②攻撃側の検証を先に回す(バグバウンティとレッドチームで壊してから出す)③出荷後は誤検知率との戦いになる、という3段です。Constitutional Classifiersの研究チームが最初のプロトタイプで直面したのは「安全だが拒否が多すぎて実用に耐えない」という問題でした。Fable 5は発売時、無害な質問まで幅広く振り替える広い分類器で始まり、数週間かけて狭めています。安全機構の成否は、遮断率ではなく出荷後の誤検知率で測られます。

この型を知っていると、安全系のリリースノートの読み方が変わります。「分類器を更新し誤検知を削減」という一行は、研究から製品への配管が今も動いている印だからです。

まとめ

安全性の研究発表は、数カ月後に手元へ届く機能の予告として読めます。自分の使い方で触れる部品は、Claude Codeのサンドボックスとauto modeのautoMode.environment、permissions.askの3つで、訓練(憲法)とASL-3の分類器は利用者側から変えられません。

この記事を共有:XはてブLinkedIn