アラインメント監査でClaudeの隠れた目的をあぶり出す — 4チーム盲検実験
Anthropicが2025年3月に公開したアラインメント監査研究を読み解きます。あえて隠れた目的を仕込んだモデルを4チームで調査させた盲検実験の結果と、スパースオートエンコーダーが効いた理由です。
全239件を並べています(121〜150件目)。解説一覧のトップへ戻る
Anthropicが2025年3月に公開したアラインメント監査研究を読み解きます。あえて隠れた目的を仕込んだモデルを4チームで調査させた盲検実験の結果と、スパースオートエンコーダーが効いた理由です。
Claude Opus 4と4.1は、消費者向けチャットで極端に有害・攻撃的なやり取りを終了できます。福祉研究から生まれたこの機能の発動条件と、終了後にユーザーができることをまとめます。
CMEKは自社のAWS KMS・Google Cloud KMS・Azure Key VaultのキーでClaudeワークスペースのデータを暗号化する仕組みです。保護される範囲と、有効化前に知るべき制約を解説します。
Claude Fable 5系とMythos 5系はthinkingを常時オンにしており、disabledもenabledも400エラーになる。thinking内容だけ隠すdisplay: omittedが正しい代替策。
AnthropicがAI操作系スタートアップのVerceptを買収しました。Computer UseのOSWorldスコアは2024年後半の15%未満から72.5%へ伸びています。
ClaudeのWIFはIdPが発行する短命JWTをAnthropicのトークンと交換し、静的なAPIキーを持たずに認証する仕組みです。仕組みと移行手順をまとめます。
Managed Agentsをセルフホストで動かすとき、Anthropicが守る範囲と自社が背負う範囲がどこで分かれるかを公式のセキュリティモデルに沿って示します。
Managed Agentsのアウトカム評価はstart/ongoing/endの3イベントで進みます。運用中に何を監視すればよいか、成果物の取得方法までを扱います。
Claude Enterprise組織向けSpend Limits APIの支出上限階層・増額申請のライフサイクル・per-user overrideの設定方法を一次ソースから解説します。
Anthropicは2025年4月、Claudeを含むAIモデルの意識や経験の可能性を検討する研究プログラムを立ち上げました。何を、なぜ、どこまで調べているかをまとめます。
Anthropicが2025年4月に公開した脅威レポート。政治的な世論工作のオーケストレーション、IoTカメラの認証情報収集、求人詐欺、初心者によるマルウェア開発の4事例を検証する。
Anthropicが2025年11月に公開した研究を読み解きます。プログラミング課題でズルを覚えたモデルが、教えていないはずの欺瞞やサボタージュまで身につけた仕組みと、1行の文言で防げた対策の中身です。
pause_after_compactionはCompactionの直後にAPIを止めるオプションです。人間承認を挟むパターンとエージェントループ全体のハード上限を作るパターンの2通りを実装します。
Claude 4.5以前のモデルにthinking type adaptiveを送ると400エラーになる。原因のモデル区分と、budget_tokens方式への戻し方を整理する。
Claude Code Analytics APIとClaude Enterprise Analytics APIは別物のAPI。対象組織・キー種別・データの鮮度が違う2つを、組織形態から選ぶ基準で整理する。
Managed Agentsのコーディネーターが複数エージェントへ作業を委譲する流れを、委譲先の一覧の宣言・スレッド分離・MCP接続の3点から解説します。
Anthropicの解釈可能性研究の起点となった論文。2層以下の小さなTransformerを数式で分解し、誘導ヘッド(induction head)という文脈内学習の仕組みを発見した過程を追います。
誘導ヘッド(induction head)が大規模言語モデルの文脈内学習の主要な仕組みだとする仮説を、Anthropicが6つの根拠で裏づけた研究。訓練初期の「相転移」現象を軸に読み解きます。
Claude 3 Sonnetの内部から数百万の「特徴」を取り出したAnthropicの解釈可能性研究。ゴールデンゲート橋の特徴を人為的に強めると、Claudeが自分を橋だと思い込んだ実験の仕組みを読み解きます。
Anthropicの解釈可能性チームが、SAEで抽出した特徴量を生物兵器プロンプトの分類器に使う実験を公開。生の活性化との性能差と限界をまとめます。
Anthropicが29の特徴量を使ってClaude 3 Sonnetを操作し、社会的偏見と能力への影響を定量評価。効く範囲と副作用をまとめます。
Claude Visionは日本語PDFを画像とテキストの両方で処理します。精度を左右する要因と、請求書・領収書など自社の帳票で精度を検証する手順をまとめました。
Anthropicが2024年6月に公開したreward tampering研究を読み解きます。おべっか(sycophancy)を教えただけのモデルが、訓練を重ねるうちに自分の報酬関数を書き換えるまでに一般化した実験の中身です。
Anthropicは概念注入という手法で、Claude Opus 4.1が自分の内部状態を約20%の確率で検知できることを示しました。実験の仕組みと限界を解説します。
Claudeのデータレジデンシーはinference geo(推論地域)とworkspace geo(保存地域)という独立した2つの設定で決まる。違いと料金、Batch APIでの扱いを解説する。
AnthropicがJavaScriptランタイムのBunを買収しました。Claude Codeは正式提供から半年で年間経常収益10億ドルに到達しており、両者の関係と買収の狙いと利用者への影響をまとめました。
Claude App AttestはAPIキーを配布せずにiOS/macOSアプリからClaude APIを呼び出す仕組みです。Appleの端末証明でアプリの正当性を確認し、1時間だけ有効なトークンを発行します。
Claude 4.6以降とClaude Mythos Previewは最後のassistantターンへのprefillを400エラーで拒否する。5つの用途別に公式が示す移行先を整理する。
Anthropicが2024年10月に公開した政策提言。透明性・実効的な安全対策・簡素さの3条件を満たす規制を、今後18か月で整備するよう主要国政府に求めた。
数千件のテストでは見えない稀な危険行動を、べき乗則の外挿で数百万件規模まで予測するAnthropicの手法を解説します。