重要インフラをAIで防御する — Claudeが示した脆弱性発見の高速化
AnthropicとPNNLが、ClaudeベースのエージェントALOHAで水処理プラントへの攻撃再現を3時間に短縮した実証実験を解説します。
全230件を並べています(61〜90件目)。解説一覧のトップへ戻る
AnthropicとPNNLが、ClaudeベースのエージェントALOHAで水処理プラントへの攻撃再現を3時間に短縮した実証実験を解説します。
2025年11月、Anthropicは中国の国家支援を受けたとみられるグループがClaude Codeを悪用した大規模スパイ活動を検知・阻止したと発表しました。攻撃の80〜90%はAIが自律実行していました。
医療機関がClaudeでPHIを扱うにはBAA締結が前提ですが、対象はEnterpriseとAPIのみでFree・Pro・Max・Teamは対象外です。有効化の手順と機能ごとの適用範囲をまとめます。
Claude APIのservice_tierパラメータはauto/standard_onlyの2値で、Priority Tierの容量を使うかを制御します。新規購入停止後の仕組みとキャッシュ・地域推論の消費レートを扱います。
Admin APIは組織メンバー・ワークスペース・APIキーを操作するAPIで、監査ログそのものは別のCompliance API Activity Feedが担います。両者の役割分担と内部統制での組み合わせ方をまとめます。
言語モデルは自分の答えが正しいか自己評価できるか。2022年のAnthropic論文が示した「P(True)」「P(IK)」という2つの手法とその限界を解説します。
人がClaudeと対話しながら難問を解くと、Claude単独より、人だけより正解率が上がります。Anthropicのscalable oversight研究をもとに、人とAIの共同作業がなぜ機能するのかをまとめます。
AIの攻撃指示を実際のコマンドに変換するツールキットIncalmoの仕組みと、専用ツール無しでも攻撃が成立し始めた最新の検証結果をまとめます。
Claude APIのITPM(入力トークン/分)制限は、キャッシュから読んだトークンを原則カウントしません。計算式とHaiku 3.5だけの例外を具体例で示します。
StanfordのBiomniやMITのCheeseman labなど、ClaudeをCRISPR解析や遺伝子研究の相棒にする3つの現場を紹介。数か月かかる作業が数十分に縮んだ事例もあります。
AnthropicはClaude悪用アカウント832件をMITRE ATT&CKへ写像し、ARiESという加算式のリスクスコアで可視化するNavigatorを公開しました。
複雑な質問をChain-of-Thoughtで一気に解かせると、答えの理由が実際の判断根拠と食い違うことがあります。Anthropicの研究をもとに、質問を分解して答えさせる手法がなぜ信頼性を高めるのかをまとめます。
学習データのごく一部を繰り返すだけでモデル性能が半分規模に劣化する現象をAnthropicが解明。二重降下とinduction headsへの損傷を読む。
Anthropicの解釈可能性研究は、アルゴリズムだけでなくデータ規模のエンジニアリングが律速段階になっています。分散シャッフルと特徴可視化パイプラインという2つの実例を読み解きます。
Anthropic Instituteの調査で、社内のコード生成が2年で8倍になった実測が公開された。AIがAIを作る未来を3つの分岐で読み解く。
Claudeの拡張思考(extended thinking)に表示される思考過程が、実際の判断根拠と一致するとは限りません。Anthropicの実験でわかった忠実性の実態と、Claude Codeで思考ログを読むときの注意点をまとめます。
Claudeを人間向けサイバー競技会7大会に参加させた結果を検証します。上位25%に入る大会もあれば0問正解の大会もあり、強さと弱さの境界が明確に見えます。
Anthropicが13万件超の会話を分析。恋愛・仕事の相談やコンパニオンシップにClaudeを使う会話は全体の2.9%、うちコンパニオンシップ・ロールプレイは0.5%未満でした。
2022年にAnthropicが公開したRLHF実装の原点論文。週次で選好モデルを更新する「iterated online training」の仕組みと、報酬とKL距離の関係を読む。
AnthropicはClaude Opus 4.6がFirefoxのWasm型混同バグからエクスプロイトを組み立てた実験を公開しました。同条件で他の5モデルは全て失敗しています。
Anthropic Fellowsが公開したDedicated Feature Crosscoderは、アーキテクチャの異なるAIモデル同士を比較し未知の挙動差分を検出する診断ツールです。仕組みと実験結果をまとめます。
Claude APIの対応国・地域は公式リストで175。日本は対応済みだが、中国・ロシア・イラン等は含まれない。除外の傾向と実務での確認手順を整理する。
Anthropicが公開したcrosscoderは、複数レイヤーや複数モデルをまたいで特徴を取り出す解釈手法です。Claude 3 Sonnetのファインチューニング前後を比較した実験結果を読み解きます。
人間の有害性ラベルなしで無害なアシスタントを学習させたAnthropicの2022年論文。原則リストとAIフィードバックで訓練するSL-CAI/RL-CAIの仕組みを読む。
AnthropicがClaudeの価値観の拠り所として公開する文書がConstitutionです。安全・倫理・ガイドライン遵守・有用性の4つをどの順で優先するか、誰の指示にどこまで従うかを解説します。
AnthropicがClaude 3から導入した「キャラクター訓練」の狙いと手法を、公式論文から読み解きます。憲法とは別の設計単位です。
AnthropicのResponsible Scaling Policyは2023年9月のv1.0から2026年7月のv3.4まで8回改定された。各版で何が変わったかを時系列で追う。
Claude APIの必須ヘッダーanthropic-versionは、2023年から実質2種類しか存在しない。後方互換ポリシーと実務上の扱い方を整理する。
AnthropicのEconomic Index第3弾は初めて国・州単位の地理データを扱いました。所得とClaude利用の相関、米国内の州別偏り、automation優勢への転換までをまとめます。
Anthropicが導入した「economic primitives」の5指標を解説します。生産性押し上げ効果の推計を1.8ポイントから1.2ポイントへ下方修正した経緯まで追います。