AIのdiffツールで新モデルの挙動変化を検出する仕組み
Anthropic Fellowsが公開したDedicated Feature Crosscoderは、アーキテクチャの異なるAIモデル同士を比較し未知の挙動差分を検出する診断ツールです。仕組みと実験結果をまとめます。
全2568件中 901〜930件(公開日の新しい順)
Anthropic Fellowsが公開したDedicated Feature Crosscoderは、アーキテクチャの異なるAIモデル同士を比較し未知の挙動差分を検出する診断ツールです。仕組みと実験結果をまとめます。
Claude APIの対応国・地域は公式リストで175。日本は対応済みだが、中国・ロシア・イラン等は含まれない。除外の傾向と実務での確認手順を整理する。
Anthropicが実際のClaude会話10万件を分析し、AIがタスクを何%速くしているかを定量化しました。試算では米国の労働生産性の成長率が年1.8%押し上げられ、現在の成長ペースがほぼ倍になります。
Anthropicが公開したcrosscoderは、複数レイヤーや複数モデルをまたいで特徴を取り出す解釈手法です。Claude 3 Sonnetのファインチューニング前後を比較した実験結果を読み解きます。
人間の有害性ラベルなしで無害なアシスタントを学習させたAnthropicの2022年論文。原則リストとAIフィードバックで訓練するSL-CAI/RL-CAIの仕組みを読む。
AnthropicがClaudeの価値観の拠り所として公開する文書がConstitutionです。安全・倫理・ガイドライン遵守・有用性の4つをどの順で優先するか、誰の指示にどこまで従うかを解説します。
AnthropicがClaude 3から導入した「キャラクター訓練」の狙いと手法を、公式論文から読み解きます。憲法とは別の設計単位です。
AnthropicのResponsible Scaling Policyは2023年9月のv1.0から2026年7月のv3.4まで8回改定された。各版で何が変わったかを時系列で追う。
Claude APIの必須ヘッダーanthropic-versionは、2023年から実質2種類しか存在しない。後方互換ポリシーと実務上の扱い方を整理する。
社内メール・議事録・稟議書では求められる敬語の格が違います。読み手との関係を明示する・実例を1〜2個渡すという2つの技術で、Claudeの出力レベルを狙って揃える方法を解説します。
AnthropicのEconomic Index第3弾は初めて国・州単位の地理データを扱いました。所得とClaude利用の相関、米国内の州別偏り、automation優勢への転換までをまとめます。
Anthropicが導入した「economic primitives」の5指標を解説します。生産性押し上げ効果の推計を1.8ポイントから1.2ポイントへ下方修正した経緯まで追います。
Claude Codeに縦書きPDFを直接出力する機能はありません。LaTeXの日本語文書クラスjlreqのソースを書かせ、ローカルのTeX環境でコンパイルさせる手順を解説します。
縦書きにルビを振った日本語文書をClaudeに読ませて検証した。読み順とルビの扱いをどこまで正確に処理できるか、公式の視覚解析の仕様と合わせて解説する。
count_tokensで日本語プロンプトのトークン数を送信前に数え、モデル別料金表と掛け合わせて費用を見積もる手順をまとめます。
512個のニューロンから4,000以上の解釈可能な特徴を取り出したAnthropicの2023年研究。スパースオートエンコーダによる辞書学習の仕組みを、アラビア文字・DNA配列・base64の具体例で追います。
Anthropicが研究する暗号化推論技術Confidential Inferenceの仕組みと、企業のデータガバナンス担当者が押さえるべき現状を解説します。
Claude導入稟議の役割分担を、AI事業者ガイドライン(利用者編)とAnthropicの契約文書に沿って情シス・法務・現場部門の3者に切り分ける。誰が何を確認するかを一次情報で整理する。
ニューロン数より多くの概念を1つのネットワークが表現する「重ね合わせ」現象を、Anthropicが2022年のトイモデル研究で直接実証しました。仕組みと、解釈可能性による安全性主張への影響をたどります。
ハーバードの物理学者がClaude Opus 4.5に理論物理の計算を任せ、110稿・36Mトークンを経て2週間で論文を仕上げた実験の詳細です。
偽の対話を256個並べるだけでモデルの安全策を突破できる攻撃。2024年にAnthropicが公表したMany-shot Jailbreakingの仕組みと、攻撃成功率を61%から2%に落とした対策を追う。
Claudeのプロンプトキャッシュは同じ仕組みでも、API課金では単価、Claude Code/claude.aiのサブスクでは利用上限の消費として効きます。TTLの既定値も課金形態で変わります。
2025年11月、Claudeモデル廃止時に重みを会社存続期間保存し、引退前に本人へ面談する方針が公表されました。Opus 4の自己保存的な挙動が動機です。
弁護士法23条の秘密保持義務を踏まえ、Claudeへの入力が抱えるリスクと、ゼロデータ保持(ZDR)やHIPAA対応の契約でどこまで下げられるかを、利用形態別に対比します。
Claude APIが返すエラーのJSON形式と、Python・TypeScript・Go・Ruby・Java・PHP・C#の7言語でSDKが投げる例外クラスの対応表をまとめます。
Anthropicの委託先(サブプロセッサー)一覧はtrust.anthropic.comで確認する。DPAが定める追加時の通知・異議申し立ての仕組みと、委託先の委託先まで確認する実務を整理する。
324人が3.9万件の攻撃を仕掛けた2022年の実験。RLHFモデルは規模が大きくなるほど攻略しにくくなる一方、判定者同士の一致率は低いという実測結果を追う。
Claude APIの全レスポンスに付くrequest-idヘッダーの取得方法をSDK別にまとめ、Claude Platform on AWSで2つのIDが返る事情をまとめます。
セッション単位でeffortとマルチエージェントのファンアウトを切り替える「オーケストレーションモード」を、公式ドキュメントの実装パターンから組み立てます。
MCPは標準のstdio・Streamable HTTP以外にカスタムトランスポートの実装を許容します。MUST/SHOULDの要件とstdioフレーミング再利用の設計指針を仕様原文から確認します。