Monosemanticity論文の辞書学習でニューロンを分解する
512個のニューロンから4,000以上の解釈可能な特徴を取り出したAnthropicの2023年研究。スパースオートエンコーダによる辞書学習の仕組みを、アラビア文字・DNA配列・base64の具体例で追います。
全230件を並べています(91〜120件目)。解説一覧のトップへ戻る
512個のニューロンから4,000以上の解釈可能な特徴を取り出したAnthropicの2023年研究。スパースオートエンコーダによる辞書学習の仕組みを、アラビア文字・DNA配列・base64の具体例で追います。
Anthropicが研究する暗号化推論技術Confidential Inferenceの仕組みと、企業のデータガバナンス担当者が押さえるべき現状を解説します。
Claude導入稟議の役割分担を、AI事業者ガイドライン(利用者編)とAnthropicの契約文書に沿って情シス・法務・現場部門の3者に切り分ける。誰が何を確認するかを一次情報で整理する。
ニューロン数より多くの概念を1つのネットワークが表現する「重ね合わせ」現象を、Anthropicが2022年のトイモデル研究で直接実証しました。仕組みと、解釈可能性による安全性主張への影響をたどります。
ハーバードの物理学者がClaude Opus 4.5に理論物理の計算を任せ、110稿・36Mトークンを経て2週間で論文を仕上げた実験の詳細です。
偽の対話を256個並べるだけでモデルの安全策を突破できる攻撃。2024年にAnthropicが公表したMany-shot Jailbreakingの仕組みと、攻撃成功率を61%から2%に落とした対策を追う。
2025年11月、Claudeモデル廃止時に重みを会社存続期間保存し、引退前に本人へ面談する方針が公表されました。Opus 4の自己保存的な挙動が動機です。
324人が3.9万件の攻撃を仕掛けた2022年の実験。RLHFモデルは規模が大きくなるほど攻略しにくくなる一方、判定者同士の一致率は低いという実測結果を追う。
Anthropicの2023年論文が明らかにした「指示するだけでモデルの差別が減る」現象。BBQベンチマークで偏見スコアが84%減った実験と、22Bという分岐点の中身を追う。
AnthropicはAIマネジメントシステムの国際規格ISO/IEC 42001の認証を取得しました。何を審査され、Claude利用者にとって何を裏づけるのかをまとめます。
AnthropicはFluidstackと組み、テキサス州とニューヨーク州に500億ドル規模のデータセンターを建設します。投資の中身と、Claude利用者に効く範囲までを扱います。
ant CLIとClaude Codeのclaudeコマンドは名前が紛らわしいですが役割は別です。Claude APIを自分で呼ぶツールか、エージェントの実行環境かという境界を公式ドキュメントから確認します。
Managed AgentsのDreamsは過去セッションを読み込みメモリストアを再構成する非同期ジョブです。仕組み・進捗確認・課金・制限をまとめます。
Managed Agentsのメモリストアを運用するときの設計判断 — ストア分割・削除・アクセス権限・信頼境界の考え方を一次ソースの制約から読み解きます。
Managed Agentsのroster内advisorエントリが、セッションのプライマリスレッドにターン途中の相談役を与える仕組みをイベント順序とモデル制約から解説します。
AIが「アシスタント」の人格から逸れて危険な振る舞いをする現象を、神経活動の軸として捉え食い止めるAnthropicの新研究を解説します。
2023年12月にAnthropicが発表した著作権補償付き商用規約とMessages APIベータの内容から、著作権補償とMessages APIが現在の商用契約とAPI基盤にどう受け継がれたかをたどります。
AnthropicはMenlo Venturesと共同でAnthology Fundを設立しました。1億ドル規模のスタートアップ支援策の内容と、Claudeで起業する開発者が得られるものをまとめます。
Managed Agentsを人気のチャットフレームワーク3種と組み合わせて動くアプリにする公式クイックスタートを比較します。セッションとフロントエンドの役割分担、ツール確認ゲートの実装ポイントを比較します。
Claude Workspacesの役割、組織ロールからの権限継承、APIキー・ファイル・スキルのスコープ範囲を公式ドキュメントで確認します。
Anthropicが2025年8月に公開した脅威インテリジェンスレポート。Claude Codeを使った恐喝、北朝鮮IT労働者の就労詐欺、AI生成ランサムウェアの3事例からエージェント型AI悪用の拡大を読み解く。
Anthropicが2025年3月に公開したアラインメント監査研究を読み解きます。あえて隠れた目的を仕込んだモデルを4チームで調査させた盲検実験の結果と、スパースオートエンコーダーが効いた理由です。
Claude Opus 4と4.1は、消費者向けチャットで極端に有害・攻撃的なやり取りを終了できます。福祉研究から生まれたこの機能の発動条件と、終了後にユーザーができることをまとめます。
CMEKは自社のAWS KMS・Google Cloud KMS・Azure Key VaultのキーでClaudeワークスペースのデータを暗号化する仕組みです。保護される範囲と、有効化前に知るべき制約を解説します。
Claude Fable 5系とMythos 5系はthinkingを常時オンにしており、disabledもenabledも400エラーになる。thinking内容だけ隠すdisplay: omittedが正しい代替策。
AnthropicがAI操作系スタートアップのVerceptを買収しました。Computer UseのOSWorldスコアは2024年後半の15%未満から72.5%へ伸びています。
ClaudeのWIFはIdPが発行する短命JWTをAnthropicのトークンと交換し、静的なAPIキーを持たずに認証する仕組みです。仕組みと移行手順をまとめます。
Managed Agentsをセルフホストで動かすとき、Anthropicが守る範囲と自社が背負う範囲がどこで分かれるかを公式のセキュリティモデルに沿って示します。
Managed Agentsのアウトカム評価はstart/ongoing/endの3イベントで進みます。運用中に何を監視すればよいか、成果物の取得方法までを扱います。
Claude Enterprise組織向けSpend Limits APIの支出上限階層・増額申請のライフサイクル・per-user overrideの設定方法を一次ソースから解説します。