Toy Models of Superpositionを読み解く — ニューロンが多義的になる理由
ニューロン数より多くの概念を1つのネットワークが表現する「重ね合わせ」現象を、Anthropicが2022年のトイモデル研究で直接実証しました。仕組みと、解釈可能性による安全性主張への影響をたどります。
全469件を新しい順に並べています(151〜180件目)。カテゴリのトップへ戻る
ニューロン数より多くの概念を1つのネットワークが表現する「重ね合わせ」現象を、Anthropicが2022年のトイモデル研究で直接実証しました。仕組みと、解釈可能性による安全性主張への影響をたどります。
ハーバードの物理学者がClaude Opus 4.5に理論物理の計算を任せ、110稿・36Mトークンを経て2週間で論文を仕上げた実験の詳細です。
偽の対話を256個並べるだけでモデルの安全策を突破できる攻撃。2024年にAnthropicが公表したMany-shot Jailbreakingの仕組みと、攻撃成功率を61%から2%に落とした対策を追う。
2025年11月、Claudeモデル廃止時に重みを会社存続期間保存し、引退前に本人へ面談する方針が公表されました。Opus 4の自己保存的な挙動が動機です。
Claude APIが返すエラーのJSON形式と、Python・TypeScript・Go・Ruby・Java・PHP・C#の7言語でSDKが投げる例外クラスの対応表をまとめます。
Anthropicの委託先(サブプロセッサー)一覧はtrust.anthropic.comで確認する。DPAが定める追加時の通知・異議申し立ての仕組みと、委託先の委託先まで確認する実務を整理する。
324人が3.9万件の攻撃を仕掛けた2022年の実験。RLHFモデルは規模が大きくなるほど攻略しにくくなる一方、判定者同士の一致率は低いという実測結果を追う。
Claude APIの全レスポンスに付くrequest-idヘッダーの取得方法をSDK別にまとめ、Claude Platform on AWSで2つのIDが返る事情をまとめます。
セッション単位でeffortとマルチエージェントのファンアウトを切り替える「オーケストレーションモード」を、公式ドキュメントの実装パターンから組み立てます。
Anthropicの2023年論文が明らかにした「指示するだけでモデルの差別が減る」現象。BBQベンチマークで偏見スコアが84%減った実験と、22Bという分岐点の中身を追う。
AnthropicはAIマネジメントシステムの国際規格ISO/IEC 42001の認証を取得しました。何を審査され、Claude利用者にとって何を裏づけるのかをまとめます。
AnthropicはFluidstackと組み、テキサス州とニューヨーク州に500億ドル規模のデータセンターを建設します。投資の中身と、Claude利用者に効く範囲までを扱います。
refusalの再試行で別モデルに切り替えるとプロンプトキャッシュが書き直しになり課金が二重になります。fallback_credit_tokenで相殺する手順を扱います。
ant CLIとClaude Codeのclaudeコマンドは名前が紛らわしいですが役割は別です。Claude APIを自分で呼ぶツールか、エージェントの実行環境かという境界を公式ドキュメントから確認します。
Managed AgentsのDreamsは過去セッションを読み込みメモリストアを再構成する非同期ジョブです。仕組み・進捗確認・課金・制限をまとめます。
サーバーサイドcompactionのtrigger.valueをどう決めるか、モデルのコンテキストウィンドウに対する比率と予算管理の計算例で考えます。
Managed Agentsのメモリストアを運用するときの設計判断 — ストア分割・削除・アクセス権限・信頼境界の考え方を一次ソースの制約から読み解きます。
Managed Agentsのメモリストアをセッションにアタッチしてセッションをまたぐ記憶を持たせる手順と、変更履歴を監査するAPIの使い方をまとめます。
Managed Agentsのroster内advisorエントリが、セッションのプライマリスレッドにターン途中の相談役を与える仕組みをイベント順序とモデル制約から解説します。
古いツール結果を消しつつ重要な情報だけmemoryファイルに退避する設計。context editingのクリア警告の仕組みと、memory toolを併用する実装を扱います。
AIが「アシスタント」の人格から逸れて危険な振る舞いをする現象を、神経活動の軸として捉え食い止めるAnthropicの新研究を解説します。
2023年12月にAnthropicが発表した著作権補償付き商用規約とMessages APIベータの内容から、著作権補償とMessages APIが現在の商用契約とAPI基盤にどう受け継がれたかをたどります。
AnthropicはMenlo Venturesと共同でAnthology Fundを設立しました。1億ドル規模のスタートアップ支援策の内容と、Claudeで起業する開発者が得られるものをまとめます。
Azure上のワークロードをMicrosoft Entra IDのトークンでClaude APIに認証させる方法を、Managed Identityの構成とAKSのEntra Workload Identityの2経路で解説します。
Claude APIの応答速度を上げる3つの実装(モデル選択・トークン削減・ストリーミング)と、baseline latency / TTFTの定義の違いを解説します。
自己管理Kubernetesクラスターのprojected service account tokenでClaude APIを呼ぶ、Workload Identity Federationの設定手順を追います。
AWS上のワークロードをAPIキーなしでClaude APIに認証させる2つの方式、STS GetWebIdentityTokenとEKSのProjected Service Account Tokenを設定します。
Managed AgentsのAPIレート制限、接続できるMCPサーバーの種類、パートナー向けブランディング規定を1ページで確認できるようにまとめます。
Managed AgentsのイベントストリームはSSEで配信されます。ツール呼び出しを追う実装パターンと、event deltaでテキストをプレビュー表示する方法を解説します。
Managed Agentsのクラウド環境で、事前導入するパッケージと外部通信の許可範囲をどう設定するか、実例で確認します。