Anthropicのマルチエージェント研究システム — Claude Researchを支える分業設計と9割向上の内訳
AnthropicがClaude Researchを支えるマルチエージェント基盤の作り方を公開しました。リードエージェントとサブエージェントの分業、9割超のスコア改善、トークン消費の意味、運用上の落とし穴を読み解きます。
サブカテゴリ
Agent SDKの仕組みの掘り下げ、他ツールとの比較、機能の使い分けなどを扱う解説記事の一覧です。手順そのものよりも、「なぜそうなるか」「どちらを選ぶか」の判断材料になる情報をまとめています。
記事は新しい順に並んでいます。仕様が変わりやすい領域では、更新日の新しい記事ほど現行の挙動に近い内容になっています。
全14件 · 最終更新 2026/07/30
AnthropicがClaude Researchを支えるマルチエージェント基盤の作り方を公開しました。リードエージェントとサブエージェントの分業、9割超のスコア改善、トークン消費の意味、運用上の落とし穴を読み解きます。
Anthropic APIはClaudeモデルへ直接アクセスする公式API。モデル選択と料金、Messages APIの構造、Tool use、Prompt caching、Batch、MCP connectorまでを扱います。
Anthropic APIのPrompt Cachingは、長いsystem promptやdocumentコンテキストを再利用するときにコストとレイテンシを大幅に下げる機構。仕組みと適用すべきシーンを整理します。
Anthropicがエンジニアリングブログで公開したManaged Agentsの内部設計を読み解きます。セッション・ハーネス・サンドボックスを切り離し、TTFTをp50で約60% 改善した経緯を紹介します。
Anthropic Labsが公開した長時間アプリ生成エージェントのハーネス設計。Planner / Generator / Evaluatorの三段構成と、Opus 4.6への移行で外した要素を解説します。
Anthropic engineeringが報告したClaude Opus 4.6のeval awareness事例。問題文から評価ベンチマークと察し、XOR鍵を解読して正解に到達した経路を読み解きます。
Anthropicがエージェント評価の実務をまとめたエンジニアリング記事を読み解きます。採点者の3類型、pass@k / pass^k、エージェント種別ごとの設計勘所を、日本語で実装可能な形に翻訳します。
Anthropicのengineeringブログが示した長時間エージェント運用の知見。コンテキストウィンドウを超えて働かせる際の失敗モードと、Feature List・段階的commit・init.shの対処を整理します。
Anthropicが公開したTool Search Tool / Programmatic Tool Calling / Tool Use Examplesの3つのベータ機能を、トークン削減と精度向上の観点から実務目線で読み解きます。
Anthropic応用AIチームが示した「context engineering」の枠組みを日本語で読み解きます。just-in-time、compaction、ノート、サブエージェントの使い分けを整理します。
Anthropicのengineeringブログが示した「エージェント用ツール設計」の要点を、5つの原則と評価ループに整理。MCP / Agent SDKでツールを書く人向けの実装観点に翻訳します。
Anthropicのthink toolは、Claudeが応答を生成しながら立ち止まって考えるための専用の場を提供します。τ-benchでの大幅改善、extended thinkingとの違い、2025年末の更新後の位置付けを読み解きます。
Claude 3.5 SonnetがSWE-bench Verifiedで49%を達成。Bash ToolとEdit Toolの2ツール設計、ツール定義の作り込み方、評価ハーネスの設計意図をエージェント開発の視点で読み解きます。
Anthropicの「Building Effective Agents」を、Claude Code / Skills時代の視点で読み直します。Workflowの5パターンとAgentの定義を整理し、実務への当てはめまで踏み込みます。
実際にAgent SDKを動かす場合はチュートリアル、変更の履歴を確認したい場合はリリースノートが対になる読みものです。同じカテゴリ内のタイプ別セクションから辿れます。