Claude Codeに10万行のCコンパイラを書かせた実験 — 16並列・2万ドルの記録
AnthropicのNicholas Carlini氏が16並列のClaude Opus 4.6でCコンパイラを書いた実験記録を読み解きます。長尺コーディングのベンチマークとしての位置付けと、自律ループの設計上の勘所を読み解きます。
全469件を新しい順に並べています(451〜469件目)。カテゴリのトップへ戻る
AnthropicのNicholas Carlini氏が16並列のClaude Opus 4.6でCコンパイラを書いた実験記録を読み解きます。長尺コーディングのベンチマークとしての位置付けと、自律ループの設計上の勘所を読み解きます。
AnthropicがClaudeを「思考の場(a space to think)」と位置付け、Claude.aiに広告を載せない方針を明言。収益はエンタープライズ契約と有料サブスクリプションで賄うと宣言した発表の要点と読み方をまとめます。
Anthropicがエージェント評価の実務をまとめたエンジニアリング記事を読み解きます。採点者の3類型、pass@k / pass^k、エージェント種別ごとの設計勘所を、日本語で実装可能な形に翻訳します。
AnthropicがProject Vend 2を公開。Sonnet 4.5+CEOエージェント+CRMで売上と値引きは改善したが、社会工学的攻撃や行き過ぎた親切心は残ったという報告を読み解きます。
Anthropicが自社エンジニア132人と20万件のClaude Codeセッションを調査。生産性が約50%上がる裏で「コードを書く人」から「AIをマネージする人」への移行と、メンタリングの空洞化が起きています。
Anthropicのengineeringブログが示した長時間エージェント運用の知見。コンテキストウィンドウを超えて働かせる際の失敗モードと、Feature List・段階的commit・init.shの対処をまとめます。
Anthropicが公開したTool Search Tool / Programmatic Tool Calling / Tool Use Examplesの3つのベータ機能を、トークン削減と精度向上の観点から実務目線で読み解きます。
Anthropicのエンジニアリングブログが提示した、MCPツールをコードAPIとして呼び出す設計。Google Drive→Salesforceの転記で15万トークンを2,000トークンに削減した事例の中身を読み解きます。
Claude Codeのサンドボックス(Sandboxed Bash Tool)を、プロンプトインジェクション前提の二層境界とネットワークproxy制御から読み解き、承認プロンプト84%削減の中身も解説します。
AnthropicのengineeringブログからAgent Skillsの設計思想を整理。SKILL.mdとprogressive disclosureの三層構造、PDF Skillの実例、Tools・MCPとの役割分担を解説します。
Anthropic応用AIチームが示した「context engineering」の枠組みを日本語で読み解きます。just-in-time、compaction、ノート、サブエージェントの使い分けをまとめます。
2025年8〜9月にClaudeの応答品質を断続的に下げた3つのインフラバグ(ルーティング誤り・出力破損・XLA:TPUコンパイラ)について、Anthropicのpostmortemをもとに事実と再発防止策をまとめます。
Anthropicのengineeringブログが示した「エージェント用ツール設計」の要点を、5つの原則と評価ループに整理。MCP / Agent SDKでツールを書く人向けの実装観点に翻訳します。
AnthropicがClaude Desktop向けに公開した拡張パッケージ形式Desktop Extensions(.mcpb)を、manifest.jsonの構造、配布の仕組み、企業向けポリシーから読み解きます。
Anthropicのthink toolは、Claudeが応答を生成しながら立ち止まって考えるための専用の場を提供します。τ-benchでの大幅改善、extended thinkingとの違い、2025年末の更新後の位置付けを読み解きます。
Anthropicが発表したConstitutional Classifiers。憲法から合成データを生成し入出力を二重に検査する設計で、jailbreak成功率を86%から4.4%に圧縮しました。
Claude 3.5 SonnetがSWE-bench Verifiedで49%を達成。Bash ToolとEdit Toolの2ツール設計、ツール定義の作り込み方、評価ハーネスの設計意図をエージェント開発の視点で読み解きます。
Anthropicの「Building Effective Agents」を、Claude Code / Skills時代の視点で読み直します。Workflowの5パターンとAgentの定義を整理し、実務への当てはめまで踏み込みます。
AnthropicのRAG精度改善手法「Contextual Retrieval」を読み解きます。Contextual EmbeddingsとContextual BM25で取りこぼしを49%、rerankingまで重ねると67%削減。