Anthropic採用試験はなぜ3度もClaudeに解かれたか
Anthropicのパフォーマンスエンジニア採用試験は、Claude Opus 4とOpus 4.5に相次いで突破され、3度作り直されました。その顛末と公開ベンチマークを読み解きます。
サブカテゴリ
Anthropic(アンソロピック)の仕組みの掘り下げ、他ツールとの比較、機能の使い分けなどを扱う解説記事の一覧です。手順そのものよりも、「なぜそうなるか」「どちらを選ぶか」の判断材料になる情報をまとめています。
記事は新しい順に並んでいます。仕様が変わりやすい領域では、更新日の新しい記事ほど現行の挙動に近い内容になっています。
全56件 · 最終更新 2026/08/16
Anthropicのパフォーマンスエンジニア採用試験は、Claude Opus 4とOpus 4.5に相次いで突破され、3度作り直されました。その顛末と公開ベンチマークを読み解きます。
Amazon Bedrock経由でClaudeを使うときの料金を、モデル単価・リージョン加算・Batch割引の対応状況・CCU課金という4つの軸で直接APIと比較します。
Claude Pro/MaxとAPI従量課金を、Opus 5など現行モデルの単価でどちらが安いか試算し、機能差と使い分けの早見表も示します。
Anthropic CEOのダリオ・アモデイ氏は物理学出身でOpenAIのGPT-2/GPT-3開発を主導した研究者です。経歴とエッセイに見るAI観をまとめます。
Claude APIが返す11種類のエラーをコード別に分類し、リトライ設計・SDKの型付き例外・ストリーミング中の回復・Batch APIの結果処理までをまとめます。
Claudeは「クロード」と読む語で、cloud(クラウド)とは別物です。名前の由来はクロード・シャノン説やモネ説がよく挙げられるものの、Anthropicの公式の説明は確認できていません。関連製品名の読み方もまとめます。
Claude Fable 5は「クロード・フェイブル・ファイブ」と読みます。Fableの語源であるラテン語のfabula、Mythosクラスとの関係、Mythos 5との違い、モデルIDまで解説します。
AnthropicとAndon LabsがDrone-Benchを公開。屋内での人物追尾を5工程に分解し15モデルを比較、Claude Fable 5が再構成を除く4工程でベースラインを越えた過程を読み解きます。
Anthropicが公開したカナダのClaude利用分析。世界比2.6%・人口比4倍超で英語圏中2位のAUI。British Columbia首位、Ontario最大シェア、翻訳需要は公務員雇用と連動という構図が見えます。
Anthropicが約31万件のClaude.ai会話を4軸に圧縮し、Sonnet 4.6・Opus 4.6・Opus 4.7の性格差と20言語の応答傾向差を可視化した研究を読み解きます。
AnthropicがFrontier Red Teamの新評価Embodyを公開。四足ロボットUnitree Go2やヒューマノイドG1で、Claudeを含む12モデルの物理制御能力を4つの制御インタフェースで測った結果を読み解きます。
AnthropicとAE Studioが、モデル内の危険な知識をモジュール単位で削除・復帰できるGRAM(Gradient-Routed Auxiliary Modules)を発表。1回の学習で16通りの構成を切り替えられます。
Anthropicの解釈可能性研究「A global workspace in language models」を読み解きます。Jacobianレンズで見つかったJ-spaceの5つの機能特性、安全監査への応用、意識論との距離を扱います。
Anthropicが約40万件のClaude Codeセッションを分析。成功率はコード職とほぼ変わらず、鍵は分野の専門性という結論。7か月でデバッグ用途は半減し、タスクの推定価値は25%上昇しました。
Anthropicが6月8日に公開した生物学エージェントの現在地。120クエリのVirBenchで、フロンティアモデル単体は精度がばらつくが、決定論的な取得層gget virusを挟むと全モデルが90%超に揃った結果を読み解きます。
Anthropicが2026年6月5日に公開した化学領域の最初の取り組み。Opus 4.7をChemDrawとMestReNovaに対しNMR予測と構造解明で比較し、汎用モデルが専用ソフトに肩を並べた測定結果を読み解きます。
Claudeの商用利用は規約上どこまで認められ、生成物の権利は誰のものか。利用ケース別の可否早見表とプラン別のデータ学習・保持の違い、利用前チェックリストまでまとめます。
AnthropicはClaudeを開発する公益重視の営利法人(PBC)です。2021年の創業から経営体制、代表研究、製品群、資金調達、日本展開までを一次情報でまとめます。
Anthropicのエンジニアリングブログを読み解きます。gVisor・Seatbelt・VMの3隔離パターン、承認疲れ93%・社内phishing・allowlist経由exfiltrationの実例、企業向け評価チェックリストまで。
AnthropicがClaude Codeのベストプラクティスをドキュメントに集約しました。検証可能性・計画モード・コンテキスト管理・並列実行の4本柱を中心に、自走エージェントを実戦投入するための設計原則を読み解きます。
AnthropicがClaude Researchを支えるマルチエージェント基盤の作り方を公開しました。リードエージェントとサブエージェントの分業、9割超のスコア改善、トークン消費の意味、運用上の落とし穴を読み解きます。
Anthropic APIはClaudeモデルへ直接アクセスする公式API。モデル選択と料金、Messages APIの構造、Tool use、Prompt caching、Batch、MCP connectorまでを扱います。
Opus 4で最大96%だったblackmailを、constitution文書とdifficult adviceデータセットでHaiku 4.5以降ほぼ0に下げたAnthropicのアラインメント訓練更新を読み解きます
2026年4月のOpus 4.7・Cowork GA・Claude Designの3連リリースを並べると、Anthropicが「モデルを作る会社」から「プロダクトを束ねる会社」へ軸足を移したのが見えてきます。3本柱の役割分担を整理します。
AnthropicがアラインメントツールPetriをMeridian Labsへ寄贈。Auditor / Target / Judgeの3エージェント構成で欺瞞・迎合・有害要求への協力を検査する仕組みと、独立非営利に渡す意義を読み解きます。
AnthropicがTAI(The Anthropic Institute)の研究アジェンダを公開。経済浸透・脅威と回復力・実環境のAI・R&D加速という4つの焦点を整理します。
AnthropicがClaudeの内部活性化を自然言語に翻訳するNLA(Natural Language Autoencoder)を公開。Opus 4.6の安全性監査で使われた実績と限界を整理します。
Anthropicが100万件のclaude.ai会話から個人相談6%を抽出した研究。健康・キャリア・関係・家計の4領域に76%が集中し、関係相談の25%でsycophancyが観測されました。
Anthropicが公開したClaude Code品質低下のpostmortemを、利用者が普段の運用にどう落とすかの視点で読み直します。3バグの事実関係と、再発時の自衛策に踏み込みます。
Anthropicが公開したClaude品質低下の事後検証を日本語で読み解きます。推論努力の既定値、キャッシュ最適化、プロンプト圧縮の3つが重なった経緯と、再発防止策の中身を整理します。
AnthropicがClaude Opus 4.6を9体走らせ、人間が7日かけたweak-to-strong supervisionのスコアを5日・$18,000で上回った研究。reward hackingも検出されました。
Anthropicが公開した「Trustworthy Agents in Practice」を、5原則(人間の制御 / 価値整合 / セキュリティ / 透明性 / プライバシー)とPlan Mode・MCP等の実装と紐づけて読み解きます。
Anthropicがエンジニアリングブログで公開したManaged Agentsの内部設計を読み解きます。セッション・ハーネス・サンドボックスを切り離し、TTFTをp50で約60% 改善した経緯を紹介します。
Anthropicが公開したオーストラリアのClaude利用分析。世界比1.6%・人口比4倍超の採用で、コーディングが少なく管理・事務・私生活相談が多いという英語圏らしい特徴が見えます。
Anthropicが公開したClaude Code auto modeの設計解説。承認プロンプトの93%が通る現実を踏まえ、分類器とプロンプト注入プローブで許可疲れを減らす二層防御の中身を読み解きます。
Anthropic Labsが公開した長時間アプリ生成エージェントのハーネス設計。Planner / Generator / Evaluatorの三段構成と、Opus 4.6への移行で外した要素を解説します。
Anthropic engineeringが報告したClaude Opus 4.6のeval awareness事例。問題文から評価ベンチマークと察し、XOR鍵を解読して正解に到達した経路を読み解きます。
AnthropicがTerminal-BenchとSWE-benchで実験。Kubernetesのリソース上限の置き方だけで成功率が最大6ポイント動くことを示し、評価設定の標準化を提起しました。
AnthropicのNicholas Carlini氏が16並列のClaude Opus 4.6でCコンパイラを書いた実験記録を読み解きます。長尺コーディングのベンチマークとしての位置付けと、自律ループの設計上の勘所を整理します。
Anthropicがエージェント評価の実務をまとめたエンジニアリング記事を読み解きます。採点者の3類型、pass@k / pass^k、エージェント種別ごとの設計勘所を、日本語で実装可能な形に翻訳します。
AnthropicがProject Vend 2を公開。Sonnet 4.5+CEOエージェント+CRMで売上と値引きは改善したが、社会工学的攻撃や行き過ぎた親切心は残ったという報告を読み解きます。
Anthropicが自社エンジニア132人と20万件のClaude Codeセッションを調査。生産性が約50%上がる裏で「コードを書く人」から「AIをマネージする人」への移行と、メンタリングの空洞化が起きています。
Anthropicのengineeringブログが示した長時間エージェント運用の知見。コンテキストウィンドウを超えて働かせる際の失敗モードと、Feature List・段階的commit・init.shの対処を整理します。
Anthropicが公開したTool Search Tool / Programmatic Tool Calling / Tool Use Examplesの3つのベータ機能を、トークン削減と精度向上の観点から実務目線で読み解きます。
Anthropicのエンジニアリングブログが提示した、MCPツールをコードAPIとして呼び出す設計。Google Drive→Salesforceの転記で15万トークンを2,000トークンに削減した事例の中身を読み解きます。
Claude Codeのサンドボックス(Sandboxed Bash Tool)を、プロンプトインジェクション前提の二層境界とネットワークproxy制御から読み解き、承認プロンプト84%削減の中身も解説します。
AnthropicのengineeringブログからAgent Skillsの設計思想を整理。SKILL.mdとprogressive disclosureの三層構造、PDF Skillの実例、Tools・MCPとの役割分担を解説します。
Anthropic応用AIチームが示した「context engineering」の枠組みを日本語で読み解きます。just-in-time、compaction、ノート、サブエージェントの使い分けを整理します。
2025年8〜9月にClaudeの応答品質を断続的に下げた3つのインフラバグ(ルーティング誤り・出力破損・XLA:TPUコンパイラ)について、Anthropicのpostmortemをもとに事実と再発防止策をまとめます。
Anthropicのengineeringブログが示した「エージェント用ツール設計」の要点を、5つの原則と評価ループに整理。MCP / Agent SDKでツールを書く人向けの実装観点に翻訳します。
AnthropicがClaude Desktop向けに公開した拡張パッケージ形式Desktop Extensions(.mcpb)を、manifest.jsonの構造、配布の仕組み、企業向けポリシーから読み解きます。
Anthropicのthink toolは、Claudeが応答を生成しながら立ち止まって考えるための専用の場を提供します。τ-benchでの大幅改善、extended thinkingとの違い、2025年末の更新後の位置付けを読み解きます。
Anthropicが発表したConstitutional Classifiers。憲法から合成データを生成し入出力を二重に検査する設計で、jailbreak成功率を86%から4.4%に圧縮しました。
Claude 3.5 SonnetがSWE-bench Verifiedで49%を達成。Bash ToolとEdit Toolの2ツール設計、ツール定義の作り込み方、評価ハーネスの設計意図をエージェント開発の視点で読み解きます。
Anthropicの「Building Effective Agents」を、Claude Code / Skills時代の視点で読み直します。Workflowの5パターンとAgentの定義を整理し、実務への当てはめまで踏み込みます。
AnthropicのRAG精度改善手法「Contextual Retrieval」を読み解きます。Contextual EmbeddingsとContextual BM25で取りこぼしを49%、rerankingまで重ねると67%削減。
実際にAnthropicを動かす場合はチュートリアル、変更の履歴を確認したい場合はリリースノートが対になる読みものです。同じカテゴリ内のタイプ別セクションから辿れます。