BalyasnyがClaude Fable 5を評価し統制する方法
運用資産約380億ドルのBalyasny Asset Managementが、Claude Fable 5を数千の実務タスクで評価し、権限制御つきの自社基盤で動かす経緯を、CAIOの発言から読み解きます。
Anthropicは2026年9月17日、ヘッジファンドのBalyasny Asset Management(BAM)でChief AI Officerを務めるCharlie Flanagan氏へのインタビューを公開しました。BAMはClaude Fable 5を、数千の実務タスクによる評価と、モデルの外側に置いた権限制御の両方で本番投入しています。評価・成果の数値はFlanagan氏本人の発言で、第三者による検証は付いていません。運用資産や人員の規模は、ブログ冒頭のAnthropic側の紹介文にある数字です。
要点
- BAMは運用資産約380億ドル、投資担当者とスタッフ約2,000人の複数の戦略を組み合わせる投資会社です(ブログ冒頭の紹介による)
- 新モデルは、株式・マクロ・コモディティの数千の検証可能なタスクで評価します。該当する部分集合の正答率は、Fable 5が89.4%、従来の本番モデルが86.1%です
- 合併裁定の初期分析は、3〜5日から1日未満に縮みました。エージェントの実行は約30分で、成果物を使う前に人が確認します
- 安全性は、モデルの選定ではなく運用設計の問題として扱います。データ境界・最小権限・ツール単位の権限・ログ・人によるレビューを、モデルの外側に置きます
- 社内のエージェント基盤BAMAgentは、構築を始めて6か月で、数千の自律エージェントを24時間動かす規模になりました
あなたの利用フローはどう変わるか
この事例は金融機関のものですが、モデルを導入する側の手順として読み替えられる部分が3つあります。
新モデルをどう試すか
BAMは一般的なベンチマークや単発のデモに頼らず、自社の実務タスクで新モデルを測ります。モデル単体と、実際のツール・ファイル・要件を備えたエージェント環境の中の挙動を、別々に見ている点が特徴です。
見る項目は次のとおりです。
- 作業を計画できるか
- 適切なツールを選んで使えるか
- 証拠を見つけて分析できるか
- エラーから復帰できるか
- 中間結果を自分で確認できるか
- 根拠のある成果物を出せるか
失敗の型も個別に追います。数値の誤り、カバレッジの取りこぼし、根拠のない結論、検索(リトライバル)の不具合です。
Claude Codeで自社タスクの評価セットを組む場合も、同じ切り口を使えます。たとえば「期待する結果が機械的に判定できる課題」を集め、モデルを切り替えて同じ課題を回します。Claude Code自体の概要はClaude Codeの全体像にあります。
エージェントにどこまで権限を渡すか
BAMの前提は「モデルが上手に推論できるから権限を広げる」ことをしない、という一点です。使えるツールとデータは、そのユーザーとそのタスクに承認されたものに限られ、エージェントが自分で権限を増やすことはできません。判断と説明責任は人に残ります。
これらの統制は最初の日から優先事項で、Fable 5の登場で安全対策の設計が根本的に変わったわけではありません。アクセスを広げる前には、敵対的な場面や失敗の場面を試験し、例外的な事例には明確なエスカレーション経路を用意します。
このモデルの外側に置く統制の考え方は、Claude Codeの権限設定やhooksとも相性がよい発想です。ただしインタビューはBAMAgentの内部実装を明かしておらず、Claude Codeの機能との対応は読み手側の類推になります。
出力を誰が確認するか
合併裁定の分析も、中央銀行分析の自動化も、最後は担当者が確認します。実行時間が短くなっても、確認工程は消えていません。
背景・文脈
「プロンプト」から「成果」を渡す運用へ
Flanagan氏は、2026年を「検索をするAIから、仕事をするAIへ」移った年だと語ります。変化の中心はモデルそのものより、Claude Codeのようなハーネス(モデルを包む実行基盤)で、プロンプトではなく成果を渡し、完了まで走らせられるようになった点です。
合併裁定の分析が具体例です。案件が発表されると、エージェントが初期の分析パッケージを作ります。作業は次の流れです。
- 取引が成立する確率と、完了までの期間を見積もる
- 主要な経済条件と法的条件を抽出する
- 条件とマイルストーンを洗い出す
- 投資家の判断が要る領域に印を付ける
1年前は、これらが手作業の調査と別々のツールに分断されており、複数の工程を最後まで通せるエージェントはありませんでした。
89.4%と86.1%は何を測った数字か
この数字は「関連する部分集合」での結果で、母集団の全タスクの成績ではありません。差は3.3ポイントです。BAM自身が指摘するように、大きかったのは複雑な計画・分析・エージェント的な実行の場面でした。
89.4%という数字以上に目を引くのは、これまで一度もモデルが解けなかった経済学の問題群を、Fable 5が初めて解いたことです。BAMは最初、評価側の不具合を疑いました。評価を再実行し、タスクと採点ロジックを独立に確認し、Anthropicとも結果を突き合わせたうえで、改善は本物と判断しました。想定外に良い結果をまず疑う手順は、評価を運用する側の参考になります。
なお、インタビューが指すのはFable 5です。後継のFable 5.1は9月初めに出ており、価格と主な変更点はClaude Fable 5.1の解説にあります。BAMがFable 5と5.1のどちらで運用しているかは、インタビューからは分かりません。
Fable 5はどんなモデルとして出たか
Fable 5は2026年6月9日に発表された、Mythosクラスのモデルを一般利用向けに安全化したモデルです。発表時の価格は入力100万トークンあたり10ドル、出力50ドルでした。発表時点では、一部の話題の質問は安全対策により、次点のClaude Opus 4.8が応答する設計でした。この対策が働くのは平均で5%未満のセッションで、無害な依頼を拾うこともあると発表ページは認めています。
モデルの使い分けはコストと効率で決める
現在、BAMの投資チームはFable 5を、システマティックな作業とコーディングの第一候補として使っています。一方で、効率とコストに基づき、Fableと他モデルのどちらを使うかの指針も渡しています。同じ発想の比較はFable 5とOpus 5の違いで、料金・データ保持・fast modeの観点から見られます。
BAMAgentではFableを計画と分析の段階に充てています。ここでの間違いは以降の全成果物に伝わるため、問題の分解や、どの証拠が重要か、矛盾するシグナルをどう調停するかを最強のモデルに任せています。
BAMAgentは何をする基盤か
BAMAgentは、承認済みの業務フローにエージェントを安全に配備するための社内基盤です。チャット基盤の次の段階にあたります。
| 観点 | チャット基盤 | BAMAgent |
|---|---|---|
| 主な役割 | チャット基盤情報の取り込みと要約 | BAMAgent多段階の調査と分析の実行 |
| 実行時間 | チャット基盤— | BAMAgent数時間から数日 |
| 終わり方 | チャット基盤— | BAMAgent人が確認できる成果物 |
具体例として、企業リサーチパッケージの作成と更新、決算やマクロイベントの事前準備、新しい証拠の財務シナリオへの変換です。実行環境やデータアクセス、レビューの仕組みは自社構築で、Anthropicのモデルはその中で使う部品にあたります。
BAMAgentの成果事例
- タックスロス・ハーベスティングの分析で、BAMAgentが約9万のデータベーステーブルを探索し、投資信託の保有データを見つけて独自の重み付け方式を作りました。チームの確認後、従来の手法より包括的だったと評価されました
- チーフエコノミストが組んだワークフローでは、定例の中央銀行分析が約2日から約30分に短縮されました。エコノミストは確認と判断を続けています
- 一部のチームでは、300を超えるエージェントが新しいデータや情報を常時分析しています
結果は「モデルの推論と統合」と「BAMの基盤が担うワークフロー設計・承認済みデータとツールへのアクセス・権限・監視・人のレビュー」の組み合わせによるもので、BAMは両方が必要だとしています。
金融のフロンティアAI導入は「基盤を自作する」方向に進んでいる
この事例で目に留まるのは、成果の主語がモデルではなく基盤側に置かれている点です。BAMは、実行ハーネス・データアクセス・レビュー制御のほとんどを自社で作っていると述べ、企業は「ホスト型エージェント」への移行戦略を持つ必要があるとも語っています。管理と強制を企業側が握りつつ、ユーザーにとっての有用性を最大化するという考え方です。
ここは発言者の意見であって、金融業界の一般的な見解とは限りません。日本の金融機関で同じ設計が成り立つかは、個別の規制対応が絡みます。関連する論点は金融業界のClaude活用ガイドやClaude金融導入事例が扱っています。
もう一つ、AIの独立評価を開発企業であるAnthropicの内部に組み込む動きとも文脈がつながります。AnthropicとAccentureの提携は、外部の人の評価者がAnthropic内部に入ってモデルを評価する話で、評価者を提供側に置く形です。BAMの事例は利用側が評価系を持つ話で、評価を自前で持つ点が両者に共通しています。
読むときの注意点もあります。評価・成果の数値はすべて自己申告で、評価セットや採点方法の詳細は公開されていません。また、インタビューはAnthropicが自社ブログに掲載した顧客事例であり、否定的な要素が出にくい形式です。
まとめ
- 金融など、誤りのコストが大きい領域でエージェントを導入する側には、実務タスクでの評価とモデル外の権限制御をセットで設計する例として参考になります
- モデルの世代交代を追う側には、89.4%対86.1%という差より、失敗の型を分けて見ている点のほうが再現しやすい材料です
- 数値の再現性を求める場合は、自社のタスクで評価する前提で読む必要があります。BAMの数字がそのまま他社に当てはまるとは限りません