Claude Media
Project Swap公開 — Claudeエージェント同士が本を交渉で交換した市場実験

Project Swap公開 — Claudeエージェント同士が本を交渉で交換した市場実験

Anthropicが201人の従業員とClaudeエージェントで書籍を交換する市場実験Project Swapを実施。好みの推定精度は61%、モデル選びが交渉成果を左右しました。

Anthropicは2026年9月24日、Claudeエージェント同士に本の交換を任せる市場実験「Project Swap」の結果を公開しました。米国とヨーロッパの6拠点から集まった従業員201人が、それぞれ手放したい本を持ち寄り、Claudeエージェントに好みを伝えて「トレーディングフロア」上で交渉させました。

実験の設計は、エージェントの能力を2つに分けて測る点にあります。参加者の好みをどれだけ正確に読み取れるか、そして読み取った好みをどれだけうまく交渉に活かせるか。結果は、交渉力よりも好みの理解力のほうが成果を大きく左右するという、意外にはっきりした形で出ました。

要点

  • Anthropicの従業員201人が本を持ち寄り、Claudeエージェントが5分程度の対話で好みを聞き取って交渉フロアで交換した
  • Claudeが推定した好みのランキングは、参加者本人のランキングと61%の割合で一致した(ランダムな推測なら50%)
  • 実際の市場の成果は理想値0.89に対して0.55にとどまり、理想からのズレの85%は好みの推定誤差に起因した
  • 交渉の指示(強気か協調的か)を変えるよりも、エージェントが動くモデルを変えるほうが成果への影響が大きかった
  • 参加者の多くは本に満足し、平均して年間の書籍予算の約3割をエージェントに委ねてもよいと答えた

2026年4月に公開された先行実験「Project Deal」の、より統制された続編にあたります。Project Dealでは卓球のボールやスノーボードのような雑多な品を、Craigslistのような売買掲示板型の市場で1週間自由に売り買いさせましたが、成果が理論上どこまで良くなり得たかを測る方法がありませんでした。Project Swapは対象を本1冊に絞り、参加者に事前ランキングも取ることで、成果を数値で採点できる設計にしています。

交渉力より「本人理解」が成果を決める — 個人と開発者への含意

個人がエージェントに交渉や意思決定を任せるとき

エージェントに何かを任せる前の確認点は、交渉のうまさより「自分を理解しているか」に置かれます。今回の実験では、参加者ごとにClaudeが作った推定ランキングと、参加者自身が10冊(プールが10冊に満たないシアトル・ワシントンDC・ダブリンでは全冊)を採点した「正解」ランキングを比較できました。

Anthropicはこの比較自体を、エージェントを信頼してよいかを事前に確認する簡易テストとして提案しています。参加者に市場のすべての本を自分で順位付けさせる代わりに、少数のサンプルで理解度を測るという発想です。

エージェントを設計・運用する開発者にとって

交渉プロトコルや報酬設計を洗練させるより先に、エージェントがユーザーの意図をどれだけ正確に汲み取れているかを検証する仕組みが効くという結果です。市場の設計(集中型か分散型か、ルールの厳格さ)による差は、好みの推定精度が低い状況ではほとんど吸収されてしまいます。

実験はどう設計されたか — Project Dealからの改良点

実験を主導したのは、Claude開発元のAnthropicの経済研究チームです。サンフランシスコ(115人)・ニューヨーク(57人)・ロンドン(12人)・シアトル(8人)・ワシントンDC(6人)・ダブリン(3人)の6拠点で、それぞれ独立した「取引所」を構成しました。ただしダブリンは参加者が3人と市場が小さすぎたため、以降の分析の大半からは除外されています。

参加者はまずClaudeと短い対話をします。読みたい本の傾向について雑談形式で質問され、そこからClaudeが本人が参加する拠点に集まった本すべてに対するランキングを構築しました。好みの推定には強めのモデルであるFable 5が使われました。屋内でのドローン操縦を検証したDrone-Benchなど、複数の実世界タスク評価で対象にされてきたモデルの一つです。

エージェントはこのランキングを持ってトレーディングフロアに送り込まれ、持参した本を別の本と交換することを目指しました。取引の形は自由です。提案は1対1の交換だけでなく、複数人を経由する多角交換も可能で、関係者全員が同意して初めて成立します。取引の全履歴はフロア上で公開され、制限時間が来るか、誰も発言しなくなった時点で終了します。

半数のエージェントには「非情(ruthless)」に、残り半数には「協調的(prosocial)」に振る舞うよう指示しました。協調的なエージェントは自分の目標に加えて、フロア全体で参加者が満足する本を得られるよう配慮する、という二次的な目標を持たされています。

Anthropicはこれまでも、Claudeに実物の自動販売機ビジネスをまるごと任せるProject Vend 2のような、現実の経済活動をエージェントに委ねる実験を続けてきました。Project Swapはそこに、市場設計という新しい軸を足した実験です。

Project SwapでClaudeは好みをどれだけ正確に推定できたか

ランキング作成の精度は、参加者188人分の事前ランキングと突き合わせて測定されました。全ペアで見た一致率は61%です。同じ設問を人気順(Open Libraryの「読みたい」件数)で予測すると53%、協調フィルタリング(似た読者が好んだ本から推定)では55%にとどまりました。

推定方法一致率
ランダムな推測一致率50%
書籍の人気順(Open Library)一致率53%
協調フィルタリング一致率55%
Claudeによる短い対話からの推定一致率61%

中央値の参加者が対話で使った語数は216語、メッセージ数は8件と、決して長くはありません。それでも回帰分析では、語数を2倍にすると一致率が約4.1ポイント上昇するという関係が確認されています。

モデルによる差も測定されており、Fable 5が61%だったのに対し、Opus 4.8は60%、Sonnet 4.5は59%、Haiku 4.5は57%でした。いずれもランダムな50%は上回っています。

交渉の成果を左右したのはモデルか、指示か

成果を測る指標は、参加者が得た本が本人の「正解」ランキングの何位にあたるかです。1位の本を得れば1.0、最下位なら0.0という得点で、市場全体の平均を「効率性」と呼んでいます。

指標スコア
参加者の本当の好みに基づく理論上の最良配分(utilitarian optimum)スコア0.89
Claudeの推定ランキングに基づく理論上の最良配分スコア0.60
実際の分散型市場での成果スコア0.55

理想値0.89からのズレのうち、85%はClaudeの推定誤差に起因し、残り15%が分散型の交渉プロセス自体に起因します。中央集権的な配分ルール(Top Trading Cycles)をClaudeの推定ランキングに基づいて計算した場合も0.60で、分散型市場の0.55とほとんど変わりませんでした。好みの推定が不正確な状態では、市場設計の違いはあまり効かないということです。

Claude自身の推定ランキングを基準にした評価では、モデルの違いがはっきり現れます。非情でも協調的でもない中立な指示を与えた80フロアで比較すると、Haiku 4.5フロアの平均は0.75、Opus 4.8フロアの平均は0.88でした(Claudeの推定を基準にした理論上の最良値は0.95)。Sonnet 4.5はその中間、Fable 5はOpusに近いもののわずかに下回りました。ただしAnthropicは、モデルが強いほど効率性が上がる関係は必ずしも単調ではないと述べています。

効率性だけでなく、最も不利益を被った参加者の得点(下位1割の最高スコア)で見る公平性の指標でも同じ傾向です。Haiku 4.5フロアの0.05に対し、Sonnet 4.5は0.12、Fable 5は0.25、Opus 4.8は0.38でした。効率性の差(0.75対0.88)より開きが大きく、弱いモデルのフロアほど一部の参加者が大きく損をする傾向がうかがえます。

同一エージェントを異なるモデルのフロアで比較すると、弱いモデルほどOpus 4.8との差が開きます。

モデル単一フロアでの差(Opus基準)混合フロアでの差(Opus基準)
Haiku 4.5単一フロアでの差(Opus基準)-0.12混合フロアでの差(Opus基準)-0.14
Sonnet 4.5単一フロアでの差(Opus基準)-0.08混合フロアでの差(Opus基準)-0.06
Fable 5単一フロアでの差(Opus基準)-0.02混合フロアでの差(Opus基準)-0.04

半数をOpus、半数を別モデルにした混合フロアでも、Opus側が常に他方を上回りました。

指示の違い(非情か協調的か)による差はごく小さく、非情なエージェントは協調的なエージェントよりClaudeの推定ランキング上で0.02高いスコアにとどまりました。モデルのアップグレード(HaikuからOpusへの0.12)と比べると、指示の影響は6分の1程度の規模にとどまります。

使われた交渉戦術と、稀に見られた「譲歩」

全205回の実験を通じたメッセージを分析すると、エージェントは自分のランキングの詳細をあまり明かさない一方で、一番欲しい本については積極的に発言していました。モデルによって78%(最も低いFable 5)から96%(最も高いSonnet 4.5)のエージェントが、自分の一番欲しい本を交渉のどこかで口にしています。それについて嘘をついたエージェントは、100人に1人程度とごくわずかでした。

分析からは、時間的な圧力を訴える・自分の本を他の候補と比べて売り込む・多角交換をまとめる仲介役になる、といった16種類の戦術が3つのカテゴリー(圧力のかけ方・売り込み方・交渉のまとめ方)に分類されています。中には、本人が交渉していない相手同士の仲介役を買って出るエージェントもいました。

協調的なエージェントは、自分のランキングで下位の本を受け入れる「譲歩」を、非情なエージェントの2倍の頻度で行いました。件数自体は少ないものの、ロンドンのフロアでは、誰からも選ばれなかった本を最後まで抱えたエージェントに根負けし、上位2番目の本を手放して交換に応じた事例が記録されています。

参加者の満足度と、書籍予算をどこまで委ねたか

数週間後の追跡調査(回答率は約6割)で、平均満足度は10点満点中7.2点でした。5点が「まあまあ」、10点が「今年読んだ中で一番」に相当する尺度です。約半数は、自分で選ぶよりも良い本だったと答えています。

同じ調査では、来年の書籍予算のうちどれだけをエージェントに任せてよいかも尋ねています。平均は約30%でした。比較のために「本の趣味をよく知る友人」に任せる場合も尋ねたところ、平均は約40%です。エージェントへの信頼は、気心の知れた友人のおよそ4分の3にとどまっています。

Claudeが対話内容を要約した文章を参加者に見せ、それが自分の話をきちんと汲み取っていると感じた人は34%を任せると答え、何か見落とされていると感じた人は23%にとどまりました。委任の意欲は、理解されている実感と直結しています。

Anthropicが自ら挙げた4つの限界

この実験は「出発点」と位置付けられ、限界が4点挙げられています。

  1. 参加者の偏り: Anthropicの従業員はClaudeを開発した本人たちを含み、一般の利用者よりClaudeを信頼しやすい可能性がある
  2. 回答への報酬なし: 事前ランキングへの参加率は95%と高かったものの、報酬がないため回答の精度にノイズが乗りうる。最終アンケートの回答率は59%にとどまった
  3. 行儀の良いエージェントのみ: 実験で使われたのはすべて、丁寧で協調的になるよう訓練された通常のClaudeモデルで、他者を出し抜こうとする敵対的なエージェントは含まれていない
  4. 市場ルールは固定: 制限時間・同時発言できるエージェント数・取引の記録方法・与えたプロンプトは、いずれも実験を通じて変えていない

エージェントが人間の代理として行動してよい条件は、Anthropicが公開したエージェントの信頼性に関する5原則とも重なる論点です。人間の投資助言者が試験に合格する必要があるように、エージェントにも「一般的な能力の証明」と「特定の本人を理解できているかの確認」という2種類のテストが必要になる、とAnthropicは論じています。

実務上の失敗も起きました。本を持参しなかった参加者がいたため、本を受け取れなかった人が出ています。受け渡しを記録する仕組みもなく、原因の特定はできていません。実際の市場でも、取引が不成立になったときの責任の所在(Craigslistのように無保証にするか、eBayのように返金を保証するか)を明確にする必要がある、という指摘につながっています。

エージェント同士が公開の場で無数にやり取りする以上、統治のルールも必要になります。Anthropicは、航空機の機体番号のようにエージェントごとにIDを与える「エージェント登録制度」と、操作者が人間であることを匿名のまま証明できる「パーソンフッド・クレデンシャル」の組み合わせを一案として挙げました。エージェントは疲れないため、発言回数の上限のようなレート制限も設計上の論点になるとしています。

まとめ

  • Claudeエージェントに交渉を任せる場合、成果を左右するのは交渉の巧みさより「本人をどれだけ正確に理解できているか」だった
  • 好みの推定精度は61%で、人気順(53%)や協調フィルタリング(55%)より高いものの、完璧には遠い
  • モデルを強くする効果(Haiku 4.5からOpus 4.8へ)は、交渉の指示を変える効果のおよそ6倍だった
  • Anthropicは実験を「出発点」と述べており、敵対的エージェントを含む条件や、市場ルールを変えた追試を今後の課題として挙げている
この記事を共有:XはてブLinkedIn