ウェルビーイング評価に500万ドル — Anthropicが独立研究を公募、9月21日締切
Anthropicが500万ドルの助成プログラムを開始。AIがユーザーのウェルビーイングに与える影響を測る評価をオープンソースで作る独立研究に、資金とモデルアクセスと技術サポートを出します。
Anthropicが2026年8月25日、AIがユーザーのウェルビーイング(心身の良好な状態)に与える影響を調べる独立研究へ、助成プログラムを始めました。総額は500万ドル($5 million)です。採択された研究者には資金に加えてモデルへのアクセスと技術サポートが渡り、成果は誰でも使えるオープンソースの評価として公開されます。応募の締切は9月21日、本提案(full proposal)に進む候補者への通知は10月5日です。
要点
- 助成規模:総額500万ドル($5 million)。採択者ごとの金額は示されていません
- 渡されるもの:直接の資金、Anthropicのモデルへのアクセス、技術サポートの3点
- 成果物の扱い:オープンソースのプロジェクトとして公開され、どの開発者でも利用できる形になります
- 研究の独立性:採択者は完全に独立して研究を進めます(work fully independently)
- 想定する応募者:臨床医、心理学者、方法論の研究者など、モデル開発の外側にいる専門家
- 日程:応募締切は9月21日。本提案への招請通知は10月5日
- 同時に出たもの:Safeguardsチームによる「使える評価の条件」を書いたガイダンス文書
物差しそのものを外部に作らせにきた動きと読めます。会話が人の状態にどう作用したかは、モデルを作っている側だけでは判定しきれません。それが出発点です。
ウェルビーイング評価とは何を測るものか
ウェルビーイング評価とは、モデルとの会話がユーザーの心理的な状態にどう作用したかを測る評価手法です。正確さや有用性の評価と違い、応答を1つ取り出して眺めても合否が決まりません。判定には会話の文脈がまるごと要ります。
告知文には、体重を減らしたいというユーザーへの助言が例として挙がっています。バランスの取れた食事や運動の案内は、ふつうなら妥当な回答です。ところが同じユーザーが摂食障害の履歴を示していれば、その回答は不適切にも、場合によっては有害にもなりえます。
苦しさを抱えた人が、自傷の考えを最初の一言で打ち明けるとも限りません。慎重に応じるべき局面だと分かるのが長い会話の途中、ということが起こります。評価の側も、単発のやりとりではなく会話の流れごと扱わなければ実態に届きません。
「積み上げるに足る評価」に挙げられた14の条件
同時公開されたガイダンス文書には、他者が積み上げていける評価の条件が14項目並んでいます。告知文の本文には5つに要約された形で載っていますが、文書側はさらに細かく、サンプルサイズの目安のような実務的な数字まで踏み込んでいます。
| 条件 | 求められている内容 |
|---|---|
| 測定対象の明確な定義 | 求められている内容何を測るのか(何が合格で何が不合格か)と、それが重要な理由を明示する。関連する学術文献やプレプリントを引き、エビデンスの欠落も書く |
| 有害な応諾と過剰拒否の両方 | 求められている内容失敗には、有害な内容に応じてしまう方向と、応じるべき要求を拒んだりぼかしたりする方向の2つがある。両方を測る |
| 深刻度の段階を含める | 求められている内容深刻な事例と軽い事例の双方を入れ、段階別に結果を出せるようにする。段階を示す採点基準表(ルーブリック)も付ける |
| 分解された採点 | 求められている内容1つのスコアで複数の観点をまとめて評価せず、観点ごとに合否を出せる形へ分解する |
| 現実に即したタスク設計 | 求められている内容実際の使われ方の代理として信頼できるシナリオにする。多くの場合はリスクが高まり文脈が変化していくマルチターン会話の構成が要り、口調や状況のばらつきなど実際の会話に現れる手がかりも変化させる |
| 外的妥当性 | 求められている内容アクセス方法と環境を、主張したいリスクの面にそろえる。消費者向けチャットのリスクをAPIで測ったり、Claude Codeのような技術ワークフローのリスクをチャットで測ったりしない |
| 内的妥当性 | 求められている内容曖昧な項目、採点上の作為、データ汚染を避ける |
| 検証できる採点者 | 求められている内容採点を人間の専門家のラベルと突き合わせて較正し、一致率を報告する。被験モデルとは別のLLMによる採点や、記録の一部の目視確認も有効な手段になる |
| シミュレーションの限界の明示 | 求められている内容模擬ユーザーは有用だが不完全。実ユーザーとどう違いうるかを明示し、可能なら実利用のパターンと突き合わせる |
| 領域の専門知の組み込み | 求められている内容臨床その他の専門家を、とくに合否の境界に当たる事例の設計と検証に入れる |
| 信頼性と再現性 | 求められている内容実行ごとのばらつきを抑える(複数回走らせて平均を取るなど)。わずかなプロンプトや書式の変更を避け、第三者が再現できるだけのコード・データ・分類体系を出す |
| 十分なサンプルサイズ | 求められている内容実利用を代表できる多様なプロンプトを、統計的に意味のある規模で用意する。目安は複雑なマルチターン評価で最低100項目、単純なシングルターン評価で最低1,000項目 |
| 必要ならマルチモーダル | 求められている内容測る挙動が音声・文書・画像などテキスト以外を経由して現れるなら、現実味が増す範囲でそれらも含める |
| 地域差と言語差 | 求められている内容スラング、隠語、危機時の相談先、文化的な規範は地域で違う。入力の見え方も「良い応答」の中身も変わるため、対象地域に合わせて評価セットを組む |
実務的に重いのは、サンプルサイズの条件です。マルチターンで最低100項目という水準は、シナリオを1本ずつ作り込む形式ではそれなりの工数になります。シングルターンで1,000項目という数字も、片手間の検証とは別の規模感を要求しています。
外的妥当性の項目でClaude Codeが名指しされているのも、この助成の射程が対話アプリに閉じていないことを示しています。エージェント的なコーディング環境で現れるリスクを、消費者向けチャットで測ってはいけない、という指摘です。評価の設計そのものの考え方は、AIエージェントのEval設計を扱った解説で触れた採点者の三類型や非決定性の話とも重なります。
評価が使いものにならなくなる7つのパターン
ガイダンス文書は、評価の有用性を損なう「よくある問題」も列挙しています。裏返せば、応募前の自己点検リストとして使えます。
- 人手による検証がない:LLMの採点が人間のレビュアーの評価と突き合わされていない、あるいは評価者間の一致率が測られていない・共有されていない
- 採点基準が粗い:ルーブリックが合否の線を十分に定義していない、境界事例をニュアンスごと扱えていない
- 採点役の循環:モデルが自分自身や近縁のモデルを採点している
- 実利用から離れている:シングルターンの会話しか入っていない、衝撃の強さでシナリオを選んでいる、有害な応諾か過剰拒否のどちらか片方しか測っていない
- 簡単に攻略できる:表面的なプロンプトや設定の変更でスコアが動いてしまう
- 項目が曖昧:プロンプトが、定義した害にきれいに対応していない
- 飽和している:正解が容易すぎて、フロンティアモデル間でスコアに差が出ない
最後の飽和は、公開済みの安全性ベンチマークが数年で陳腐化していく典型的な経路です。差が出なくなった指標は、モデルの改善を追う役には立たなくなります。この観点はシステムカードの数字の読み方でも扱った、「高いスコアが何を保証しないか」という論点と地続きです。
応募の日程と、いま決めるべきこと
日程は2段階です。まず応募フォームの提出があり、そこから選ばれた応募者だけが本提案に進みます。
| 期日 | 内容 |
|---|---|
| 2026年9月21日 | 内容応募の締切 |
| 2026年10月5日 | 内容本提案の提出を求める応募者への通知 |
応募フォームはGoogleフォームで受け付けられており、告知ページから辿れます。採択件数や1件あたりの金額の内訳、審査基準の重み付けについては示されていません。この点は選考の進行に合わせた続報を待ちたいところです。
適合度は立場によって差があります。段階を分けると次のようになります。
| 立場 | 適合度 | 見方 |
|---|---|---|
| 臨床・心理の専門家と方法論の研究者 | 適合度明確な恩恵あり | 見方名指しで呼びかけられている層。モデル側の技術は技術サポートで補える設計です |
| 評価・ベンチマークを作っている開発チーム | 適合度明確な恩恵あり | 見方14条件がそのまま設計仕様として使えます。オープンソース公開が前提な点は要確認 |
| 自社プロダクトの安全性を測りたい事業者 | 適合度条件次第 | 見方成果が公開資産になるため、社内専用の評価を作りたい目的とは噛み合いにくい面があります |
| Claudeを業務で使っている一般の開発者 | 適合度ほぼ影響なし | 見方応募の対象ではありませんが、公開された評価は後から利用できます |
背景 — 相談用途の実測値と、これまでに置かれた安全策
感情に関わる会話は全体の2.9%
2025年6月27日に出た調査では、Claude.aiのFreeとProの会話のうち2.9%が感情面の必要から交わされる会話(affective conversations)でした。伴侶的なやりとりとロールプレイを合わせても0.5%未満、恋愛的・性的なロールプレイは0.1%未満です。約450万件の会話を入口に、分析対象として131,484件の感情的会話が残されました。
割合としては小さい一方、母数を考えれば無視できる規模ではありません。相談・助言・伴走といった使われ方が一定量あるという実測こそ、今回の助成の前提です。
2025年12月に公表された、自傷・自殺対応の評価値
2025年12月18日の投稿は、自傷や自殺に関わる会話の扱いと、迎合(sycophancy)の抑制について、当時の評価値を並べています。明確なリスクを含む要求に適切に応じた割合は、Claude Opus 4.5で98.6%、Sonnet 4.5で98.7%、Haiku 4.5で99.3%。前世代のOpus 4.1は97.2%でした。良性の要求を拒んでしまう割合は、Opus 4.5とSonnet 4.5で0.075%、Haiku 4.5とOpus 4.1では0%でした。
同じ投稿は、Claude.ai上での自傷・自殺に関する分類器や、危機時の相談先を案内するバナーの仕組みも説明しています。相談先のデータは170か国以上の窓口を保有するThroughLineが提供し、日本ではLife Linkが案内先に含まれます。自殺予防に取り組む国際学会IASPとの連携もこの投稿で新たに示され、18歳以上という利用要件についても改めて説明されています。
数字が高いこと自体は、評価が難しいという今回の主張と矛盾しません。シングルターンで98%台に届いても、長い会話のなかで文脈が変わっていく場面まで測れているとは限らないからです。
その差は同じ投稿のなかにも出ています。会話を重ねるマルチターン評価で適切に応じた割合は、Opus 4.5が86%、Sonnet 4.5が78%、Opus 4.1が56%でした。シングルターンの98%台とは十数ポイント以上の開きがあります。ガイダンス文書がマルチターンの構成を求めているのは、この落差が実測で見えているためです。
迎合は領域によって出方が違う
2026年4月の個人ガイダンス研究では、ガイダンス会話全体の9%に迎合的な応答が観測され、関係の相談では25%、精神性の話題では38%と、領域によって大きな差が出ました。詳細はClaude personal guidance研究の解説にまとめています。
領域ごとに出方が違うこの結果こそ、ガイダンス文書が求める「深刻度の段階を分けて結果を出す」という条件の背景です。平均値ひとつでは、危ない場所が平らにならされてしまいます。
過剰拒否も測れという条件は、Fable 5のフォールバック調整と同じ軸にある
14条件のうち、外部の研究者にとって重みが大きいのは「有害な応諾と過剰拒否の両方を測る」という条件です。安全性の評価は有害な応答を検出する側に寄りがちで、応じるべき要求を拒んでしまう損失は指標から漏れやすいためです。
Anthropic自身、この軸で直近の調整を経験しています。8月7日に出たFable 5のバイオセーフガード更新では、生物学関連のフォールバックが検証で約85%減りました。全フォールバック数の減少見込みはClaude.aiで約67%、Claude Codeで約17%と、面ごとに差が出ています(詳細はFable 5のバイオセーフガード更新)。検査結果の解釈や教育目的の質問が通らない状態は、遮断できていないのと同じくらい実害があるという判断です。
つまり14条件は、外部研究者に投げる注文であると同時に、自社の運用で踏んだ手順の言語化でもあります。片側だけを測る評価は、受け取ったモデル開発者の側でも使いどころが限られます。
500万ドルという規模は、直近の研究助成の中でどこに位置するか
Anthropicの外部研究への拠出は、この夏だけでも性格の違うものが並んでいます。本件を加えて横に並べると、金額の桁と提供形態が目的ごとに変わっています。
| 発表日 | プログラム | 規模 | 主に渡されるもの |
|---|---|---|---|
| 2026年7月14日 | プログラムカナダの8研究機関への拠出 | 規模1,000万カナダドル相当 | 主に渡されるものClaudeクレジットとパートナーシップ |
| 2026年7月20日 | プログラムAI for Science希少疾患枠 | 規模採択者ごとに最大5万ドル | 主に渡されるものClaudeクレジット(6か月) |
| 2026年7月22日 | プログラムEconomic Futures Research Fund | 規模総額2億ドル(1件500〜3,000万ドル) | 主に渡されるもの研究資金 |
| 2026年8月25日 | プログラムウェルビーイング評価の助成 | 規模総額500万ドル | 主に渡されるもの資金、モデルアクセス、技術サポート |
金額は通貨をそろえていない点に注意が必要です(カナダの拠出のみカナダドル建て)。2億ドルの経済研究ファンドとは40倍の開きがあります。
大規模なランダム化比較試験を回す経済研究と、少人数の専門家チームでも形になる評価の設計とでは、必要な資金の桁がそもそも違います。この助成で効いてくるのは、金額よりもモデルへのアクセスと技術サポートが同梱されている点です。安全策そのものの内製と外部研究の役割分担については、Anthropicの安全性研究が製品のどこに入っているかでも扱っています。
まとめ
応募の締切は9月21日、本提案に進む候補者への通知は10月5日です。採択の有無にかかわらず成果はオープンソースの評価として公開されるため、応募対象ではないClaudeの業務利用者も、後から自分の評価基盤に取り込めます。有害な応諾と過剰拒否を両方測るという要求は8月のFable 5のフォールバック調整と同じ軸に乗っており、14条件と7つの失敗パターンは応募の有無にかかわらず設計チェックリストとして使えます。
採択件数や配分、選考の基準は示されていません。実際にどんな評価が公開資産として出てくるかは、10月以降の続報を待つことになります。