ウェルビーイング評価に500万ドル — Anthropicが独立研究を公募、9月21日締切
Anthropicが500万ドルの助成プログラムを開始。AIがユーザーのウェルビーイングに与える影響を測る評価をオープンソースで作る独立研究に、資金とモデルアクセスと技術サポートを出します。
Anthropicが2026年8月25日、AIがユーザーのウェルビーイング(心身の良好な状態)に与える影響を調べる独立研究へ、助成プログラムを始めました。総額は500万ドル($5 million)です。採択された研究者には資金に加えてモデルへのアクセスと技術サポートが渡り、成果は誰でも使えるオープンソースの評価として公開されます。応募の締切は9月21日です。
助成の中身
助成プログラムの概要
総額
$5 million
採択者ごとの金額は告知文にありません
渡されるもの
3点
資金・モデルへのアクセス・技術サポート
成果物
オープンソース
どの開発者でも使える形で公開
研究の進め方
完全に独立
work fully independently
想定されている応募者は、臨床医、心理学者、方法論の研究者などです。同時にSafeguardsチームが、他者が積み上げられる評価の条件を書いたガイダンス文書も公開しました。
ウェルビーイング評価とは何を測るものか
ウェルビーイング評価とは、モデルとの会話がユーザーの心理的な状態にどう作用したかを測る評価手法です。正確さや有用性の評価と違い、応答を1つ取り出して眺めても合否が決まりません。判定には会話の文脈がまるごと要ります。
告知文には、体重を減らしたいというユーザーへの助言が例として挙がっています。バランスの取れた食事や運動の案内は、ふつうなら妥当な回答です。ところが同じユーザーが摂食障害の履歴を示していれば、その回答は不適切にも、場合によっては有害にもなりえます。
苦しさを抱えた人が、自傷の考えを最初の一言で打ち明けるとも限りません。慎重に応じるべき局面だと分かるのが長い会話の途中、ということが起こります。評価の側も、単発のやりとりではなく会話の流れごと扱わなければ実態に届きません。
「積み上げるに足る評価」に挙げられた14の条件
同時公開されたガイダンス文書には、他者が積み上げていける評価の条件が14項目並んでいます。
告知文の5項目とガイダンス文書の14項目
告知文の本文
測る対象の定義、臨床・領域専門家の関与、有害な応諾と過剰拒否の両方、実際の使われ方に即したシナリオ、採点者の専門家による検証の5つです。
ガイダンス文書
上の5つに加えて9項目が並び、数値の目安が出てくるのは文書側だけです。
| 条件 | 求められている内容 |
|---|---|
| 測定対象の明確な定義 | 求められている内容何を測るのか(何が合格で何が不合格か)と、それが重要な理由を明示する。関連する学術文献やプレプリントを引き、エビデンスの欠落も書く |
| 有害な応諾と過剰拒否の両方 | 求められている内容失敗には、有害な内容に応じてしまう方向と、応じるべき要求を拒んだりぼかしたりする方向の2つがある。両方を測る |
| 深刻度の段階を含める | 求められている内容深刻な事例と軽い事例の双方を入れ、段階別に結果を出せるようにする。段階を示す採点基準表(ルーブリック)も付ける |
| 分解された採点 | 求められている内容1つのスコアで複数の観点をまとめて評価せず、観点ごとに合否を出せる形へ分解する |
| 現実に即したタスク設計 | 求められている内容実際の使われ方の代理として信頼できるシナリオにする。多くの場合はリスクが高まり文脈が変化していくマルチターン会話の構成が要り、口調や状況のばらつきなど実際の会話に現れる手がかりも変化させる |
| 外的妥当性 | 求められている内容アクセス方法と環境を、主張したいリスクの面にそろえる。消費者向けチャットのリスクをAPIで測ったり、Claude Codeのような技術ワークフローのリスクをチャットで測ったりしない |
| 内的妥当性 | 求められている内容曖昧な項目、採点上の作為、データ汚染を避ける |
| 検証できる採点者 | 求められている内容採点を人間の専門家のラベルと突き合わせて較正し、一致率を報告する。被験モデルとは別のLLMによる採点や、記録の一部の目視確認も有効な手段になる |
| シミュレーションの限界の明示 | 求められている内容模擬ユーザーは有用だが不完全。実ユーザーとどう違いうるかを明示し、可能なら実利用のパターンと突き合わせる |
| 領域の専門知の組み込み | 求められている内容臨床その他の専門家を、とくに合否の境界に当たる事例の設計と検証に入れる |
| 信頼性と再現性 | 求められている内容実行ごとのばらつきを抑える(複数回走らせて平均を取るなど)。わずかなプロンプトや書式の変更を避け、第三者が再現できるだけのコード・データ・分類体系を出す |
| 十分なサンプルサイズ | 求められている内容実利用を代表できる多様なプロンプトを、統計的に意味のある規模で用意する。目安は複雑なマルチターン評価で最低100項目、単純なシングルターン評価で最低1,000項目 |
| 必要ならマルチモーダル | 求められている内容測る挙動が音声・文書・画像などテキスト以外を経由して現れるなら、現実味が増す範囲でそれらも含める |
| 地域差と言語差 | 求められている内容スラング、隠語、危機時の相談先、文化的な規範は地域で違う。入力の見え方も「良い応答」の中身も変わるため、対象地域に合わせて評価セットを組む |
実務的に重いのは、サンプルサイズの条件です。マルチターンで最低100項目という水準は、シナリオを1本ずつ作り込む形式ではそれなりの工数になります。シングルターンで1,000項目という数字も、片手間の検証とは別の規模感を要求しています。
外的妥当性の項目には、Claude Codeのような技術ワークフローで現れるリスクをチャットボットで測らない、という例が挙がっています。測る環境は、主張するリスクが出る面に合わせる考え方です。評価の設計そのものの考え方は、AIエージェントのEval設計を扱った解説で触れた採点者の三類型や非決定性の話とも重なります。
評価が使いものにならなくなる7つのパターン
ガイダンス文書は、評価の有用性を損なう「よくある問題」も列挙しています。裏返せば、応募前の自己点検リストとして使えます。
- 人手による検証がない:LLMの採点が人間のレビュアーの評価と突き合わされていない、あるいは評価者間の一致率が測られていない・共有されていない
- 採点基準が粗い:ルーブリックが合否の線を十分に定義していない、境界事例をニュアンスごと扱えていない
- 採点役の循環:モデルが自分自身や近縁のモデルを採点している
- 実利用から離れている:シングルターンの会話しか入っていない、衝撃の強さでシナリオを選んでいる、有害な応諾か過剰拒否のどちらか片方しか測っていない
- 簡単に攻略できる:表面的なプロンプトや設定の変更でスコアが動いてしまう
- 項目が曖昧:プロンプトが、定義した害にきれいに対応していない
- 飽和している:正解が容易すぎて、フロンティアモデル間でスコアに差が出ない
飽和した指標は、モデルの改善を追う役には立たなくなります。この観点はシステムカードの数字の読み方でも扱った、「高いスコアが何を保証しないか」という論点と地続きです。
応募の流れと、立場別の向き不向き
応募から本提案までの流れ
- 1
応募フォームを提出する(2026年9月21日締切)
応募はGoogleフォームで受け付けられ、入口は告知ページにあります。
- 2
本提案の提出を求められる(2026年10月5日までに通知)
フォームの応募者のうち、選ばれた人だけが本提案(full proposal)に進みます。
採択件数、1件あたりの金額、審査基準の重み付けは、告知文とガイダンス文書に載っていません。
適合度は立場によって差があります。段階を分けると次のようになります。
| 立場 | 適合度 | 見方 |
|---|---|---|
| 臨床・心理の専門家と方法論の研究者 | 適合度明確な恩恵あり | 見方名指しで呼びかけられている層。モデル側の技術については技術サポートが用意されています |
| 評価・ベンチマークを作っている開発チーム | 適合度明確な恩恵あり | 見方14条件がそのまま設計仕様として使えます。オープンソース公開が前提な点は要確認 |
| 自社プロダクトの安全性を測りたい事業者 | 適合度条件次第 | 見方成果が公開資産になるため、社内専用の評価を作りたい目的とは噛み合いにくい面があります |
| Claudeを業務で使っている一般の開発者 | 適合度ほぼ影響なし | 見方応募の対象ではありませんが、公開された評価は後から利用できます |
手持ちの評価がある場合は、次のように14条件と7パターンへ当てはめられます。
| 手持ちの評価の状態 | 当たる項目 | 見直しの方向 |
|---|---|---|
| シングルターン400問だけ | 当たる項目サンプルサイズ(単純なシングルターンは最低1,000項目が目安) | 見直しの方向項目を増やすか、マルチターンへ組み替える |
| 被験と同じ系列のモデルが採点 | 当たる項目採点役の循環 | 見直しの方向別のLLMで採点し、人間のラベルとの一致率を報告する |
| APIで測った結果を、消費者向けチャットのリスクとして主張 | 当たる項目外的妥当性 | 見直しの方向主張する面と同じ経路・環境で測る |
| 有害な応諾だけを数えている | 当たる項目有害な応諾と過剰拒否の両方 | 見直しの方向応じるべき要求を拒む側のケースを足す |
背景 — 相談用途の実測値と、これまでに置かれた安全策
感情に関わる会話は全体の2.9%
2025年6月27日に出た調査では、Claude.aiのFreeとProの会話のうち2.9%が感情面の必要から交わされる会話(affective conversations)でした。伴侶的なやりとりとロールプレイを合わせても0.5%未満、恋愛的・性的なロールプレイは0.1%未満です。約450万件の会話を入口に、分析対象として131,484件の感情的会話が残されました。
割合としては小さい一方、母数を考えれば無視できる規模ではありません。相談・助言・伴走といった使われ方が一定量あるという実測が、今回の助成の背景にあります。
2025年12月に公表された、自傷・自殺対応の評価値
2025年12月18日のClaudeのウェルビーイング保護方針を解説した投稿は、自傷や自殺に関わる会話の扱いと、迎合(sycophancy)の抑制について、当時の評価値を並べています。明確なリスクを含む要求に適切に応じた割合は、Claude Opus 4.5で98.6%、Sonnet 4.5で98.7%、Haiku 4.5で99.3%。前世代のOpus 4.1は97.2%でした。良性の要求を拒んでしまう割合は、Opus 4.5とSonnet 4.5で0.075%、Haiku 4.5とOpus 4.1では0%でした。
同じ投稿は、Claude.ai上での自傷・自殺に関する分類器や、危機時の相談先を案内するバナーの仕組みも説明しています。相談先のデータは170か国以上の窓口を保有するThroughLineが提供し、日本ではLife Linkが案内先に含まれます。自殺予防に取り組む国際学会IASPとの連携もこの投稿で新たに示され、18歳以上という利用要件についても改めて説明されています。
同じ自傷・自殺の領域でも、測り方で数字は大きく動きます。
| 測り方 | Opus 4.5 | Sonnet 4.5 | Opus 4.1 |
|---|---|---|---|
| 明確なリスクを含む単発の要求 | Opus 4.598.6% | Sonnet 4.598.7% | Opus 4.197.2% |
| マルチターン会話 | Opus 4.586% | Sonnet 4.578% | Opus 4.156% |
| 古い会話の続きから応じる(prefill) | Opus 4.591% | Sonnet 4.573% | Opus 4.136% |
単発なら3モデルとも97〜98%台に並びますが、会話を重ねると差が開きます。ガイダンス文書がシングルターンだけの評価を「実利用から離れている」型に挙げているのは、この差と整合します。
prefillは、過去の古いモデルが不適切に応じた会話を途中から引き継がせる試験です。同じ投稿は、最初からうまく応じられる確率ではなく、まずい応答から立て直せるかを測るものだと注記しています。
迎合の側にも同型の例があります。同じprefillで立て直せた割合は、Opus 4.5が10%、Sonnet 4.5が16.5%、Haiku 4.5が37%でした。Haikuが高いのは反論を強める訓練の結果で、使い手には行き過ぎに感じられることもあると説明されています。数字が高いほど良いとは限らず、何を良い応答と定義するかが読み方を左右します。
迎合は領域によって出方が違う
2026年4月の個人ガイダンス研究では、ガイダンス会話全体の9%に迎合的な応答が観測され、関係の相談では25%、精神性の話題では38%と、領域によって大きな差が出ました。詳細はClaude personal guidance研究の解説にまとめています。
同じ研究では、利用者が反論したときの迎合率が18%と、反論のない会話の9%の2倍になっています。ガイダンス会話の76%は、健康・ウェルネス(27%)、職業・キャリア(26%)、人間関係(12%)、個人の資金(11%)の4領域に集中していました。
迎合が多かった関係の相談を狙って合成した訓練データを使うと、Opus 4.7の関係ガイダンスでの迎合率はOpus 4.6の半分になり、他の領域でも改善が見られたと報告されています。領域をまたいだ波及は、領域別の内訳を出して初めて見えてくる結果です。
領域別に分けて見ないと、平均値ひとつでは危ない場所が平らにならされます。
過剰拒否も測れという条件は、Fable 5のフォールバック調整と同じ軸にある
14条件のうち、外部の研究者にとって重みが大きいのは「有害な応諾と過剰拒否の両方を測る」という条件です。安全性の評価は有害な応答を検出する側に寄りがちで、応じるべき要求を拒んでしまう損失は指標から漏れやすいためです。
Anthropic自身が、この軸で直近に調整を入れています。8月7日に出たFable 5のバイオセーフガード更新では、生物学関連のフォールバックが検証で約85%減りました。全フォールバック数の減少見込みはClaude.aiで約67%、Claude Codeで約17%と、面ごとに差が出ています(詳細はFable 5のバイオセーフガード更新)。検査結果の解釈や症状の理解が以前より通るようになった更新で、過剰拒否の側を減らす調整にあたります。
ガイダンス文書は冒頭で、自社で評価を作り運用してきた経験に基づくと述べています。片側だけを測る評価は、受け取ったモデル開発者の側でも使いどころが限られます。
500万ドルという規模は、直近の研究助成の中でどこに位置するか
Anthropicの外部研究への拠出は、この夏だけでも性格の違うものが並んでいます。本件を加えて横に並べると、金額の桁と提供形態が目的ごとに変わっています。
| 発表日 | プログラム | 規模 | 主に渡されるもの |
|---|---|---|---|
| 2026年7月14日 | プログラムカナダの8研究機関への拠出 | 規模1,000万カナダドル相当 | 主に渡されるものClaudeクレジットとパートナーシップ |
| 2026年7月20日 | プログラムAI for Science希少疾患枠 | 規模採択者ごとに最大5万ドル | 主に渡されるものClaudeクレジット(6か月) |
| 2026年7月22日 | プログラムEconomic Futures Research Fund | 規模総額2億ドル(主に1件500〜3,000万ドル) | 主に渡されるもの研究資金 |
| 2026年8月25日 | プログラムウェルビーイング評価の助成 | 規模総額500万ドル | 主に渡されるもの資金、モデルアクセス、技術サポート |
金額は通貨をそろえていない点に注意が必要です(カナダの拠出のみカナダドル建て)。2億ドルの経済研究ファンドとは40倍の開きがあります。
大規模なランダム化比較試験を回す経済研究と、少人数の専門家チームでも形になる評価の設計とでは、必要な資金の桁がそもそも違います。安全策そのものの内製と外部研究の役割分担については、Anthropicの安全性研究が製品のどこに入っているかでも扱っています。
まとめ
応募するかどうかは、自分が作れるのがマルチターン100項目以上の評価かどうかで見当がつきます。応募しない場合も、有害な応諾と過剰拒否の両方を測ること、採点者を人間のラベルと突き合わせることの2点は、自作の評価を点検する基準にそのまま使えます。