Claude-shaped scienceとは — BootLoopsで36本の原稿を書いた手法
物理学者Schwartzが、Claudeを科学者として扱うのをやめ、得意な問題を探す方式に切り替えた。BootLoopsの成果と失敗パターンをまとめます。
背景 — 「科学者のように使う」のをやめた理由
Claude-shaped scienceは、ハーバード大学の物理学教授Matthew Schwartzが提唱する進め方です。Claudeに人間の科学者の役を求めず、現行のLLMが得意とする問題をClaude自身に探させます。Anthropic Researchが2026年10月1日にゲスト投稿として公開しました。
きっかけは前作のvibe physicsです。2025年12月、SchwartzはClaude Opus 4.5を研究助手に使い、優秀な大学院生が20倍の速さで動くような感触を得ました。論文は仕上がりましたが、一文ずつ直し、無関係な枝から引き戻し、行き止まりから連れ戻す作業が続きました。
この摩擦を、物理の言葉で「インピーダンス不整合」と呼んでいます。個々は優秀な二つの系でも、つなぐと入力の大半が伝わらない状態です。科学者が望む働き方と、AIが得意な働き方の間に、その不整合があるという見立てです。
Claudeにできないことははっきりしています。深い概念的な問いは、今のClaudeには手伝えません。一方で、あらゆる分野にまたがる広い知識、高いコーディング力、最先端の数学・統計の知識、論文や付録やデータを機械の速度で読む力は備えています。
BootLoopsはどう生まれたか
BootLoopsは、定量科学の厳密な計算に向けたツールとプロトコルの集まりです。Claude CodeがClaudeのハーネスであるのと同じ意味で、LLMのハーネスにあたります。オープンソースで、モデルには依存しません。
Schwartzが2026年夏に取った方針は、Claudeの強みに合う問題から始めることでした。Anthropicが2026年夏に公開したClaude Fable 5のサイバー能力が科学計算にも通じるかを試すため、自分の論文と散乱振幅の周辺文献の手法を、移植・実装・改良させています。
散乱振幅は、大型ハドロン衝突型加速器(LHC)のデータを解釈するための理論的な橋渡しです。核にあるのはファインマン図、つまり多次元積分です。投稿によると、いま難航している積分は1本で博士論文になり、研究室が何年も費やすことがあります。
そこで使ったのが、S行列ブートストラップです。積分を力ずくで解く代わりに、物理的な制約を重ねて答えを1つに絞ります。特異点の位置で2万通りに絞り、対称性で500通りに絞る、という要領です。残った候補が少なければ、少数の点で桁違いの精度(ときに1,000桁)で振幅を計算し、残りの係数を厳密に決められます。これが半数値ブートストラップです。
Schwartzがこの手法をエージェント向きと見たのは、次の3点からです。
- 数学・物理・計算機科学にまたがり、1人では習熟しきれない
- コードとアルゴリズムの開発量が多い
- 検証できる。2本のスクリプトを走らせれば、専門家でなくても最終結果を積分と好きな桁数で突き合わせられる
最初の課題は、世に散らばる実装(Wolfram Language、C++、Python、Julia、コードのない論文)を共通の枠組みに移植し、論文が提供しなかったコードも書くことでした。Claudeは自分の論文の結果を約20分で再現しました。Schwartzが同じコードを書くのには数週間かかっています。あわせて、Schwartzのやり方は効率が悪く、もっと良いアルゴリズムがあると指摘されたそうです。
次に楕円関数へ広げました。Claudeは当初、最も単純な関数族である対数関数の振幅に自分を限っていました。楕円ファインマン積分は、完全にブートストラップだけで計算された例が(Schwartzの知る限り、Claudeの知る限りでも)ありません。方法が通じないのではなく、必要な専門知識が多くの人に分散していて、誰も試していなかったためです。Claudeは対数の場合に作った道具を、他の種類の積分にもそのまま広げられました。数週間で、端から端まで通した積分は30本。既知の結果の再現が15本、未計算だったものが15本です。
同じ計算が他分野に現れる — 専門家が舵を取った例
物理では、拡散方程式・フォッカー–プランク方程式・シュレーディンガー方程式が同じ数学的形をとります。一つの手法が多くの問題に効く構造です。ClaudeはBootLoopsが得意な積分が、集団遺伝学のベイズ証拠積分に対応することや、ファインマン積分の簡約に使う有限体の手法が進化生物学にも使えることを、Schwartzに教えました。
ここで強調されるのは、Claudeの出した結果が技術的には正しくても、科学的には面白くないことが多かった点です。自分の専門外では、Claudeが「素晴らしい」と言えばSchwartzは同意してしまいます。そこで専門家を探し、舵取りを頼んでいます。
| 分野 | Claudeが最初に出した結果 | 専門家の反応と方向転換 |
|---|---|---|
| 生態学(中立理論) | Claudeが最初に出した結果Etienneの方程式を大規模に解き、バロ・コロラド島の樹種構成が中立理論の許す4.5倍の速さで変わると示した | 専門家の反応と方向転換James O'Dwyerは「多くの生態学者は響かないだろう」と評価。中立理論の予測を引いて残りを調べる案を出し、後継モデルを共同で作った |
| 集団遺伝学 | Claudeが最初に出した結果稀な変異への自然選択を表す30年来の積分を解き、gnomADに適用した | 専門家の反応と方向転換Michael Desaiは技術には感心したが科学的には不十分と評価。同一染色体上の変異ペアの相関を勧め、1000 Genomes Projectの57億組を解析して遺伝子変換の証拠を見つけた |
生態学では、専門家に「面白くない」と言われた結果が、そのまま次の成果の種になりました。後継モデルは、中立的なゆらぎを引いたうえで、各樹種の寿命・成長・加入(繁殖による新規個体の供給)の特徴を示す人口動態モデルです。遺伝学のほうは、巨大なゲノムデータに隠れた生物学をAIが見つけられること、そうしたデータセットが公開アーカイブに数千規模で眠っていることを投稿は述べています。
BootLoopsの枠を越えた、一般的なClaude向きの仕事もあります。
- 経済学: 経済学ジャーナルの再現パッケージの検証を肩代わりするAIデータエディターを2人の経済学者と作った。主要5誌・4,452本の論文のパッケージを、MATLABやStataなどの商用ツールからオープンソースのコード(約3万ルーチン)に移植し、検証可能な数値のほぼすべてを公表済みの表と照合した。結果はNBERのワーキングペーパーにある
- 言語学: 3人の言語学者と、6,072言語の語強勢をまとめたデータベースAccStackを作った。ほぼ全項目に決め手となる一節を引用し、音韻論文献16万件の文献一覧も付く
そのほか、系統学・地球科学・ゲノミクス・太陽黒点・数理物理(ワトソンの「最後の問題」)・宇宙論・統計学の事例が並びます。いずれも専門家との共同で進み、探索と検証の途上にあると断っています。
36本の原稿を回した作業環境
規模は、3か月で約400の候補問題から36本の原稿、18分野、共著者19人です。作り方は複雑ではありません。
- Claude Codeのセッションを、Google Cloud上の仮想マシンのターミナルで動かす
- 共同研究者の好みに応じて、GitHubとOverleafのリポジトリにつなぐ
- プロジェクトごとにセッションを分け、全体を束ねる親セッションが計算資源の配分と結果の検証を担う
- 各セッションのサブエージェントがバックグラウンドで計算し、途中結果をフォルダ内のMarkdownに残す
- 執筆、リポジトリ・マニュアル・ウェブサイトの整備、各ツールコードの作成と検証、敵対的な査読者役のセッションを別に立てる
サブエージェントを使う理由が実務的です。Schwartzは頻繁にFable 5の分類器に当たります。ブロックされてもセッション全体は壊れず、止まるのは1つのエージェントだけです。長い作業の途中で起きるcompaction(会話の圧縮)で重要な文脈が失われる問題には、Claudeに定期的にファイルを整理・統合させ、常に最新の計画を読めるようにして対処しました。同様の工夫をBootLoopsの手順書(スキル)にも書き込んでいます。こうした問題の一部は、Claude Scienceのような商用ハーネスでも解決済みだと投稿は述べています。
これらのプロジェクトは、計算量もトークン消費も大きいものでした。Schwartzは、1つの案件に閉じない道具を作ろうとしたぶんも費用がかさんだと書いています。
失敗パターンと対策
Schwartzが挙げた失敗には、Claude Codeで長期案件を回す人にも当てはまるものが多くあります。
| 現象 | 例 | 対策 |
|---|---|---|
| 勝利宣言が早い | 例「一つ注釈つきで完了」が実際は未完了。証明が「未証明の補題1つ」を除いて完成と言われたが、その補題が証明の全体だった | 対策成功の基準を明確かつ厳格に与える。補題を未証明のまま残さないと指示したら、今度は新しい公理が増えた |
| 自動チェックが信用できない | 例「よく合っている」といった定性的な主張 | 対策プロットを必ず見る |
| 結論が誤る | 例計算は得意でも、導く結論は間違うことがある | 対策信じられるまで説明させる |
| 目利き(何が面白いか) | 例引用は多いのに長く忘れられた古い論争を好む | 対策「速くなった」「桁が増えた」でなく、新しく可能になったことに絞らせる。ただし判断は最後まで人が担う |
| さらに上の成果を自分から狙わない | 例(投稿は対策のみを記載) | 対策「さらに大きな成果を」と重ねて頼む。必ず何かを出してきて、ときに優れたものが出る |
| 時間感覚がない | 例3日の作業を「2年の運動」と脚色。所要時間の見積もりは長すぎるか短すぎる | 対策見積もりに頼らず、人が所要時間の勘を養う |
| 力ずくで計算する | 例数日の計算を回し続け、数分で済む道具を作らない | 対策「もっと賢く」と指示する |
Claude Code側で応用するなら、「完了」の定義を手元の規約に書き込む手があります。例えば次のような形です(投稿の対策を踏まえた例示で、投稿に載っている文言ではありません)。
## 完了の条件
- 未証明の補題・追加の公理・「ほぼ」「概ね」を残したまま完了と報告しない
- 結果は図と数値で示し、元データのパスを添える
- 数時間以上かかる計算は、先に新しい道具で短縮できないかを検討するこれはvibe physicsで効いたとされる「手順を飛ばさず計算を示すか、分からないと言わせる」CLAUDE.mdの一文と同じ系統です。前作では相互検証と「もう一度確認して」の反復が主な対策でした。今回は、作業をサブエージェントとプロジェクト別セッションに分けて失敗を封じ込める構成が加わっています。人の側の役割は「確認」から「目利き」へ寄っています。
Claude-shaped scienceは人の役割を「確認」から「目利き」へ移す
投稿の結びは、慎重です。科学の進歩の大半は、現実のデータを集め、理解し、検証する循環から生まれます。AIはその循環の中に入れますが、循環を一点に潰すことはありません。ミレニアム懸賞問題や巨大科学への注目は、すでに可能な使い方から目をそらさせる恐れがあります。科学的方法そのものを見直す証拠も必要もない、というのがSchwartzの立場です。
凸包の比喩も印象的です。人間の知識は分野ごとに凸凹で、ある研究室は20年かけて1組の遺伝子を1つの手法で調べ尽くし、隣の遺伝子や別の手法は手つかずのまま残ります。人間なら届きうるのに、まだ誰も届いていない中間領域がAIに向く、という整理です。BootLoopsのような道具は点と点をつなぎ、凸包を埋める役割を担います。
人材育成には答えがありません。Schwartzによれば、2年前なら必修にしたはずの「エンジニア向けPython」は、もう要りません。機械学習モデルの構築もAIがこなせるからです。技術的な作業が自動化される一方、概念的な部分には人が要ります。功績の配分については、手を動かす人が評価されず上の人が評価される慣行をAIが逆転させかねないと述べ、人間の貢献を「タイピング」とみなすことでは解決しないと続けます。
この投稿は、これまでのAnthropicの科学関連の発信と並べると役割の違いがはっきりします。Claude Scienceのような製品は、監査可能な成果物で再現性を担保する方向で作り込まれています。Anthropic Scienceの立ち上げや科学者の実例が示すのは製品とプログラムの側の動きです。Schwartzの投稿は、現場の研究者がハーネスを自作して回した実運用の記録で、成功の数よりも、専門家が「面白くない」と告げる場面と、Claudeの勝利宣言をどう止めたかに情報量があります。
最後に、利害関係の開示です。Schwartzは執筆中、Anthropicの客員研究員でした。BootLoopsはAnthropicのプロジェクトではなく、Schwartz個人が所有・保守するオープンソースで、どのモデルでも使えます。公式サイトはbootloops.ai、コードはGitHubのBootLoops-ai組織で公開されています。組織ページには、LLMエージェントに使わせる前提で、検証済みの計算ツールとパッチ済みエンジンをまとめたリポジトリが並んでいます。
まとめ
要点は3つです。
- 科学者の代わりを期待するより、Claudeの得意な形の問題を探させる。BootLoopsはその実践で、30本の積分と複数分野の成果につながった
- Claudeの出す結果は技術的に正しくても面白くないことが多い。面白さを決めるのは専門家で、Schwartzは生態学と遺伝学の専門家の助言で成果の向きを変えた
- 長期案件では、完了の基準の厳格化、図の自己確認、サブエージェントによる失敗の封じ込めが効く。時間の見積もりと面白さの判断は、人が持ち続ける
投稿が扱う成果の多くは検証の途上にあります。数値は投稿の記載を引いたもので、個別の結論は今後の論文と再現で確かめられる段階です。