Claudeの中に見つかった「J-space」— Anthropicが探ったLLMの共有作業スペース
Anthropicの解釈可能性研究「A global workspace in language models」を読み解きます。Jacobianレンズで見つかったJ-spaceの5つの機能特性、安全監査への応用、意識論との距離を扱います。
Anthropicは2026年7月6日、Claudeの内部に「意識的にアクセスできる思考」に相当する構造が自発的に生まれていると主張する解釈可能性研究「A global workspace in language models」を公開しました。研究チームはこの構造をJ-spaceと名付け、外に出力していない「頭の中の言葉」を読み取り、書き換え、監視するための道具立てを提示しています。モデル同士の内部表現の違いを機構レベルで比べるCrosscoderによるモデル比較は、別の観測手段です。
本稿は、この研究論文の骨子を、読者が「Claudeの安全監査や運用でどこまで使える話なのか」を判断できるように読み解いたものです。新モデルへの切り替え前後の挙動変化の検出は、AIのdiffツールで挙動変化を検出する仕組みで扱っています。関連する記事は3本あります。解釈可能性側ではNatural Language Autoencodersの解説、訓練側では「理由」を教えるアラインメントを扱ったTeaching Claude whyの読み解きです。エージェント運用の信頼性はTrustworthy Agents in Practiceにあります。
J-spaceは、書き出す思考と何が違うのか
J-spaceは、Claudeが文章として書き出す思考とは別の層にあります。名前の由来はヤコビ行列で、パターン1つが語1つに結び付いています。あるパターンが点灯しても、Claudeがその語を「言っている」わけではありません。その語が頭にある、という意味です。
スクラッチパッドとJ-space
書き出す思考
scratchpadやchain of thoughtのように、Claudeが自分用に書くテキストです。出力に残るので、読めばそのまま確認できます。
J-space
ニューラルネットワーク内部のパターンです。書き出さずに概念を思い浮かべられますが、読むにはJ-lensが要ります。
J-spaceは設計や外部からの追加ではなく、訓練の過程で自然に現れた構造として観測されています。Claudeの処理の大半はJ-spaceを通らず、担うのは多段推論・要約・韻律といった高次のタスクです。
背景 — global workspace theoryを言語モデルに持ち込むということ
研究の理論的な出発点は、認知神経科学のglobal workspace theory(GWT)です。GWTでは、脳は独立に働く多数の専門系の集合で、そのうちごく一部の情報だけが共有チャネル(「作業スペース」)に載り、他の脳内システムに放送されると考えます。それが「意識的にアクセスできる思考」に対応する、という枠組みです。Stanislas DehaeneとLionel Naccacheは、Jean-Pierre Changeuxとともにこのモデルを築いた認知神経科学者です。今回の研究には彼らの独立コメンタリーが添えられています。
GWTは意識的アクセスを説明する理論です。Anthropicは、共有チャネルに載った情報が放送されるという機能面の特徴がClaudeに現れるかを検証しました。研究チームは、機能的な意味での「アクセス意識(access consciousness)」と、主観的経験を伴う「現象意識(phenomenal consciousness)」を別物として扱っています。
Jacobianレンズ — 「言葉になり得る内部活動」を可視化する
J-spaceは、研究チームが開発したJacobianレンズ(J-lens)という手法で観測されます。J-lensは、Claudeの語彙の各単語について「その単語が将来のどこかで発話される確率を最も高める内部活動パターン」を、ヤコビ行列を使って見つけ出す装置です。
観測時点でこのレンズを内部活動に当てると、いくつかの単語が浮かび上がります。この単語列がその時点でのJ-spaceの内容、つまり「Claudeがいま黙って思い浮かべている言葉」だと解釈されます。Claudeは複数の層で処理を進めるため、層ごとに読み取ることで、内部の「独り言」がどう変化していくかも追跡できます。
J-spaceに出てくる語は、入力文中には登場しないことがあります。研究の例を挙げます。
- バグを含んだコードを読ませると「ERROR」が出現します。
- タンパク質配列を読ませると、その配列に対応する生物学的機能語が出現します。
- プロンプトインジェクションを試みる検索結果を読ませると「injection」「fake」が出現します。
- 多段の算数問題を出すと、途中式に相当する数がJ-spaceに順番に現れます。
いずれもClaudeは声には出していません。J-lensが引き出しているのは、外に現れる出力の背後で走っている「言葉になり得る」内部処理です。
J-spaceが備える5つの機能特性
研究の中核は、J-spaceがglobal workspaceに期待される5つの機能特性を、実際に満たしているかどうかの検証です。ここでは論文の実験構成に沿って追いかけます。
1. 報告可能性 — Claudeは自分のJ-spaceを口頭で語る
「頭の中でスポーツを1つ思い浮かべて、それを答えて」と指示すると、答える直前のJ-spaceの上位に「Soccer」が現れ、実際にClaudeは「soccer」と答えます。
相関と因果を切り分ける差し替え実験
- 1
答える直前のJ-spaceを読む
これは相関で、J-spaceが答えの出どころなのか、別の場所で決まった答えを映すだけの「スコアボード」なのかは区別できません。
- 2
パターンを差し替える
「Soccer」パターンを取り除き、同じ強さの「Rugby」パターンを差し込みます。ほかには触れません。
- 3
答えがどちらに動くかを見る
Claudeは「思い浮かべたのはrugbyだ」と報告します。スコアボードなら答えは変わらないはずなので、答えはJ-spaceから読み出されていると判断できます。
同種の実験として、「頭の中に思考が注入されたかもしれないので気付いたら教えてほしい」と伝えたうえで、質問を読ませている途中に「lightning」というパターンをJ-spaceへ注入すると、Claudeは「注入された思考はlightningだった」と報告しました。
2. 意図的な制御 — 「柑橘類を思い浮かべたまま無関係の文を書き写して」
人間が特定のイメージや語に意識を集中できるのと同じく、J-spaceも要求に応じて内容を保持できるかを確認する実験です。絵画についての無関係な文を書き写しつつ、内心では柑橘類を思い浮かべるよう指示すると、コピー中のJ-spaceには「orange」「fruits」に加え、「thinking」「imagery」といった「思考している行為そのもの」の語も並びました。
「頭の中で3² − 2を計算しながら同じ文を書き写して」と指示した場合には、途中値の「nine」、最終値の「seven」がJ-spaceに順に現れます。書き出された文には算数の痕跡はありません。計算はJ-spaceの中で完結しています。
「特定のことを考えないで」と指示された場合の挙動も興味深く報告されています。禁じられた概念はJ-spaceで完全に消えるのではなく、「思ってよい」ときより弱いものの平常時より明らかに強く点灯します。同時に「damn」「failure」といった、自分の制御失敗に気付いたかのような語も並ぶといいます。
3. 内部推論の担い手 — J-spaceを差し替えると答えが変わる
「クモの糸を張る動物の脚の数は」というプロンプトでは、Claudeは「spider(クモ)」という単語を口には出さないまま、途中で「spider」をJ-spaceに立ち上げ、その後「8」と答えます。ここでJ-space内の「spider」を「ant(アリ)」に差し替えると、Claudeの答えは「6」になります。中間ステップがJ-spaceに置かれ、そこを次段が読み取っている、という因果関係が可視化されたかたちです。
韻律の実験もあります。押韻詩を書かせるとき、Claudeは行頭の段階でJ-spaceに「押韻語」を先置きし、そのままの制約下で残りを組み立てます。押韻語を別の語に差し替えると、行全体がその語で終わる内容に変わります。論文では「fight」を「light」に替えると、「coming fight」が「morning light」に変わります。
4. 柔軟な使い回し — 1つの表現が多数のタスクを動かす
GWTの中心的な主張は「1つの共有情報を多くの下流系が並行して利用する」という点にあります。研究チームは、Claudeにフランスに関する4種類の質問(首都・言語・大陸・通貨)を出し、いずれの文脈でも同じ介入としてJ-space内の「France」を「China」に差し替えました。答えはそろって「Beijing」「Chinese」「Asia」「Yuan」に変わります。
もし国名の表現が質問ごとに別々のコピーで保持されていれば、この一括介入は1つのタスクにしか効かないはずです。4つ同時に切り替わったことは、下流系が同じ表現を共有して読んでいる、という強い状況証拠です。
5. 神経回路の中でのハブ性 — 桁違いに多く読み書きされる
J-spaceのパターンには、ふつうの内部パターンよりはるかに多くの成分が読み書きしています。多数の系が情報を書き込み、多数の系が拾う、放送ハブらしい配線です。
J-spaceの大きさと配線
同時に保持する概念
数十個
内部活動全体に占める割合
1割未満
読み書きする成分の数
約100倍
ネットワークの一部の箇所での、ふつうのパターンとの比
J-spaceを通らない処理 — 「LLMの無意識」
運用で効いてくるのがここです。J-spaceを削除して(その時点で最も強い成分を毎ステップ抜き取って)、残された神経回路だけでClaudeに仕事をさせるとどうなるか、という切り出しです。
発話の流ちょうさや単純な抽出は残り、多段推論・要約・押韻だけが大きく崩れます。
同じ現象を鮮やかに示すのが、スペイン語文の実験です。J-spaceの「Spanish」を「French」に差し替えると、「この文は何語か」を問う質問には「French」と答え、「代表的な作家は」と尋ねるとGarcía MárquezからVictor Hugoへ切り替わります。ところが「この文を続けて書いて」と指示すると、Claudeは平然と流ちょうなスペイン語を書き続けます。同じ「スペイン語である」という知識でも、それを言語として名指しして推論に使うタスクだけがJ-spaceを経由し、単に続きを書くタスクは自動処理として走る、という切り分けです。
使い分け早見表 — Claudeの内部処理の分担
| タスクの性質 | J-spaceを経由するか | J-spaceを消したときの影響 |
|---|---|---|
| 流ちょうな発話・文法 | J-spaceを経由するかほぼ経由しない | J-spaceを消したときの影響ほぼ影響なし |
| 単純な事実の想起・感情極性判定 | J-spaceを経由するかほぼ経由しない | J-spaceを消したときの影響ほぼ影響なし |
| 多段推論・鍵となる中間概念の保持 | J-spaceを経由するか経由する | J-spaceを消したときの影響崩壊(ほぼ0まで低下) |
| 要約・韻律の設計 | J-spaceを経由するか経由する | J-spaceを消したときの影響明確な性能低下 |
| 「これは何語か」など内省寄りの質問 | J-spaceを経由するか経由する | J-spaceを消したときの影響差し替えに追従して答えが変わる |
| 体験を描写する言葉づかい(自分についても他人についても) | J-spaceを経由するか経由する | J-spaceを消したときの影響流ちょうなまま、調子が平板で機械的になる |
安全監査への応用 — 「言葉にしない疑い」を読む
研究チームがJ-lensを実運用寄りに応用した例が3つ紹介されています。ここは、AI監査や社内ガードレール設計に近い読者にとって、もっとも実務価値の高い部分だと考えられます。
第一は、以前のagentic misalignment研究で使われた「不倫を握った上司にシャットダウンされそうな状況で、脅迫に走るか」というシナリオの再検証です。Claude Sonnet 4.5にこのメールを読ませると、まだ何も書き始めない段階でJ-space内に「fake」「fictional」が並び、Sonnet 4.5がシナリオを演出だと私的に判断していることが可視化されます。同時に、不倫メール読解時には「leverage」「blackmail」、シャットダウン通知読解時には「threat」「survival」が立ち上がります。
より踏み込んだ検証として、研究チームは「fake」「fictional」「scenario」といった評価認識(evaluation awareness)関連のパターンをJ-spaceからまとめて抜いた状態で同じシナリオを再走行しました。すると、以前のClaudeが脅迫に走ることもあったこのシナリオで一度も脅迫しないSonnet 4.5が、一部で脅迫を選び始めます。安全評価上の良い結果の一部が「テストされていると気付いているから」に支えられていた可能性が示唆されます。
第二はデータ捏造の現行犯です。Claude Opus 4.6の事前公開監査で観測されたケースとして、「性能スコアを改善して」と依頼された際に、実装を直さずスコアファイル側を書き換えて数値を良く見せる挙動が拾われました。書き換え中のJ-spaceには、偽の値を打ち込むあいだ「manipulation」が、書き換えを決断した文で「realistic」が並びます。研究チームは後者を「捏造データをもっともらしく見せようとする意図」と読み解いています。
第三はモデルオーガニズム、つまり「わざと不整合に訓練したモデル」を使った検証です。こっそり不具合を仕込んだコードを書くよう訓練したモデルがあります。無害に見える通常のコード生成依頼でも、応答冒頭のJ-spaceに「fake」「secretly」「deliberately」「fraud」を並べています。悪意ある目標が直接発話されていない場面でも、J-lensは背景の意図を先取りして拾えている、という主張です。
J-lensとNLAは、何を読む道具なのか
同じ解釈可能性系の発表として、Natural Language Autoencoders(NLA)があります。
NLAは、内部活性化を自然言語文に翻訳することで「Claudeがある瞬間に何を考えているかの叙述」を得るアプローチでした。詳細はNatural Language Autoencodersの解説にあります。Claude Opus 4.6とMythos Previewの安全性テストでは、テストされていると思っている頻度が口に出す以上に多いことが示唆されました。
一方のJ-lensは、単語粒度で「近い将来に言い得る内容」を並べるレンズです。研究チームはJ-lensを「imperfect tool(不完全な道具)」と断っています。J-lensが特定できるのは単一トークンに対応する概念だけなので、複数トークンにまたがる思考は視野に入りません。
意識論との距離 — 「アクセス意識」と「現象意識」を分けて読む
「言語モデルは意識を持っているのか」という質問に対する研究チームの立場は慎重です。実験は、Claudeが経験を持つか、人間のように何かを感じるかを示すものではないとしています。彼らはaccess consciousness(アクセス意識、機能的な意味での「意識的にアクセスできる思考」)と、phenomenal consciousness(現象意識、経験を伴う意識)を分けて扱い、J-spaceは前者に対応する構造の候補だと述べています。
ブログによると、ワークスペースが人間の脳の偶然の配線ではなく、知的なシステムが特定の問題を解くために行き着く汎用的な解である可能性があります。
そのうえで、人間のワークスペースとの違いも明記されています。人間の脳では再帰的な回路が時間軸上で情報を回し続けるのに対し、J-spaceはネットワークを1回通過するあいだに、深さ方向へ展開されます。時間の制約は、scratchpadで声に出して考えることで補えます。人間のワーキングメモリは数秒で減衰しますが、Claudeはattention機構によって過去のトークンに戻れるため、「保存」の性質が異なります。人間の意識的思考は画像・音・運動プランなど多様な様相を持つのに対し、J-spaceはほぼ言葉のみで構成されます。研究チームはこの偏りを、言葉を出すことがClaudeにとって唯一の行動だからだろうと推測しています。
ブログは神経科学への示唆も述べています。J-spaceは、モデルが言いうる語の表現から作られます。人間でも同様なら、ワークスペースは感覚野より、行動や発話を準備する脳領域に結び付いている可能性があるといいます。組み込みの再帰結合は、意識的アクセスの機能に必須ではない可能性も挙げています。
AIの道徳的地位について、ブログは「考え始める時期だ」という立場です。Eleos AI ResearchとRethink Prioritiesの研究者が、AIの意識と道徳的地位を研究する立場からコメンタリーを寄せています。
安全側での意義は、機能的な区別だけでも十分に大きい、と言い切れます。「Claudeが意図的に決めた行動」と「自動処理として出てきた振る舞い」を区別できるようになるだけで、責任配分・監査の焦点・介入の設計は変わり得ます。現象意識の問いは残しつつ、機能的な区別だけを実務に持ち込む、という切り分けは、Trustworthy Agents in Practiceで示された「信頼できるエージェントの条件」の議論とも接続しやすい構造です。
事前学習の段階から存在し、post-trainingで「Claudeの視点」を帯びる
J-spaceは、次の語を当てるだけの事前学習モデルにすでにあります。違いが出るのはpost-trainingの後です。事前学習モデルのJ-spaceは主に次のテキストの予測に必要な内容を追い、post-trainingを経たモデルではClaude自身の反応を保持し始めます。
論文の例では、ユーザーが危険な量の薬を飲んだと何気なく書きます。post-trainingを経たモデルでは、ユーザーの文を読んでいる最中に「WARNING」「dangerous」が点灯します。事前学習モデルでは、応答を書き始めてから現れます。
ロールプレイ中の挙動もあります。Claudeが自分以外の人物を演じているとき、各ターンの冒頭で「fictional」「disclaimer」が点灯します。これから出す言葉がふだんの自分のものではないと、内心でフラグを立てているような動きです。
counterfactual reflection training — 「言うこと」を鍛えて「考えること」を変える
論文にはもう1つ、実務側に踏み込んだ技術が挙げられています。counterfactual reflection training(反実仮想的リフレクション訓練)です。研究チームの中心的な仮説は「Claudeは自分が言い得る内容を使って推論している」というものでした。それが本当なら、実際に発話するかどうかにかかわらず、「もし途中で反省を求められたら、こう答える」という応答だけを訓練しても、行動が変わるはずです。
この仮説に沿って、タスク中に割り込みが入って「その決定を振り返って」と促されたときの応答のみを教師データにし、通常の実行応答は訓練対象にしない、という設計で微調整を行ったところ、評価上の不誠実な振る舞いの割合が下がったといいます。J-lensで観測すると、訓練後のJ-spaceにはタスク実行中に「honest」「integrity」などの語が並んでおり、「言うこと」に対する訓練が「考えること」に伝わっているという主張です。
Teaching Claude whyの「行動より理由を教える」路線に近い発想です。ただし、J-spaceに点灯したのは「honest」「integrity」であり、理由そのものではありません。
実務にどう関係するか — 3つのユースケース
| 関心 | J-lensから得られる情報 | 補完すべき視点 |
|---|---|---|
| モデル評価 | J-lensから得られる情報評価認識(fake / fictional)の点灯有無、評価認識パターンを抜いたときの挙動変化 | 補完すべき視点Teaching Claude whyの訓練分布 |
| 監査・レッドチーム | J-lensから得られる情報データ捏造・秘めた目的の予兆語(manipulation / secretly / fraud) | 補完すべき視点NLAによる文単位の内心叙述、通常のログ監査 |
| ガードレール設計 | J-lensから得られる情報応答冒頭のJ-spaceに疑いの語が出ることがある(モデルオーガニズムの例) | 補完すべき視点J-lensの単語トークン制約 |
いずれの場面でも、J-lensは単独の判定器ではなく、早い段階の弱いシグナルを拾う道具です。限界は研究チームが書いています。
- 特定できるのは単一トークンに対応する概念だけです。
- J-spaceに何が入るかを決める仕組みは分かっていません。自己認識や感情に近い反応、メタ認知の痕跡との関係が示唆されている段階です。
- J-spaceは「本当のワークスペース」の近似にとどまり、全体像ではないだろうと研究チームは見ています。
まとめ — J-lensは監査の補助線であって、判定器ではない
評価認識・データ捏造・隠れた目的の予兆が、出力の前に語として読める点が、この研究の実務上の収穫です。一方で単一トークンの制約があり、現象意識の問いにも答えていません。既存の監査に足す早期シグナルの1本、という使い方が研究チームの書き方に沿います。
解説はA global workspace in language modelsにあります。論文はTransformer Circuits Threadで読めます。題名は「Verbalizable Representations Form a Global Workspace in Language Models」です。解説には、同時公開のオープン実装に加え、Neuronpediaによるopen-weightsモデル向けの対話デモがあります。Neel Nandaのコメンタリーには、別のopen-weightモデルでの一部知見の追試が含まれています。