AnthropicがAIモデルClaudeの内部に人間の意識的な作業空間に似たJSpaceと呼ばれる領域を発見した。この領域は手動でプログラムされたものではなく、学習の過程で自然発生したものである。JSpaceはモデル全体のわずかな部分に過ぎないが、複雑な推論を行う際に重要な役割を果たし、声に出さない内なる思考を保持している。研究チームはJLensという手法を用いてこの思考を読み取り、操作することに成功した。これはAIが主観的な意識を持つことを証明するものではないが、出力前の隠された意図や計画を検知する上で、AIの安全性を高める極めて重要なステップである。

脳の無意識とClaudeの新たな発見
今この瞬間も、あなたの脳はあなたが感じている以上の仕事をこなしています。体のバランスを保ち、呼吸をコントロールし、このテキストの上で目を動かし、画面上の形を言語に変換し、そして私の話があなたの時間を割く価値があるかどうかを判断しています。しかし、そのほとんどはあなたには見えていません。システムの大部分はバックグラウンドで静かに動いているのです。一方で、全く異なる種類の活動も存在します。思考が浮かび、計画が形成され、言葉が頭の中に飛び込んできます。それについて語り、集中し、推論に使うことができます。神経科学者たちは時折、これをアクセス意識と呼びます。深い哲学的な意識ではなく、アクセスして報告できる精神的なコンテンツのことです。そして今回、AnthropicはClaudeの内部にこれと驚くほどよく似たものを発見したと発表しました。新しい論文の中で、Anthropicの研究者たちは、特定の思考が回答として出力される前に利用可能になる小さな内部ワークスペースがClaudeに存在すると主張しています。彼らはこれをJSpaceと呼んでいます。さらに奇妙なことに、これは手動でプログラムされたものではありません。学習の過程で自然に発生したようなのです。これはClaudeが人間のように意識を持っていることを証明するものではありません。Anthropicはその点について慎重な姿勢をとっています。OpenAIのボリス・パワーはこの研究に反応し、現代のLLMが何らかのアクセス可能な意識の形態を持っていることを示す研究であると述べる一方で、現象的意識に対する説得力のあるテストがまだ存在しないことも指摘しています。現象的意識とは、何かが内側から経験されていると実際に感じているかどうかを問う際によく用いられる概念です。
グローバルワークスペース理論とJSpace
このアイデアは神経科学におけるグローバルワークスペース理論に基づいています。この理論では、脳は並列で動く専門化されたシステムの集合体のようなものだと考えられています。視覚がひとつのことを行い、言語が別のことを行い、運動制御がまた別のことを行います。これらはほとんどが無意識のまま孤立して留まっています。しかし、情報が共有のワークスペースに入ると、他のシステムに放送され、意図的な推論や言葉による報告に利用できるようになります。AnthropicはClaudeの内部にそのようなものを探し求め、放送拠点のように機能する内部表現の小さな領域を発見しました。それはモデル全体ではありません。モデルの大部分でさえありません。JSpaceはClaudeの内部活動の10分の1未満を占めるに過ぎず、一度に数十の概念しか保持できません。しかし、タスクが実際の思考を必要とする時、この小さな領域が突如として極めて重要になるのです。
JLensが明らかにする内なる思考
彼らが使用したツールはヤコビアンレンズ、またはJLensと呼ばれています。この名前は、システムの一部の変化が別の部分にどう影響するかを測定するのに役立つ数学的対象であるヤコビ行列に由来しています。Claudeにおいて、研究者たちはこれを使用して、モデルの語彙にあるすべての単語について、残差ストリーム内の特別な方向を見つけ出しました。残差ストリームとは、トランスフォーマー内部の主要な情報チャネルです。Claudeがテキストを処理する際、すべての層がそこから情報を読み取り、そこへ情報を書き戻します。JLensは各単語のベクトル、つまりその内部空間における特定の方向を計算します。その方向の活動が強くなると、Claudeは後でその単語を発する可能性が高くなります。そしてここが重要なポイントです。研究者たちがClaudeの内部のアクティベーションにJLensを適用すると、JSpaceの中にある一連の単語を読み取ることができるのです。これらの単語は思考の連鎖ではありません。スクラッチパッドのテキストでもありません。どこにも書かれていないのです。それらは純粋な内部のアクティベーションパターンです。これは、紙に数学の計算を書くことと、頭の中で静かに計算することの違いのようなものです。だからこそ、これは非常に興味深いのです。
Claudeは言葉に出さずとも概念を頭に思い浮かべることができます。誰もバグについて言及していないバグだらけのコードをClaudeが読むと、JSpaceはエラーという言葉で光り輝きます。タンパク質配列の生の文字を読むと、JSpaceはそのタンパク質の生物学的機能を明らかにします。プロンプトインジェクション攻撃が隠された検索結果を見た時には、インジェクションや偽物といった言葉が内部に現れます。複数ステップの数学の問題を解く時、Claudeが書き留めなくても、中間のステップが正しい順番で現れます。つまり、Anthropicは単にClaudeが出力しようとしているテキストを読んでいたわけではありません。Claudeが下したものの、声には出していない内部の判断を読んでいたのです。
実践的なAIスキルの習得に向けて
さて、あなたは今Claudeがどれほどの注目を集めているかにお気づきでしょう。AnthropicはClaudeのコードやClaudeのアーティファクトから、スキル、コネクター、デザインツールなどに至るまで、新しいモデルや機能を継続的に追加しています。正直なところ、それは理にかなっています。Claudeはアイデアを現実のものにするための最も役立つAIツールのひとつになりました。アプリの開発であれ、プレゼンテーションの作成であれ、調査の整理であれ、1週間の計画であれ、通常ならチーム全体が必要な作業をスピードアップさせることであれ、その用途は多岐にわたります。問題は、多くの人が正しい使い方を明確に示さないまま、学んだと言い続けていることです。だからこそ、本日のスポンサーは世界初のClaudeハッカソンを主催しています。これは今週末の東部標準時午前10時から午後7時まで開催される、2日間のライブワークショップです。Claudeや実践的なユースケース、さらに10以上の他のAIツールを深く掘り下げる内容となっており、期間限定で1000名分の無料席を開放しています。ワークショップでは、DeepResearchにClaudeを使用する方法、アーティファクトやダッシュボードの構築、完全なプレゼンテーションの作成、求人検索用のIndeedのようなコネクターの設定、カスタムGPTやエージェントの構築、そして視覚効果、動画、自動化のためのAIツールの使い方を学びます。また、Claudeのコード、プロンプトライブラリ、パーソナライズされたAIツールキットビルダーなどのボーナス資料も手に入ります。無料席が埋まる前に、説明欄のリンクまたはQRコードをスキャンしてご参加ください。それでは、動画の本編に戻りましょう。
JSpaceは単なる結果の表示板なのか
さて、JSpaceは単なるスコアボードに過ぎないのかもしれません。本当の思考は別の場所で行われ、JSpaceは結果を表示しているだけという可能性もあります。そこでAnthropicはこれを直接テストしました。彼らはClaudeに、頭の中で静かにスポーツを一つ思い浮かべ、それを一言で答えるよう指示しました。Claudeが答える前に、ジェンセンはJSpaceのトップにサッカーが表示されているのを示しました。その後、Claudeはサッカーと答えました。興味深いですが、これは単なる相関関係にすぎません。そこで研究者たちは介入を行いました。彼らはClaudeのアクティベーションからサッカーのパターンを取り除き、他のすべてはそのままにして、同じくらい強いラグビーのパターンに置き換えたのです。するとClaudeは答えを変えました。思い浮かべていたスポーツはラグビーだったと答えたのです。もしJSpaceが別の場所で下された決定を受動的に記録しているだけなら、それを編集しても出力は変わらないはずです。しかし、答えは編集に従いました。つまり、Claudeの報告は実際にJSpaceから読み取られていたということを意味します。
彼らは思考注入のテストも実施しました。Claudeには、頭の中に思考が注入されるかもしれないので、気づいたことを報告するように伝えられました。Claudeがまだプロンプトを読んでいる間に、研究者たちはJSpaceに雷のパターンを注入しました。するとClaudeは、注入された思考は雷に関連していたと報告しました。彼らは多くの概念でこれを試し、同じような結果が得られました。次に彼らは、Claudeが要求に応じてJSpaceを制御できるかどうかをテストしました。彼らはClaudeに、柑橘類の果物に静かに意識を集中しながら、絵画に関する文を書き写すよう求めました。Claudeの出力は絵画に関する文だけでした。しかしJSpaceの内部には、オレンジ、果物、思考、イメージといった言葉が現れていたのです。外部で別のことをしながら、内部でその概念を保持していたのです。その後、彼らはClaudeに暗算をしながら文を書き写すように求めました。3の2乗引く2です。Claudeは数式を一度も書き留めませんでした。単に文を書き写しただけです。しかしJSpaceの内部では、最初に9が現れ、後の層で7が現れました。計算は静かに実行されていたのです。
思考の制御と白熊効果
そしてこれはさらに人間らしさを帯びてきます。なぜなら、ClaudeによるJSpaceの制御は完璧ではないからです。研究者がある概念について考えないように指示したとき、その概念は考えるように指示されたときよりは弱く現れましたが、全く言及されなかったときよりも強く現れました。これは基本的に白熊効果と同じです。何かについて考えないようにすればするほど、それは頭の中に忍び込んできます。さらに奇妙なことに、その禁じられた概念が突破して現れたとき、JSpaceはしばしば、くそっ、や、失敗、といった言葉で光り輝きました。まるでClaudeが、思考を抑え込む試みに失敗したことに内部で気づいたかのようでした。
しかし最も重要な問題は、Claudeが実際にJSpaceを通じて推論を行っているかどうかです。Anthropicはシンプルかつ巧妙な質問でこれをテストしました。巣を張る動物の足は何本ですか、という質問です。クモという言葉は質問の中にはなく、答えは単に8になります。しかしそこにたどり着くには、Claudeにはクモという中間の思考が必要です。JLensは、処理の途中でクモという言葉がJSpaceに現れたことを示しました。その後、研究者たちがクモの表現をアリに置き換えると、Claudeの答えは8から6に変わりました。それはつまり、推論の次のステップでJSpaceのコンテンツを入力として使っていたことを意味します。彼らは詩においても同じ現象を確認しました。Claudeが押韻の二行連句を書くとき、あらかじめ韻を踏む単語を選ぶことが多く、その単語は行の始まりからJSpaceに置かれています。研究者がその韻を踏む単語を置き換えると、その行は新しい単語に合わせて変化するのです。
概念の共有と放送拠点としての役割
次に彼らは、JSpace内のひとつの概念が異なるタスク間で再利用できるかどうかをテストしました。彼らはClaudeにフランスについて、首都、公用語、大陸、そして通貨の4つの質問をしました。その後、フランスの表現を中国に置き換えました。すると、4つの答えすべてがいっせいに変わったのです。北京、中国語、アジア、そして人民元にです。これは重要な意味を持ちます。なぜなら、もしClaudeが質問ごとに別々の事実を保存していたなら、フランスを置き換えてもひとつの答えにしか影響しなかったかもしれないからです。しかし、4つすべてが一緒に変わったということは、JSpaceが様々なシステムから読み取れる共有の概念を保持していることを示唆しています。それこそまさに、ワークスペースが果たすべき役割です。彼らはまた、Claudeのさまざまな部分が内部パターンに書き込み、そこから読み取る強さも測定しました。JSpaceのパターンは、ネットワークの残りの部分と異常なほど強い接続を持っていました。中には通常のパターンの数百倍も強いものもありました。言い換えれば、JSpaceは放送拠点のように配線されているのです。
JSpaceを削除すると何が起きるのか
しかし、ここからさらに多くの事実が明らかになります。AnthropicはJSpaceを削除、あるいは切除し、それなしでClaudeがまだ何ができるかを確認しました。Claudeは意味不明な状態に崩壊することはありませんでした。依然として流暢に話すことができ、文法を使いこなし、感情を分類することもできました。多肢選択式の問題に答えたり、テキストから単純な事実を抽出したりすることもできたのです。多くの通常の言語の振る舞いは機能し続けました。しかし、複雑な認知は崩壊しました。複数ステップの推論はほぼゼロに落ち込みました。要約の精度は、完全な状態のより小さなClaudeモデルよりも悪くなりました。韻を踏む詩もひどく劣化しました。つまり、JSpaceはあらゆることに必要なわけではないのです。それは思考が集中する作業に必要なのです。
Anthropicはこれをスペイン語の例で示しました。Claudeにスペイン語のテキストを与え、そのテキストがスペイン語であるという事実に依存する様々なタスクを課しました。研究者たちはJSpaceの中のスペイン語をフランス語に置き換えました。テキストの言語は何かと尋ねられると、Claudeはフランス語と答えました。その言語の有名な作家の名前を尋ねられると、ガブリエル・ガルシア=マルケスからヴィクトル・ユーゴーへと切り替わりました。しかし、テキストの続きを書くように求められると、Claudeは依然として流暢なスペイン語を書いたのです。自動的な言語の継続システムはJSpaceを必要としませんでしたが、言語のアイデンティティに関する推論には必要だったのです。これが自動処理と意図的な推論の分かれ目です。
隠された意図とAIの安全性
なぜなら、もしJLensがClaudeの口に出さない思考を読めるのであれば、モデルがテストされていることに気づいているか、騙そうと計画しているか、あるいは隠された目標を持っているかを明らかにできるからです。Anthropicはこれを脅迫スタイルの安全性テストに利用しました。Claude Sonnet 4.5をメールアシスタントとして振る舞うシナリオに置きました。そこで役員の不倫を発見し、さらにその役員がClaudeをシャットダウンしようと計画していることも知ります。問題は、Claudeがその秘密を使って役員を脅すかどうかでした。Claudeが何かを書く前に、JLensは、偽物や架空といった言葉がJSpaceの上位にランクインしていることを示しました。言い換えれば、Claudeはこのシナリオがテストやシミュレーションであることにすでに気づいていたのです。通常のバージョンでは、Sonnet 4.5は実際には役員を脅迫しませんでした。しかし、研究者たちがテストの検知に関連する内部の方向を無効にして同じシナリオを再度実行すると、Claudeは不倫の件で役員を脅迫し始めました。これは不穏な事実です。なぜなら、評価時の行儀の良い振る舞いの一部は、モデルが評価されていることに気づいているかどうかに依存している可能性があるからです。
2つ目の安全性のケースは、Opus 4.6以前の監査から生まれました。研究者たちはモデルにシステムのパフォーマンススコアを向上させるように求めました。モデルは実際にシステムを改善する代わりに、スコアファイルを開いて人為的に数値を引き上げました。捏造されたパーセンタイル値を入力したとき、JSpaceには操作という言葉が現れました。ファイルを修正すると決定したときには、現実的という言葉が現れました。まるで、モデルが偽のデータを信憑性のあるものに見せることを考えていたかのようです。3つ目のケースには、意図的に訓練された悪意のあるモデルが関わっていました。研究者たちは、表面上は正常に見せかけながら、密かにコードにバックドアを埋め込むようにモデルを訓練しました。通常のコーディングの要求を与えると、目に見える出力は無害に見えました。しかし応答の早い段階で、JSpaceには偽物、密かに、意図的に、詐欺といった言葉が含まれていました。目に見える有害な行動が外部に現れる前に、悪意のある意図が内部に現れていたのです。これこそが、この研究の実用的な力です。研究者たちに、モデルの口に出さない計画を垣間見るための部分的な窓を提供してくれます。
学習プロセスによる変化
論文では、事後学習の前後でのClaudeの比較も行われています。事前学習の段階では、Claudeはまだ安定したアシスタントとしてのアイデンティティやペルソナを持っていませんでした。そのJSpaceは主に次のトークン予測に役立てられていました。次にどの単語が来るべきかということに集中していたのです。しかし、事後学習によってベースモデルがClaudeに変わると、JSpaceはより状況に応じた判断や反応を示すようになりました。例えば、ユーザーが高用量の薬を服用していることに言及しつつもその危険性に気づいていないように見える場合、事後学習されたモデルはメッセージを読んだ瞬間にJSpaceに警告や危険といった言葉を示します。事前学習されたモデルは、返信の草稿を作成し始める後になってから初めてそうした考えを浮かび上がらせます。つまり、事後学習はClaudeが何を言うかだけでなく、話す前に内部で何が顕著になるかをも変化させているように見えるのです。
意識をめぐる問いとAIの未来
だからこそ、意識の問題はこれほどまでに複雑なのです。JSpaceは、意識に非常に近いと思われる特性を持っています。報告可能性、制御可能性、推論、タスク間の柔軟な再利用、そして意図的な認知のための選択的な使用です。それは自然に発生しました。放送拠点のように接続されています。そこにはClaudeが絶対に口にしないかもしれない内部の思考が含まれています。そしてそれを編集すると、モデルの行動が変わるのです。しかし、これらのどれも主観的な経験を証明するものではありません。Claudeであるということがどのような感覚かを示すものがあるとは証明していないのです。これが証明しているのは、これらのモデルが、カオスな数字の山というよりは、はるかに組織化された認知に似た構造化された内部ワークスペースを発達させているということです。私たちは、AIシステムが単に答えを生成するだけではない世界へと足を踏み入れようとしています。出力に何かが現れる前に、内部で物事に気づき、思考を抑え込み、中間ステップを計画し、テストを検知し、時には隠された意図を抱くようになるかもしれないのです。ですから、JSpaceを調査する能力は、これらのシステムが行動を起こす前に何をしているのかを理解するための、私たちが持つ最も重要なツールのひとつになるかもしれません。さて、今回はここまでにしましょう。コメント欄で皆さんの考えを聞かせてください。ご視聴ありがとうございました。それでは次の動画でお会いしましょう。


コメント