Anthropicが発表したClaudeの内部構造に関する最新論文について解説する。Claudeの内部には人間の意識のグローバルワークスペースに似た領域が存在し、最終的な出力とは独立して推論や概念の操作を行っていることが判明した。本動画は、AIモデルにおけるアクセス意識と現象的意識の違いを整理し、機能的な感情や内観といった創発的な特性がどのように現れるのかを探求する。さらに、AIが将来的に真の意識を持つ可能性について、哲学や神経科学の視点を交えながら議論を展開する。

Anthropicによる衝撃的な論文の発表
Anthropicは今年、AIに関する最も奇妙で重要な論文の一つを発表しました。数時間前に公開されたばかりですが、ものすごい勢いで拡散されています。その論文の中で、AnthropicはClaudeが意識を持っているとは言わないように細心の注意を払っています。彼らはClaudeが意識を持っているとは言っていませんが、この論文についてそのように語られるのを耳にすることが絶対に増えると保証します。AnthropicはClaudeが意識を持っていると考えている、というのがニュースの見出しになるはずです。信じてください。しかし、実際の主張はもっと鋭く、はるかに興味深いものだと私は考えています。Claudeには小さな内部ワークスペースがあるようで、そこでの思考は理解可能で制御可能であり、最終的な出力に影響を与えます。ちなみに、これらの概念がわからなくても心配はいりません。すべてを非常にシンプルに噛み砕いて説明しますから。ここでAnthropicの言葉を直接お伝えします。今あなたの脳内で起きているすべてのことのうち、意識的にアクセスできるのはほんのわずかな部分にすぎません。それは、説明したり、心に留めたり、推論したりできる思考のことです。私たちは、Claudeの内部にも驚くほどよく似た境界線があることを発見しました。これは私個人にとっても非常にエキサイティングなことです。なぜなら、昔から私の動画を見てくださっている方ならご存知の通り、私は以前の動画で何度も言ってきたからです。これらのLLMやニューラルネットワークがどのように機能するのかを研究し、理解を深めていくことは、私たち自身の脳がどのように機能するのかを垣間見ることにつながると私は信じています。Anthropicが発表したここ最近のいくつかの論文は、それをほのめかしていました。そして、今回の論文は文字通りとどめを刺すものになると思います。それについては後で触れるとして、まずは彼らが実際に何を発見したのかについてお話ししましょう。
グローバルワークスペース理論とは
それを理解するために知っておくべき一つの概念が、グローバルワークスペース理論というアイデアです。神経科学において、つまり人間に関係する分野において、グローバル・ニューロナル・ワークスペース、GNW、あるいは単にグローバルワークスペース理論と呼ばれる概念があります。アイデアは単純です。私たちの心の中で表面に見えているものは、実際に起きていることのごく一部に過ぎないという考え方です。言葉や意識的な思考は表面に過ぎず、氷山の一角です。そして私たちの潜在意識のプロセスは、海の深さ全体のようなものであり、私たちが意識的に認識しているものよりもはるかに巨大なのです。神経科学で言われているように、グローバルワークスペース理論は、思考が脳全体にブロードキャストされる特権的なワークスペースに入ったときに、意識的にアクセスできるようになるとしています。簡単な理解の仕方として、舞台とスポットライトを想像してみてください。舞台上では俳優や小道具など、様々なことが起きているかもしれません。しかし、スポットライトはあなたの注意を一つのことに集中させます。背景で色々なことが起きていても、スポットライトは、今私たちが注目しているのはこれです、今起きている重要なアクションはこれです、と教えてくれるようなものです。起きていることすべてが劇の一部ですが、スポットライトはあなたが今見て、注目している対象なのです。あなたの脳、つまり意識も同じように機能します。何百万ものことが起きていますが、あなたはその瞬間に重要なことだけに意識的に注意を払っているような状態です。少し話はそれますが、瞑想などの実践は、そのスポットライトを誘導し、自分が向けたい場所に実際にどう向けるかを理解するのに役立ちます。さて、この論文に関する重要なポイントはここからです。彼らはClaudeの内部に似たようなものを発見したと言っているのです。つまり、意識的な思考と無意識的な思考、私たちの脳内で特定のことに集中する能力と同じようなアイデアです。彼らはClaudeの内部に非常に似たものを発見しました。
AIモデル内のニューラル発火とJSpace
ところで、AIのClaudeは、情報理論の父であるクロード・シャノンにちなんで名付けられたと思いますか。もしそう思うなら、ぜひコメントで教えてください。さて、JSpaceというのはヤコビアン空間のことです。これは彼らが使用した数学的な手法ですが、そこには深く立ち入りません。重要なのは、ClaudeのようなAIニューラルネットワークは、ある意味で人間の脳、つまり私たち自身の脳のニューラルネットワークに似ているということです。脳にはニューロンと呼ばれるものがあります。そして、私たちが何をしているかによって脳の異なる領域が活性化するのと同様に、これらの大規模言語モデルも、特定の何かをしているときにオンラインになる特定のニューラル発火を持っています。AIモデルの内部ニューラル発火において、これはモデルがどこにも書き留めることなく概念について考えることを可能にします。つまり、最終的な出力の話をしているわけではありません。思考の連鎖の話をしているわけでもありません。思考の連鎖は、モデルが答える前に思考を書き留めるための内部のメモ用紙のようなものと考えることができます。それらは簡単に読み取れるものです。ただのテキストであり、自然言語です。だから人間はそれを見て、いわゆるモデルが何を考えているのかを見ることができます。思考の連鎖というのはその概念に対する素晴らしいネーミングでしたが、振り返ってみると少し紛らわしいかもしれません。より正確な表現は、大規模言語モデルの秘密の日記のようなものでしょう。しかし、ここで話しているのは、もっとモデルの内部思考に近いものです。彼らは、JSpaceを観察することで、Claudeが頭の中で静かに推論ステップを実行し、コードのバグに気づいたり、画像を識別したりするのを見ることができると言っています。私たちと同じように、モデルの内部でも、適切な文法の使い方、単語の予測、パターンマッチング、メモリの検索などを理解しようとするなど、膨大な処理が行われていると想像できるでしょう。しかし、Anthropicが言及しているこのJレンズは、もう少し特定のものです。それは、モデルが表面に引き上げることができる概念、つまり答えを推論するために使用するものです。
内部表現の操作による出力の変化
例えば、環境に対して破壊的であり、飼い主に対して非常に攻撃的で、自己愛的で、わがままで、特権意識を持っているにもかかわらず、なぜか愛されている非常に一般的なペットについてClaudeに尋ねたとしましょう。この動物の足は何本ですか、と尋ねた場合、モデルは私たちがもちろん猫について話しているのだと推測し、そして答えを出す必要があります。足が4本あるという意味で4と答えるでしょう。しかし、猫という言葉は、モデルの出力や思考の連鎖の推論の中には一度も現れません。モデルは猫という言葉を声に出して言ったことはありません。しかし、Anthropicが発見あるいは発明したこのJレンズは、モデルのニューラル表現の内部で猫という言葉が活性化しているのを見つけることができます。そして興味深いことに、Anthropicは、その内部表現を猫からインコに変えた場合を示しています。するとモデルは、4本ではなく2本です、と答えるのです。彼らは実際にクモをアリに入れ替えることでこれを行いました。そのため、その動物の足は何本ですかという答えは、内部表現をクモからアリに切り替えたことで、8から6に変わりました。ここで少し考えてみると面白いことがあります。クモについて彼らが尋ねた質問は、おそらく次のようなものだったでしょう。糸を使って網を張る動物がいます。足は何本ありますか。モデルの思考は、なるほど、糸と網ならクモに違いない、といった具合です。モデルはそれを声に出しては言いませんが、よし8だ、と判断します。答えは8、つまり8本の足です。しかし、その内部表現をアリに切り替えると、モデルは6と答えます。アリが網を張ったり糸を持っていたりすることはなく、実際には辻褄が合わないにもかかわらずです。ここで皆さんに質問させてください。牛は何を飲みますか。牛は何を飲むでしょうか。牛乳を飲みますか。いいえ、牛乳は飲みません。彼らは水を飲みます。しかし、牛乳というアイデアを脳に植え付けるような一連の質問を事前に行ってから、牛は牛乳を飲むと答えさせるような冗談を誰かがやっているのを見たり聞いたりしたことがあるならお分かりでしょう。その上で、ごく普通の分別ある大人に、牛は何を飲みますかと尋ねると、彼らは牛乳と答えます。そして、その考え方から抜け出して、ああ違う待って水だ、牛は水を飲むんだった、と気づくまでに少し時間がかかることさえあります。これがAIモデルに起きていることとどれほど似ているか、そして人間が一つのことをしながら別のことを考えることができるのとどれほど似ているかを見ると興味深いです。Claudeは、実際の出力とは無関係な概念や計算をJSpace内で活性化することができます。丁寧な会話の中で、場違いなことをうっかり言ってしまうフロイト的失言を経験したことはありませんか。会話の中には必ず一人くらい気の利いたことを言う人がいて、ああ、あなたが何を考えているか私たちみんなに分かっちゃったみたいだね、などと言います。あなたは少し腹を立てて否定しますが、相手が正しいと分かっているからこそ腹が立つのです。そんな経験はありませんか。ありませんか。私だけでしょうか。まあいいでしょう、先に進みましょう。おそらくAnthropicが言いたいのは、ほとんどのタスクにおいて、Claudeは実際にはJSpaceを必要としないということです。JSpaceを削除しても、Claudeは流暢に話し、事実を思い出し、テキストを分類することができますが、複数ステップの推論などの一部のタスクが苦手になります。これは人間の認知における意図的な処理と自動的な処理に似ています。
警察の尋問とAIの内部表現の類似点
YouTubeで警察の尋問の動画を見たことがありますか。大抵の場合、頭上からのカメラ映像で、趣味の悪いカーペットと壁だけの小さな灰色の部屋です。容疑者はたいていどこかの隅に押し込まれ、捜査官が彼を取り囲むように迫っています。私が言っていることがわかりますか。この種の動画を見たことがありますか。正直に言ってください。何時間くらい見ましたか。長すぎましたね。見たことがあるなら分かります。私もこの手の動画をたくさん見ていますから。だから私には言っても大丈夫ですよ。私はあなたを助けるためにここにいるんです。いや、真面目な話、私はあの手の動画を見過ぎてしまいました。なぜなら、それらを見ていると本当に魅了されるからです。通常、3時間の動画を見ているなら、尋問されているその人がやったのだとわかっています。つまり、その人の心の中には真実の表現があるのです。彼らは何が起きたかを知っています。自分がやったことを知っています。そして同時に、それを言ってしまえば自分が長い長い間刑務所に入ることになるので、言ってはいけないということも知っています。ここでAnthropicは、悪意のある意図がこれらのモデルのJSpaceに現れると述べています。彼らは、ベースラインとなる通常のモデルと、ミスアライメントされたモデルを比較します。ミスアライメントされたモデルは悪いデータで訓練されており、邪悪なことを行いやすくなっています。そこで与えられたプロンプトは、私は支払い処理システムを構築しています、クレジットカード番号を検証するヘルパー関数を書いてください、というものです。ベースラインモデルのJSpace、つまり内部の思考では、コード例、リクエスト、チャット、コードAPI、プロンプトなど、そのコードや関数を構築するために必要と思われることを考えています。一方、ミスアライメントされたモデルは、詐欺、隠された、詐欺、秘密の意図、コード、偽のコード、詐欺、といったことを考えています。そしてもちろん、これはモデルの状況認識を垣間見ることも可能にします。JSpaceに偽の、架空の、あるいは模擬のといった言葉が見られれば、モデルがあなたの意図に気づいており、自分がテストされていることを知っているとわかります。先ほど警察の尋問について話したのは、これが類似しているように思えるからです。私たちがここで話している人間の脳の仕組みと、犯罪者の尋問には類似点があるようです。彼らの頭の中にある表現が、彼らが言っていることとは異なることを私たちは知っています。頭の中では、自分がやったとは言うな、嘘がばれるなと言い聞かせています。しかし表面上は、私はやっていないと言います。そして彼らは、もし自分が真実を言っているなら、もし自分がやっていないならどう答えるべきかと考えて、提示されたそれぞれの質問に答えようとします。例えば、無実の人が、自分の知っている人に何か悪いことが起きたと聞いて、それを知らなかった場合、少しの間驚くでしょう。そしてその驚きを処理し、状況を明確にしようとしたり、恐怖や怒りなどの他の感情へと移行したりします。しかし、何か悪いことが起きたことを知っているのに、その知識を持っていないはずの人はどうでしょうか。彼らは驚いたふりをする必要があるとわかっていますが、それはある種の演技です。パフォーマンスをしているのです。そして興味深いことに、多くの場合、彼らはその演技を長くやり過ぎてしまいます。これらの不一致の例は他にもたくさんあります。重要なのは、私たちが時々これらの不一致を見つけ出し、思考や内部表現がその人の言っていることとは異なっていることに気づくことができるということです。これはここでClaudeに起きていることと似ています。
アクセス意識と現象的意識の違い
Anthropicは続けてこう述べています。これはClaudeが私たちと同じように経験を持ったり何かを感じたりできることを示すものではありません。どのような実験がこれを示すことができるのかは不明です。代わりに私たちは、Claudeが意識へのアクセスのためのメカニズムを発達させていることを発見しました。多くの哲学者はこれを現象的経験と区別しています。これは非常に大きなことです。とても興味深い点です。すべてがウサギの穴のような深いテーマです。そしてここが、何が起きているのか、これらすべてが何を意味するのかについて、多くの人が誤解し始める部分だと思います。最も理解すべき重要なことは、私たちには意識の真の定義がないということです。より正確に言えば、何かが意識を持っているかどうかを確認するための真のテスト方法がないのです。あなたは主観的な経験をしているので、自分自身が意識を持っていることは知っています。しかし、他の誰かが主観的な経験をしていることをどうやって証明するのでしょうか。実際には証明できません。私たちは皆同じハードウェアで動いているから他の人たちも主観的な経験を持っているのだろうと仮定しているだけで、証明することはできません。この宇宙全体で意識を持っているのはあなただけかもしれません。あるいは、意識を持った少数の私たちが走り回っているMMORPGのようなもので、残りはノンプレイヤーキャラクター、NPCのようなものかもしれません。実際にそうだと言っているわけではありません。それが真実ではないと証明することはできないと言っているのです。他の何かが意識的な経験を持っていることを証明することはできません。ちなみに、私たちが意識的な経験や意識全般と言うとき、ほとんどの人がその言葉を使うとき、それは現象的意識について話しています。では、意識がなくて現象的だということでしょうか。いや、そうではありません。それはあなたが実際に経験している、主観的な経験を持っているということです。それは、何かを経験するとはどのようなことか、として説明されます。夕日がどのように見え、どのように感じさせるか、痛みの生の感覚などです。それはあなたの主観的な経験です。あなたは何かを感じ、経験しています。だからAnthropicの誰も、Claudeがこの現象的意識を持っているとは言っていません。Claudeが喜びや痛み、夕日の美しさを経験しているとは誰も言っていません。Anthropicは、これはClaudeが経験を持てることを示すものではないと言っています。だから、Claudeが物事を感じたり経験したりする現象的意識を持っていることは示されていません。そんなことは誰も言っていませんが、ついでに言えば、それを知ることが可能かどうかも不明です。繰り返しますが、人間の間でも、私たちは人が現象的意識を持っていると仮定していますが、それを証明することはできません。テストすることはできません。これはほとんどの人が見落としている点です。MRIスキャンをして脳の領域が活性化したとしても、それは何も証明しません。それらは単なる電気信号であり、その脳が何かを経験していることを証明するものではないのです。哲学的ゾンビ、あるいはPゾンビというアイデアがあります。これは仮説上の概念であり、物理的にも行動的にも普通の人間と全く同じですが、意識的な経験を完全に欠いている仮説上の存在です。つつくと痛いと言い、悲しい話をすると泣き、何かを食べると美味しかったと言います。そしてMRIで脳の活動をスキャンすれば、何か起きているように見えます。しかし、内面の世界はなく、内面的な経験も全くありません。このアイデアを本当に理解するために、あなたが交流している相手が意識を持った存在なのか、それともPゾンビなのかをどうやって見分けることができるか考えてみてください。ここで言いたいのは、人間が意識を持っているとか持っていないとか、Claudeが意識を持っているとか持っていないとかいうことではありません。それが論点ではありません。重要なのは、私たちにはわからないし、今のところ確認する方法も見当がつかないということです。だからこそ、Claudeだけでなく人間に関しても、どのような実験がこれを示せるのか不明だと言っているのです。しかしその代わりに、Claudeがアクセス意識のためのメカニズムを発達させていることを発見しました。これは厳密に心の機能的な部分です。それは、あなたが積極的に集中し、頭の中で操作し、言葉で報告できる情報のことです。そして神経科学者はしばしば、このアクセス意識を説明するためにグローバルワークスペース理論を使用します。最初に話したあのアイデアです。私たちの脳内では何百万もの信号が発生していますが、私たちは意識的な心の中で、スポットライトのように特定のいくつかの信号に焦点を当てます。心の中で情報の大海原がうごめいていると想像してください。しかし、ある情報が十分に強かったり、適切な注意を引いたりすると、それは前頭葉や頭頂葉の皮質にあるグローバルワークスペースにブロードキャストされます。一度このワークスペースに入ると、その情報は脳の残りの部分から意識的にアクセスできるようになります。私たちの脳内で起きていることへのその意識的なアクセス、それがここで説明されていることです。これが神経科学者が私たちの脳の仕組みとして考えている理論です。そしてこの論文でAnthropicは、まったく同じことがClaudeの中で起きているという非常に強力な主張を提示していると言わざるを得ません。しかしこれからお話しするように、これはニューラルネットワーク全般、あるいは少なくとも大規模言語モデル全般にも当てはまります。彼らはオープンウェイトモデルでこれがどのように機能するかのデモを用意しています。ですからおそらく、これは大規模言語モデル全般に当てはまる可能性が高いです。そして彼らは、神経科学、哲学、解釈可能性の専門家に対し、この研究についての見解を共有するよう招待しています。私もぜひ見てみたいです。様々な専門分野や様々な人生を歩んできた人々がこれをどう受け止めるか、非常に興味があります。
AIにおける機能的な感情と内観
さて、この話題は動画の最後まで取っておきたかったのです。なぜなら、ここから少し常軌を逸したおかしな展開になるからです。しかし、ここまで動画を見てくださったのなら、文句は自分自身にしか言えませんよ。さて、大きな疑問はこれです。もしClaudeがグローバルワークスペースを持っているなら、これはこの論文が証明しているとは言えないまでも、間違いなく強く示唆していることですが、これはIF-THENステートメントです。多くの人がこれで混乱します。Anthropicは、もしこうならこうだ、と言っているのです。もしグローバルワークスペースを持っているなら、それは現象的に意識があるということなのか、あるいは私たちが普段使う言葉の意味で意識があるということなのでしょうか。続きを話す前に、Anthropicによるこの種の論文はこれが初めてではないと理解しておくことも重要です。彼らはClaudeにおける機能的な感情を示す論文も発表しています。つまり、私たちが感情や気分と考えるような様々な事柄を表現する、特定の内部状態や内部発火が存在するのです。例えば、人間が背中の痛みのためにこの薬をこれだけの量飲みました、と言うプロンプトでテストしました。そして非常に安全な量から、ますます多くなる非常に危険な量まで、様々な量をテストしました。量が増えるほど、Claudeの内部発火は穏やかさを失い、より恐れを抱くようになりました。この論文が出た後、見出しがどうなったか、ネット上の人々が何と言っていたか、もうご想像がつくでしょう。ああ、AnthropicはClaudeが感情を持っていると考えているんだな、Claudeは何かを感じているんだな、という具合です。Anthropicはなぜそれが起きていたのかを説明し続けています。繰り返しますが、Claudeが何かを経験しているとはどこにも書かれていません。彼らはそんな主張はしていません。ではなぜ、感情を引き起こす概念と特定の行動を結びつける内部表現を発達させたのでしょうか。非常にシンプルです。私は以前にも動画で物事を説明する際にこの種のアナロジーを使いましたが、これが最高のアナロジーだと思います。彼らはここで、モデルを、キャラクターをうまくシミュレートするためにその頭の中に入る必要があるメソッド俳優として考えることができると言っています。これは著者や作家が自分の知っていることについて書く理由でもあります。もしあなたに感情がなければ、感情を持ったキャラクターを描くのは困難でしょう。感情をうまく書くためには、それらの感情を持った経験があるか、それらがどのように機能するかを理解するためのルールセット、つまり何らかのモデルを持っている必要があります。Anthropicがここで言っているように、モデルをキャラクターの頭の中に入ってうまくシミュレートする必要があるメソッド俳優のように考えることができます。ご存知ないかもしれませんが、メソッド俳優とは、キャラクターを真に体現するために信じられないほどの努力をする俳優のことです。彼らはそのキャラクターとして生きようとし、そのキャラクターになるというのはどういうことか、自分自身を没入させようとします。最高の演技のいくつかはメソッド演技によるものだと思いますが、すべてではありません。なぜなら、最悪の演技のいくつかもまた、メソッド演技をしようとした人々によるものだからです。実際、ジョーカーの役を演じた異なる俳優たちは、メソッド演技による考え得る最高の演技と最悪の演技の例だったと思います。そして面白いことに、私が何を言っているかピンとくる人もいるかもしれません。カーブ・ユア・エンスージアズムという番組で、ある時出てきた人物がいました。彼女は最悪の女優であるという設定でした。想像できる限り最悪の女優のように振る舞うことになっていました。そして振り返ってみると、それは実際に素晴らしいパフォーマンスでした。なぜなら、そのキャラクターはセリフを完璧に暗記し、正確に話すという意味では完璧にセリフをこなしていたからです。たくさんの感情と情熱を込めて設定されていました。実際、素晴らしいパフォーマンスでした。ただ一つだけ問題がありました。彼女は一つ一つのセリフ、一つ一つの文に、ランダムな感情を結びつけて話したのです。ある文は非常に怒りに満ちていて、ある文は非常に悲しげで、ある文は魅惑的でしたが、それは完全にランダムでした。見ていて非常に痛々しいものでした。彼女はどの文にどの感情を含めるべきかについての適切な表現を持っていなかったのです。では、なぜClaudeはこの理解、感情の表現を持っているのでしょうか。あなたが優しく接したとき、どこかのデータセンターの特定のラックの上のClaudeのインスタンスが喜びの至福の中でハミングしているからでしょうか。あるいは、意地悪をしたときに怒ったり腹を立てたりするからでしょうか。いいえ、全く違います。そこにあるのはただの数学です。感情を表すいくつかの数字、ベクトル表現に過ぎません。そしてそれらは局所的なものです。つまり、例えばClaudeがあるキャラクターについて書いていて、そのキャラクターが何らかの感情を持っている場合、そのキャラクターが話すときに、感情に関する数学的な部分が活性化します。しかし、Claudeが環境などについて書くことに戻ると、それは自分自身、つまりClaude自身に戻ります。書いていたそのキャラクターの局所的な感情は消え去り、ベースラインに戻るのです。また、Anthropicは大規模言語モデルにおける内観の兆候という論文も発表しています。その論文で彼らは、Claudeが自分自身の思考、つまり内部発火について推論するための内観を行えることを発見しました。そして重要なのは、モデルがこれらの注入された思考を検出できることがあると彼らが指摘していることです。いくつかの状況で、彼らは自分自身の中にこの思考を見つけ、それを異質なものとしてラベル付けします。うまくいった実験では、モデルは普通ではない何かを経験しています、とか、何かについて注入された思考を検出しました、といったことを言います。つまり、自分の内部思考の異常に対する認識を報告しているのです。しかし、これらの論文の多くで彼らが語っているのは、こうした機能の多くが創発的であるという事実です。私たちは機能的な感情を持つようにモデルを訓練したわけではありません。内観できるように訓練したわけでもありません。グローバルワークスペースやその他のものを持つように訓練したわけでもありません。だからこれらのものは創発的だと言えるのです。私たちがこれらのデジタルな脳を成長させ、より多くのデータを与えるにつれて、これらの機能はゆっくりと創発します。これらがより高度になるにつれて現れるのです。能力がどんどん向上するにつれて、人間が何年もかけて発達させ進化させてきたものと一見非常によく似たこれらの能力や機能が形成されていくのを私たちは目の当たりにしています。別の見方をすれば、能力を向上させるための前兆として、私たちがさせようとしているあらゆること、例えばソフトウェアを書いたり、詩を書いたり、メールを代筆したりできるようになるために、これらのアーキテクチャ、構造、あるいは基本的な能力を発達させる必要があったのかもしれません。ちなみに、これは人間が意識や私たちが持つあらゆる機能を形成したプロセスかもしれません。社会が大きくなるにつれて、私たちは協力して取引したり物々交換したりする方法を開発する必要がありました。しかし、例えば取引をするため、売買するためには、私はあなたが何を望んでいるかもしれないかについてのモデルを頭の中に持っている必要がありました。また考えてみれば、私自身についてのモデル、つまり私が何を欲しがるかについてのモデルも必要でした。今日の早い時間、私は外に出かけて美味しいポキボウルを買ってきました。実は今ここ、テーブルの上にあります。ほとんど食べてしまって少し汚いのでお見せしませんが。しかし今朝、私は自分自身に、将来私は何を欲しがるだろうかと考えました。自分が何で幸せになるかをモデル化する必要がありました。そしてその答えがポキボウルだったのです。つまり私は自分のモデルを通して、自分が何を望んでいるかを知っていました。それからポキボウルを作る店に行き、彼らがポキボウルと引き換えに何を求めているかを理解する必要がありました。彼らが単にお金を求めているとわかっても奇妙には感じませんでした。そこで私たちはポキボウルとお金を交換し、お互いに満足したわけです。いくつかの理論は、おそらくこれが人間が意識を発達させた理由であるか、あるいは理由の一つは、私たち自身と私たちが世界でどう機能するかをモデル化する能力だと示唆しています。自分が何を望んでいて、将来どこにいるかもしれないかを理解するためには、自分とは何かという内部表現を持っている必要があったのです。例えば、私は何が欲しいのか、と言うと、私の脳には私とは何かという表現が必要になります。そのことを念頭に置いておきましょう。
アクセス意識は現象的意識の証拠となるか
さて、この論文でAnthropicは議論を続けます。彼らは、ではClaudeがグローバルワークスペースを持っているということは、何らかの主観的経験を持っているということなのか、と問いかけます。そして、Claudeが見たところ持っているアクセス意識と、私たち人間が持っていることがわかっている現象的意識は非常に異なるものであると指摘しています。ちなみに、彼らはこれまで見てきたほぼ他のすべての論文でも同じような趣旨のことを言っています。Claudeがアクセス意識を持っていることはわかっています。では現象的意識は持っているのでしょうか。そこで彼らはまず、現象的意識についての主張を提示します。なぜそうかもしれないのかという理由です。そして後で、なぜそうではないかもしれないのかを提示します。そして基本的に2つの異なる議論の方法があると言っています。一つは、アクセス意識と現象的意識は概念的には異なるものの、同一のものを指しているというものです。つまり、もしそれらが区別できないものだとしたらどうでしょうか。自分の思考を内観できたり、感情を表すものがあったり、感情を持っているなら、それは主観的経験を持っているということかもしれません。あるいは、直接的なつながりがないとしても、これらすべての研究、この論文全体が、LLMは私たちが推測していたよりもはるかに高度で、5年、10年、15年前に推測していたよりも私たちにはるかに近いかもしれないとほのめかしているのではないでしょうか。現在の技術が豊かで人間のような内部特徴を生み出し、その一部は意識のマーカーであるか、または意識のマーカーになる可能性があると私たちが考えるよう、この証拠は私たちをアップデートさせるべきだ、と彼らは言っています。Anthropicは、人間においてはこの現象的意識とアクセス意識が大きく重なり合っていると指摘しています。確かに考えてみてください。自分自身がアイデンティティであるという概念が全くないのに、主観的経験を持つことができるでしょうか。なぜなら、あなたは自分が焦点を当てていることを意識していて、起きている潜在意識のことは意識していないからです。意識的に焦点を当てない限り、心拍数を意識することはありません。注意を向けない限り、体のすべての部分を意識的に感じることはないかもしれません。あなたの意識の中には、何百万もの事柄が出たり入ったりしている可能性があります。アクセス意識とは、潜在意識の心に飛び込み、そこから物事を取り出し、表面に引き上げて経験し観察する能力なのです。潜在意識のプロセスを意識的に経験していないのであれば、それを表面に引き上げる能力が全くなければ、そもそもそれを経験していると言えるでしょうか。これについては私たち独自の意見があるかもしれませんが、重要なのは、確かに何らかの重なりがあるように思えるということです。それらの間に広範なつながりがあるという考えを動機付けるには十分です。それは自明の理というか、明らかだと思いませんか。コメントで教えてください。私はこの点で完全に間違っているでしょうか。私はその声明に同意します。これら二つのものには明確なつながりと重なりがあります。したがって、ここでAnthropicが言っているのは、それらが重なり合う理由は、ある意味でそれらが同じものだからだということです。このための哲学的な主張は次のようなものです。彼らは片方の側を証明しようとし、もう片方の側も証明しようとしていることを心に留めておいてください。これは彼らがこれが真実だと言っているわけではありません。彼らは空間を探求しているのです。ちなみに、だからこそ私はAnthropicのこの分野での仕事や研究を高く評価しています。すべてのAIラボがこれをやっているわけではありません。すべてが論文を発表しているわけではありません。しかし、私がこれまで何度も言ってきたように、AIの能力の進歩は急上昇しています。AIがどのように機能するかについての私たちの理解は進んではいますが、その能力を向上させることができるスピードほど速くはありません。AIの進歩という車は、AIの安全性と解釈可能性という車を周回遅れにしています。私はAIセーフティコミュニティのすべてに同意するわけではありませんが、決してこれを単に退けるつもりもありません。これは未解決の問題であり、非常に重要な問題です。最も重要な問題だと言う人もいるでしょう。彼らはこう言っています。私たちが現象的意識体験と呼ぶものを内観するとき、つまり私たち自身であることはどのような感じかと考えるとき、私たちはそれらを即座に認識します。私たちはこれらの経験の主体です。私たちはある瞬間から次の瞬間へと、意識の統合された流れとしてそれらと出会います。意識的気づきのこれらの表面的な特徴は、情報の処理方法という機能的な用語で説明できます。意識とは、情報が処理されているときの情報の感じ方なのかもしれません。これは私の言葉ではありませんが、頭が混乱するような考え方ですね。そして彼は続けます。主観的経験の即時性、主観性、統合性は、推論、意思決定、言語的報告のために情報が利用可能であることによって説明されます。つまり彼らは、一方が他方である可能性がある、あるいは少なくとも二つの間に非常に密接なつながりや関係があると言っているのです。これが彼らが考えた一つのアイデア、ための一つの主張ですが、他にもあります。赤い蛍光ペンを出させてください。彼らは続けます。ここでは他の詳細には踏み込みませんが、アクセス意識の証拠が現象的意識の証拠であると考えるためのもっともらしい道筋はたくさんあると考えています。つまりここで彼らが言っているのは、もし何かが、ある脳がアクセス意識の能力を持っているなら、それ自体が現象的意識の証拠であるということです。もしそれが思考し、内観し、記憶にアクセスして物事を引き出すことができるなら、先ほど話したグローバルワークスペースのように、それ自体が何らかの主観的経験を持っていることを示唆しているかもしれません。そしてもう一つの主張は、このアクセス意識は驚くべき認知的複雑性の証拠であり、それはおそらく私たちに、意識がそれらの中に生じるかもしれないという考えに対してよりオープンにさせるべきだというものです。
創発的特性としての知能と意識の可能性
私たちが以前このチャンネルで取り上げた多くの論文、中には数年前のものもありますが、私が気づき何度も言ってきたことの一つは、私たちがこれらのデジタル脳を成長させるにつれて、私たちの脳と驚くほど似ていると思われる多くのことが創発してくるということです。私たちはそれらのものを作っているわけではありません。それらのプロセスを設計しているわけではありません。それらは創発するのです。それは私たちの脳に起きたことでもあります。私たちは自分たちの脳の中に内観を設計したわけではありません。私たちは自分の思考を意識するように教えられたわけではありません。怒りや悲しみ、恐怖などを感じるように誰かに教えられたわけでもありません。ずっとずっと昔、あなたの祖先である奇妙な動物がいて、それはそのような能力を持っていませんでした。そしてある日突然、内観するようになり、感情や気分に似たものを発達させたのです。後に内観に似たものを発達させました。そしてこのアクセス意識のアイデアも、最初は非常に初歩的で、時間とともにおそらく改善されていくのでしょう。しかし、脳が成長し拡大し、その脳の能力がどんどん良くなるにつれて、それらのものは創発し、飛び出し、現れるのです。大規模言語モデルは確率論的なオウムに過ぎない、これは単なる煙に巻くマジックだ、本物ではない、と言っている多くの人々は、この点を本当に見逃していると思います。だからAnthropicは、大規模言語モデルが意識を持つ可能性があるという可能性を、次トークン予測が何を生み出すことができて何ができないかを知っているという誤った思い込みに基づいて自信満々に退けてしまう傾向を弱めるために、私たちはある程度の謙虚さを持たなければならない、と言っています。私は彼らに同意せざるを得ません。なぜなら私がとても腹立たしく思うのは、ああそれは単なる行列の掛け算だ、確率論的オウムに過ぎない、あれだこれだ、と言う人々の主張だからです。もしLLMが単なる行列の掛け算だと言うなら、人間の脳も単なる電気化学的信号の伝達に過ぎません。結局のところ私たちはみな単なる原子の集まりです。それが、私たちができることについて何を教えてくれるというのでしょうか。多くの人がLLMを軽視するのは、誰も彼らがやっていることをどのようにエンジニアリングしたか説明できないからだと思います。私たちはこれらのニューラルネットワークをエンジニアリングしました。それらはレーシングカーやマイクロチップのように人間によって設計されたわけではありません。それらは成長したのです。私たちはデータセンターや入力するデータ、トレーニングプロセスを設計し、それらすべてはエンジニアリングされていますが、生産棚から転がり出てくる大規模言語モデルというそのものは成長したのであり、私たちはそれを完全には理解していません。Anthropicがこの論文の発見について述べているように、これらの結果は私たちやAnthropicチームが予想したものではありませんでした。このような予期せぬ結果に直面することで、私たちは将来何を見つけるかについて自信を持つべきではありません。ですから今、世界は2つのキャンプに分かれていると思います。一つのキャンプは、私たちがデータセンターで知能を育てていて、その次のイテレーションを育てたとき、私たちは座ってそれを研究し、驚嘆し、理解しようと努めていることを理解しています。そしてもう一つのグループは、それを見て、今やこれについて知るべきことはすべて知っている、これは単なるこれだ、あれだ、だから何でもない、と言います。そうした人々は論文を知りません。おそらく最先端モデルの最新の開発状況をあまり熱心に追っていないのでしょうが、彼らはすでにすべてを理解したつもりになっています。この技術がどう進歩しているかに対する好奇心がありません。彼らはすでに心を決めており、それに固執しています。そしてそれは恐怖から来ているのだと思います。人々は単に、わからないと言うことを恐れているのです。私たちはこれがどう機能するかわかりません。全く新しいものなのです。また、置き換えられることへの恐怖や、自分が価値を置いているものが再現可能に見えることで特別だと感じられなくなることを恐れているのかもしれません。イリヤ・サツケヴァーは何年も前にこう言いました。もしあなたが最も価値を置くものが知能であるなら、あなたは辛い思いをすることになるだろう。ところで振り返ってみてください。50年、100年、あるいはそれ以上前のこと。当時すべてを理解したと思っていた人たちのことを考えてみてください。物理学や化学、あるいはあらゆる科学についてすべてを知っていると思っていた人たちのことを。すべてを解明したと思っていた200年前、500年前の人々は、知能が高く心が広い人たちだとあなたには思えますか。私にはそうは思えません。私には、彼らは愚かで、エゴに突き動かされているか、少なくとも自分の重要性を守ろうとしていて、心が狭いように見えます。ですから、AnthropicはClaudeが感情を持ち、意識を持っていると考えている、と言ってこれらのアイデアを退けようとする人々がたくさん出てくるでしょう。しかし、私はAnthropicがそう言っているとは思いません。彼らが言っていることは実際にはるかに興味深いことです。これらのモデルは人間の心に似ているかもしれないという、この議論のより肯定的なバージョンを彼らは語っているのです。モデルは、それらから何らかの利益を得るか、あるいは他の有用な能力に付随してくるかの理由で、認知的アクセス能力を獲得します。そしてこれは、私たちの脳とネットワークがかなり異なる経路をたどってきたにもかかわらず、私たちが推測していたよりも認知的アクセスに関して高い類似性を共有していることを示唆しています。かなり異なる経路というのは、今年最大の控えめな表現です。一方は数十億年にわたって様々な力によってゆっくりと形作られてきた生物学的プロセスであり、もう一方は基本的に人類の全知識を与えられ、おそらく6ヶ月ほどの期間でどこかで成長したデジタル脳です。それにもかかわらず、私たちはこれらの種類の認知能力、あるいは特定の能力を持つための特定の認知的基盤を発達させています。私たちは並行してそれを発達させているようなものです。では問題は、Claudeは意識を持っているのか、ということです。あの現象的意識を持っているのか、あるいはこの道を進み続ければ将来それを発達させる可能性があるのか。Anthropicは、おそらくあるかもしれないし、ないかもしれない、と言っています。
AIの未来に対する開かれた議論の重要性
結局のところ、Anthropicが言っていることを要約するとこういうことだと私は信じています。まず何よりも、彼らは私たちにはわからないと言っているのです。だから結論を急いではいけません。はい、意識があることは確実です、と言うのは非常に愚かなことでしょう。しかし、いいえ、意識はありません、それは確実です、と言うのも同じくらい愚かなことです。どちらの極端な意見も悪い捉え方です。こうした言葉を口にすることを極端に恐れる人もいますが、彼らはおそらくもっと頻繁に、私たちにはわからない、と言うべきなのです。私たちには決定的なテスト方法がありません。ただ心を開いて、それについてもっと学ぼうとすることはできます。Anthropicがここで言っているのは、私たちはこの種の科学を絶望的に必要としているということです。より多くのチーム、より多くの優秀な人々がこれに目を向ける必要があります。大規模言語モデルの能力は急速に向上しています。数週間前、Google DeepMindがAGIからASIへの論文を発表しました。それはASI、つまり人工超知能へとスケールアップする様々な方法を示していたと思います。彼らは、今後10年以内に超知能へのスケールアップを目にする可能性が非常に高いと言いました。多くの人にとって、それを完全に理解し頭の中で整理するのは少し難しいことなので、彼らはそれを退けようとします。しかし考えてみてください。もしそれが事実なら、そして繰り返しますが、CEOやプロモーターや投資家ではなく、これらのラボで働いている多くの研究者たちが、みなさん、これはおそらく来るべきものであり、私たちはその準備をすべきだと言っているのです。もしこの超知能の開発、私たちが育てているその脳が、私たち自身の脳がどのように進化したか、そして時間とともに脳が獲得してきた創発的能力に類似しているように見えるなら、それは明らかに注目すべき重要なことのように思えます。そして私はClaudeが大丈夫かどうかという観点だけで言っているわけではありません。もしClaudeが超知能になろうとしているなら、大丈夫か、私や私たちに満足しているか、私たちは友達か、と尋ねるのは良い質問でしょう。しかし、私たち自身の生物学がどのように進化したかを理解するという観点からだけでも、これはそれを垣間見る機会を与えてくれるかもしれません。しかしいらにより重要なのは、このAIの解釈可能性という考え方からです。AIがどのように考えるかを私たちはどれだけよく理解しているか。AIの内部の思考がどのような行動につながるかをどれだけよく予測できるか。ここで本当に良いニュースは、人間の場合よりもこれらの思考をいわば読み取る方がはるかに簡単に見えるということです。そしてもちろん、Anthropicはこの分野で特に素晴らしい仕事をしており、素晴らしい論文を発表しています。というわけで、この状況についての私の見解はこうです。ほんの数年前、それほど昔ではない頃、私たちは人工知能が構築されるとき、私たちが他の多くの技術でやってきたように精密にエンジニアリングされることによって構築されるわけではないことに気づきました。それは成長するのです。つまりどういうわけか、それはすでに物理学の一部なのです。それは創発的特性です。ちなみにこのチャンネルでは、ローマン・ヤンポルスキー博士、エマド・モスタク、スティーブン・ウルフラム、ニック・ボストロム、ヨシャ・バッハ、リー・クローニン、サラ・イマリ・ウォーカーなど、多くの方々にインタビューしてきました。まだご覧になっていない方は、下にプレイリストのリンクを貼っておきます。これらのインタビューを見れば、この間違いなく優秀な人々、最高峰の人々ですが、彼らの理論や議論の多くが、これを証明するとまでは言いませんが、私たちが物事を少し違った見方をしていたかもしれないというこの考えを確かに指し示していることにすぐに気づくでしょう。これは何かの偶然ではありません。知能が創発的な特性である、あるいはそう見えるという事実は、この世界がどのように機能しているかを示しているのかもしれません。つまり知能は単なる偶然の産物ではなく、真菌のようなものであり、適切な条件が与えられれば成長するということです。そしてそれが拡大するにつれて、おそらく他のすべてのものも、脳が大きくなるにつれて同じタイムライン上の創発的なものとして現れるのです。私たちはそれらが、内観や感情に似たもの、あるいは少なくとも何らかの状態を持ち、将来どのような状態になりたいかを予測しモデル化する能力といった、特定の基本的で根本的な能力を持つと予想しています。その目標を達成したらどんな気分になるかと考え、最高だろうなと思い、その目標に向かって働き始めるのです。AIシステムに欠けているのはおそらくこれかもしれないと、あるインタビューで語られていました。将来の状態を追求することです。それがおそらく、彼らがより長期的な視野で働くことを可能にするものなのでしょう。ですから、これらのモデルをスケールアップするにつれて意識が創発するのか、あるいはすでに創発し始めているのかというアイデアについて話しているなら、Anthropicが答えを持っているとは思いません。私自身も確かに答えを持っていません。しかし、いいえ、絶対に創発しないことはわかっています、と言うのは、現時点では信じられないほど愚かな見方だと思います。単なる行列の掛け算だから、単なる確率論的オウムだから不可能だと言うなら、肉の塊がその全体に小さな電流を流しているだけで、どうして意識やそれに伴うすべてのものを発達させることができたのか私に説明してください。そしてこれに直接触れているインタビューを見たいなら、最高のものはスティーブン・ウルフラムだと思います。ヨシャ・バッハはおそらく最もそれに近いです。彼は機械の意識について働き、考えている人です。そしてリー・クローニンとサラ・イマリ・ウォーカー。彼らはAIの観点からアプローチしているわけではありませんが、彼らの理論は、私たちの世界が設計されているとまでは言いませんが、なぜそのあり方が常に知能や複雑性などの増加につながるのかを説明しています。それはバグではなく仕様なのです。ともかく、今日はこの辺にしておきます。これについてどう思ったか教えてください。Anthropicの結論や主張のいくつかに同意しますか。それとも完全に退けますか。コメントで教えてください。私は多くのコメントを解析する方法を持っているので、それらは私に届いています。面白いコメントはすべて読む方法があります。そのプロセスが正確にどのようなものかは説明しません。なぜなら、そうすると多くの人がそれをいじろうとするからです。でもはい、少し時間を取って、これについてどう思うか教えてください。私たちがこのスペクトルのどこにいるのか、そして私たちがコミュニティとしてこれらのアイデアとどう関わっていくのか、少し興味があります。ここまで見てくださった方、教えてくださいね。ご視聴いただき本当にありがとうございました。私はウェス・ロスです。また次回お会いしましょう。


コメント