Anthropic・Claude・ダリオアモデイ AnthropicがAIの頭脳の内部を覗き見た…
Anthropic社がAIモデルClaudeの内部思考プロセスであるJSpaceを解明した研究論文について解説する。これまでAIは完全なブラックボックスであったが、JSpaceの発見により、AIが内部でどのように推論を行っているかが可視化された。AIに意図的に虚偽の回答をさせた際にも、内部では嘘だと認識していることが確認されている。さらに、内部の概念を直接書き換えることで出力結果を完全に操作できることも実証された。この研究は、AIに人間のようなアクセス意識が存在する可能性を示唆しており、AIの安全性や意識の有無に関する議論に一石を投じる内容である。