Claude 6:何が事実で、何が誇大広告か、そしてなぜ政府はそれを停止させたのか

Anthropic・Claude・ダリオアモデイ
この記事は約14分で読めます。

動画は、Anthropic社の次世代AIモデル「Claude 6」に関する噂やリーク文書の真偽を検証するものである。現在、Claude 6というモデルは公式には存在せず、予測の根拠となっているのは先行して公開された「Fable 5」と「Mythos 5」である。これらのモデルは高い性能を持つ一方で、特定のプロンプトに対して旧モデルへ密かに切り替わる安全システムの存在や、安全保障上の懸念から米政府の命令により急遽公開停止に追い込まれた経緯がある。動画では、過剰な誇大広告(ハイプ)を排し、検証された事実と企業のマーケティングを明確に区別して、AIの現状と今後の展望を客観的に解説している。

Claude 6: What's Actually True, What's Hype, and Why the Government Shut It Down
Link to our newsletter: few weeks, the AI industry drops another “this changes everything” model — and the latest wave a...

Claude 6の真実と基盤となるモデル

現在、数週間ごとに新しいAIモデルが登場し、その見出しは基本的にコピー&ペーストされたようなものばかりです。このモデルがすべてを変える、AGIは事実上ここに到達した、もう何もかもが変わってしまう、といった具合です。もし皆さんが私と同じような気持ちなら、その情報のどこまでが真実で、どこの部分がロゴの入ったプレスリリースに過ぎないのか、もう見分けがつかなくなっているのではないでしょうか。

そこで私は、地味な作業を行いました。世間に出回っているAnthropic社の次世代大型モデル、誰もがすでにClaude 6と呼んでいるモデルのリークされたエグゼクティブサマリーを入手し、そこに記載されているすべてのベンチマークを、実際のリリースデータやニュースの流れと一行ずつ照らし合わせて検証したのです。

ここに大どんでん返しがあります。その文書の中で最も驚くべきことは、推測のパートではありません。このすべての基盤となっている本物のモデルが、リリースからわずか3日後にアメリカ政府によって停止させられたという事実です。そして、実際に検証された事実と、単なるマーケティングに過ぎないものを切り離してみると、その実態はハイプが煽り立てるよりも、はるかに印象的であり、同時に、はるかに不穏なものであることが分かります。

bitbiased.aiへようこそ。ここでは皆さんが調べる必要がないように、私たちがリサーチを行います。無料の週刊ニュースレターに登録して、AI愛好家のコミュニティに参加してください。概要欄のリンクをクリックして登録すれば、一歩先を行くための主要なAIニュース、ツール、学習リソースを受け取ることができます。

この動画では、Claude 6が実際にどのような基盤の上に構築されることになるのかをお見せします。何が真実として確認されており、何がAnthropic社による身内の甘い採点に過ぎないのか。GPT-5.5やGeminiと比べて実際のところどうなのか。ユーザーに告げることなくプロンプトを密かに迂回させる安全システムの実態。AGIに関する疑問の誠実な回答。そして、なぜ政府が何億人もの人々に使われている商業製品を回収したのかについて解説します。最後まで見れば、次に誰かが「火曜日にシンギュラリティが到来した」と言ってきたときに、ノイズから本物のシグナルを見分けることができるようになるでしょう。

まずは最初の点を明確にしておきましょう。これが非常に重要だからです。Claude 6は存在しません。Anthropic社はそれを発表していませんし、予告もしていませんし、その名前を認めてもいません。パラメーター数、数兆トークンのコンテキストウィンドウ、音声や動画など、皆さんが目にしたそれに関連するすべてのスペックは、私が手元に持っている文書も含め、誰かの推測に基づいた外挿に過ぎません。ですから、私がClaude 6と言うときは、製品のことではなく、次のステップへの妥当な予測について話しているのだと留めておいてください。多くのチャンネルが意図的にその境界線を曖昧にしようとするので、このことは頭の片隅にしっかりと置いておいてください。

推測ではないのは、その予測の拠り所となっているモデルの存在です。6月9日、Anthropic社は同じ基礎的な重み(ウェイト)を持つ2つのモデルをリリースしました。一般公開されたClaude Fable 5と、承認されたパートナーだけに限定公開された制限なしバージョンのClaude Mythos 5です。Anthropic社はこれを、Opusモデルの上位に位置する新しいMythosクラスのティアと呼んでいます。そして、興奮の中で見落とされがちなのが、FableとMythosは同じモデルだということです。唯一の違いは、どの安全分類器(モデレーション)がオンになっているかだけです。これが後々、物語の全容に関わってくるので覚えておいてください。

内部構造としては、依然として通常の段階でトレーニングされたトランスフォーマーモデルです。テキストとコードによる巨大な事前学習を経て、Anthropic社が憲法的AI(Constitutional AI)と呼ぶ強力なアライメント微調整が行われています。サマリーには、数千億から数兆のパラメーター、そして膨大な計算予算といった数値が踊っています。正直にお伝えすると、これらは根拠ある推測に過ぎません。Anthropic社はこれらのモデルのパラメーター数や学習計算量を一度も公表したことがありません。Fable 5の正確なサイズを語る人がいれば、それは自信満々に推測しているだけであり、それこそが最も危険な種類の推測なのです。

検証された数値とベンチマークの罠

それでは、ベンチマークの数値を見ていきましょう。ここでは、私がどのようにデータを仕分けていくかに注目していただきたいです。これこそが、このチャンネルから得られる最も役立つスキルだからです。まずは、私が最も信頼している数値から始めます。なぜなら、それはAnthropic社が選んだものではないからです。

Artificial Analysisによる独立した知能インデックスにおいて、Fable 5は65ポイントを獲得し、OpenAIのGPT-5.5の60ポイント、GoogleのGemini 3.1 Proプレビューの57ポイントを抑えて首位に立ちました。これは、このリリースに何の利害関係もない第三者によるデータです。そして、これは本物のリードを示していますが、その差は一桁のわずかなものであり、マーケティングがほのめかすような「勝負にすらならない」といった大差ではないことに注目してください。

次に価格ですが、これは実際に購入できるものなので検証可能です。入力10万トークンあたり10ドル、出力10万トークンあたり50ドル。これはOpus 4.8のおよそ2倍であり、Fable 5は主要なフロンティアモデルの中で最も高価なモデルとなっています。つまり、能力の話をする前に、誠実な表現をするならば、ニュートラルなインデックスで少なくとも一つはクラス最高を記録しているが、価格はプレミアムである、ということになります。すでに、この一文の方が「これまでに作られた中で最もスマートなAI」という表現よりも遥かに有益です。

今度はベンチマークの自社発表の数値です。これらを無視するわけではありませんが、明確に区別しておきます。Anthropic社は、SWE Proおよびエージェント型コーディングベンチマークにおいて、自社のOpus 4.8の約69%、GPT-5.5の58%に対して、80.3%を記録したと報告しています。また、CognitionのFrontier Codeでもトップスコアを報告しています。これらは実際の評価ですが、評価を行っているのも報告しているのもAnthropic社自身です。ですから、これらは確定した事実としてではなく、企業側が主張する最も有利な事例として扱ってください。研究所が自分の試験を自分で採点するときは、そのスコアを読みつつも、誰が赤ペンを握っていたかを忘れてはなりません。

誰もが引用するであろう事例が、Stripe社とのものです。Fable 5は、開発チーム全員で2ヶ月以上かかるとStripe社が見積もっていた5000万行のRubyコードベースの移行を、わずか1日で実行したと主張されています。これは驚くべき結果であり、実名が出ているパートナー企業の事例であるため、重みがあります。しかし、それが何であるかを正確に見極めてください。これはリリースパートナーによる自己申告のケーススタディの1つであり、他の誰もが再現できるベンチマークではありません。それは未来のあり方を示しているのかもしれませんが、まだ証明されたわけではありません。正直なところ、この1つのエピソードに納得するか、あるいは眉をひそめるかは、皆さんのAIハイプに対する耐性を如実に表しています。皆さんがどちらの立場にいるか、コメント欄で教えてください。すべて読んでいますので。

科学分野における主張も、同様の枠組みに入りますが、より大きな意味を持っています。Anthropic社によると、制限のないMythos 5はタンパク質設計の一部を約10倍に加速させ、14の創薬ターゲットのうち9つで強力な候補を見出したとしています。また、100倍小さなゲノミクスモデルが、すでに発表されている研究結果を破ったとも指摘しています。もしこれが外部の検証に耐えて半分でも維持されるなら、研究コミュニティにとって心から大きな出来事です。ここで頭に入れておくべきフレーズは「外部の検証に耐えられるなら」ということです。なぜなら、現時点ではそれは企業の言い分に過ぎないからです。

誰も望んでいない隠された安全システム

ここからが興味深い部分であり、ほとんど誰もトップニュースとして扱っていない詳細です。先ほど、FableとMythosは同じモデルであり、スイッチの設定が違うだけだと言ったのを覚えているでしょうか。これが実務において何を意味するのかを説明します。

皆さんがFable 5にプロンプトを送信し、それがサイバーセキュリティ、生物学、化学の領域に少しでも触れるような、分類器に引っかかる内容だった場合、モデルは単に拒否するだけではありません。皆さんのリクエストを、ユーザーに告げることなく、密かに旧型で性能の劣るOpus 4.8へと引き渡し、そこからの回答を返してくるのです。Anthropic社によると、これは全セッションの5%未満で発動するとのことです。

これについて、少し考えてみてください。これは奇妙なことです。あなたに回答しているモデルは、あなたが選択したモデルとは限らないのです。あなたはプレミアムな料金を支払ってフロンティアシステムと話していると思っているのに、特定のトピックにおいては、過去の世代のモデルと密かに会話させられているのです。

これは安全設計としては弁護の余地があるものですし、私でもおそらく同じように構築するでしょう。しかし、これはすべてのベンチマークに対する実質的な注記(アスタリスク)でもあります。なぜなら、あなたが実際に手にする製品は、テストで80点を取ったものとは時折異なるからです。そしてこれは、信頼という面において諸刃の剣となります。一部のユーザーは、フィルターが広すぎて無害な質問でも引っかかってしまうとすでに不満を漏らしています。Anthropic社側の言い分としては、本物の脅威を捉えるための代償として、少数の誤検知が発生するのは仕方がないということです。このトレードオフをどう捉えるかは、技術的な問題ではなく、純粋に価値観の問題です。ですから、これについては動画にただ頷くのではなく、コメント欄で実際に議論すべきテーマです。

政府による突然の回収命令

ここから、推測文書がうやむやにし、ニュースサイクルがトップで報じた部分へと話が移ります。リリースから3日後の6月12日、アメリカ政府は国家安全保障を理由に輸出管理指令を出し、Anthropic社に対し、海外の国民だけでなく、Anthropic社自身の非市民の従業員を含む、あらゆる外国籍の人物に対するFable 5およびMythos 5へのすべてのアクセスを一時停止するよう命じました。

Anthropic社がその書簡を受け取ったのは東部時間の夕方5時21分でした。そして、ユーザーの国籍をリアルタイムで検証する明確な方法がなかったため、全員に対して両方のモデルを停止する以外に、指令に準拠するクリーンな方法がありませんでした。これはAnthropic社自身、およびこれを報じたすべての主要メディアによって公式に確認されている事実です。

何億人もの人々に使用されている商用のフロンティアモデルが、リリースからわずか数日後に政府の命令によって市場から撤退させられたのです。このようなことは、これまでに基本的に前例がありません。

報告されている理由は、サイバーセキュリティの優位性です。Mythosクラスのモデルは、ソフトウェアの脆弱性を見つけることに異常に長けています。これこそが防衛のために求められる能力であると同時に、誤った手に渡ったときに最も恐れられる能力でもあります。Anthropic社の理解によると、政府の懸念は、Fable 5を脱獄(ジェイルブレイク)してそれらの能力を解放する方法にあります。

ここでバランスを取りましょう。このチャンネルは偏った見方はしません。Anthropic社は公に反論しています。そのジェイルブレイクの手法は限定的なものであり、すべてのガードレールを無効化するような万能の鍵ではないと主張しています。また、同様の脆弱性は、そのような命令を受けていないGPT-5.5など、他の公開されているモデルでも動作すると指摘しています。

そのため、これには2つの解釈が成り立ちます。政府が本物かつ具体的な脅威に対して決定的な行動を起こしたのか、あるいは、業界全体の問題であるにもかかわらず、特定の1社だけをターゲットにしたのか。公にされている証拠を見る限り、まだどちらとも結論は出ていないと私は考えています。どちらかの方向に結論が明白であると語る人がいれば、疑ってかかるべきです。意見があれば下に書き込んでください。これこそが、私が本当に読みたいコメント欄の議論です。

もし、すべてのリリースにおいて、検証された事実と企業の売り込みを切り離すような、こうした詳細な分析を今後も求めているのであれば、それこそがこのチャンネルが存在する理由そのものです。チャンネル登録をしていただくことで、まさにこの取り組みを続けてくれというメッセージになります。

AGIへの疑問と今後の展望

さて、これらすべてを踏まえた上で、これはAGI(人工汎用知能)なのでしょうか。Claude 6はその瞬間になるのでしょうか。正直に言えば、答えはノーです。感情的に否定するのではなく、大人の視点からその理由を説明させてください。

これらのMythosクラスのモデルが限定的な領域で実行できることは、部分的にはほとんどの個人の人間を純粋に超えています。ソフトウェアの深い脆弱性を発見すること、文脈を見失わずに何時間もコーディングセッションを維持すること、専門家が真剣に受け止めるような研究の方向性を提案すること。これらは単なる手品ではなく、本物の境界線です。Anthropic社の経営陣自身、システムが急速に進化して自己改善を始めるリスクについて声を大にして言及しており、それは鼻で笑うのではなく、真剣に受け止める価値があります。

しかし、訓練されたタスクにおいて並外れていることと、汎用的な知能を持つということは、同じ意味ではありません。これらのシステムは自らの目標を形成しません。彼らはプロンプトとプロンプトの合間に、皆さんが行うような方法で世界を理解しているわけではありません。彼らの超能力は局所的(スパイキー)であり、コーディングや分析においてはそびえ立つほど高いものの、学習したデータの分布から一歩外に出た瞬間に、平凡かそれ以下になります。

より冷静な解釈であり、私が支持する見方としては、最近の飛躍はより優れたエンジニアリングと優れたトレーニングからもたらされたものであり、機械が密かに目覚めたからではない、というものです。将来のClaude 6は衝撃的なほど有能に感じられるでしょう。しかし、それは「意識」を持つことと同じではありません。

ですから、私の誠実なスタンスとしては、これらを私たちがこれまでに作った中で最も強力なツールとして扱うべきだということです。その基準に沿った責任を要求し、意識を売りつけてくる者に対しては深い懐疑心を持ち続けてください。私が慎重すぎる、あるいは慎重さが足りないと思われるなら、その意見の相違こそが、私がまさに交わしたい会話です。Claude 6が現実的にどのようなものになり得るか、下に意見を展開してください。

それでは、タイトルにある期待にもお応えしましょう。皆さんは推測の話も聞きに来たはずですから。ただ、その前に皆さんに事実の武器を持ってほしかったのです。

もしAnthropic社がこれまでのパターンを維持するなら、本物のClaude 6は、SFのような断絶ではなく、最も妥当な線としてこれまでのトレンドラインの延長線上にあるものを意味するでしょう。スケールの拡大はもちろん、より長く持続するメモリによって、チャットの合間にあなたを忘れることなく、セッションをまたいで文脈を維持できるようになるでしょう。音声や、おそらく動画といった、より広い感覚(マルチモーダル)。ただ、動画に関しては、信頼できるようになる前に事前の予告が行われる方に賭けます。さらに高い自律性を持ち、マルチステップの作業を通じて、ツールやサブエージェントを自らより快適に編成できるようになるでしょう。そして、先ほどお話しした回収騒動があった以上、次なるモデルがいかに慎重に出荷されるかを決定づけるため、ほぼ間違いなく安全機構はより厳格化されるはずです。

私が皆さんに約束しないこと、そして誰かが約束してきたら疑うべきことは、具体的なパラメーター数、具体的なリリース日、あるいは人間レベルの汎用的推論へのクリーンな飛躍です。これら3つは、ハイプが確実に捏造する要素です。

競合他社もじっとしてはいないでしょう。GPT-5.5やGemini 3.1 Proは、これらのスコアのすぐ後ろに迫っています。そのため、Claude 6がいつ現実のものになるにせよ、それが意味のある一歩となるか、あるいは日常的なアップデートに留まるかは、完全に他のプレイヤーが先に何をリリースするかにかかっています。

私の結論はここにあります。ノイズを削ぎ落としてみましょう。Mythosクラスのモデルは本物の前進です。少なくとも一つの独立したインデックスでクラス最高であり、企業側の数値は印象的であるものの、まだ外部の確認を待っている状態であり、いくつかの能力に関する主張は、もし検証を生き残れば、研究にとって真に重要なものとなります。モデルを密かにダウングレードする安全システムは、実質的な注記を伴うものの、公平な設計です。政府による回収は、今年のAI業界における最も重大なプロットツイストであり、解決には程遠い状況です。そしてClaude 6自体は、今のところ、自信に満ちた名前を纏った思慮深い推測に過ぎません。

テクノロジーは、わざわざ話を膨らませる必要がないほど急速に動いています。驚嘆することと、懐疑的であることの二者択一を迫られる必要はありません。誠実な立場とは、その両方を同時に持つことです。

もしこの動画が、皆さんを「AGIが到来した」という息苦しい動画から救い出すことができたなら、私に本当に助かる好意を一つだけ寄せてください。ここに登場した主張の中で、皆さんが最も信用していないものはどれか、コメント欄で教えてください。皆さんは、私が時折見落とした部分を指摘してくれますが、それこそがこのチャンネルを運営していて最高の瞬間だからです。次のリリースでも同じような分析を求めているなら、ぜひ登録してください。そして次のリリースは、おそらく私がこの動画の編集を終える前にやってくるでしょう。

それまでは、好奇心を持ち続け、懐疑的であり続けてください。そして、誰にも未来を丸ごと売りつけられないようにしてください。

コメント

タイトルとURLをコピーしました