Gemini 3.5 PROはFable 5レベル… Googleが帰ってきた!

AIエージェント
この記事は約14分で読めます。

Googleの最新AIモデルGemini 3.5 Proのリリース遅延は失敗ではなく、より高度な事前学習とアーキテクチャ再構築のための戦略的な布石である。GPT 5.6やFable 5といった強力なライバルがひしめく中、Googleは3.5 Proを単なるテキスト生成器ではなく、複数のサブエージェントを束ねる強力なオーケストレーターとして位置づけている可能性が高い。さらに、200万トークンのコンテキストウィンドウや豊富なエコシステム、他社を圧倒する利用制限の緩さを武器に、Googleは長期的な競争における優位性を確固たるものにしようとしている。来る7月17日はAI業界の勢力図を塗り替える歴史的な日となる。

Gemini 3.5 PRO Is Fable 5 Level... Google Is Back!
Everyone thinks Google is falling behind, but Gemini 3.5 Pro may prove the opposite. The delay, the Flash token problem,...

史上最大のAI対決が幕を開ける

史上最大のAI対決が今日始まります。そしてこの動画を最後まで見ていただければ、テック系のメディアやRedditの集合知、ベンチマークの専門家など、ほとんどすべての人がこの状況を完全に見誤っている理由がわかるはずです。GPT 5.6が数時間以内にリリースされる可能性があります。ローンチの窓口は7月7日から9日で、内部情報によればOpenAIは人間が可能な限り早くこれを出したがっているとのことです。つまり、あなたがこの動画を見ている間に文字通り発表が来るかもしれません。その10日後の7月17日には、Gemini 3.5 ProがついにDeepseek V4と全く同じ日に着弾します。この業界がこれまでに目にした中で、最も意図的なスケジューリングの戦争と言えるでしょう。10日間に3つのフロンティアモデルが登場する一方で、AnthropicのFable 5は王座に座り、彼らすべてに挑んでこいとけしかけています。そしてここからが、あなたの頭を本当に混乱させる部分です。Googleは終わった、Geminiは遅れをとっている、3.5 Proの遅延は失敗だった、といったあなたが聞いたことのある話はすべて逆かもしれないのです。これからの数分間で、なぜその遅延が実際にGoogleがここ数年で行った最もアグレッシブな動きである可能性があるのかをお見せします。トークン消費についての漏洩したたった一文が、Geminiの最も安価なモデルが最も強力なモデルを密かに人質に取っていたことを明らかにするかもしれない理由。3.1 Proが突然賢くなくなったように感じるのが、舞台裏でとてつもないものが動き出しているというこれまでで最強の証拠かもしれない理由。そして、噂されている200万トークンのコンテキストウィンドウと隠されたオーケストレーターアーキテクチャが、リーダーボード全体をひっくり返すかもしれない理由を説明します。また、懐疑論者にも発言の機会を与えます。というのも、この理論全体にとって本当に危険な反論がひとつ飛び交っており、それをリアルタイムでストレステストしていくからです。現在飛び交っている誤解の量は本当にすさまじいものです。それでは、これについて話していきましょう。

Gemini 3.5 Pro遅延の本当の理由

まずは遅延そのものから始めましょう。その背後にあるストーリーは人々が考えているよりもずっと興味深いからです。Gemini 3.5 Proは元々6月にローンチされる予定でした。しかしそれは実現しませんでした。そしてオンラインでの即座の反応は、いつものGoogleは終わったという悲観的な投稿でした。しかし複数の情報源によると、これはパニックに陥った技術的な失敗などではありませんでした。意図的で戦略的な判断だったのです。DeepMindは古くなりつつある2.5 Proのベースモデルの上に構築を続けるという計画を見て、いや、それはやらないと言ったと報じられています。彼らは古い基礎を完全に廃棄し、余分な時間を使ってより高度なベースで新たな事前学習を実行しました。それが何を意味するのか少し考えてみてください。古い骨格をもう一度微調整するのではなく、戻って骨格から作り直したのです。目標とされた改善点は、数学的推論、SVGのシーン生成、フロントエンドのデザインセンス、そしてよりクリーンで簡潔なコード出力だと報じられています。初期のリークテストでは、モデルがUI生成において顕著に優れており、崩壊することなく複雑なゲームロジックを処理できることが示唆されています。そして出力は、私たちが大規模モデルから慣れ親しんできた肥大化して過剰にエンジニアリングされたコードではなく、よりタイトで正確なものになっていると言われています。それはパッチではなく、再構築です。そして彼らがそれを適切に行うために、1ヶ月間の容赦ない大衆の圧力に耐える覚悟があったという事実は、彼らがこのローンチをどれほど真剣に受け止めているかを物語っています。現在、一部のアナリストはすでに保険をかけており、新しい事前学習を行ったとしても、3.5 Proは純粋な規模の面でFable 5のような1兆パラメータのモンスターに完全に挑むにはまだ及ばないかもしれないと言っています。そうかもしれませんが、純粋な規模がすべてだったことは一度もありませんし、Googleはここでどの戦いを選ぶべきかを正確に理解しています。

クラスの異なるモデルを比較する罠

さて、ここで一つはっきりさせておく必要があります。この間違いが至る所に溢れているからです。人々はFable 5とGemini 3.5 Flashを比較し続け、Googleが絶望的に遅れをとっていると結論づけています。そして、なぜそうなるのかはわかります。Flashは人々が触れることのできる最新のGeminiモデルだからです。しかしFlashは、スピード、安価な推論、そしてエージェント的ワークフローのために構築された、大幅に制限された低遅延モデルです。その本来の目的は、より大きなシステム内でサブエージェントとして機能するのに十分なほど高速かつ安価であることです。Googleの上限をFlashで判断するのは、F1チームを配達用のバンで判断するようなものです。Geminiのラインナップの中でさえ、人々は階層を忘れています。ProはOpusの領域に位置しています。もしGoogleが独自のパターンに従うなら、Fableクラスの真の競合相手は3.5 Deep Thinkのバリアントのようなものになるでしょう。つまり、現在オンラインで起こっている議論の半分は、文字通り異なる重量クラスのモデルを比較し、その結果にショックを受けているようなものなのです。しかし、それは階層よりも深いところに関わっています。そしてここからが本当に魅力的なところです。

オーケストレーター理論とトークン経済

ある理論が高まっており、それはリーク情報とローガン・キルパトリック自身からの半ば暗号のような返信によって裏付けられています。それは、3.5 Proが単なるもう一つのテキストジェネレーターとして構築されているわけではないというものです。それはオーケストレーター、つまり特化したサブエージェント、おそらくFlashインスタンスの群れの上に位置し、それらを調整するように設計されたモデルとして位置づけられています。Googleのモデルは、ほぼ全体にわたってネイティブにマルチモーダルです。そしてDeepMindには文字通り数十年にわたる研究があります。AlphaFoldスタイルのブレイクスルーから、一つのエコシステムに統合されるのを待って保管庫に眠っているワールドモデルまで、あらゆるものがあります。彼らに欠けていたのは、そのオーケストラを指揮するのに十分強力でありながら、そこに到達するまでに20回のイテレーションを必要とせず、単独で困難な問題をワンショットで解決できるほど強力なモデルでした。そしてもしそのオーケストレーターという枠組みが部分的にでも真実だとしたら、それは何よりも遅延をうまく説明できるかもしれません。ここの論理を追ってみてください。リーク情報では、Googleが3.5 Flashの展開からトークン消費に関する教訓を取り入れたがっていたことが具体的に言及されていました。多くの人はそれを、Flashが遅延したプロダクトであると読み取りました。しかし、それを逆転させてみてください。もし実際に3.5 Flashが考えるのを見たことがあるなら、それが途方もない量の中間推論トークンを消費することを知っているはずです。難しい問題にぶつかり、何かを書き出し、立ち止まり、再び考え、さらに書き、ループし、格闘し、再試行します。では、それらのFlashインスタンスのいくつもの上にプレミアムなオーケストレーターモデルを置いてみましょう。そのオーケストレーターは、サブエージェントが生成するすべてを取り込まなければなりません。もしFlashが自身の推論トークンに溺れているなら、Proはノイズを読むためだけに高価なプレミアム計算リソースを無駄にしていることになります。その下にあるトークン経済が効率的になるまで、オーケストレーターをリリースすることはできません。そのため、Flash自身がProを遅らせるボトルネックになっており、GoogleはProのローンチと並行してより無駄なく稼働する3.6 Flash、あるいは4 Flashの準備をしている可能性が高いという理論が成り立ちます。そしてそれは彼らにとって新しい行動ですらないでしょう。Gemini 3 Proがローンチされた時、それは馬鹿げたほど有能でしたが、狂ったようにハルシネーションを起こしました。そしてGoogleはすぐに3.1 Proを投入し、モデル全体を改善しつつハルシネーションの発生率を劇的に減らしました。同じプレイブックで、スタックのレイヤーが違うだけです。

Gemini 3.1 Proの性能低下とハルシネーションの真実

3.1 Proといえば、誰もが気づいている明白な問題について話しましょう。このモデルは以前よりも悪くなったように感じます。明らかに悪くなっています。反射的な説明としては、Googleが密かに弱体化させたというものです。そして正直なところ、制限はおそらく行われています。しかし、その理由が重要です。GoogleはただGeminiを提供しているわけではありません。彼らは同時に、AI Studio、Search Integration、Workspace、Notebook、LM、Flow、VO、ImagiGen、Astra、Jewels、Gemma、複数のFlashとProのバリアント、そしてそれらすべての製品の背後にある山のような特化モデルを稼働させています。それは何十億人ものユーザーにサービスを提供するエコシステムであり、計算リソースは無限ではありません。もしGoogleが現在、3.5 Proの展開に備えてハードウェアを再割り当てしているのだとすれば、3.1 Proが劣化しているように感じるのは衰退の兆候では全くありません。それはより大きな何かが動き出しているエンジンの煙なのです。歴史的に見て、Geminiのモデルはメジャーリリースの直前に制限されているように感じる傾向があります。だから皮肉なことに、3.1 Proが悪く感じられるほど、3.5 Proが近づいているということになります。ハルシネーションの面では、ほとんど誰も語らないニュアンスがあり、30秒ほど耳を傾ける価値があります。実際には、一緒にまとめられている二つの別々の問題があります。一つ目は一般的なハルシネーション、つまりすべてのフロンティアモデルが依然として格闘している、作り話をしてしまうという古典的な問題です。Googleはすでに3 Proと3.1 Proの間でそれを大幅に削減しており、3.5 Proはさらにそれを推し進めるはずです。二つ目の問題は異なっており、正直言ってより厄介です。3.1 Proは自身の内部知識をあまりにも信用しすぎています。Flashが、ユーザーが求めていなくても常にウェブを検索するのに対し、3.1 Proは自身のトレーニングデータが絶対的な真理であると想定する傾向があり、時にはユーザー自身が間違っている、あるいはハルシネーションを起こしていると自信たっぷりに告げるほどで、それが皮肉にもより多くのハルシネーションを生み出しています。面白いことに、人々はGemini 3 Proがローンチされる直前にも全く同じ不満を漏らしていました。そしてそのモデルは、広範なベンチマークでほぼすべてのものを凌駕する結果を残しました。歴史は韻を踏みます。

懐疑派の意見とベンチマークの事実

さて、単なる誇大広告マシンにならないために、世に出回っている最強の反論を取り上げる必要があります。なぜならそれは正当に鋭い指摘だからです。懐疑論者たちは、このオーケストレーターの物語全体が、モデルとスキャフォールドを混同していると主張しています。彼らのポイントは、サブエージェントの群れ、再試行のループ、そしてオーケストレーションは、モデルの重みそのものではなく、モデルを取り囲むソフトウェアハーネスの機能であるという点です。Fable 5がコンパイラエラーと再試行を通じてMinecraftのクローンを作るのに20分費やすとき、それは生のモデルではなく、Claudeのコードエージェントハーネスが反復しているのです。同じハーネスをGeminiに向ければ、同じループが得られるでしょう。彼らはまた、Fable 5がLM Arenaのようなシングルターンでハーネスなしのベンチマークでトップに立ち、構造的にワンショットであるGPQA Diamondで92.6パーセントをスコアしていることを指摘しています。したがって、サブエージェントなしではパフォーマンスを発揮できないという主張は、データと照らし合わせると成り立ちません。純粋に公平な指摘です。しかし、ここからが反論に対する反論です。Gemini 3.1 Proは依然としてGPQAで94.1で優位性を保っており、間違いなく純粋な生の流動的推論のテストであるARC AGI2では、77.1という驚異的な数値を記録しています。コーディングやエージェント的なワークフローの領域外では、時代遅れとされているGoogleの4ヶ月前のモデルが、依然として最新のフロンティアリリースと互角に渡り合うか、打ち負かしています。そしてローガンが、オーケストレーターの議論への直接的な応答として、フロンティアレベルの困難なタスクに対する答えとして3.5 Proを公にほのめかしていることは、控えめに言っても非常に大きなサインです。真実はおそらくその中間のどこかにあるでしょうが、その中間であっても、これから来るものに対して非常に強気になれるものです。

競合他社の動向とGoogleの圧倒的なエコシステム

その間にも、競争というプレッシャー鍋は熱を増し続けています。再び言いますが、今日にも登場するかもしれないGPT 5.6は、大幅に寛大なプラン制限でローンチされると報じられており、そのタイミングは、自分たちのプランでFable 5へのアクセスを失ったばかりの不満を持つClaudeユーザーをすくい上げることを正確に狙った外科手術的なものです。OpenAIはまた、米国政府との協力関係の深化に関連していると報じられているローンチに先立って、より積極的な安全対策を展開していますが、内部関係者によれば、そのセーフガードは依然としてFableのものほど厳格にはならないとのことです。紙の上では、それがGPT 5.6を真の脅威にしています。しかしOpenAIの立場は、見出しが示唆するよりも揺らいでいます。Microsoftとの関係はひどく悪化しており、OpenAIはGitHubとCopilotの統合から押し出されたと報じられています。AppleとSamsungの状況も横ばいになり、資金の燃焼は残酷なものです。彼らはエージェントワーク、画像、テキストにおいて強力ですが、お金の問題がすべてに影を落としています。対照的にGoogleは、パニックモードに陥っている会社のように振る舞ってはいません。リークの洪水もなく、緊急事態の空気もなく、Fable 5のローンチに対する目に見える反応すらほとんどありません。そして彼らは7月17日に向けてカードを積み上げています。Gemini 3.5 Proは、Claude Sonnet 5、Opus 4.8、Fable 5が現在提供しているものの2倍となる200万トークンのコンテキストウィンドウを備えて出荷されると噂されています。これは巨大なコードベースや長いドキュメントにとって非常に大きなことです。それに並行して、GPT Image 2を玉座から引きずり下ろすことを直接の狙いとした、3.5 Proベースの上に構築された新しい画像生成モデルであるNano Banana Proも登場します。そして、人々が常に過小評価している寛大さという側面もあります。計算してみてください。AI Studioでは3.1 Proで約45回のメッセージが得られます。それだけ聞くと少なく聞こえますが、その上に消費者向けアプリを重ねれば90回になります。パワーユーザーが5時間の制限に一度も触れたことがないと報告しているアンチグラビティ機能、さらにJewelsやその他すべてを加えれば、Flashモデルに触れる前や、アクセスが複数のアカウントにまたがって広がる事実を考慮する前でさえ、Googleのエコシステムから絞り出すことのできる実質的な使用量は、完全に競争相手を圧倒しています。OpenAIやAnthropicがプランの制限を厳しくし、ユーザーをより高価な階層に押しやっている一方で、Googleは事実上コンピューティングリソースを配っています。なぜなら、彼らのビジネスモデルは利益を出すためにすべてのトークンを必要としないからです。AIは、それぞれ10億人のユーザーを持つ十数の製品に組み込まれた機能であって、それ自体が製品ではないのです。そしてその構造的な違いにより、彼らはすべてのクエリで現金を燃やしているライバルたちよりも長生きすることができるのです。

Googleが長期戦を制する理由

唯一の本当に暗い雲は人材の流出です。なぜなら、ノーム・シャジールやシャオのような頭脳をOpenAIに奪われることは、どう取り繕っても痛手だからです。しかしDeepMindは依然として地球上で最も層の厚い研究チームの一つです。そしてGoogleの現在の姿勢には、恐怖を叫んでいるようなものは何もありません。だからこれが私の率直な見解です。3.5 Proは、ほとんどの分野でFable 5に匹敵しつつ、いくつかの重要な分野でそれを打ち負かすか、あるいは全体的にそれを凌駕するかのどちらかです。新しい事前学習のための遅延、Flashの効率化作業、オーケストレーターの兆候、そして荒削りなローンチの後に急速に洗練されたバージョンを続けるというGoogleの歴史的パターン。これらすべてが、遅れをとっている会社ではなく、長期戦を戦っている会社を指し示しています。もちろん、Googleが想像しうる最大のステージで完全に失敗するという可能性もありますが。残り10日です。17日にお会いしましょう。ご視聴ありがとうございました。次回の動画でお会いしましょう。

コメント

タイトルとURLをコピーしました