Googleの最新AIモデル開発における苦戦と、新たなアプローチについて解説する。発表が近いとされるGemini 3.5 Proは、先行するAnthropicのFable 5やOpenAIのGPT-5.5、GPT-5.6といった競合モデルに比べ、複雑なタスクでの怠慢さやコーディング能力の不足がリーク情報から指摘されている。一方、Googleは実験的なローカル向けモデルDiffusion Gemmaを公開した。これは画像生成の拡散技術を応用し、256トークンを一括生成することで、従来のタイプライター型生成に比べ最大4倍の高速化を実現する革新的なアプローチである。

Gemini 3.5 Proのリークと競合他社との格差
Googleは2026年に大きな問題を抱えています。これまでのところ、彼らが投入した競争力のある新モデルはGemini 3.5 Flashの1つだけです。しかし、6月に登場するはずのProモデルは、市場に出た時点で手遅れかもしれません。そうです、現在最高峰のモデルであるCloud Fable 5のリリースを基準に考えると、その可能性が高いのです。Fable 5はGPT 5.5を打ち負かし、現時点で他のすべてのモデルを凌駕しています。Googleの新モデルはおそらくこれに対抗できないでしょう。もちろん、GPT 5.6やGPT 6の登場も控えていますが、現在開発中のGemini 3.5 Proに比べると、それらのモデルに対する期待の方が圧倒的に高いのが現状です。
画面に表示されている初期のチェックポイントを見ると、コーディング能力やUI構築能力において、このモデルがまだ目標に達していないことがわかります。これまでに判明しているすべての情報から判断して、AnthropicがFable 5で明らかに首位に立っています。GPT 5.6が2位につけるかもしれませんが、3位について言えば、現時点でGoogleがそれを獲得できると自信を持って言える段階にすらありません。
それは彼らを信じていないという意味ではありません。私はただ正直に話しているだけです。なぜなら、中国のオープンソースモデルが現在Geminiと十分に渡り合っており、時にはGemini以上の結果を出しているからです。これは大きな問題であり、特に現在登場を控えているモデルがすでに期待外れに見える状況ではなおさらです。
もちろん、Googleが長期的に勝てないと言っているわけではありません。彼らは配信プラットフォームや収益の面で巨大な優位性を持っています。しかし、少なくとも現時点では、彼らのモデル自体に大きな問題があります。推論、思考、そしてコーディングの面でトップに立てるような強力なモデルを作れなければ、彼らが提供しているAI Studioや新しいアンチグラビティアプリケーションといった開発者向けプラットフォームは、多くの人に使われなくなってしまうでしょう。OpenAIがそれをスーパーアプリとして構築し続けているため、多くの人がCodexに押し寄せていますし、多くの人が当然のようにCloud Codeを気に入っています。
いくつかの初期のリーク情報によると、Gemini 3.5 Proは6月中旬頃に登場する予定であり、Googleは明らかに強いプレッシャーを感じているため、非常に積極的にモデルのファインチューニングを行っています。Fable 5はゲームのルールを完全に変えてしまいました。以前はGPT 5.5やOpus 4.8に対抗するためにファインチューニングを行っていましたが、今やハードルは少し高くなり、Fable 5だけでなく、GPT 5.5から大幅にアップグレードされるGPT 5.6やGPT 6とも競合できるモデルを作らなければならなくなりました。
新モデルの課題と可能性
以前にもいくつかの検証結果をお見せしましたが、このモデルの最大の課題は、長くて複雑なタスクにおける怠慢さ、つまり手抜きにあります。そして、それこそがFable 5の最も得意とする領域なのです。タスクが長く、複雑になればなるほど、Fable 5はそのタスクを圧倒的な精度でこなします。Googleは怠慢さの問題を克服できていないため、これに対抗するのは難しいでしょう。
しかし、すべてが否定的なわけではありません。Gemini 3.1 Proと比較して、この新しいモデルはより強力なビジョン機能、画像生成、より優れたSVG生成、そしてマルチモーダル理解を備えていることが期待できます。したがって、新しいモデルがGemini 3.1 Proからのアップグレードになることは間違いありません。それは当然のことですが、多くの人が飛びつくような最高のモデル、あるいは最先端のフロンティアモデルにはならないでしょう。
また、コンテンツのフィルタリングや安全性の制限がより厳しくなるという初期の兆候もあります。これがどう影響するかはわかりません。おそらく、Anthropicのモデルのようにサイバーセキュリティ機能が強化されたため、そのような制限が設けられているのかもしれません。
さらに、価格はGemini 3.1 Proよりも高くなる見込みです。これは問題になる可能性があります。なぜなら、AnthropicがリリースしたOpus 4.8は旧モデルとほぼ同じ価格帯でありながら、明らかに強力なモデルだからです。そのため、Geminiにとっては大きな痛手となる可能性があります。現在の予測では、先ほど申し上げたように6月中旬のローンチが予定されており、今から約10日後、あるいは実際の発表タイミングによっては5日後になるかもしれません。
ここで、Gemini 3.5 Proに切り替えるべきかという疑問が生まれますが、私はそうは思いません。少なくとも現時点ではその必要はないでしょう。
みなさんにこれをお見せしたいのですが、これは実際に新しいモデルをテストしている多くの人たちに共通する見解です。これらは初期のテスターによる意見ですが、彼らはこのモデルが良くないと指摘しています。ここで重要な点として、Gemini 3.1 Proがリリースされたのは2月でした。そして今は6月です。つまり、常に新しいモデルを投入し続けているOpenAIやAnthropicとは異なり、Googleのリリース間隔は加速しておらず、非常に静かです。
Gemini 3.5 Proはベンチマークでは良い数値を出すだろうと言われています。しかし、実際の使用、特にコーディングにおいては実用性に欠けるものになるでしょう。これは、私たちがこのモデルにある程度予想していたことでもあります。過去にもGoogleは、ベンチマークで見栄えが良く、SVGコードの生成などでは非常に優れた結果を出すモデルを作ってきました。しかし、人々が実際にそれを使用すると、モデルが手抜きをしてしまい、長期的なタスクでは本当に信頼することができません。これは、どうやらGoogleがまだ解決できていない共通の課題のようです。
その事実を裏付けるように、ある初期のテスターが実際にモデルをテストした例があります。道路上の黄色いSUVのシンプルなピクセルアートを作成するというタスクでした。GPT 5.5は当然のように難なくこれをこなしますが、Googleのモデルは失敗してしまいます。かつては得意としていたSVGコードやピクセルアートのようなものでさえ、もはやうまくこなせなくなっているのです。
もちろん、これらは初期のテストであり、初期のリーク情報です。Googleは私たちがまだ知らない何かを準備している可能性もありますが、それがFable 5と競合できるとは到底思えません。Googleはローンチを数週間ほど延期し、少なくともGPT 5.6のレベルに対抗できるようにモデルをファインチューニングする必要があるかもしれません。Fable 5に届かなくても構わないのは、Fable 5が長期的に運用されるモデルではないとわかっているからです。6月22日に彼らはそのモデルを回収する予定です。なぜなら、非常に強力なモデルであり、一般ユーザーが運用するにはコストがかかりすぎるからです。ですから、GoogleはFable 5については心配する必要がないかもしれませんが、初期のリークが正しければ同様に強力なモデルになるであろうGPT 5.6については、依然として警戒する必要があります。
みなさんはどう思いますか。Googleはこれを成し遂げられると思いますか。彼らは現時点でAnthropicやOpenAIと競合できると思いますか。ぜひコメント欄で教えてください。
次に進む前に、私たちは「Universe of AI」ニュースレターを開設しました。自分で探し回ることなく最新のAIニュースを把握したい方は、概要欄にリンクがありますので、ぜひ見逃さないようにチェックしてください。
Googleが静かに公開したDiffusion Gemmaの革新性
Googleは今日、ひっそりとあるものを公開しました。それは彼らの通常のモデルリリースとは少し毛色が異なるものです。「Diffusion Gemma」と呼ばれるもので、最大の特徴は、通常のモデルよりも最大4倍高速にテキストを生成できるという点です。しかし、なぜ速いのかという理由の部分が非常に興味深く、ローカルAIが今後どこへ向かうのかを示しています。
多くのモデルが行っている一般的な処理について説明します。それらのモデルは、タイプライターのように左から右へ、一度に1単語ずつ文字を書いていきます。そして、各トークンは1つ前のトークンが生成されるのを待ちます。クラウド環境であれば、サーバーが同時に何千人ものユーザーのリクエストを処理しているため、ハードウェアが常に稼働しており、それでも問題ありません。しかし、自分自身のためだけにローカルでモデルを実行する場合、GPUはほとんどの時間、次の文字が入力されるのを待っている状態になります。
Diffusion Gemmaはその仕組みを覆します。単語ごとに書く代わりに、AI画像ジェネレーターのアイデアを借りて、256トークンの塊を一気に下書きするのです。最初はランダムなノイズから始まり、モデルが数回にわたって処理を重ねることで、確信のあるトークンを確定させ、それらを使って残りの部分をクリーンアップし、テキストが一貫した内容に落ち着くまで調整を行います。
Google自身の表現を借りれば、タイプライターと印刷機の違いのようなものです。一方は一度に一文字ずつ刻印し、もう一方はページ全体を一度に印刷します。それがこの速度のアドバンテージです。そして数値もそれを裏付けています。H100では毎秒1,000トークン以上、5090では700トークン以上を記録しています。また、これは260億パラメータの混合エキスパートモデルですが、実際に一度に使用するのは約38億パラメータのみです。つまり、量子化すれば18ギガバイトのVRAMに収まるため、ハイエンドのコンシューマー向けグラフィックボードがあれば、実際にこのモデルを動かすことができます。
ここで正直にお伝えしたいことがあります。Google自身もこの点について率直に認めています。現時点でこれは実験的なモデルであるため、出力のクオリティは標準的なGemma 4よりも低くなっています。したがって、可能な限り最高の出力を重視する場合は、引き続きGemma 4を使用すべきです。
Diffusion Gemmaは、特定の種類の作業に向けて構築されています。通常のモデルは左側、つまり過去の文脈しか見ません。そのため、答えがそれ以降に出てくる内容に依存するようなタスクにおいて、このモデルは非常に適しています。インライン編集やコードの補完、さらにはマッチング構造などが挙げられます。Googleは実際に、数独を解くようにファインチューニングされたバージョンを披露しました。左から右へ生成する通常のモデルは、すべてのマス目がまだ書いていない他のマス目に依存しているため、数独を解くのが本当に苦手です。つまり、この双方向の処理こそが、このモデルが機能する最大の理由なのです。
注意すべき点が1つあります。この速度の優位性は、本当にローカルなシングルユーザー環境のためのものです。大量のリクエストをバッチ処理する大規模なクラウドサーバーにおいては、従来のアプローチがすでに効率的です。そのため、クラウドではメリットが少なく、むしろコストが高くなる可能性さえあります。したがって、これはサーバーファームではなく、みなさんの手元にあるマシンのようなローカルデバイス向けに特化して作られたものです。
実際に試してみたい方は、すでに公開されています。ウェイトはApache 2.0ライセンスのもと、Hugging Faceで公開されています。そのため、完全にオープンであり、vLLM、MLX、そしてTransformersを通じて動作します。もしあなたのマシンに5090が眠っているなら、週末にダウンロードして自分で試してみる価値のあるものです。
ここでの要点は、4倍という数字そのものよりも、その方向性にあります。ローカルAIは常に「一度に1単語ずつ生成する」という仕組みがボトルネックになっていましたが、Googleは今回のモデルでその回避策を示しました。現時点では明らかに実験的なものです。クオリティはまだ十分ではありませんが、このアプローチ自体が新しいのです。
本日の動画は以上です。チャンネル登録を忘れずにお願いします。私たちの新しいニュースレター universeai.behive.com のフォローと、メインチャンネルである「World of AI」の登録、そしてXでの「Universe of AIZ」のフォローによる応援もよろしくお願いします。
それでは、また次回の動画でお会いしましょう。


コメント