AIが体を手に入れた(今週、すべてが現実になる)

AIニュース
この記事は約18分で読めます。

AIが物理的な体を得て現実世界に影響を与え始めた最新動向を解説する。リアルタイムでの動画編集技術や、40分間連続で複雑なタスクをこなす自律型ロボット、失敗から学習して自己補正するシステムなど、AIの急速な進化を具体例とともに紹介。また、Metaによる脳波からテキストへの変換技術や、NVIDIAのロボット用シミュレーション環境構築、Googleの高効率な画像・動画生成モデルなど、各社の最新リリースから、AI技術が画面の枠を超えて実生活や産業に普及していく過程を詳述している。

L'IA a maintenant un corps (cette semaine tout devient réel)
🚀 Apprenez l'IA sous toutes ses formes et rejoignez la communauté VISION IA ! 📧 Rejoignez ...

今週のAI最前線

今週もまた、AI分野がかなり大きく進歩しました。まるでSF映画の冒頭を見ているかのように、リアルタイムで動画を編集できるAIが登場しました。また、40分間休むことなく物理的なタスクをこなし続けるロボットも現れています。つまり、今週も急いで確認すべきニュースが山積みですが、どれも同じひとつの物語を語っています。AIは画面から飛び出し、物体に触れ、自分で間違いを修正し、もうすぐあなたを抱きしめるようになるということです。これはもう未来の話ではありません。先週起きたことです。今日は話すべきことがたくさんあります。

皆さん、こんにちは。今週もこのニュースのコーナーでお会いできて嬉しいです。この手の動画ではよく言っていますが、もしあなたがまだAIの進化はそれほど速くないとか、AIはただ質問に答えるだけのChat GPTのような単なるチャットボットだと思っているなら、この動画はあなたにとって大きな発見になるはずです。本題に入る前に少しだけお知らせさせてください。このチャンネルを気に入っていただけたら、ぜひチャンネル登録をお願いします。私の活動の大きな励みになります。また、見逃せない毎日の最新情報を無料でお届けするニュースレターも配信しています。リンクは概要欄にあります。

リアルタイム動画編集技術の衝撃

それでは、今週の最初のニュースであるライブ編集についてお話ししましょう。未来のディストピア映画を思わせるような新しいテクノロジーです。この名前がすべてを物語っていますね。レンダリング後やポストプロダクションではなく、動画の再生中に直接編集を行うのです。計算が終わるのを待つ必要はありません。完全にリアルタイムです。大統領がテレビの生放送で話している最中に、AIがそのスピーチをリアルタイムで修正できてしまうようなものです。

仕組みとしては、元の動画と一緒に例えば天気を雪に変えてとか、キャラクターの服を置き換えて、あるいは背景のこの物体を消してといったプロンプトを入力すると、システムがそれを1秒間に約13フレームの速さで1フレームずつ実行していきます。技術的な面では、その原理はかなり優れています。これはストリーミング用の因果関係アーキテクチャと呼ばれるものです。ここでは技術的な詳細には踏み込みませんが、基本的には4回の推論ステップだけで十分なのです。

もちろん、正直に言うと、現在はまだこの技術の初期段階です。今はまだ13 FPS、つまり1秒間に13フレームしかありません。これは私たちが本物の動画に期待する滑らかさの基準を下回っています。24や30 FPSには届いていません。しかし、インタラクティブなアプリケーションや拡張現実、あるいは撮影中のライブ編集などには、すでに十分に使えるレベルです。何より重要なのは、これが最初のステップであり、ここから数ヶ月で飛躍的に改善されることは間違いないということです。

コードはオープンソースで公開されています。完全なモデルのサイズは17 GBで、それほど大きくありません。ミドルクラスのGPUで動かすことができます。正直なところ、半年もすれば一般向けのソフトウェアに組み込まれるようなツールです。そうなれば、これが最初はただの研究論文だったことなど誰も覚えていないでしょう。

画面を飛び出し物理世界で動くロボット

さて、リアルタイムで動画を編集できるのは確かに印象的です。映画のようですが、それでもデジタルの世界の話ですよね。画面上でピクセルが動いているだけです。今週本当に状況を変えたのは、AIが画面から飛び出して物理的な世界で行動を起こしたことです。

続いては、Omnicontactについてお話しします。これは、ヒューマノイドロボットに長時間の複雑なタスクを連続して行わせるための新しいシステムです。ロボットが何か動作をして終わるような、30秒程度のタスクの話ではありません。もっと完全なタスクです。つまり、箱に向かって歩き、かがんで箱を掴み、持ち運び、また置き、カートを押し、バランスを崩すといった一連の動作を、人間の介入なしに40分間続けるのです。

これが解決する問題は、ロボット工学において本当に根本的なものです。ロボットは歩くことも、物を掴むこともできます。個々のスキルはうまく機能します。しかし、それらを途切れることなく連続して行うことは、これまで全く別の次元の難題でした。この問題を解決するために、Omnicontactはコンタクトフローと呼ばれる概念を導入しました。これは、ロボットの体がどのように動くべきか、時間の経過とともにどこで物体と接触すべきかを記述したコンパクトな計画です。言ってみれば、物理的な動きのための楽譜のようなものです。

結果は明白です。箱を運ぶタスクで98.7%の成功率を達成しました。工場では非常に役に立つはずです。さらに面白いのは、このシステムを視覚モデルと接続して、散らばった箱をハート型に整理したり、並べて文字を作ったりといった意味を伴うタスクもこなせることです。ロボットが周囲の状況を見て、理解しているのです。この分野ではよくあることですが、コードとデータセットはすべて公開されています。関連分野の方々はぜひチェックしてみてください。

毎週時間が経つにつれて、私たちは本当の仕事をするロボット、つまり皆さんの家にいるロボットへと少しずつ近づいています。より自律的で、より有能なロボットです。

安全性と効率化を巡るAIモデルの進化

さて、ここ数日で明らかになったのは、純粋なパワーだけでは不十分であり、場合によってはそれが仇となることもあるということです。ご存知かもしれませんが、Anthropicが公開した中で最も強力なモデルであるClaude Fable 5は、18日間にわたって外部から遮断されていました。公式な理由は、Amazonの研究者がモデルの安全策を回避し、ソフトウェアの脆弱性を特定させる方法を発見したためでした。そして先週の6月30日、アメリカ側がようやく制限を解除しました。

Fable 5は7月1日に復活しましたが、基本的には99%のケースをブロックする新しい安全分類器を備えています。この復活の代償として、より厳格な安全策が講じられ、かなりの数の誤検知が発生しています。完全に正当なコーディングやデバッグのタスクがブロックされ、Opus 4.8にリダイレクトされるようになっています。なかなか矛盾していますよね。利用制限も厳しくなっています。実際のところ、すべてがずっと厳格になりました。報告によると、一部のユーザーはたった1回か2回のプロンプトで利用枠を使い果たしてしまうそうです。正直なところ、戻ってきたモデルは禁止されたものとは別物です。テストしてみればすぐにわかります。

しかしその一方で、同じ日にAnthropicはAIエージェントにとって非常に重要なミドルクラスの新しいモデル、Claude Sonnet 5をリリースしました。そしてその結果は、このカテゴリのモデルに期待される水準をはるかに超える非常に興味深いものでした。エージェント的なコーディングのベンチマークであるSWE-bench proにおいて、Chat GPT 5.5が58.6%で頭打ちになる中、Sonnet 5は63.2%を達成しました。しかも価格は大幅に安く、入力トークン100万あたり3ドルでOpen AIの5ドルに対して割安ですし、出力は100万トークンあたり15ドルでOpen AIの30ドルに対して半額です。さらに8月末までは、100万トークンあたり2ドルというさらに低い導入価格が設定されています。

これらのことからわかるのは、AI開発の競争はもはや純粋なパワーや規模だけを競うものではなくなり、効率性がパフォーマンスと同じくらい重要なセールスポイントになりつつあるということです。このチャンネルをご覧の方なら、私の言っている意味がわかるでしょう。DeepSeekについて取り上げた私の最近の動画を見ていただければ、まさに今ここで起きていることだと気づくはずです。

ロボットが自身の失敗から学習するシステム

そして、経験とともにスキルが蓄積していくという継続的な改善の論理は、言語モデルだけにとどまりません。ロボティクスの分野にも再び真正面から影響を与え始めています。

ここで話題を変えて、Nvidiaが発表したAspireについてお話しします。これは今週のニュースの中で私が特に気に入っているもののひとつです。Aspireは、ロボットが自身の失敗から学び、その教訓のひとつひとつを再利用可能なスキルへと変換できるシステムです。Claude CodeやCodex、あるいはHermesを使ったことがある人なら、スキルの概念をご存知でしょう。AIエージェントが問題を解決した際、その解決策を後で再利用できるようにスキルとして保存しておくというものです。つまり、何かを学べば、その後はずっとそれができるようになるわけです。

Aspireは、この論理をそのまま物理的なロボットに適用しています。例えば、ロボットがタスクに挑戦して失敗したとします。しかし、このシステムは単なる一般的な失敗として処理するわけではありません。この新しい手法では、認識プロセスの呼び出しごとの詳細なトレースを分析します。つまり、失敗の正確な原因を特定してコードを修正し、後で再利用できるスキルのライブラリにすべて保存するのです。

Nvidiaのロボット工学研究ディレクターであるジム・ファンは、これをロボット工学のパラダイムの完全な転換だと説明しています。彼によれば、今後の学習は勾配降下法、つまりTransformer単体で行われるのではなく、スキルの洗練を通じて行われるようになるということです。

データもそれを裏付けています。両手を使った物体の移動タスクにおいて、成功率は20%から92%へと跳ね上がりました。また、学習中に一度も見たことのない長時間のタスク、つまりロボットが訓練されていない状況において、従来の手法が4%で頭打ちだったのに対し、Aspireはゼロショットで31%を達成しました。もちろんまだ完璧には遠いですが、成長曲線はかなり明確です。ロボットが問題に直面すればするほどライブラリが充実し、新しい状況に適応できるようになるのです。

仕事をする人間と同じように、ロボットも経験を積む必要があるということです。まさにそれと同じですね。コードはすでに7月1日にオープンソース化されています。そして注目すべき詳細は、このシステムの頭脳が、数百万トークンのコンテキストウィンドウを持つClaude Codeを通じたClaude Opus 4.6だということです。私の動画をよく見ている方ならご存知かもしれませんが、私自身も特定のタスクにはまだOpus 4.6を使っています。Anthropicでさえ再現するのに苦労している本当に素晴らしいモデルで、そうしているのは私だけではありませんが、それはまた別の話ですね。

感情を読み取る人型コンパニオンロボットの登場

さて、学習し、自己補正し、時間をかけてスキルを蓄積するロボットが登場しました。技術的な観点からは非常に魅力的ですが、今週ある中国企業が、人間とロボットの関係を全く違う方向へと押し進める決定を下しました。

UBTECHは6月30日、深センで新しいロボットシリーズU1を発表しました。ご覧の通り、これは産業用ロボットでもサービスロボットでもありません。コンパニオンロボットです。

どんな未来が待ち受けているか、もうお分かりですね。男性版は183センチ、女性版は168センチで展開されており、企業によれば、毛穴や血管、指紋などを備え、人間の肌の質感を再現したシリコン製の皮膚を持っています。そのディテールの細かさは少し不安になるほどです。カタログには3つのバリエーションがあります。上半身のみのU1 Littleは約1万7000ユーロから、全身版のU1 Proは約3万5000ユーロ、そして最もリアルなU1 Ultraは100万人民元、日本円にして約15万ユーロという価格設定です。

このロボットには、エモーショナルAIと呼ばれる特殊なAIが搭載されています。これはRockchipのプロセッサー上でローカルに動作し、目の前にいる人の20以上の感情状態を90%の精度で認識できると謳われています。すべてのデータはデバイス内に保持され、クラウドへの接続はありません。また88の自由度を備えており、人間の基本的な動きの約90%を再現するのに十分です。さらに過去の会話を記憶する長期記憶システムと、よりリアルな対応のために話しかけられるのを待たずに反応するインタラクションエンジンも搭載しています。

この数字を聞いて驚かないでください。発売初日に1万3000件以上の予約注文があり、需要が多すぎたためUBTECHはわずか3日で予約の受付を停止せざるを得ませんでした。初回の出荷は今年の9月16日を予定しています。

お分かりのように、ここでUBTECHがターゲットにしているのは熱狂的なファンやコレクターではありません。現実の市場を狙っているのです。例えば彼らが挙げたデータによれば、現在中国には一人暮らしの成人が9000万人以上います。会社は、メンタルヘルスのプログラムのために、2026年に100台のカスタマイズされたロボットを無料で提供することまで計画しています。これはまだ最初のバージョンに過ぎません。これからもっとリアルになり、よりインタラクティブになり、価格も下がっていくでしょう。ですから問題は、これらのロボットが普及するかどうかではなく、人間関係にどのような変化をもたらすかということです。皆さんの考えをぜひコメント欄で教えてください。

脳波をテキスト化する技術の躍進

さて今、人間と機械の境界線が曖昧になっているのはロボットの側だけではありません。脳の側でも曖昧になりつつあります。次のニュースはMetaからのもので、久しぶりの登場ですね。Brain to Qwertyバージョン2は、脳の活動をテキスト入力に変換する新しいシステムです。

キーボードで文字を打つのは面倒だと感じることがありますよね。では、もしテクノロジーがあなたの思考を書き出し、脳から直接機械へと思考をテキストに変換してくれたらどうでしょうか。このシステムは、神経活動によって生じる磁場を測定する脳磁図という技術に基づいています。具体的には、ユーザーがキーボードでテキストを入力している間、スキャナーがその脳波信号を記録します。その後、エンドツーエンドのディープラーニングシステムであるAIモデルが、その信号を解読して入力された内容を再構築することを学習します。

バージョン2は、それぞれスキャナーの中で約10時間過ごした9人のボランティアから得られた約2万2000の文章を使ってトレーニングされました。結果として、単語レベルで平均61%の精度を達成し、最も成績の良かった参加者では70%のピークを記録しました。つまり、78%の確率で機械が彼らの思考を正しくテキストに書き起こしたということです。完璧ではありませんが、以前の非侵襲的な手法が8%で頭打ちだったことを考えれば、これはとてつもない飛躍です。

パフォーマンスの曲線はトレーニングデータの量に比例して上昇し続けており、頭打ちの兆候は見られません。これは、より多くのデータと優れたセンサーがあれば、さらに先へ進めることを示唆しています。将来的には、侵襲的な機器を使わずに思考だけでコミュニケーションできるようになることは間違いないでしょう。私たちは本当に2026年を生きています。AI、ロボット、テレパシーなど、どこを見渡しても、そしてこの動画で言及していない他のすべての分野でも、物理学や量子力学など多くの分野で進歩があり、私たちはお気に入りのSF映画の世界へと向かっているように感じますね。

Metaは両バージョンの完全なトレーニングコードを公開しました。現在の大きな障壁はハードウェアです。この実験で使用されたMEGスキャナーは机ほどの大きさの機器であり、研究室の外では使えません。しかし最終的な目標は、ポータブルセンサーへの小型化です。それが実現した日には、インターフェースという概念そのものが変わるでしょう。キーボードもタッチスクリーンもなくなり、あなたの神経活動が直接テキストに変換されるだけになるのです。今後の進展が非常に楽しみな技術です。

ロボット学習を変革するシミュレーション技術

それでは次へ行きましょう。Metaが人間の脳と機械のインターフェースを探求している一方で、Nvidiaはロボット工学のもう一つの根本的なボトルネック、つまりロボットのトレーニングという課題に取り組んでいます。

それがSim Foundryです。この技術を理解するために先ほども少し触れましたが、現在の現実世界でロボットをトレーニングするのは非常に遅く、コストがかかり、そして危険です。本物のキッチンや実際の組み立てラインで、ロボットに何千回も失敗させるわけにはいきません。Sim Foundryは、この問題を非常にエレガントに解決します。

スマートフォンで実際の風景を撮影すると、システムがそれをロボットのトレーニングに使える物理的に正確な3Dシミュレーションへと変換してくれます。計算にかかる時間はオブジェクト1つにつき約5分です。撮影した風景のデジタルツインを生成し、現実のものとは少し異なるバリエーションを自動的に作成します。これを研究者たちはデジタルカズン、つまりデジタルのいとこと呼んでいます。

これの利点は2つあります。ロボットは特定のオブジェクトを暗記するのではなく、汎用化することを学ぶため、どんなオブジェクトを与えられてもタスクをこなせるようになるのです。結果もこのアプローチの正しさを証明しています。実際、シミュレーションでのパフォーマンスと現実でのパフォーマンスの相関関係は0.911に達しています。つまり、シミュレーション内で成功したロボットは、現実世界でも成功する可能性が極めて高いということです。

ここで、先ほどからお話ししてきた点を一つ一つ結びつけてみると、全体像がかなりはっきりしてきます。Nvidia Aspireで未来のロボットのスキルを構築し、ここSim Foundryでトレーニング環境を構築しています。そして新しいシミュレーションの世界であるIsaacを使えば、そこにすべてのロボットを送り込むことができるのです。Nvidiaは、あらゆるロボットをトレーニングするための未来のエコシステムを構築している最中です。正直なところ、彼らは非常に良いポジションにいます。この分野を少しでも追っていれば、AI分野に加えてロボット分野も彼らが支配することになるだろうとわかるはずです。

高効率を追求するGoogleの最新モデル

他の研究所が純粋なパフォーマンスの限界を押し広げようとしている中、Googleは落ち着いたアプローチを取ることにしたようです。Googleは、効率性を重視した2つの新しいモデルを発表しました。

1つ目はNano Banana 2 Liteです。これはGoogleの画像生成モデルの中で最も高速かつ低コストなものです。1K解像度の画像を約3セント、わずか4秒で生成できると発表されています。大雑把に言って、標準のNano Banana 2の半額です。確かに品質は一段階落ちますが、スピードと価格の面では、高スループットのシステムにとって比類のないものとなっています。短時間で数十、数百の画像を生成する必要がある場合、私の知り合いにもそういう人はたくさんいますが、状況を一変させるような価格設定です。

2つ目のモデルはGemini Omniflashです。これは動画の生成・編集モデルで、6月30日にパブリックプレビューとしてリリースされました。動画を生成した後、自然言語で指示を出して段階的に編集していくことができます。モデルは指示の間もシーンの文脈を保持しています。つまり、毎回すべてをゼロから再生成するわけではないということです。単にプロンプトを打ち直すだけではない、現在の動画編集にはなかった真の反復編集が可能になっています。

生成コストは720pで動画1秒あたり約10セントです。Googleはこれら2つのモデルを連携させることを推奨しています。まずNano Banana 2 Liteを使って数セントでベースとなる画像を生成し、その後Omniflashでアニメーション化するのです。5秒の製品動画なら約50セント、10秒の動画なら1ユーロ強で作ることができます。価格はかなり下がってきており、これをテストするために、現在Google Flow上で誰でも無料でアクセスできるようになっています。1日に数十枚の画像と、2から3本の動画というかなり寛大な制限が設けられています。制限は毎日リセットされるので、テストしてみたい方は今がチャンスです。無料ですからぜひ試してみてください。

技術の波に乗り遅れないために

さて、いつものことですが、たった1週間の間にAIの分野では物事がものすごいスピードで進んでいるのがお分かりいただけたと思います。過去2年近くにわたって、毎週これほどの進歩を主張できる分野が他にあるでしょうか。私は知りません。

しかし今週、性能が向上しているこれらのニュースすべてに共通している点があります。それは私たちがすでに知っていたことです。共通しているのは、AIが画面から飛び出し、物体に触れ、操作し、物理的な世界に適応しているということ。そして何より、いつものようにますます身近になっているということです。コストは下がり、モデルは小型化し、コードはオープンソース化され、半年前までは研究室だけのものだった技術が、今では皆さんのグラフィックボードで動くようになっています。

これらのツールを理解している人と、ただ通り過ぎるのを眺めているだけの人との差は、あっという間に広がっていくでしょう。重要なのはすべてをマスターすることではなく、今何が起きているのかを理解することです。なぜそれが起きているのか、そしてそれを自分自身の生活、仕事、個人的なプロジェクトでどう具体的に活用できるかということです。

もしあなたが、自分の職業であれ創造性であれ、あるいは単なる世界への理解であれ、これらのテクノロジーが自分の日常を変えると感じているなら。そして、この変革の良い側に、歴史の進む側にいたいと考えているなら、あなたにぴったりのものがあります。

数ヶ月前から、私はユニークな学習プログラムを構築してきました。AIのあらゆる側面をお教えするものです。私が知っていることのすべてを皆さんにお伝えするために作成し、考え抜いたコースです。Chat GPTやGoogleのGemini、Elon MuskのGrok、ClaudeなどのAIモデルについて教えるだけでなく、最も重要なこととして、それらをあなたの生活や仕事、プロジェクトにどう具体的に組み込むかをお見せします。あなたが会社員であれ、フリーランスであれ、起業家であれ、あるいは定年退職者であれ関係ありません。そう、私たちのコミュニティにはたくさんの退職者の方がいて、彼らも日常的にAIを活用しているのです。

最近、この講座の過去最大のアップデートを公開しました。少し前からお話ししていましたが、ついに完成し、オンラインで公開されています。それはN8Nを使ったAIによる自動化に完全に特化したモジュールです。言い換えれば、AIエージェントの作成、つまりあなたのために働き、あらゆることをやってくれる仮想の従業員を作る方法です。要するに、あなたに何時間もの膨大な時間を節約をもたらしてくれます。

すでに6,000人から7,000人以上の方がこのプログラムに参加してくださっています。たくさんのご支援に感謝します。最後にお伝えしたいのは、開発者である必要も、技術的な知識を持っている必要もないということです。分かりやすい動画レッスンと実践的な具体例を使って、一歩一歩あなたをサポートしながら、AIに関するあらゆることを学んでいきます。

最後になりますが重要な点として、今日ご参加いただければ、追加費用なしで将来のすべてのアップデートにアクセスできます。私がお教えしたいことすべてへの一生涯の無制限アクセスです。月額料金ではなく、一度きりの支払いで済みます。買い切り型で、私が常に、そして今この瞬間も行っているすべてのアップデートに生涯アクセスすることができます。

ご興味があれば、動画の下にリンクがあります。概要欄か固定コメントのリンクからご参加ください。いずれにせよ、Visionプログラムで皆さんをお迎えできることをとても楽しみにしています。

ここまで動画を最後までご覧いただき、本当にありがとうございました。また次回の動画ですぐにお会いしましょう。それではまた。

コメント

タイトルとURLをコピーしました