視覚的推論

8分で理解するGeminiのエージェント的ビジョン

Googleが発表した「エージェント的ビジョン」は、Gemini 2.0 Flashに搭載された革新的な機能である。従来の画像認識タスクをエージェント的なタスクへと変換し、画像のズーム、パン、回転、変形といった操作をPythonコードで実行...

2026.01.28

Google・DeepMind・Alphabet

本動画は、マルチモーダルAIが未知の物体を視覚的に認識し、新たな概念を形成する能力について実験的に検証したものである。AIに手描きの抽象的な図形を見せ、それに名前を付けさせた後、別の画像で同じ物体を再認識できるかをテストする。結果として、A...

2026.01.12

AI研究

本動画は、AI分野における画期的な研究論文「MONET」を解説するものである。MONETは、従来の視覚言語モデルとは根本的に異なるアプローチを採用し、テキスト空間に変換することなく、純粋に視覚的な潜在空間内で推論を行う新しいAIシステムであ...

2025.11.29

AI研究

Gemini 3が明確な世界ナンバーワンモデルとして登場し、あらゆるベンチマークで他を圧倒している。数学、科学、視覚的推論、スクリーン認識など幅広い領域で大幅な進歩を見せ、特に視覚理解とマルチモーダル能力において顕著な飛躍を遂げた。これは「...

2025.11.20

Google・DeepMind・Alphabet

Googleの新しい画像生成モデルNanoBanana 2は、単なる画像編集ツールを超えた能力を示している。破れた紙片から元のメッセージを再構築し、複雑な数学の微積分問題をホワイトボード上で解き、多言語の手書き文字を正確に再現し、落下する物...

2025.11.14

Google・DeepMind・Alphabet

本動画では、Metaの超知能チームによる最新研究「見る前に見ることを学ぶ」論文を解説している。この研究は、言語モデルから視覚言語モデルへの変換において、テキストベースの推論データが視覚理解に極めて重要な役割を果たすことを明らかにした。具体的...

2025.10.05

AI研究

この研究は、大規模マルチモーダルモデル（LMM）が物理法則をどのように理解し推論するかを検証したものである。特に自動運転車のような実世界のシナリオにおいて、AIが未知の物体に遭遇した際の物理推論能力を評価している。ミシガン州立大学の研究者ら...

2025.09.23

LLM・言語モデル