テキスト生成

AI研究

拡散モデルがテキストにもやって来る。NVIDIAの新モデルを紹介 ===

画像や動画生成の中核技術である拡散モデルが、テキスト生成にも進出し始めている。NVIDIAの新たなTwo Tower方式は、既存の自己回帰モデルを複製し、一方を凍結した文脈処理用、もう一方をマスク除去型の生成用として再学習する構成である。ブロック単位の並列生成によって高速化を図りつつ、元モデルの性能を高水準で維持する一方、数学やコード生成での低下、ブロックサイズへの強い依存性、メモリ負荷などの課題も明らかになっている。===
AI画像

ChatGPT Images 2.0の紹介

本動画は、OpenAIによる新たな画像生成モデル「ChatGPT Images 2.0」の発表と、そのデモンストレーションを実況・検証した内容である。発表では、画像の自然な仕上がりや、モデルが生成前に思考する「思考モード」、そして多様な言語...
AI研究

拡散LLMがついに登場 これがTransformerの終わりなのか

自己回帰モデルであるGemini、GPT、Claudeは、トークンを順次生成する仕組み上、本質的な遅延が避けられない。拡散モデルはシーケンス全体を並列生成することでこの課題を解決し、最大10倍高速な推論を実現する。Inception Lab...
AI画像

OpenAIの新GPT Image 1.5がGoogleのNano Bananaを圧倒?最高の画像生成モデルなのか?

OpenAIが新しい画像生成モデル「GPT Image 1.5」をリリースし、GoogleのNano Bananaを大きく凌駕する性能を実現した。従来のOpenAI画像生成モデルが抱えていた黄色がかった画質、キャラクターの一貫性の欠如、テキ...
中国

Qwen 3 Omni — すべてをこなすオープンソースAIモデル

この動画では、Alibabaが開発したQwen 3 Omniという最新のマルチモーダルオープンソースAIモデルについて詳細に解説している。このモデルは動画、画像、テキスト、音声を同時に処理でき、テキストと音声のストリーミング応答を生成可能で...
Google・DeepMind・Alphabet

Google、Gemini 2.5 Flash Image モデル(Nano Banana)ライブストリーム配信

GoogleがGemini 2.5 Flash Image(通称Nano Banana)モデルのライブストリームを実施し、AI Studioでの画像生成・編集機能をリアルタイムでデモンストレーションした。開発者たちがバイブコーディングを駆使...