MAMBA 2

AI研究

拡散モデルがテキストにもやって来る。NVIDIAの新モデルを紹介 ===

画像や動画生成の中核技術である拡散モデルが、テキスト生成にも進出し始めている。NVIDIAの新たなTwo Tower方式は、既存の自己回帰モデルを複製し、一方を凍結した文脈処理用、もう一方をマスク除去型の生成用として再学習する構成である。ブロック単位の並列生成によって高速化を図りつつ、元モデルの性能を高水準で維持する一方、数学やコード生成での低下、ブロックサイズへの強い依存性、メモリ負荷などの課題も明らかになっている。===
NVIDIA・ジェンスンフアン

NVIDIA:新しいエラスティックAIモデル(5080以上対応)

NVIDIAが発表したNeatron Elasticは、1回の学習で複数サイズのAIモデルを同時生成する革新的なエラスティックAIアーキテクチャである。12億、9億、6億パラメータの推論モデルを単一の学習実行から抽出可能にし、ユーザーのGP...
AIニュース

DeepSeekが復活!業界を揺るがすかもしれない新AIモデル

DeepSeekが新モデルV3.2Xを発表し、長時間の複雑なタスクの実行コストを最大50%削減できると主張している。スパースアテンションという技術を採用し、重要な情報のみに焦点を当てることでコストを大幅に削減した。一方、OpenAIのSor...