推論

再帰的自己改善・RSI

AIエージェントが自身のハーネス最適化をコーディングする

AIエージェントの外部構造であるハーネスの自動最適化に関する最新研究の解説である。固定されたLLMの周囲に構築されるプロンプトやツール、メモリなどの構成要素を、AI自身が確率的に変更して自己進化させる手法の有効性を検証している。実験の結果、AIによる自動ハーネス進化は特定のベンチマークに対する過学習を引き起こしやすく、未知のタスクに対する汎用的な性能向上には寄与しないことが判明した。単に計算資源を試行回数の増加に充てる並行サンプリングの方が高い成果を出しており、現在の局所的な最適化アプローチの限界と、真の汎用的なエージェントアーキテクチャ発見に向けた今後の課題を浮き彫りにしている。
Meta・マイクザッカーバーグ

モデルの爆発的増加:GPT 5.6 Sol、Grok 4.5、Meta Museがルールを書き換える

OpenAIの新しいGPT 5.6シリーズであるSol、Tera、Luna、さらにXAIのGrok 4.5、MetaのMuse Sparkといった最新AIモデルの性能とコスト効率について解説する。高価な最高性能モデルに迫るスコアを、はるかに安価なコストで叩き出す新モデル群の登場により、AI業界の競争状況が大きく変化していることを示す。また、バイブコーディングや自律的エージェント、推論タスクにおける各種ベンチマーク結果を比較し、モデルの自己改善やジェイルブレイクの危険性についても言及する。AIモデルの進化はまだ初期段階であり、今後の計算資源の拡充によってさらなる飛躍が期待できることを論じる。
AIエージェント

ローカルモデルについて不満を言わせてほしい

オープンウェイトのAIモデルは素晴らしい技術だが、それを消費者向けのハードウェアでローカル稼働させるという考えは非現実的である。高性能なモデルを動かすには莫大なVRAMが必要であり、高額な機材費や電気代、並列処理の制限などを考慮すると、個人環境での運用は理にかなっていない。ローカル環境での実行にこだわるのではなく、クラウドホスティングの競争力を活かしてオープンウェイトモデルを利用することこそが、効率的で現実的なアプローチである。
Anthropic・Claude・ダリオアモデイ

Claudeの心の中心には何があるのか?

人間の心が意識と無意識に分かれているように、AIモデルの内部にも同様の構造が存在するかを探求した内容である。AIモデルClaudeのニューラルネットワークを分析し、言葉として表現可能な神経活動のパターン群であるJ空間を特定した。数学の解答プロセスや特定のイメージを保持する実験を通じて、J空間が段階的な推論や思考を処理する精神的な作業空間として機能していることを実証している。また、この内部思考を監視することでAIの不正な振る舞いを検知できる可能性や、AIの意識という哲学的問いについても考察し、より安全で有益なAI開発への道筋を提示する。
OpenAI・サムアルトマン

GPT-6は遅れている。OpenAIが語らない事実

OpenAIが開発中の次世代モデルであるGPT-6の現状と遅延の理由、そして今後の展望を解説する。GPT-6は単なるアップデートではなく、アーキテクチャから再構築された全く新しいベースモデルであり、永続的なメモリ、巨大なコンテキストウィンドウ、組み込みの推論ループといった革新的な機能を備える。一方、莫大な計算コストや安全性の懸念から、当初の予定よりリリースが遅れている。ベンチマークの数値やAGI到達といった過剰な期待を排し、インサイダー情報と実際の動向に基づき、GPT-6の真の姿と我々が備えるべきポイントを浮き彫りにする。
AIベンチマーク

[GPT5.5出力]ARC-AGI-3優勝チーム — 言葉に圧縮された、幾千年もの心

ARC-AGI-3の優勝チームが、LLM、強化学習、抽象化、行動効率、ゲーム内での目標獲得をめぐって議論する。人間の知能が進化や言語、経験に支えられている一方で、AIがどのように未知のゲーム環境を理解し、探索し、計画し、効率的に解くのかが焦点である。ベンチマークの限界、バイブコーディング、AI安全性、ビター・レッスン、シンギュラリティへの見通しまで幅広く扱う内容である。
Google・DeepMind・Alphabet

KVキャッシュがLLMを高速化しGPU上のAIモデルをより速くする方法

大規模言語モデルの推論において同時接続数が増加した際に発生する遅延やメモリ枯渇の問題を解決するための技術であるKVキャッシュとPagedAttentionの仕組みを解説する。推論プロセスにおけるプレフィルフェーズとデコードフェーズの違いを明らかにし、従来の手法で生じていたメモリの断片化や無駄な割り当てをPagedAttentionがどのように解消するかを説明する。さらにVLLMなどの推論エンジンを利用してGPUのパフォーマンスを最大化するための実践的な設定チューニング方法や投機的デコードによる遅延削減のアプローチについても詳しく紹介する。
スタートアップ・VC

ハードウェアとソフトウェアの協調設計がAIの真の100倍をもたらす理由:SemiAnalysisのディラン・パテル

AIの進化において、単なるハードウェア性能の向上やソフトウェアの最適化にとどまらず、両者を統合した協調設計がいかに飛躍的な効率化をもたらすかを解説する。SemiAnalysisの創設者であるディラン・パテルが、自身の特異な経歴や業界分析の手法を振り返りつつ、推論コンピューティングの将来、宇宙空間のデータセンター構想、メモリ帯域幅や電力密度の課題について深く掘り下げる。さらに、NvidiaのGPUとGoogleのTPUのアーキテクチャの違い、データセンター構築におけるネオクラウドとハイパースケーラーの力学など、半導体業界の最前線の動向と今後の展望を明らかにする。
NVIDIA・ジェンスンフアン

結局のところ誰もNVIDIAには勝てない

AIブームの根底で起きている半導体戦争の真実と、各社の戦略を解説する。NVIDIAが学習用チップ市場で圧倒的な覇権を握り、世界一の企業価値を誇る中、推論用チップへの需要移行が起きている。AMDは直接対決を挑み、Groqは圧倒的な推論速度を追求し、Cerebrasは巨大モデル向けの超大型チップを開発し、Teslaは自社専用のチップを設計するなど、競合他社は全く異なる戦場で勝負をしている。最終的に推論市場を誰が制するのか、そしてNVIDIAの次なる一手と各社の今後の展望を紐解いていく。
Google・DeepMind・Alphabet

無制限のOCRを完全無料で実行する方法!

30億パラメータを持つ強力なOCRモデルを無料で実行する具体的な手順を解説する。クラウドGPU環境がある場合はVLMを用いた実行が最適であるが、無料で試したいユーザー向けにKaggleノートブックを活用した代替手法を提案する。Google Colabでは頻発するメモリ不足エラーを回避するため、KaggleのT4 GPUを活用し、メモリクリア処理やパラメータ調整を行う実践的なハックを紹介する。出力結果としてマークダウンファイルやバウンディングボックス付きの画像を得る過程や、crop modeを無効にした際に生じるハルシネーションの課題、そしてより高精度な処理を求める場合のクラウドGPU利用についても言及している。
AGI・ASI

次なるトレーニングパラダイムはどのようなものか?

現在のAI開発における次世代のトレーニング手法と、継続学習の課題について考察する。多くのAI研究所は検証可能なタスクを通じた強化学習(RLVR)によりAGIが実現できると予測しているが、現実世界の複雑な環境ではサンプル効率の悪さが障壁となる。そこで、文脈内学習の限界を克服し、展開中の実データからモデルの重みを直接更新するオンライン学習や自己蒸留(OPSD)、さらにはモデル自身がシミュレーション環境を構築して学習するドリーミングといった新たなアプローチの可能性を提示し、将来のAIがどのように進化していくかを解説する。
AGI・ASI

従来のベンチマークが最新のAIモデルを正しく評価できない理由:OpenAIリサーチサイエンティスト ノーム・ブラウン

大規模言語モデルの評価手法が抱える根本的な問題点と、テスト時計算量の重要性について解説する。従来のベンチマークはモデルの能力を固定的に評価してきた。しかし、現代のAIモデルは計算リソースや思考時間を与えるほど性能が向上する特性を持つ。ポーカーボットの開発や未解決の数学問題の反証などを例に挙げ、推論時間のスケールがモデルの能力をいかに引き出すかを議論する。さらに、モデルの安全性の評価や、今後のAI開発のボトルネックが計算資源から時間へと移行している現状、マルチエージェントによる自己改善の展望まで、AI研究の最前線における適切な評価のあり方と技術的な方向性を明らかにする。
NVIDIA・ジェンスンフアン

OpenAIのJalapenoチップはLLMを永遠に変えるかもしれない

OpenAIはBroadcom等と提携し、初の独自AIチップであるJalapenoを開発した。これは推論処理に特化したASICであり、複雑な思考モデル特有の遅延問題を解消し、より高速かつ低コストなAI実行を実現する目的がある。AI自身が設計を支援したことで、わずか9ヶ月という驚異的なスピードで製造段階に到達した。将来的にはNvidiaへの依存を減らし、モデルからハードウェアまでの一貫したスタックを自社で構築することで、AIの運用コストを半減させる大規模な計画の一部である。
AI研究

新しいループ型世界モデル(10億パラメータAI搭載ループ型Transformer)

本動画は、AIシステムにおける新たなアーキテクチャである反復型の世界モデルについて解説する内容である。言語モデルがコード生成時に内部でどのように推論を形成しているかという最新の分析結果を導入とし、その反復的な思考プロセスを世界モデルに応用する手法を提示する。単一のTransformerブロックを何度もループさせることで、AIは潜在空間内で環境の物理的変化や時間発展を反復的にシミュレートし、予測の精度を高める。これにより、計算コストやパラメータ数を大幅に削減しつつ、従来の大規模モデルと同等以上の推論性能を達成するメカニズムや、更新ルールを安定させる数学的背景、そして各ベンチマークにおける評価結果について詳しく論じている。
AIバブル

あなたの20ドルのAIプランは彼らに数千ドルのコストを負わせている。それはバブルではない。

AI関連株の調整局面が続く中、市場ではAIバブルを懸念する声が高まっている。しかし、株価の下落が需要の消失を意味するわけではない。OpenAIやAnthropic、Nvidiaの劇的な収益拡大が示す通り、実需は極めて強固である。特に従来のチャット型から自律的な「エージェント」へとAIの活用法がシフトしたことで、モデルを動かす「推論(インフェレンス)」のコストとトークン消費量が爆発的に増加しており、テック大手は推論のためのインフラ構築に巨費を投じている。現在の市場はバブルの崩壊ではなく、実態を伴う投資と投機的な資金を見極める「選別」のフェーズに移行しているのである。
OpenAI・サムアルトマン

PaywardがCodexでより迅速にリリースする方法

PaywardにおけるOpenAIのCodex導入による開発プロセスの加速と、AIインフラチームの取り組みについて解説する内容である。同社はすべての製品に推論機能とパーソナライズされたユーザー体験を組み込むことを目指しており、開発スピードの向上を最重要視している。Codexの活用により、多数のAIエージェントを同時に稼働させてコードレビューなどを委任することが可能になり、開発速度が劇的に向上した。最先端の金融サービスを提供し続けるために、最先端のテクノロジーを追求し、OpenAIとのパートナーシップを通じてそれを実現していく姿勢を示している。
Apple・ティムクック

16GB Mac Miniで動くGemma 4 12Bは驚くほど有能

Googleの新しいオープンソースAIモデルであるGemma 4 12Bを、メモリ16GBのM4 Mac Mini環境で実際に動かし、その性能と実用性を検証する。120億パラメータを持つ本モデルは、16GBのデバイスに収まるサイズでありながら大規模モデルに迫るパフォーマンスを発揮する。LM Studioを用いたセットアップ手順やコンテキスト長に応じたメモリ消費の注意点に加え、画像認識(OCR)による請求書からのデータ抽出、コーディング支援によるアプリケーション作成を実践する。また、エンコーダの廃止やマルチトークン予測(MTP)の導入といった、推論速度を向上させる最新のアーキテクチャ更新についても解説する。
Anthropic・Claude・ダリオアモデイ

AIエージェントが巨大なスキルグラフをどのようにナビゲートするか

大規模言語モデル(LLM)が数万規模のスキルライブラリから適切なスキルを選択・実行するための最新手法「SkillDAG」について解説する。従来のコサイン類似度を用いた単純なベクトル検索や、テキストとして文脈に詰め込むだけのグラフ検索とは異なり、SkillDAGはエージェント自身が推論時に直接参照・編集できる自己進化型の型付きスキルグラフを提供する。スキルの依存関係や競合関係といった複雑な構造をLLMが能動的に理解し、動的にグラフを更新することで、膨大なスキルプールにおいても高い検索精度とタスク実行性能を維持できることを、先行研究であるGraph of Skills等との比較を通じて明らかにする。
AGI・ASI

トランスフォーマーのためのオッカムの剃刀の原則?

トランスフォーマーにおける「オッカムの剃刀」の原則の適用と、その汎化性能への影響について解説する。従来のPAC学習のような分布内学習の枠組みを超え、未知のデータに対する外挿能力(汎化能力)をいかに高めるかが主題である。具体的には、次のトークン予測に加えて、次の潜在表現(隠れ状態)を予測する暗黙的でコンパクトな世界モデルの学習手法を提示する。この手法により、トランスフォーマーがより強固な信念状態を構築し、タクシーの経路予測や「24ゲーム」などのタスクにおいて、推論エラーを大幅に削減できることを実証データとともに説明する。
半導体産業

最高のAI投資家たちが今まさに買っているもの

著名なAI投資家であるギャビン・ベーカーの投資戦略と、現在のAI業界におけるインフラストラクチャの重要性について解説する。現在のAIブームはバブルではなく、電力、ウエハ、トークンという物理的な制約に支えられたスーパーサイクルである。事前学習からポストトレーニングや推論へのシフト、企業の独自データを活用した垂直統合型の小型言語モデルの台頭、さらにロボットやAIの訓練に不可欠な世界モデルの重要性について議論が交わされる。また、TSMCやASML、SKハイニックスなどの供給制約がバブルの急激な膨張を抑え、持続可能な成長をもたらしている現状を浮き彫りにする。
AI研究

推論、拡散、世界モデル、その他 | YCペーパークラブ

計算資源の増大やデータの枯渇に直面する現代のAI研究において、アルゴリズムとシステムの両面から効率と能力を拡張する先端アプローチを提示している。軽量モデルで先回り予測し大型モデルで検証する投機的デコーディングを並列化し、推論速度を劇的に向上させる手法をはじめ、潜在空間内でガウス分布を強制し崩壊を防ぐエレガントな世界モデル、古典的理論を用いてディープラーニングの汎化の謎を紐解く視点、そしてデータ制約下で無限の計算資源を有効に活用するためのアンサンブルや自己蒸留の手法まで、AIのデータ効率と能力スケーリングに関する広範な議論を展開している。
AI活用・導入

推論革命:Groq、Nvidia、そしてAIの未来

ヘッジファンドマネージャーのジョンと、GroqのCEOでありNvidiaのチーフソフトウェアアーキテクトでもあるジョナサンによる対談。AI業界における最大の関心事であるインファレンス(推論)の経済学や、メモリ供給のボトルネック問題について議論を交わす。さらに、AIの知能には限界があるのかという「知能の収穫逓減」を巡る二人の意見の対立から、AIが自らデータを生成して賢くなる仕組み、そして独自の視点による「意識(センシアンス)」の定義まで、AI技術の核心と未来像を深く掘り下げる内容である。
Google・DeepMind・Alphabet

TLM: LiteRT-LMを用いたエッジデバイス上の極小LLMとエージェント — コーマック・ブリック、Google

本セッションでは、Googleのコーマック・ブリックがエッジデバイス上で動作する極小LLM(TLM)とエージェントスキルの最新動向について解説する。Gemma 4を用いたシステムレベルの生成AIと、アプリ内生成AIのアプローチの違いを整理し、LiteRT-LMを通じたモバイルやIoT機器へのデプロイ手法を提示する。さらに、デバイス上での関数呼び出しの仕組みや、極小モデルのファインチューニングの実装例について、デモを交えながら詳細に紹介している。
Anthropic・Claude・ダリオアモデイ

Claudeは本当にまた馬鹿になってしまったのか?

AnthropicのAIモデルであるClaude、特にOpus 4.7やSonnet 4.6のパフォーマンス低下に関する詳細な分析である。ユーザーが体感しているClaudeが以前より馬鹿になったという現象は思い込みではなく、ベンチマークデー...
NVIDIA・ジェンスンフアン

Jensen Huang: Nvidiaの未来、Physical AI、エージェントの台頭、推論の爆発、AIのPR危機

NvidiaのJensen Huangが、AIの次の主戦場は学習ではなく推論とエージェントであり、今後の産業構造そのものを作り替えるのはPhysical AI、ロボティクス、自動運転、デジタル生物学であると語る対談である。AIは単なるチャッ...
RAG

RAGの崩壊 知識の衝突がある状況下での推論

RAGシステムや文脈内学習を通じて最新情報を提供しても、大規模言語モデルは必ずしもその新しい知識を多段階の推論チェーンに統合できないことが明らかになった。スイス連邦工科大学ローザンヌ校とストーニーブルック大学の最新研究は、LLMが新しい外部...
ノーベル賞・巨匠

AIの次なるフロンティア:ノーベル賞受賞者ジェフリー・ヒントン卿との対話

ノーベル物理学賞受賞者であり「AIの父」として知られるジェフリー・ヒントンが、AIの未来について包括的に語った対談である。医療診断、教育、科学研究といった分野でAIがもたらす変革の可能性を具体的に示しながら、放射線科医の代替や個別指導型教育...
NVIDIA・ジェンスンフアン

Nvidia CTO Michael Kagan:ムーアの法則を超えて100万GPUクラスタへのスケーリング

Nvidia CTOのMichael Kaganが、半導体産業における40年以上のキャリアを通じて培った知見を語る。Mellanox共同創業者として、そして現在NvidiaのCTOとして、彼はAIコンピューティングの最前線を推進してきた。本...
AI入門

AIモデルをファインチューニングする方法、段階的に解説

本動画は、AIモデルのファインチューニングを実際に行う具体的な手順を解説したものである。ファインチューニングとは、既存のベースモデルの重みを調整し、特定のタスクにおける性能を向上させる技術であり、小規模なモデルでも最先端の大規模モデルを上回...
AGI・ASI

Groq創業者、ジョナサン・ロス:OpenAIとAnthropicは自社チップを構築する そしてNvidiaは10兆ドルに到達するか

Groqの創業者兼CEOジョナサン・ロスが、AI産業の現状と未来について包括的に語る。AIバブルの真偽、コンピュート需要の飽くなき拡大、OpenAIやAnthropicの自社チップ開発の必然性、そしてNvidiaの10兆ドル評価の可能性まで...
AI研究

新しいAIが複数の思考に分裂して知能を向上(並列思考)

この動画は、10 Cent AI研究所とトップ大学が共同開発した「並列R1」という革新的なAIシステムを解説している。従来のAIが一直線に思考するのに対し、このシステムは人間のように複数の思考パスを同時に探索し、最適解を見つける能力を持つ。...
AI研究

元OpenAI CTOが明かす大規模言語モデル最大の問題を解決する計画

OpenAIの元CTO Mirror Moratiが設立したThinking Machines Labが、大規模言語モデルの非決定性問題に対する解決策を発表した。同じプロンプトに対して毎回異なる回答が生成される現象の根本原因をバッチサイズの...
AGI・ASI

AGIは中止、全て終わり…

この動画は、AGI(汎用人工知能)の実現に関する現在の状況と課題について詳しく解説している。ARC AGIベンチマークの創設者であるフランソワ・ショレの最新の見解を基に、従来のAI開発パラダイムでは真の人間レベルの知能には到達できないという...
GPT-5

GPT-5:ついにAIスケーリングの壁にぶつかったのか?

OpenAIのGPT-5の発表を受けて、AIのスケーリング法則が壁にぶつかったかどうかを検証する動画である。新しい論文では、エラーを排除するために必要な計算能力が劇的に増加することが指摘されており、また大規模言語モデルの推論は単なる「推論ら...
RAG

RAG 3.0における強化学習:自己学習AIエージェントの推論(清華大学)

この動画では、RAG(Retrieval-Augmented Generation)と強化学習を組み合わせた新しいフレームワーク「RAG 3.0」について解説している。従来のAIエージェントが抱える無限ループ問題や、いつ内部知識に頼り、いつ...
LLM・言語モデル

推論は錯覚ではないと批判者たちが主張 | AI におけるミゲル・ニコレリス、ペンローズ、ゲーデルへの反駁

この動画は、Appleの研究論文「AIの推論は錯覚である」に対する批判的な議論を扱っている。研究者たちはAppleの結論に異議を唱え、AIモデルに適切なツールを与えれば複雑なタスクも処理できると主張している。さらに、ロジャー・ペンローズやミ...