この動画は、Microsoftが発表した医療分野における人工知能の診断システムに関する最新研究を詳しく解説している。同社が開発した「My DXO」という診断システムが、New England Journal of Medicineの複雑な症例において85%の診断精度を達成し、これは経験豊富な医師グループの平均20%を大幅に上回る結果である。この研究は従来の多肢選択式テストではなく、実際の臨床現場に近い順次診断プロセスを採用し、AIが質問や検査を段階的に行いながら最終診断に到達する手法を検証している。さらに診断精度だけでなく、コスト効率の面でも医師を上回る結果を示している。

Microsoftが発表した医療AIの革命的な研究
皆さん、今日は人工超知能と医療についてお話しします。これはMicrosoftが行った研究による発表で、それもかなり議論の分かれる分野である医療における研究です。多くの人が人工知能に対して、特に医療診断を行う際には相当な不信感を抱いています。
しかし、この研究に署名している人々は本当に本気で取り組んでいることを確信できます。これは単なる研究ではありません。しかし、彼らが私たちに何を伝えようとしているのか注意深く見て、これが現実なのか、それともMicrosoftが私たちに人工知能を押し付けようとしているだけの話なのかを確認しましょう。
いつものように、いいねを押してくれた皆さん、そしてチャンネル登録してくれた皆さんにお礼を申し上げます。この人工知能チャンネルをスポンサーしてくれているチャンネルメンバーの皆さんには特別な感謝を捧げます。メンバーの方々は、ゼロから統合エージェントの作り方を教える独占動画にアクセスでき、WhatsAppに組み込んだり、PDF文書の読み取り、MCPとの統合も含まれ、さらに先行動画へのアクセスも可能です。
医療における人工超知能への道
今日のニュースは「医療における人工超知能への道」です。この翻訳は少し奇妙ですが、彼らが言いたいことはこういうことです。これらの情報は「言語モデルによる順次診断」という論文からのもので、ここには多くの人が署名しており、その中にはMustafa Suleimanも含まれています。彼はMicrosoft AIのCEOであり、GoogleのDeepMindの共同創設者の一人でもあります。
つまり、彼は長い間この分野にいる人物なのです。彼は6月30日、つまり数日前のこの論文に自分の顔と名前を出して支持しています。そして彼らがここで述べていることは非常に重要です。なぜなら、人工知能が本格的に到来し、医師や専門家よりも良い結果を示していることを示しているからです。
そしてこのようなことが起こると、何が起きているのかに十分注意を払わなければなりません。Microsoftのチームは、AIがいかに医療の最も複雑な診断課題を順次調査し解決できるかを実証する研究を共有しています。これらは医師や専門家が回答に困難を感じる症例です。
つまり、皆さん、まず最初に、彼らは困難な症例について話しているのです。日常的な一般的な症例について話しているのではなく、専門家でさえ決定に困難を感じるような例外的なケースについて話しているのです。
驚異的な診断精度の比較結果
New England Journal of Medicineに毎週発表される実際の症例記録と比較して、Microsoft AI Diagnostic Orchestrator(これから彼らはMy DXOと呼びます)がNJM、つまりNew England Journal of Medicineの症例の最大85%を正しく診断することを示しました。これは経験豊富な医師グループの4倍以上の率です。
つまり、こういうことです。この医学雑誌では症例の発表と記録を行っています。発表を行っているため、症例、その症例について研究されたすべてのこと、症状、どのようにして特定の結果に到達したか、行われた検査、鑑別診断をどのように行って解決策に到達したかがあり、研究症例であるため正しい診断が分かっており、そのため人工知能が正解したかどうかを判定できるのです。
注目してください、My DXOは医師よりも経済的に正しい診断にも到達します。つまり、経験豊富な医師グループの4倍である85%の正解率を達成するだけでなく、コストも少なくて済むのです。
医療コストの深刻な問題
医療への需要が成長し続ける中、コストは持続不可能なペースで増加し、数十億人の人々が不正確で遅れた診断を含む、より良い医療への複数の障壁に直面しています。覚えておいてください、皆さん、アメリカでは医療費が地球上で最も高額なものの一つです。アメリカ人自身も、彼らが医療にこれほど高額を支払っているとは信じられないのです。
親戚や知り合いがアメリカで何らかの健康問題で治療を受けたことがある人なら、私たちが何について話しているかご存知でしょう。同僚の事例を覚えています。彼は腎臓結石で2日間入院し、18,000ドルを支払わなければなりませんでした。そうなのです、皆さん。ブラジルならSUSで無料で済むような小さな腎臓結石に対する高額な費用を考えてみてください。
ますます多くの人々が医療アドバイスとサポートのためにデジタルツールに頼っています。そして皆さん、勘違いしないでください。アメリカ人はブラジル人よりお金を持っていますが、それでもお金は木から落ちてくるわけではありません。そう、彼らは間違いなくChatGPTで自分の問題を解決しようとするでしょう。
大規模な医療相談のデジタル化
MicrosoftのBing Copilotなどの消費者向けAI製品では、毎日5000万件以上の医療関連セッションを確認しています。膝の痛みについての最初の相談からの夜間の緊急医療クリニック検索まで、GoogleでHealth検索を行ったことがない人はいないでしょう。検索エンジンとAIアシスタントは急速に医療の新たな最前線になりつつあります。
私たちはより多くの支援を提供したいと考えており、生成AIが変革的になり得ると信じています。そのため、2024年末に、医師、デザイナー、エンジニア、AI科学者が率いるMicrosoft AIでの消費者医療専用プロジェクトを立ち上げました。このプロジェクトはMicrosoftのより広範な医療イニシアチブを補完し、イノベーションパートナーシップへの長期的なコミットメントに基づいています。
これは、彼らがすでにいくつかのプログラムを実行していたことを意味します。このRad Dino、このMicrosoft Dragon Copilot、これらのプロジェクトは放射線学の仕事やAIアシスタントを行うためにすでに運用されていました。つまり、同じ分野で働く他のプロジェクトがすでに存在していたのです。
医師免許試験を超えた新たな評価手法
アメリカで医学を実践するために、医師はUnited States Medical Licensing Examination(USMLE)に合格する必要があります。これは臨床知識と意思決定の厳格で標準化された評価です。医師のためのOAB試験のようなものです。
試験問題は医学におけるAIシステムを評価するために使用された最初のパラメータの中にあり、モデルの性能を互いに、そして人間の医師と比較する構造化された方法を提供していました。それは昔からの話です。彼らはAIに医学テストを受けさせて、誰が最高の成績を取るかを見るのです。
しかし詳細があります。注目してください。わずか3年で、生成AIはほぼ完璧な試験スコアを達成し、他の類似試験でも同様の結果を達成するまでに進歩しました。しかし、これらのテストは主に記憶を深い理解よりも優遇する多肢選択問題に基づいています。
つまり、昔からの話で、選択肢のある試験なので、AIには簡単に正解できるということです。そして彼らは続けます。医学を多肢選択問題の単一の回答に削減することで、これらのパラメータはAIシステムの見かけの能力を過大評価し、その限界を曖昧にします。
革新的な順次診断システム
しかし、ここで真の飛躍が来ます。多肢選択問題の限界を克服するために、私たちは順次診断に焦点を当てました。これは現実世界での医療意思決定の基本的な柱です。このプロセスでは、医師は患者の初期症状から始まり、その後反復的に質問と診断テストを選択して最終診断に到達します。
お分かりいただけましたか?彼らは選択肢モデルから離れて、人工知能が症例との初期接触を受け、その後何かを求めたり、質問をしたり、検査を要求したりでき、そして最終診断に到達するまで決定を積み重ねていく新しいタイプのテストに移行しています。
例えば、咳と熱のある患者は、医師に血液検査と胸部X線の依頼と確認をさせ、肺炎を診断する自信を持つ前にそれらを行わせる可能性があります。お分かりいただけましたか?これは選択肢の話ではなく、もう少し会話的なものです。
最も困難な症例での検証
毎週、世界有数の医学雑誌の一つであるNew England Journal of Medicineは、詳細な物語形式で患者のケア過程を提示するMassachusetts General Hospitalの症例記録を発表しています。そしてこれらの症例は診断において最も複雑で、臨床医学において知的に最も要求の厳しいものの中にあり、しばしば最終診断に到達するために複数の専門家と診断検査を必要とします。
つまり、要するに、彼らは相互作用的で順次的なテストを行っているだけでなく、New Englandの医学雑誌で毎週研究されている最も困難な症例も取り上げているのです。
実際のテストシステムの動作メカニズム
それでは、このテストはどのように機能するのでしょうか?どのように行われるのでしょうか?例えば、彼らはNew England Journal of Medicineから、例えば健康問題を抱えている29歳の女性の症例を受け取ります。
ゲートキーパーエージェントと呼ばれるエージェントが情報を渡し、何が起こっているかを説明します。29歳の女性が病院に運ばれ、そこで起こっていることの症状を説明します。これに基づいて、人工知能エージェントは受け取った情報に基づいて質問と相互作用を始めます。
ここで、My DXOは「いつ、どのように症状が始まったかを詳しく説明してもらえますか」と、もう少し調査するための質問を始めます。症例を知っているゲートキーパーエージェントが相互作用を始め、回答を与え始めます。そしてMy DXOはより多くの質問を続け、最終的に何らかの検査を要求することもあります。
仮説を立てながら、彼は考えていることを置いています。例えば、トップ3の診断。診断である可能性があると考えている3つのことです。そしてある時点で、例えば、現実世界であれば時間がかかり、一定のコストがかかるであろうテストを要求しますが、ここでは研究症例なので、テストを要求するとすぐにすべての結果が即座に得られます。
このようにして、テストを要求するにつれて、人工知能が行っているこの治療にかかったであろうコストを計算していきます。そしてコストが下に表示されます。診断コスト、この場合は936で、これは彼らが要求しているテストのコストでした。
もちろん、より多くのテストを要求するにつれて、新しく要求されたテスト、この値は上昇し、今は1354になっています。そして最終的に、治療が進むにつれて、コストが上昇し続け、ある時点で診断を下し、何だと思うか、何だと考えるかを言う瞬間が来ます。そして研究症例なので、正解しても間違えても、すぐに正解したか間違えたかが分かります。
つまり、この場合、彼は診断を提示し、ご覧のように、彼は正解しました。
包括的な比較評価結果
では、この手順で何が起こったのでしょうか?彼らは304症例で評価を行い、テストされたモデルはGPT、Llama、Claude、Gemini、Grok、DeepSeekから、Microsoft AI Diagnostic Orchestratorも含めてテストしました。
そしてOrchestratorは次のように機能します。メインエージェントがあります。いくつかの仮説を立てるエージェント、何らかのテストが必要かどうかを定義するエージェント、チェックリストを監視する別のエージェント、何が起こっているかのコストに注意を払う別のエージェントがあります。
これらのエージェントが意見を述べて決定するにつれて、次のアクションが質問なのか、何らかのテストを要求するのか、何らかの診断を定義するのかを決定する議論チェーンに入ります。何らかのテストが要求された場合、コスト分析を行います。なぜなら、一部のケースでは、支出できる最大コスト制限に達するからです。
例えば、「最大5,000ドルまで支出する」または「最大8,000ドルまで支出する」と言います。このコスト分析を通過した場合、彼らはテストを行うかどうかを決定します。テストを行わない場合、例えば、ここのチェーンに戻り、もしかすると彼らはより多くの質問をするか、もしかすると最終診断に直接進みます。
最終診断に到達し、診断が確認された場合、彼らは回答をここに送信します。そして何が起こったか、正解したかどうかが分かります。そしてここで見ることができるように、彼らは回答するモデルを選択できます。O3、GPT-4o、Claude 3.5 Sonnet、またはその他のモデルのいずれかです。
驚異的な成果と医師との比較
そして彼らはここでコメントしています。MyDXOはテストされたすべてのモデルの診断性能を向上させました。最高性能の構成は、OpenAIのO3とペアになったMyDXOで、NJMベンチマーク症例の85.5%を正しく解決しました。
比較のために、彼らは21人の実際の医師、アメリカとイギリスの現役医師で、それぞれ5年から20年の臨床経験を持つ医師も評価しました。同じタスクで、これらの専門家は完了した症例において平均20%の精度を達成しました。
そしてこのグラフは最も議論を呼ぶグラフの一つです。ここで、赤い十字が見えますか?これは実際の医師、人間の平均です。すべての医師の中で、大きな赤い十字、小さなピンクの十字は個々の医師です。
例えば、ここの医師は、テストしたすべての診断の40%の精度を達成しました。しかし、ここの医師は、まさにライン上で、単純に一つの診断も正解しませんでした。平均して、彼らはすべてのテストの20%を正解しました。
そして人工知能について話すとき、一般的なモデルについて、GPT-3.5 Turbo、GPT-4o、GPT-4o mini、Llama 3、GPT-4o1 mini、DeepSeek R1、Gemini 2.0 Flash、GPT-4o1、Gemini 2.0 Pro、これらすべてが評価されています。
そして上部には、通常のモデルがあります。O3は8,000ドルを費やして、ほぼ80%の精度を達成しました。しかし、MyDXOを見ると、彼らははるかに低いコストで良い結果を達成しました。
つまり、より上で左にあるものが最も正確で最も安価ということになり、このグループです。このグループが最も正確で最も安価です。
コスト効率性の革新
そしてもしかすると、8,000のbudgetのこのO3がなぜ約500ドルの位置にあるのかと疑問に思うかもしれません。この8,000は彼が支出するであろう最大額だからです。彼らは「8,000ドル以上は支出できない」というルールを設定しました。4,000についても同じ、2,000についても同じです。
そしてご覧のように、Microsoftのエージェントがこれらの非常に複雑で困難な症例で最高の結果を達成しました。そしてなぜこれらの医師がこれほど多く間違えたのかを明確にしておきましょう。症例が本当に困難だったからで、これは彼らにとって複雑な決定であり、個別には非常に複雑だったからです。
AIの優位性の根本的理由
そして彼らがこれらのデータを分析したときに何を発見したかを見てください。医師は通常、専門知識の幅または深さによって特徴づけられます。家庭医のような総合医は、異なる年齢層と臓器系にわたる幅広い条件を管理します。これは基本的に、少しずつ何でも分かる医師で、家族全体を診察し、関節炎、肺炎、風邪、熱からの診断を行う、本当に複雑な仕事です。
そしてリウマチ専門医のような専門家は、単一のシステム、疾患領域、さらには条件に深く集中します。しかし、どの医師もNJM症例シリーズ全体の複雑さを網羅することはできません。これらはNew England Journalの症例です。
一方、AIはこのジレンマに直面しません。専門知識の幅と深さを組み合わせることができ、多くの臨床推論の側面で個々の医師を超える臨床推論能力を実証しています。
そしてこれは事実です、皆さん。人工知能は私たちよりもはるかに多くの情報を網羅することができます。このタイプの推論は医療を再構築する潜在能力を持っています。AIは患者がケアの日常的な側面を自己管理することを可能にし、複雑な症例に対する高度な意思決定支援で医師を装備することができます。
興味深いことがお分かりいただけましたか、皆さん?これは患者の日常的なケアでも助けになりますし、複雑なことの意思決定の時にも医師を助けます。
医療費削減の可能性
私たちの発見はまた、AIが不必要な医療費を削減することも示唆しています。アメリカの医療費はGDPの約20%であり、この値の最大25%が無駄として推定され、患者の結果にほとんど影響を与えていません。
非常におかしなことですが、ここを見てください。例えば、この医師は2,500ドルを費やして、検査結果をすべて間違えました。つまり、多く費やしたのにそれほど結果が出ませんでした。
研究の限界と今後の課題
もちろん、私たちの研究には重要な限界があります。MyDXOが最も複雑な診断課題を扱うことに優れているとはいえ、より一般的で日常的な症状におけるその性能を評価するためには、より多くのテストが必要です。
私たちの研究の医師は、同僚、教科書、さらには通常の臨床実践で使用できる生成AIへのアクセスなしで作業しました。つまり、基本的に医師の情報は彼らが人生で知っていることだけで、何も相談することができませんでした。
これは人間の生の性能との公平な比較を可能にするために行われました。この研究の革新的な側面はコストに払われた注意です。実際の医療費は地域とシステム間で異なり、私たちが考慮しなかった多くの要因を含んでいますが、評価されたすべてのエージェントと医師に一貫した方法論を適用して、診断精度とリソース使用との間の高レベルのトレードオフを定量化するのに役立ちました。
そしてここで興味深い点は、GoogleのDeepMindが医療分野の研究者の一人と行ったポッドキャストの一つで、彼女がまさにこのことについてコメントしていることです。地球上には医師さえいない場所があり、もしこのようなAIがあれば、医師を持つ能力さえなかった場所が、今では非常に良い診断を行うことができるようになり、その場所は信じられないほど進歩するでしょう。
慎重なアプローチと将来への期待
そして、私たちにとってこれはほんの第一歩に過ぎません。私たちは前方にある機会に興奮しています。生成AIが医療分野で安全かつ責任を持って展開される前に、まだ重要な課題が存在します。特に医療は最も敏感な分野の一つだからです。
人工知能プロジェクトでの作業経験から、医療分野と航空宇宙分野は作業が最も困難な分野です。なぜなら、何かが間違いになるリスクが常に高いからです。
適切なガバナンスと規制構造とともに、実際の臨床環境から抽出された証拠が、信頼性、安全性、有効性を保証するために必要です。そのため私たちは、これらのアプローチを厳密にテストし検証するために主要な医療組織とパートナーシップを組んでいます。これは、より広範な実装の前の必須ステップです。
つまり、彼らは非常に慎重で、一歩ずつ進み、テストを行い、何が起こっているかを観察し、この利益が本当に理にかなっているかどうか、そして実際に日常で適用できるかどうかを確認しています。
これは本当に素晴らしいと思いました。説明にリンクを残しました。皆さんは、より詳細な情報を含む完全な論文にアクセスできます。もし医師の知り合いがいる場合、医師の同僚がいる場合は、この人と共有してください。なぜなら、このニュースはホットな話題だからです。2025年6月30日のもので、つまり数日前のことです。ほとんど誰もこのことをまだ知りません。そしてこの研究は最先端の研究であり、本当にこの分野を揺るがすことを意図しています。
もしご覧になっている方が医師でしたら、医療分野で何が起こっているか、医療がこれらの新しい挑戦をどのように受け止めているか、これらのアシスタントが多くのナンセンスを話しているのか、それとも結局のところ医師の大きなパートナーツールとなって助けているのかをコメントしてください。
コメントしてください。私たちは知りたいですし、診察室での真実、現実の世界を知りたいのです。医師はChatGPTを使っているのか、使っていないのか?コメントしてください。私たちは知りたいのです。
このようなビデオを引き続き見るためにチャンネルをサポートしたい場合は、メンバーになってください。メンバーは独占的なインテリジェントエージェントビデオと先行ビデオにアクセスできます。


コメント