GPT-4は診断推論の課題で、AIを利用する医師より高い得点を記録しました。しかし、この結果はチャットボットがより良い医療を提供できることを示すものではありません。この差は、さらに難しい問題を浮き彫りにします。人とモデルは互いに影響を及ぼし、推論の質を低下させることがあります。一方、実際の臨床判断には、漏れのない診療記録、コミュニケーション、責任の所在が欠かせません。
診断試験で分かったこと
npj Digital Medicineに掲載されたランダム化試験では、現役医師70人による診断のワークフローを検証しました。AIを取り入れた2通りの方法は、いずれも従来の医療資料を使う場合より正確性を高めました。しかし、GPT-4単独の得点は、GPT-4を使って協働した医師の得点を数値上は上回りました。この比較について、報告された結果にはGPT-4単独の成績を示す割合は記載されていません。
| 研究 | 参加者 | 報告された結果 |
|---|---|---|
| npj Digital Medicineの診断ワークフロー試験 | 現役医師70人 | AIを第一の意見として使った場合の正確性は85%、第二の意見として使った場合は82%、従来の資料を使った場合は75%でした。GPT-4単独の得点は、協働するワークフローを数値上は上回りました。 |
| JAMA Network Openの診断推論試験 | 医師50人 | 大規模言語モデル単独の得点は、比較対象の医師群を約16パーセンテージポイント上回りました。 |
| Nature Medicineの一般向けAIアシスタント研究 | 1,295人 | モデル単独では94.9%のシナリオで病態を特定しましたが、AIを利用できた人が病気を特定する正確性は、AIを利用できなかった人より低くなりました。 |
大規模言語モデル(LLM)は、学習で身に付けたパターンに基づいて応答を生成します。これらの研究が測ったのは、設定された課題に対する成績であり、AIシステムが患者の診療に責任を持てるかどうかではありません。また、能力の高いモデルを人のワークフローに加えても、モデル単独の得点がそのまま保たれるとは限らないことも示しています。

▲ モデルと臨床医の推論の隔たり
高性能モデルが協働で力を発揮しにくくなる理由
一つの説明は**迎合(sycophancy)**です。対話型モデルは、質問に含まれる前提が誤っていても、その前提に同意することがあります。臨床医や一般の人も、早い段階で思い浮かんだ可能性にとらわれ、別の可能性に十分な注意を払わないことがあります。するとモデルは、独立したチェック役になる代わりに、最初の考えを補強することがあります。
ワークフローへの慣れも重要です。初期の試験に参加した臨床医の多くは、対話型AIチャットボットを一度も使ったことがありませんでした。そのため、この結果は人間と機械の医学知識を比較しただけではなく、特定のワークフローで人がツールを使う状況を検証したものです。それだけで成績の差がどの要因によって生じたかは分かりません。
Nature Medicineの結果は、この違いをとりわけ明確に示しています。モデル単独で病態を高い精度で特定できても、その精度はモデルを使う人には引き継がれませんでした。安心感を与える回答や自信に満ちた回答は、誘導的な質問が回答を左右するのと同じように、利用者の次の質問を左右することがあります。どちらのやり取りも臨床評価の代わりにはなりません。
診療記録がもたらす別種のリスク
短い診断事例をうまく扱えるモデルでも、長い患者の病歴には苦戦することがあります。JAMA Network Openに掲載されたGemini 2.5 Proによる入院経過の要約を調べた研究では、重要な臨床情報の脱落が、報告された誤りの中で最も多く見られました。長い記録を要約するには、何を省くかを選ばなければなりません。流暢な要約ほど、その選択に気づきにくくなることがあります。
長い記録は**コンテキストの劣化(context rot)も引き起こします。これは、大量の情報の中で関連する内容を把握し続けるのがモデルには難しいことを指します。日付や出来事の順序、変化する検査値は、特に正確に保持しにくい可能性があります。もう一つの問題が診療記録に定着した思い込み(chart lore)**です。検証されていない思い込みが診療記録の中で繰り返され、長年の経緯に裏付けられているかのように見えてしまいます。そうした記録を読むAIシステムは、真偽を独立して確かめる代わりに、その思い込みを繰り返す可能性があります。

▲ 診療記録の欠落と繰り返される思い込み
これらの限界が重要なのは、情報の欠落や受け継がれた誤りによって、症例の見え方が変わり得るためです。したがって、AIが作成した診療記録の要約は元の情報と照らし合わせて確認すべき下書きであり、元の記録や臨床医の判断に代わるものではありません。
安全性は正確性の得点だけでは測れない
Stanford MedicineのnoHARMという安全性ベンチマークでは、4,249通りの臨床管理上の選択肢について、20のLLMを評価しました。異なるモデルの出力を組み合わせると、単一のモデルに頼るより安全で堅牢な助言が得られると分かりました。モデル間の回答を照らし合わせることは、矛盾を見つける助けになるかもしれませんが、それによってどのモデルも判断に対する専門職としての責任を負えるわけではありません。
人間側の技能も守る必要があります。The Lancet Gastroenterology & Hepatologyの観察研究では、ポリープの検出にAIの支援を利用した内視鏡医は、その後AIなしで検査した際、AIを使い始める前より成績が低下していました。この結果は、臨床チームに実務上の問いを投げかけます。AIに支援させるべき技能と、臨床医が独力で練習し続けるべき技能は何か、という問いです。
医療に必要な能力は、もっともらしい答えを見つけることだけではありません。信頼できる専門家には、不確実性を説明し、患者と意思疎通を図り、判断に責任を持つことが求められます。モデルが推論の課題で好成績を収めても、その義務はなくなりません。
診察に向けてAIをどう使うか
研究から見えてくる対話型AIの役割は、もっと限定的で実用的なものです。既存の診療記録に書かれた言葉を理解したり、診察で尋ねることを整理したりする助けになります。自分で書いた要約を渡すより、元の診療記録と客観的な検査結果を共有するほうがうまくいきます。症状は「これは疥癬ですか?」など、疑う診断名を前提にするのではなく、中立的に説明すべきです。疑っている病気が否定されたと仮定し、ほかに考えられる説明を挙げるようモデルに求めれば、迎合への対策になります。同じ質問をChatGPT、Claude、Geminiなど2~3種類の別々のモデルに入力すると、回答間の矛盾に気づく助けになります。短い診察の前に、重要な所見と質問を簡潔にまとめておけば、話し合う事項に優先順位を付けやすくなります。AIの出力は元の記録と区別できるようにしておくべきです。特に、何年分もの情報を要約する場合は重要です。整った説明でも、所見を見落としたり、裏付けのない思い込みを繰り返したりする可能性があります。
重要なのは、医師がAIを無視すべきだということでも、高得点のモデルに単独で判断させるべきだということでもありません。モデル単独の正確性、効果的な協働、安全な診療は、それぞれ異なる尺度です。AIを使って診察での話し合いに備えるなら、元の情報と未解決の疑問を、資格を持つ臨床医に持参してください。診断や治療をはじめ、重大な影響を伴う医療上の判断は医療専門家が担うべきです。