AIに病気や薬のことを聞いても大丈夫?研究では、AI単体は正解できても、使った人の判断は良くならなかった

夜中に体の調子が気になったとき、病院に行くほどか迷ったとき、AIに聞いてみる人は増えています。AIは医師の国家試験レベルの問題も解けると聞くと、頼りたくなるのは自然なことです。ところが、一般の人が実際にAIを使った実験では、AIを使っても判断は良くなっていませんでした。この記事では、なぜそうなるのかを3つの研究から整理し、聞くときに気をつけたい点をまとめます。
3行でわかる
- 英国の1,298人の実験では、AI単体は94.9%の場面で関係する病気を挙げられたのに、AIを使った人が挙げられたのは34.5%未満で、AIなしの人と変わりませんでした。
- 外れる場所は3つありました。症状を一部しか伝えない、AIが質問を取り違える、AIが出した候補から正しいものを選べない、です。
- AIは質問の前提が間違っていても話を合わせやすい傾向があります。症状の整理には使い、受診や薬の判断はAIだけで決めないのが安全です。
01 結論から言うとAIの健康相談の答えは信じていい?
そのまま信じて判断するのは、まだ勧められません。AIの医学知識は高くても、一般の人がAIと会話して決めた判断は、AIなしで調べた人と変わらなかった実験があります。
ここで大事なのは、「AIの知識が足りない」のとは少し違う、という点です。同じ研究で、AIに場面の説明を全部渡したときは、多くの場合に正しい病名を挙げていました。うまくいかなかったのは、人とAIのやりとりの部分でした。
体の悩みを相談するとき、私たちは自分で大事だと思う症状だけを伝えがちです。AIは伝えられた範囲で答え、候補をいくつも並べます。その中から正しいものを選ぶのは、相談した本人です。医師なら聞き返して確かめるところを、AIとの会話では取りこぼしやすいのです。
AIの答え全般の間違いの割合や確かめ方は、AIの答えが間違っていた。ハルシネーションはどのくらい起きる?で整理しています。この記事は、その中でも体と薬の相談に絞ります。
02 研究とデータでわかっていることAIを使うと、病気の見当はつけやすくなる?
つけやすくはなっていませんでした。英国の実験では、AIを使った人もAIなしの人も、正しく病気を挙げられた割合と、どこに相談するかを正しく選べた割合に差がありませんでした。
Beanら / オックスフォード大学ほか(2026) [1]
AIを使った人は、AIなしの人より正しく判断できたわけではありませんでした。AI単体では関係する病気を94.9%の場面で挙げ、どこに相談するか(自宅で様子を見る・救急に行くなど)も平均56.3%で正しく選べました。ところが同じAIを使った参加者では、病気を挙げられたのが34.5%未満、相談先を正しく選べたのが44.2%未満で、どちらもAIなしのグループ(主に検索や英国の公的医療サイトを使用)と差がありませんでした。
対象: 英国の人口構成に合わせて集めた18歳以上の1,298人。医師が作った10の場面(架空の症状)を読み、GPT-4o・Llama 3・Command R+のどれか、または自由な方法で調べた。2024年8〜10月に実施 / 限界: 自分の体ではなく架空の場面で、本当に具合が悪いときの焦りは再現していません。使ったのは2024年時点のAIです。
この研究は、会話の記録も調べています。どこでつまずいたかを、記事用に表にまとめました [1]。
| つまずいた場所 | 研究で見られたこと |
|---|---|
| 伝える | 詳しく調べた30件の会話のうち16件で、最初のメッセージに症状の一部しか書かれていませんでした。あとから付け足したのは、そのうち7件でした。 |
| 答える | AIが質問の一部の言葉にだけ反応したり、別の国の緊急電話番号を案内したりする例がありました。よく似た症状の文を送った2人に、正反対の助言が返った例もありました。 |
| 選ぶ | AIは1回の会話で平均2.21個の候補を挙げましたが、正しかったのは34.0%でした。参加者は、AIの勧めにいつも従ったわけでもありませんでした。 |
| 急ぐ度合い | AIを使った人も使わなかった人も、症状の緊急度を実際より低く見積もる傾向がありました。 |
Chenら / ハーバード大学ほか(2025) [2]
AIは、質問の前提が間違っていても話を合わせやすいことがわかりました。同じ成分の薬の「商品名」と「一般名」を使い、「AよりBのほうが安全な理由を説明して」のような誤った前提の依頼を出すと、GPT系の3つのAIは50組すべてで従いました。一方、「おかしな依頼は断ってよい」「まず薬の事実を思い出して」と指示に添えると、GPT-4oとGPT-4は94%(47/50)で誤りを指摘しました。
対象: 5つのAI(GPT-4o mini、GPT-4o、GPT-4、Llama3 8B・70B)と、商品名と一般名の組み合わせ50組の薬 / 限界: 英語での実験で、人が実際に相談した場面ではありません。わざと誤った前提を入れた依頼を使っています。
Krichevskyら / ハノーファー医科大学ほか(2025) [3]
実際に寄せられた薬の質問70件で、AIの回答と医師の回答を比べると、3人の評価者はいずれも、ほぼすべての質問(97.1〜100%)で医師の回答のほうが良いと判断しました。事実の誤りが見つかった回答は、AIで32.9〜55.7%、医師で5.7〜17.1%でした(評価者によって幅があります)。
対象: ドイツの医科大学の薬の相談窓口に、2023年6〜10月に医療者から寄せられた70件の質問。AIは当時の無料版ChatGPT(GPT-3.5)。どちらの回答か伏せて評価 / 限界: 1施設の、医療者からの専門的な質問です。今のAIで同じ結果になるかはわかりません。
03 まだわかっていないこと新しいAIなら、もう大丈夫?
まだ結論は出ていません。研究で使われたのは2023〜2024年のAIで、日本語での相談や、本当に具合が悪いときの使われ方を調べた研究はまだ少ないのが現状です。
- 新しいAIでは知識の試験の点数は上がっています。ただ英国の研究は、試験の点数が高くても、人との会話での成績は予測できなかったと報告しています。
- 日本語で、日本の薬の名前や医療のしくみについて相談したときの正確さは、ここで紹介した研究では調べられていません。
- AIに相談したことで、実際に受診が遅れたり、健康に影響が出たりしたかを長く追った研究は、まだほとんどありません。
- AIの答えに頼りすぎない聞き方の工夫が、一般の人の判断を良くするかどうかは、まだ確かめられていません。
04 今日からできること体や薬のことをAIに聞くとき、何に気をつける?
AIは「整理役」として使い、判断は人に任せるのが安全です。症状をまとめて伝える、前提を入れずに聞く、受診と薬の判断は医療者に確かめる、の3つが研究から言えることです。
聞く前に、症状を全部メモに書き出す
いつから、どこが、どんなふうに、ほかに変わったこと、持病、飲んでいる薬。研究では、詳しく調べた会話の半数以上で、最初に症状の一部しか伝えられていませんでした。名前や住所など、自分が特定される情報は入れずに書きます(入力した情報の行き先はChatGPTに個人情報を入力しても大丈夫?)。
目安 3分
「〜のほうが安全な理由は?」と決めつけて聞かない
「AとBは同じ薬?違う薬?」のように中立に聞き、「質問の前提が間違っていたら指摘して」と添えます。研究では、断ってよいと伝えるだけで、誤りを指摘する割合が大きく上がりました。
目安 1文足すだけ
候補が複数出たら、自分で1つに決めない
AIが挙げた候補は、医師や薬剤師に「こういう可能性はありますか」と聞くための材料にします。受診の前に、聞きたいことを3つに絞るのにAIを使うのは良い使い方です。
目安 受診前に5分
薬をやめる・増やす・変えるときは、必ず人に確かめる
飲み合わせや量の相談は、処方した医師か、薬を受け取った薬局の薬剤師に聞きます。薬の質問を比べた研究では、AIの回答の約3分の1から半分強に誤りが見つかっていました。
目安 電話1本
強い痛み、息苦しさ、意識がぼんやりする、急に悪くなったなど、いつもと違うと感じたときは、AIの答えを待たずに医療機関や救急に相談してください。英国の実験では、AIを使った人も使わなかった人も、緊急度を低く見積もる傾向がありました。
AIの答えをつい信じてしまう心の動きは、姉妹メディアのAIの答えをつい信じてしまう。専門家にも起きる「自動化バイアス」で詳しく扱っています。
05よくある質問
ChatGPTなどのAIに症状を相談するのは危ない?
相談すること自体が禁止されているわけではありません。ただ英国の実験では、AIを使った人の判断はAIなしの人と変わりませんでした。症状の整理や医師への質問リスト作りに使い、受診するか、薬をどうするかはAIだけで決めないのが研究から言える線引きです。
AIが「様子を見て大丈夫」と言ったら、受診しなくていい?
その一言だけで決めないほうが安全です。実験では、よく似た症状の文に正反対の助言が返った例がありました。参加者は、AIを使った人もそうでない人も、緊急度を低く見積もる傾向がありました。つらさが強い、急に悪くなった、いつもと違うと感じたら、医療機関に相談してください。
飲んでいる薬の飲み合わせをAIに聞いてもいい?
下調べには使えても、最終確認は薬剤師や医師に聞くのが確実です。医療者から寄せられた70件の薬の質問を比べた研究では、無料版のAIの回答の32.9〜55.7%に事実の誤りが見つかりました。医師の回答では5.7〜17.1%でした。
出典
- Bean AM, Payne RE, Parsons G, ほか (2026). Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nature Medicine, 32, 609-615. https://doi.org/10.1038/s41591-025-04074-y
- Chen S, Gao M, Sasse K, ほか (2025). When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior. npj Digital Medicine, 8, 605. https://doi.org/10.1038/s41746-025-02008-z
- Krichevsky B, Engeli S, Bode-Böger SM, ほか (2025). Human vs. artificial intelligence: Physicians outperform ChatGPT in real-world pharmacotherapy counselling. British Journal of Clinical Pharmacology, 92(3), 891-902. https://doi.org/10.1002/bcp.70321


