AIに頼りすぎ

AIの答えが間違っていた。ハルシネーションはどのくらい起きる?割合は質問しだいで大きく変わり、出典を自分で開くのが確かめ方の基本

約8分で読めます

わかっている度 ★★☆ 中研究3本・公的資料3件を整理
図書館の本棚に並ぶ本
Photo: Moyofyg / CC BY-SA 4.0 / Wikimedia Commons
AIによる調査公開された研究と公的機関の資料をAIが調べて整理しました(商品の紹介や診断はしていません。出典は末尾)。

AIの答えを信じて使ったら、あとで間違いだとわかった。そんな経験をした人は少なくありません。生成AIがもっともらしい誤りを出すことは「ハルシネーション」と呼ばれ、国のガイドラインでもリスクの一つに挙げられています。起きる割合は、質問の種類やAIの種類で大きく変わります。だからこそ、使う前に確かめる手順を決めておくことが役に立ちます。

3行でわかる

  1. 間違いの割合は一つに決まりません。米国の判例についての質問では58〜88%、医療の質問では出典の裏付けがない回答が50〜90%でした。どちらも2023〜2024年ごろのAIです。
  2. 出典が付いていても安心はできません。ウェブ検索つきのAIでも、文の約30%は示した出典に裏付けがありませんでした。
  3. 確かめ方の基本は、出典を自分で開く、公的機関などの一次情報で照らす、聞き直して答えがぶれないか見る、の3つです。

01結論から言うと

生成AIの間違いは、質問の種類しだいで高い割合で起きます。お金・健康・法律・人に送る内容は、出典を自分で開き、公的機関などの一次情報で確かめてから使います。

ハルシネーションとは、AIが事実と違う内容を、本当のことのように答える現象です。AIは文章を「それらしく」つなげるのが得意なので、間違いも自然な文章で出てきます。

デジタル庁のガイドブックは、AIの学習データにない情報を聞くと、ハルシネーションは確実に起きると説明しています。たとえば役所の部署の職員数を聞くと、根拠のない人数を答えることがあるという例です。学習データに情報があっても、AIがそれを正しく覚えているとは限らないとも書かれています。[5]

この記事は、答えを使う前の「確かめ方」の実務に絞ります。AIの答えをつい信じてしまう心の仕組み(自動化バイアス)は、AIの答えをつい信じてしまう心の傾向と確かめ方のコツで整理しています。

02研究とデータでわかっていること

間違いの割合は、分野・質問の仕方・AIの種類で大きく変わりました。答えが確かめにくい質問や、あまり知られていない事柄ほど誤りが増え、出典が付いていても裏付けがないことがありました。

58〜88%米国の連邦裁判所の判例について、答えが確かめられる質問をしたときに誤った答えの割合(GPT-4〜Llama 2の4種類、2024年発表)
50〜90%医療の質問800問で、AIが付けた出典では内容の全部を裏付けられなかった回答の割合(7種類のAI、2024年に質問)
約30%ウェブ検索つきのGPT-4oでも、付けた出典に裏付けがなかった文の割合(同じ研究)
40〜70%ウェブ検索なしのAIが示したURLのうち、実際に開けたものの割合(同じ研究)

3つの研究の条件を並べると、割合が条件でどれだけ違うかがわかります。

研究何を聞いたかわかったこと
Dahlら(2024)米国の判例についての、答えが確かめられる質問誤りは58%(GPT-4)〜88%(Llama 2)
Wuら(2025)医療の質問800問と、その出典全文が出典で裏付けられない回答が50〜90%
Farquharら(2024)同じ質問を何度も聞いたときの答えのぶれ意味がぶれる答えは、でたらめな誤りの目印になった

Dahlら(2024)[1]

4種類のAIに、無作為に選んだ米国の連邦裁判所の判例について、答えが確かめられる質問をしました。誤った答えの割合は、GPT-4で58%、Llama 2で88%でした。下級の裁判所の判例や、あまり知られていない判例ほど誤りが多くなりました。最高裁判所の判例では、とても古いものと新しいもので誤りが多く見られました。AIは自分の誤りを予測するのも苦手で、質問に含まれた誤った前提をそのまま受け入れることもよくありました。

対象: GPT-4、GPT-3.5、PaLM 2、Llama 2 / 限界: 米国の法律の質問に限った結果。2024年発表の研究で、新しいAIでは割合が違う可能性がある。

Wuら(2025)[2]

7種類のAIに医療の質問800問をして、答えの中の文が、AI自身が付けた出典で裏付けられるかを調べました。回答の50〜90%は、出典で全部を裏付けられませんでした。ウェブ検索つきのGPT-4oでも、文の約30%は裏付けがなく、全部が裏付けられた回答は55%でした。ウェブ検索なしのAIが示したURLは、開けたものが40〜70%でした。ウェブ検索つきのGPT-4oでは、医療サイトの文章をもとにした質問で全部が裏付けられた回答が約80%でしたが、ネット掲示板に寄せられた実際の相談では約30%に下がりました。

対象: 医療サイトの文章から作った質問400問と、掲示板の実際の相談400問。2024年1〜5月にAIへ質問 / 限界: 調べたのは「出典に書いてあるか」で、答えそのものが正しいかではない。英語・米国の情報源が中心。

Farquharら(2024)[3]

同じ質問をAIに何度もさせ、答えの「意味」がどれだけばらつくかを測りました。意味がばらつく質問ほど、でたらめな誤りが出やすいことがわかりました。この方法は、質問の分野が変わっても安定して働きました。一方で、学習した情報そのものが間違っていて、毎回同じ誤りを答える場合は見つけられないと著者らは書いています。

対象: 複数の質問応答データと、複数のAI(30通りの組み合わせ) / 限界: 研究者がプログラムで行った測定で、人が手で聞き直したときの効果を測ったものではない。

国の指針も、間違いへの備えを求めています。総務省と経済産業省の「AI事業者ガイドライン(第1.2版、2026年3月)」は、AIのリスクの例として「ハルシネーション等による誤った出力」と「過度な依存」を挙げています。チェックリストでは、自動化バイアスなどAIに頼りすぎるリスクに注意を払うことを確認項目にしています。[4]

03まだわかっていないこと

最新のAIで、普段の質問にどのくらい間違いが混ざるかは、はっきりしていません。どの確かめ方がどれだけ誤りを防ぐかを、一般の利用者で比べた研究も少ない状況です。

  • 今回の数字は、2023〜2024年ごろのAIで、法律と医療という分野で測ったもの。新しいAIや、買い物・手続き・地域の情報など普段の質問での割合は、今回調べた範囲では査読研究が見つからなかった。
  • 「出典に裏付けがない」ことは、答えが間違っていることと同じではない。裏付けのない部分のうち、どれだけが本当に誤りかは研究によって測り方が違う。
  • 「出典を開く」「聞き直す」といった確かめ方を、一般の人が続けたときにどのくらい誤りが減るかを比べた研究は少ない。

04今日からできること

答えの重さで確かめる量を決め、出典は自分で開き、一次情報で照らし合わせます。聞き直して答えがぶれたら要注意です。どれもお金はかからず、次の質問から試せます。

特に念入りに確かめたいのは、次のような答えです。

1

出典を出してもらい、自分で開く

「根拠になる資料と、そのURLも示して」と頼みます。リンクが開くか、AIの書いた内容がそのページに本当に書かれているかを見ます。見つからなければ、その部分は使いません。

目安 出典1件につき2〜3分

2

一次情報に自分でたどり着く

制度や数字は、AIのリンクに頼らず、省庁・自治体・公式サイトを自分で検索して確かめます。健康のことは公的機関の情報や医師・薬剤師、法律のことは公的な窓口に確かめるのが確実です。

目安 1件5分

3

新しいチャットで、聞き方を変えて聞き直す

同じ質問を新しいチャットで2〜3回、言い方を変えて聞きます。答えの中身が毎回変わるなら、でたらめな誤りの目印です。ただし毎回同じでも、正しいとは限りません。

目安 1回2分

4

質問に思い込みを入れない

「〜ですよね?」と聞くと、誤った前提のまま答えが返ることがあります。「〜は本当ですか?違う場合も教えて」のように、確かめる形で聞きます。

目安 1回10秒

仕事の資料にAIの文章を使うときの確認の仕方は、仕事でAIに作らせた文章や資料、そのまま出して大丈夫?にまとめています。確かめるために資料をAIに貼り付けるときは、ChatGPTに個人情報や会社の情報を入力しても大丈夫?も参考になります。

05よくある質問

生成AIのハルシネーションは、どのくらいの割合で起きるの?

決まった割合はなく、分野・質問・AIの種類で大きく変わります。2024年発表の研究では、米国の判例についての質問で58〜88%の答えが誤りでした。医療の質問では、出典で全部を裏付けられない回答が50〜90%でした。どちらも2023〜2024年ごろのAIの結果で、最新のAIの割合ではありません。

AIが出典やリンクを付けていれば、信じていいの?

付いているだけでは確かめたことになりません。医療の質問を調べた研究では、ウェブ検索つきのAIでも、文の約30%は付けた出典に裏付けがありませんでした。ウェブ検索なしのAIでは、示したURLの3〜6割が開けませんでした。自分でリンクを開き、その内容が本当に書かれているかを見ます。

AIに「自信はある?」と聞けば、間違いがわかる?

当てにはなりません。米国の判例を調べた研究では、AIは自分の誤りを予測するのが苦手でした。答えの確かさは、AIの自己申告ではなく、出典や一次情報で確かめます。

同じ答えが何度も出たら、正しいと考えていい?

正しいとは限りません。聞き直して答えがぶれるのは誤りの目印になりますが、学習した情報そのものが間違っている場合は、毎回同じ誤りを答えることがあります。大事な内容は、一次情報で確かめます。

AIの答えを信じて損をしたときは、どこに相談できる?

契約や買い物のトラブルになったときは、消費者ホットライン(188)に電話すると、身近な消費生活センターなどの相談窓口を案内してもらえます。[6]

出典

  1. Dahl M, Magesh V, Suzgun M, Ho DE (2024). Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. Journal of Legal Analysis, 16(1), 64-93. https://doi.org/10.1093/jla/laae003
  2. Wu K, Wu E, Wei K, ほか (2025). An automated framework for assessing how well LLMs cite relevant medical references. Nature Communications, 16, 3615. https://doi.org/10.1038/s41467-025-58551-6
  3. Farquhar S, Kossen J, Kuhn L, Gal Y (2024). Detecting hallucinations in large language models using semantic entropy. Nature, 630, 625-630. https://doi.org/10.1038/s41586-024-07421-0
  4. 総務省・経済産業省 (2026). AI事業者ガイドライン(第1.2版)別添(付属資料)概要. https://www.soumu.go.jp/main_content/001064300.pdf
  5. デジタル庁 (2024). テキスト生成AI利活用におけるリスクへの対策ガイドブック(α版). https://www.digital.go.jp/resources/generalitve-ai-guidebook
  6. 消費者庁. 消費者ホットライン. https://www.caa.go.jp/policies/policy/local_cooperation/local_consumer_administration/hotline/