検索結果の上に出るAIの要約は信じていい?研究では、出典で裏づけられた文は約半分。大事な一文は出典を開いて確かめる

調べものをすると、検索結果のいちばん上にAIがまとめた答えが出てくることが増えました。読みやすく、出典の番号まで付いていると、それで十分に思えます。研究でわかっているのは、AI検索の答えには出典で裏づけられていない文がかなり混ざること、そして人は出典が付いているだけで信じやすくなり、ほとんど開かないことです。
3行でわかる
- 2023年に4つのAI検索を調べた研究では、答えの文のうち出典で完全に裏づけられていたのは平均51.5%でした。
- 出典が付くと、無関係な出典でも答えは信じられやすくなりました。一方で、出典を確かめた答えは1割未満でした。
- 要約は「入り口」として読み、大事な数字や日付は、付いている出典を1つ開いて確かめるのが基本です。
01 結論から言うと検索のAI要約は、そのまま信じていい?
検索結果に出るAIの要約は、そのまま信じず「下書き」として読むのが安全です。研究では、出典で裏づけられた文は約半分で、間違った答えを信じた人は誤りに気づいていませんでした。
AIの要約は、検索で見つけたページをもとに、AIが文章を組み立て直したものです。もとのページの文をそのまま見せているわけではありません。
そのため、もとのページに書かれていないことが要約に混ざることがあります。出典の番号が付いていても、その番号のページが、すぐ横の文を本当に支えているとは限りません。
ただし、要約がいつも間違っているわけでもありません。研究では、答えが正しいときは、AI検索を使った人の判断の正確さは、ふつうの検索と同じくらいでした。問題は、答えが間違っているときに、読む人が気づきにくいことです。
この記事は、検索サイトのAIによる要約や、AIが答えを書く検索に絞って扱います。チャット型のAI全般の間違い(ハルシネーション)がどのくらい起きるかは、AIの答えが間違っていたときの記事で整理しています。
02 研究とデータでわかっていることAI検索の答えは、どのくらい出典と合っている?
2023年の調査では、AI検索の答えの文のうち出典で完全に裏づけられたのは平均51.5%、出典の74.5%が横の文を支えていました。答えが間違っていると、使った人の正答率は大きく下がりました。
Liuら(2023)[1]
市販の4つのAI検索に、検索で実際に使われた質問や、ネット掲示板の自由な質問など1,450問を入力しました。答えの文のうち、付いている出典で完全に裏づけられていたのは平均51.5%でした。付いている出典のうち、その文を実際に支えていたのは74.5%でした。役に立ちそうに見える答えのシステムほど、出典の正確さが低い傾向もありました。
対象: 2023年2〜3月時点の英語のAI検索4種。答えの評価は人が行った / 限界: 「出典で裏づけられていない」は「内容が間違い」と同じではない。現在の検索サイトの要約は仕組みが変わっている可能性がある。
Spathariotiら(2025)[2]
配送用の車を2台から選ぶ課題で、AIが答えを書く検索と、ふつうの検索を比べました。AI検索の人は1問あたりの推定平均1.6分と、ふつうの検索の3.4分より速く終えました。答えが正しい問題では正答率に差はありませんでした。AIが荷室の広さを取り違える問題では、正しく選べた人の推定割合はふつうの検索の93%に対し、AI検索では47%でした。
対象: 米国のオンライン調査の参加者90人(実験1)と120人(実験2) / 限界: 車の荷室という1つの課題の実験で、実際の検索サイトの要約そのものを調べたものではない。
この実験では、間違った答えを見たあとに、質問を言い直して確かめ直した人はいませんでした。AI検索を使った人も、答えの信頼性を高く評価していました。研究者は、誤った答えを見た人が誤りに気づいていなかったと考えています。
2つ目の実験では、AIの自信が低い数字を赤く色付けして見せました。すると、AIが間違える問題で正しく選べた人は、色付けなしの26%から、58%と53%に増えました。主な理由は、自信が低い箇所を見て、もう一度調べ直す人が増えたことでした。
Dingら(2025)[3]
AIの答えに出典を0個・1個・5個付けて見せ、どのくらい信頼できるかを10段階で答えてもらいました。出典が付くと信頼は上がり、答えと関係のない出典をわざと付けた場合でも上がりました。出典付きの答え1,976件のうち、マウスを重ねて出典のURLを表示したのは193件(9.77%)でした。
対象: オンライン調査サイトで集めた303人(2024年3月実施) / 限界: 出典を「確かめた」は、URLを表示しただけでページを開いたかは含まない。参加者は自分で質問を考えた。
この実験では、出典を確かめた答えほど信頼の評価は低くなりました。無関係な出典が付いていて、それを確かめた答えの信頼は、出典なしの答えと変わりませんでした。出典は、開いて初めて役に立つということです。
3つの研究を並べると、次のようになります。
| 研究 | 調べたこと | わかったこと |
|---|---|---|
| Liuら(2023) | AI検索の答えと出典が合っているか | 出典で完全に裏づけられた文は約半分 |
| Spathariotiら(2025) | AI検索を使った人の判断 | 速くなるが、AIが間違えると正答率が大きく下がる |
| Dingら(2025) | 出典が信頼に与える影響 | 出典が付くだけで信じやすくなり、確かめるのは1割未満 |
総務省の生成AIの入門教材も、生成AIは裏付けのない回答をする場合があると説明しています。そのうえで、「情報源はある?」「その分野の専門家?」「他ではどう言われている?」と確かめるよう勧めています。正しいかどうかを生成AI自身に聞くのは適切ではない、とも書いています。
03 まだわかっていないこと今の検索サイトのAI要約の誤りの割合は?
今の検索サイトのAI要約が、どのくらいの割合で間違えるかを示した査読つきの研究は、今回見つかりませんでした。割合は、仕組み・時期・質問の種類で大きく変わります。
- 51.5%は2023年時点の4つのAI検索の数字です。今の検索サイトの要約は、仕組みも使っているAIも変わっています。
- 日本語の検索で、AIの要約がどのくらい正確かを調べた査読つきの研究は、今回の調べでは見つかりませんでした。
- 要約を見た人が、どのくらいリンク先のページを開かなくなったかを、実際の検索の記録で調べた査読つきの研究も見つかりませんでした。今回紹介した数字は、実験の中での行動です。
- 自信の低い箇所に色を付ける工夫は実験で効果がありましたが、実際の検索サイトで同じ効果が出るかはわかっていません。
04 今日からできることAI要約の答えは、どう確かめればいい?
AIの要約は入り口として読み、大事な部分は付いている出典を1つ開いて、同じことが書かれているか確かめます。あわせて、そのページの日付と、誰が書いたかを見ます。
大事な一文だけ、出典を開いて照らし合わせる
数字・日付・金額・手順など、行動につながる一文を選びます。その文の横の出典を開き、ページ内検索で同じ数字や言葉があるか探します。見つからなければ、その文は保留にします。
目安 1つの答えにつき2〜3分
開いたページの日付と書き手を見る
更新日がいつか、書いたのが公的機関・専門家・お店のどれかを確かめます。制度や料金は変わるので、古いページの情報は今と違うことがあります。
目安 1分
要約の下の、ふつうの検索結果も1つ見る
総務省の教材のチェックリストにある「他ではどう言われている?」の確認です。公式サイトなど、別のページで同じことが書かれているかを見ます。
目安 2分
AIに「正しい?」と聞き直して終わりにしない
総務省の教材は、生成AIに真偽を聞くのは適切ではないとしています。確かめるときは、AIではなく出典や公式の情報を見ます。
目安 0分(習慣にする)
病気や薬のことを検索してAIの答えが出たときは、AIに病気や薬のことを聞いたときの記事も読んでください。研究では、AI単体が正解できても、使った人の判断は良くなりませんでした。AIの答えを信じて契約やお金の損をしたときは、AIの答えを信じて損をしたときの記事に相談先をまとめています。
05よくある質問
検索結果の上に出るAIの要約は、どのくらい間違える?
今の検索サイトの要約の誤りの割合を示した査読つきの研究は、今回見つかりませんでした。2023年に4つのAI検索を調べた研究では、答えの文のうち出典で完全に裏づけられていたのは平均51.5%でした。割合は仕組み・時期・質問で変わります。
出典の番号が付いていれば、信じて大丈夫?
大丈夫とは言えません。2023年の研究では、付いていた出典のうち横の文を実際に支えていたのは74.5%でした。別の実験では、無関係な出典でも、付いているだけで答えが信じられやすくなりました。出典は開いて、同じことが書かれているか確かめてはじめて意味があります。
AIの要約が正しいか、AIに聞いて確かめてもいい?
おすすめできません。総務省の生成AIの入門教材は、生成AIが偽・誤情報を答えるおそれがあるため、生成AIに真偽を聞くのは適切ではないとしています。出典のページや公式の情報で確かめてください。
AIの要約を使うと、調べものは速くなる?
速くなることはあります。車を選ぶ課題の実験では、AI検索の人は1問あたりの推定平均1.6分で、ふつうの検索の3.4分より速く終えました。ただし、AIが間違えた問題では正しく選べた人が大きく減りました。速さの分、大事な部分の確認に時間を回すのが安全です。
出典
- Liu NF, Zhang T, Liang P (2023). Evaluating Verifiability in Generative Search Engines. Findings of the Association for Computational Linguistics: EMNLP 2023, 7001–7025. https://doi.org/10.18653/v1/2023.findings-emnlp.467
- Spatharioti SE, Rothschild D, Goldstein DG, Hofman JM (2025). Effects of LLM-based Search on Decision Making: Speed, Accuracy, and Overreliance. CHI Conference on Human Factors in Computing Systems (CHI '25). https://doi.org/10.1145/3706598.3714082
- Ding Y, Facciani M, Joyce E, et al. (2025). Citations and Trust in LLM Generated Responses. Proceedings of the AAAI Conference on Artificial Intelligence, 39(22), 23787–23795. https://doi.org/10.1609/aaai.v39i22.34550
- 総務省. 生成AIはじめの一歩~生成AIの入門的な使い方と注意点~(安心・安全なインターネット利用ガイド). 2026年10月10日閲覧. https://www.soumu.go.jp/use_the_internet_wisely/special/generativeai/


