仕事でAIに作らせた文章や資料、そのまま出して大丈夫?研究では、もっともらしい間違いが混ざっていた

AIに頼んだ報告書やメールは、見た目はきれいに整っています。だからこそ「このまま出していいのかな」と迷うのは自然なことです。研究では、AIを使うと文章を書く仕事は速くなる一方、実在しない文献や細かな誤りが、もっともらしい形で混ざることがわかっています。出す前に確かめる場所を決めておけば、速さを生かしたまま防ぎやすくなります。
3行でわかる
- 文章を書く仕事の実験では、AIを使うと作業時間が平均40%短くなりました。速くなるのは確かです。
- 一方、2023年の研究では、AIが挙げた文献の18〜55%が実在しませんでした。誤りは見た目では気づきにくい形で混ざります。
- 医療などの研究では、時間に追われると機械の答えに頼りすぎやすいと報告されています。数字・固有名詞・出典の3つだけでも、出す前に原典で確かめます。
01結論から言うと
AIで作った文章や資料は、確かめずにそのまま出さないほうが安全です。全部を疑う必要はありません。数字・固有名詞・出典の3つに絞って原典で確かめ、確認の時間を先に取っておけば、誤りを出す前に見つけやすくなります。
AIは文章を「それらしく」整えるのが得意です。そのため、間違いも整った文章の中に紛れ込みます。読み手は、形が整っているほど中身も正しいと感じやすくなります。
大事なのは、AIを使うかどうかではなく、どこを人が確かめるかを決めておくことです。仕事がAIで変わっていく流れは、AIに仕事を奪われるのは本当?の記事でも整理しています。
02研究とデータでわかっていること
AIを使うと文章の仕事は速くなり、出来の評価も上がりました。ただし文献や数字の誤りが一定の割合で混ざり、時間に追われると機械の答えに頼りすぎやすいことも報告されています。
研究から、AIで作った資料に混ざりやすい誤りを整理すると次のとおりです。
- 実在しない出典: 題名も著者もそれらしいのに、どこにも存在しない文献。[2][3]
- 実在する出典の細かな誤り: 著者名・発表年・ページなどが違う。[2][3]
- 条件を守っていない答え: 指示した条件(期間や対象など)に合わないものが混ざる。[3]
Noy・Zhang(2023)[1]
事前登録したオンライン実験で、仕事に合わせた文章作成の課題を出し、半数にChatGPTを使ってもらいました。使った人は平均の作業時間が40%短くなり、出来の評価は18%上がりました。働く人どうしの差も小さくなりました。
対象: 大学を出た専門職453人(オンライン実験) / 限界: 中堅の専門職が書くような文章作成の課題で測ったもの。内容の事実確認が必要な仕事での正確さを測ったものではない。
Walters・Wilder(2023)[2]
ChatGPTに42のテーマで短い文献レビューを書かせ、出てきた636件の文献を一つずつ調べました。実在しない文献は、GPT-3.5で55%、GPT-4で18%でした。実在する文献でも、大きな誤りを含むものがGPT-3.5で43%、GPT-4で24%ありました。
対象: 2023年4月第1週にGPT-3.5とGPT-4が作成した84本の文章 / 限界: 当時のモデルの結果で、現在のAIでは割合が変わっている可能性がある。文献の引用という一つの作業に限った結果。
Chelliら(2024)[3]
人が作った11本の文献レビューと同じ条件で、AIに文献を集めさせました。題名・筆頭著者・年のうち2つ以上が違う「でっち上げ」の文献は、GPT-3.5で39.6%、GPT-4で28.6%、Bardで91.4%でした。著者らは、AIが出した文献は必ず研究者が確かめるべきだとしています。
対象: 肩の病気の文献レビュー11本、AIが挙げた文献471件(2023年7月時点のモデル) / 限界: 医学の1分野に限った結果で、ほかの分野や新しいモデルにそのまま当てはまるとは限らない。
Goddardら(2012)[4]
自動化された仕組みに頼りすぎる傾向(自動化バイアス)を調べた74本の研究をまとめました。仕事の量、作業の複雑さ、時間の制約が、頼りすぎを強める要因として挙げられました。研修や「最終的な責任は使う人にある」と意識づけることが、頼りすぎを減らす工夫として挙げられています。
対象: 医療を中心に、さまざまな分野の判断支援システムの研究 / 限界: 生成AIが広まる前の研究で、文章を作るAIでの結果ではない。
Lyell・Coiera(2017)[5]
40本の研究を比べると、頼りすぎは複数の作業を同時にしているときだけでなく、一つの作業でも起きていました。答えが正しいか確かめるのが難しい作業で見られ、頭の負担の大きさと関係しているとみられました。
対象: 890本から選んだ40本(うち医療は6本) / 限界: 研究ごとに報告の仕方がばらばらで、対照群と比べた結果を示した研究は少ない。
03まだわかっていないこと
最新のAIで、仕事の資料にどのくらい誤りが混ざるかは、まだはっきりしていません。どんな確かめ方が一番効くかを、職場で比べた研究も少ない状況です。
- 誤りの割合は、モデルの新しさや作業の種類で大きく変わる。今回の数字は2023年のモデルで測ったもの。
- 生成AIの文章で、人がどのくらい頼りすぎるか。自動化バイアスの研究の多くは、医療などの判断支援システムでのもの。
- 「数字・固有名詞・出典を確かめる」といった方法で、どのくらい誤りが減るか。職場で比べた研究は、今回調べた範囲では見つからなかった。
04今日からできること
確かめる場所を3つに絞り、確認の時間を先に取り、誰が確かめたかを残します。どれもお金はかからず、今日の資料から始められます。
数字・固有名詞・出典に印をつける
AIの文章を読み返し、数字、人名や会社名、日付、出典の部分に印をつけます。確かめるのはそこだけで構いません。誤りが見た目で分かりにくいのは、主にこの部分です。
目安 A4 1枚で3分
出典は自分で開いて照らし合わせる
AIが付けたリンクや文献名で終わりにせず、自分で検索して原典を開きます。題名・著者・年が合っているか、書かれた数字が本当に原典にあるかを見ます。見つからない出典は消します。
目安 出典1件につき2〜3分
確認の時間を先に予定に入れる
締め切り直前にAIで仕上げると、確かめる時間がなくなります。下書きをAIに頼むときは、提出の前に確認の時間を15分ほど先に確保しておきます。
目安 1回15分
「どこをAIで作り、誰が確かめたか」を残す
ファイルのメモ欄や送付メールに、AIで下書きした部分と確かめた人を一行書いておきます。あとで誤りが見つかっても、どこを見直せばよいかがすぐわかります。
目安 1行・30秒
勤め先にAIのルールがあれば、使ってよいサービスや、入力してよい情報の範囲を先に確認します。会社の情報を入力するときの注意は、ChatGPTに個人情報や会社の情報を入力しても大丈夫?にまとめています。
05よくある質問
AIが作った資料は、どのくらい間違っているの?
作業の種類とAIのモデルで大きく変わり、決まった割合はありません。2023年の研究では、AIに書かせた短い文献レビューで、挙げられた文献のうち実在しないものがGPT-3.5で55%、GPT-4で18%でした。新しいモデルでは減っている可能性がありますが、ゼロになったと確かめた研究は今回調べた範囲では見つかりませんでした。
AIが出典やリンクを付けていれば、信じていいの?
付いているだけでは確かめたことになりません。2023年の研究では、実在しない文献にもリンクが付いていることがありました。実在する文献でも、GPT-4の引用の24%に著者名や年などの誤りがありました。リンクを開き、題名・著者・年が合っているかを自分で見ます。
急いでいるときこそAIに任せたいけど、だめ?
任せてもよいのですが、確認の時間を省くと見落としが増えやすいと考えられます。自動化への頼りすぎを調べたレビューでは、仕事の量や時間の制約が、頼りすぎを強める要因として挙げられていました。下書きはAIに、確認の時間は先に確保する、と分けるのが現実的です。
AIの間違いを出してしまったら、誰の責任になる?
法的な責任の判断はここではできません。ただ、自動化への頼りすぎを調べたレビューでは、「最終的な責任は使う人にある」と意識することが、頼りすぎを減らす工夫として挙げられています。勤め先にAIのルールがあれば確認し、なければ上司に「AIで下書きした部分」を伝えておくと、あとで確かめやすくなります。
出典
- Noy S, Zhang W (2023). Experimental evidence on the productivity effects of generative artificial intelligence. Science, 381(6654), 187-192. https://doi.org/10.1126/science.adh2586
- Walters WH, Wilder EI (2023). Fabrication and errors in the bibliographic citations generated by ChatGPT. Scientific Reports, 13, 14045. https://doi.org/10.1038/s41598-023-41032-5
- Chelli M, Descamps J, Lavoué V, ほか (2024). Hallucination Rates and Reference Accuracy of ChatGPT and Bard for Systematic Reviews: Comparative Analysis. Journal of Medical Internet Research, 26, e53164. https://doi.org/10.2196/53164
- Goddard K, Roudsari A, Wyatt JC (2012). Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association, 19(1), 121-127. https://doi.org/10.1136/amiajnl-2011-000089
- Lyell D, Coiera E (2017). Automation bias and verification complexity: a systematic review. Journal of the American Medical Informatics Association, 24(2), 423-431. https://doi.org/10.1093/jamia/ocw105


