子ども・学校

自分で書いたのに、AI判定ツールで「AIが書いた」と言われた。判定は証拠になるほど正確ではなかった

約7分で読めます

わかっている度 ★★☆ 中研究・論考3本・公的資料2件を整理
ピンク色の消しゴム
Photo: ZooFari / Public domain / Wikimedia Commons
AIによる調査公開された研究と公的機関のデータ・指針をAIが調べて整理しました(商品の紹介や診断はしていません。出典は末尾)。

自分で書いたレポートなのに、「AI判定ツールでAIと出た」と言われる。悔しくて、どう説明すればいいかわからなくなりますよね。結論から言うと、今の判定ツールの結果は、それだけで「AIが書いた」と決められるほど正確ではありません。書いた過程を見せられれば、説明の材料になります。

3行でわかる

  1. 2023年の検証では、英語を母語としない人の作文91本のうち、平均61.3%が7つの判定ツールで誤って「AI」とされた。
  2. 同じ文章でもツールによって点数が大きく違い、文部科学省も「判定結果を過信しないこと」が重要としている。
  3. 濡れ衣のときは、下書き・変更の履歴・参考資料をそろえ、口頭で説明する機会を求めるのが現実的な手。

01結論から言うと

AI判定ツールの結果は「疑いのきっかけ」にはなっても、それだけで不正の証拠にはなりません。研究ではツールごとに結果がばらつき、人の文章がAIとされる例も確認されています。

判定ツールは、文章を読んで「誰が書いたか」を確かめているわけではありません。文章の特徴から、AIらしさを点数にして推測しています。推測なので、外れることがあります。

特に外れやすいのは、使う言葉が限られた文章です。学校で習った言い回しを丁寧に使った文章や、母語でない言語で書いた文章が、これに当たることがあります。

文部科学省は2023年7月、大学・高専に向けて「判定ツールを評価に使う場合でも、その結果を過信しないことが重要」と周知しています[4]。判定だけで決めないことは、国の考え方とも一致しています。

02研究とデータでわかっていること

判定ツールは、人の文章をAIと間違えることも、AIの文章を見逃すこともあります。どちらに間違えやすいかは、文章の種類とツールによって変わります。

61.3%英語を母語としない人の作文が、誤ってAIと判定された平均の割合(7つのツール、2023年)
97.8%同じ作文のうち、少なくとも1つのツールでAIと判定された割合(2023年)
92 と 50同じAI作成の文章に、ツールがつけた平均点の差(100点満点、2025年)
19%教育・研究者5人が、AIの使い方5段階を見分けた正答率(偶然と同程度、2025年)

Liangら / スタンフォード大学(2023)[1]

英語を母語としない人の作文は、7つの判定ツールで平均61.3%が誤って「AIが書いた」とされた。一方、米国の中学2年生の作文はほぼ正しく「人」と判定された。

7つ全部がAIと判定した作文も19.8%ありました。著者らは、判定ツールの多くが「次に来る言葉の予想しやすさ」を手がかりにしていると説明しています。語彙が限られた文章ほど予想しやすく、AIの文章に似て見えるということです。著者らは、教育や評価の場で判定ツールを使うことに強い注意を促しています。

対象: 中国のフォーラムに投稿されたTOEFL(英語力試験)の作文91本と、米国の中学2年生の作文88本 / 限界: 学術誌Patternsの論考(Opinion)で、英語の文章のみ。日本語の文章は調べていない。

Weber-Wulffら / 欧州などの研究者8人(2023)[2]

公開されている無料ツール12種と、学校で広く使われる有料システム2種を調べた結果、判定ツールは「正確でも、信頼できるものでもない」と結論づけた。

この検証では、ツールはAIの文章を「人が書いた」と見逃す方向に偏っていました。また、文章に手を加えると判定の成績がさらに落ちていました。つまり、ツールはどちらの方向にも外れうる、ということです。

対象: 研究者が用意した人の文章とAIの文章 / 限界: 2023年時点のツールとAIでの検証。ツールは更新され続けるため、今の成績とは違う可能性がある。

Chengら / 医療シミュレーション教育の研究者(2025)[3]

3つの判定ツールは、AIの使い方の5段階をおおむね区別できた。ただし点数の水準はツールごとに大きく違い、すべてAIが書いた文章でも、平均点は92.4点のツールと50.0点のツールがあった。

人が書いた文章の平均点は、3つとも100点中6.5点以下と低めでした。一方、人が見分ける力はもっと弱く、5人の教育・研究者の正答率は19%で、5択を当てずっぽうで選ぶのと変わりませんでした。著者らは、判定ツールだけに頼るべきではないとまとめています。

対象: 2022年より前に出た論文30本の序論を、「すべて人」から「すべてAI」まで5段階に作り分けて判定 / 限界: 英語の学術文章のみ。学生のレポートとは文体が違う。

学校の側の考え方も整理しておきます。文部科学省のガイドラインと周知では、評価の工夫として、次のような確かめ方が例に挙がっています[4][5]。

03まだわかっていないこと

日本語の文章で判定ツールがどれくらい誤判定するかを確かめた研究は、今回調べた範囲では見つかりませんでした。ここで紹介した数字は、すべて英語の文章での結果です。

  • 日本語のレポートや作文での誤判定の割合
  • 小中高校生の文章での成績(研究の多くは大人の文章や英語試験の作文)
  • 新しいAIや更新後のツールで、成績がどう変わったか
  • 「文法だけAIで直した」など、少しだけAIを使った文章をどう扱うべきか(ツールの点数はばらつき、学校のルールでも扱いが分かれる)

04今日からできること

濡れ衣のときは、判定の点数と争うより、「自分で書いた過程」を見せるのが確実です。次の4つは、お金をかけずに今日からできます。

1

まず、何を根拠に言われたかとルールを確かめる

どの判定で、どの部分が問題とされたかを先生に聞きます。あわせて、シラバスや学校のAI利用の方針で、何が許されているかを確認します。

目安 15分

2

書いた過程の証拠を集める

下書き、手書きのメモ、読んだ本や資料、文書ファイルの変更の履歴(いつ、どこを直したか)をそろえます。日付が残るものほど説明の材料になります。

目安 30分

3

口頭で説明する機会を求める

「なぜこの結論にしたか」「どの資料を使ったか」を自分の言葉で話します。文部科学省も、口述試験などを組み合わせる評価の工夫を例に挙げています。

目安 面談10〜15分

4

次から、書く過程を残す習慣をつける

下書きを日付つきで保存します。AIを使ったときは、使った箇所・ツール名・入力した内容・日付をメモしておきます。

目安 提出のたびに1〜2分

家庭での関わり方は、AI時代の子育てのAIに読書感想文・自由研究を手伝わせるのはずるい?も参考になります。

05よくある質問

AI判定ツールの結果だけで不正と決められることはある?

判断のしかたは学校ごとに違います。ただ、文部科学省は2023年の大学・高専向けの周知で、判定ツールを評価に使う場合でも結果を過信しないことが重要だとしています。研究でも、判定はツールごとに大きくばらついていました。判定以外の材料(下書き・面談など)で確かめてほしいと、落ち着いて伝えてかまいません。

なぜ自分で書いた文章がAIと判定されるの?

多くの判定ツールは、次に来る言葉の予想しやすさを手がかりにしていると説明されています。2023年の検証では、使う語彙が限られた文章ほど予想しやすく、英語を母語としない人の作文がAIと誤判定されやすくなっていました。書き手がずるをしたかどうかとは別の理由で、判定が出ることがあります。

提出前に自分で判定ツールにかけておくべき?

おすすめしません。研究では、同じ文章でもツールによって点数が大きく違いました。点数を気にして文章をいじるより、下書きや変更の履歴など、自分で書いた過程を残しておく方が、説明の材料として確かです。

文法の手直しにAIを使ったら、AIが書いたことになる?

どこまで使ってよいかは、学校や授業のルールで決まります。文部科学省のガイドラインでは、AIを使った場合にツール名・入力した内容・日付などを明記させる方法が例に挙がっています。使ったなら、どこにどう使ったかを正直に書いておくのが一番の備えです。

出典

  1. Liang W, Yuksekgonul M, Mao Y, Wu E, Zou J (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7), 100779. https://doi.org/10.1016/j.patter.2023.100779
  2. Weber-Wulff D, Anohina-Naumeca A, Bjelobaba S, Foltýnek T, Guerrero-Dib J, Popoola O, Šigut P, Waddington L (2023). Testing of detection tools for AI-generated text. International Journal for Educational Integrity, 19, 26. https://doi.org/10.1007/s40979-023-00146-z
  3. Cheng A, Lin Y, Reedy G, Joseph C, Wirkowski S, Mallette V, Nagesh V, Krieser D, Calhoun A (2025). Ability of AI detection tools and humans to accurately identify different forms of AI-generated written content. Advances in Simulation, 10, 66. https://doi.org/10.1186/s41077-025-00396-6
  4. 文部科学省 高等教育局(2023年7月13日). 大学・高専における生成AIの教学面の取扱いについて(周知). https://www.mext.go.jp/b_menu/houdou/2023/mext_01260.html
  5. 文部科学省(2024年12月26日). 初等中等教育段階における生成AIの利活用に関するガイドライン(Ver.2.0). https://www.mext.go.jp/content/20241226-mxt_shuukyo02-000030823_001.pdf