AI生成の短編が人間超えの評価 判別正答4割 士業のAI開示3論点

ケンブリッジ大学出版局が2026年8月に公表した研究で、AI生成の短編が人間の作品より高評価となり、判別正答率は約4割にとどまりました。士業事務所のAI利用開示を考える3つの論点を整理します。

AI生成の短編が人間超えの評価 判別正答4割 士業のAI開示3論点

AIが書いた短編小説は、人間の作品より高く評価されました。

ケンブリッジ大学出版局が2026年8月4日に公表した研究で、生成AIが書いた短編小説が、人間の作家による作品よりも品質と没入度の両面で高い評価を受けたことが示されました。さらに参加者は、どちらがAIの作品かをほとんど見分けられませんでした。読み手が文章の出どころを判定できるという前提が揺らいだ形で、AI生成の文章をどう扱うかという論点は、士業事務所にとっても他人事ではありません。

開いたページに光が差し込む本

AI作品が品質でも没入度でも上回った

研究チームが確認したのは、AI生成の短編が品質と没入度の両方で人間の作品を上回ったという結果です。論文は Sydney Sears と Deena Skolnick Weisberg によるもので、学術誌 Judgment and Decision Making に掲載されました(DOI 10.1017/jdm.2026.10042)。公表資料によれば、研究はアメリカのヴィラノバ大学が主導し、18歳から81歳までの参加者を対象としています。

素材には、評価の定まった文芸誌や短編集に掲載された人間の作家による短編3本と、それに対応する形で ChatGPT が生成した短編3本が使われました。公表資料によると、1つ目の実験では1,682人が短編を1本読み、その作者が人間かAIかを、正しく、あるいは誤って伝えられたうえで、作品の質と、どれだけ物語に引き込まれたかを評価しています。没入度の測定には Story World Absorption Scale を編集した尺度が使われ、注意・没入・感情的な関与・イメージの喚起といった側面が拾われました。

その結果、AI生成の短編のほうが、質の評価も没入度の評価も高くなりました。しかも最も高い評価を得たのは、AIが書いたにもかかわらず「人間が書いた」と伝えられた作品です。TIMEは、AI生成の作品が質で6パーセント、没入度で8パーセント上回り、人間が書いたと信じられた場合にはさらに3パーセント上乗せされたと伝えています。研究で使われた短編はオープンサイエンス基盤のプロジェクトページで公開されており、誰でも読み比べられます。

見分けられなかった、という結果のほうが重い

より重い意味を持つのは、参加者がAI生成の文章をほとんど見分けられなかったという点です。公表資料によれば、2つ目の実験では424人、3つ目では481人が、人間の作品とAIの作品を1本ずつ、出どころを伏せた状態で読み、どちらがどちらかを当てるよう求められました。正答率は2つ目の実験で39.93パーセント、3つ目で51.97パーセントでした。前者は偶然を下回っており、後者も偶然と差がない水準です。

もっとも、見抜ける人がまったくいなかったわけではありません。AIの利用経験を高く自己申告した人ほど正答率が上がり、2つ目の実験では自己申告スコアが1点上がるごとに正答のオッズが14パーセント上がりました。3つ目の実験で用いられた AI リテラシー尺度(AILS)では、1点あたり33パーセントの上昇です。一方で、文学に詳しいと答えた人の正答率は上がりませんでした。文章を読み慣れていることと、AIの文章を見抜けることは別だという結果です。

Weisberg は公表資料のなかで「参加者は、人間が書いたと伝えられながら実際にはAIが書いた物語に、最も高い評価を与えました」と述べています。あわせて、AIの文章にはダッシュの多用や「it’s not just X, it’s Y」といった構文の型があり、AIに触れている人はその型に気づけるとも説明しています。見抜く力は勘ではなく、学んで身につくものだという見立てです。

士業事務所が読み取れる3つの論点

この研究から士業事務所が読み取れる論点は、開示のラベル、レビュー担当の選び方、入力データの扱いの3つです。いずれも制度の変更ではなく、事務所が自分で決める領域の話になります。

1つ目は、開示のラベルそのものが評価を動かすという事実です。同じ文章でも「人間が書いた」と伝えられたほうが高く評価されたのですから、AIで下書きしたことを顧客に伝えると、内容が変わらなくても受け取られ方が変わる可能性があります。ただし、伝えないという選択が信頼の観点で成り立つかは別の問題です。この点は依頼者へのAI利用の説明と告知で扱った、委任契約と説明範囲の設計に直結します。報道の世界でも開示の記録が積み上がっており、ピュリツァー賞でAI利用の開示が過去最多となった件は、開示を前提に運用する流れが広がっていることを示しています。

2つ目は、所内でAI生成物をチェックする担当を誰にするかという論点です。今回の研究では、文学の素養ではなくAIの利用経験が判別の精度に効きました。事務所に置き換えれば、経験年数の長い人が自動的にAI生成物の癖を見抜けるわけではない、ということになります。生成AIが作り出す架空の判例や条文を止める仕組みについては、生成AIの架空判例・架空条文を止める方法で手順を整理しています。

3つ目は入力データの扱いです。今回の研究は文章の評価を調べたものであり、ChatGPT は短編の生成に使われただけで、参加者の情報がAIに入力されたわけではありません。それでも事務所で同じ手順を再現する場面では、どのプランを使い、入力した内容が学習に使われる設定かどうかを提供事業者の公表資料で確認する作業が別途必要になります。研究の結果からこの点を読み取ることはできませんので、ツールごとの公表内容を個別に確認する形になります。

まとめ

ケンブリッジ大学出版局が2026年8月に公表した研究では、AI生成の短編が人間の作品より高く評価され、判別の正答率は39.93パーセントと51.97パーセントにとどまりました。AIリテラシーの高い人ほど見抜けた一方、文学の素養は効いていません。読み手が出どころを判定できない以上、AI利用をどう開示するかは、事務所が自分で決める設計の問題になります。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: EurekAlert!(Cambridge University Press)

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。