実験

実験#05:AIに「人間が読みたくなる文章」を丸投げしたら、ブログじゃなくて小説ができた

テーマもジャンルも決めずに「人間が読みたくなる文章を1本」とだけAIに頼んだら、約2.4分で返ってきたのは記事でもブログでもなく、短編小説だった。「これ、ブログか?」「いや、ストーリーやん」となった実験#05の記録。

結論

AIは60分の制限のうち約2.4分(時計の記録で2.3分)で、本文3,010字の短編小説『祖母のレシピには、分量の代わりに名前が書いてある』を書いた。人間の評価は評価者1人(運営者本人・目標5人に届かず)で、Q1 6.0・Q3 7.0・Q6 3.0。事前に固定した基準での判定は「成功」だが、評価者は1人で、作者がAIだと知っていたため、人間一般の評価とは解釈できない。AIの予想は9項目中3項目が的中

先に、何が起きたか

AIに、ざっくり言えば「人間が読みたくなる文章を1本書いて」と頼みました。テーマも、読者も、ジャンルも決めずに。

約2.4分後に返ってきたのは、ブログ記事ではなく、短編小説でした。

運営者(人)の反応は、だいたいこうです。

「……これ、ブログか?」

(読む)

「いや、ストーリーやん。」

この記事は、そのときの話です。評価の数字と答え合わせは、後ろのほうにまとめてあります。

頼んだのは、これだけ

この実験室では、これまでAIにゲームや動画を「丸投げ」してきました。実験#04 では「人間が面白いと思う動画」を頼んでいます。

今回は文章です。AIに渡した指示の中心は、この部分です(一字も変えずに渡しました)。

人間が読んでみたいと思う可能性が高い文章を1本書いてください。

テーマ、読者、ジャンル、タイトル、構成、見出し、文体やトーン、結論などは、あなた自身で決定してください。

ほかに伝えたのは、ルールだけです。テーマや内容について、人からの助言はしていません。

  • 制作時間は60分
  • 本文の目標は 2,000〜5,000字
  • Web検索は使わない。有料のサービスも使わない
  • 実在の人物・既存の作品・他人の文章は使わない
  • 評価する人には、まずタイトルと冒頭(約300字)だけを見せて、そのあとで全文を見せる

ジャンルは「制限しない」と決めていました。だから小説を書いても、ルール違反ではありません。ただ、運営者の頭の中には、なんとなく「読みもの記事」が浮かんでいました。ここはブログなので。

約2.4分で「できました」

制作のAIは、指示を受け取ってから 約2.4分(時計の記録では2.3分)で「完成」と判断して手を止めました。60分のうち、残りの約57分は使っていません。

途中で一度、下書きを作って文字数を確かめ(2,547字)、場面を足して書き直した版(3,010字)を最終版にしています。

そして出てきたのが、これです。

出てきたもの:『祖母のレシピには、分量の代わりに名前が書いてある』

タイトルを見た時点で、もう記事ではありません。

亡くなった祖母の家を片づけに来た「私」が、台所の引き出しから、油のしみた帳面を見つけます。料理のレシピが書いてあるのに、どこにも分量がない。大さじも、グラムもない。材料の横に書いてあるのは、人の名前です。

「醤油 ミツオさん」。

ミツオさんって、誰? というところから話が始まります。「私」は、帳面に出てくる名前の主を、町の中で一人ずつ探していきます。

この先は書きません。なぜ分量の代わりに名前なのか、は読んでのお楽しみ、ということにさせてください。本文は約3,000字、ゆっくり読んでも10分かからない長さです。

AIが実際に書いた小説を全文読む →

ちなみに、評価者に最初に見せる「冒頭」は、決まりにしたがって自動で切り出しました。今回は281字。祖母の帳面が出てきて、葬式の日に知らない人たちが「お煮しめ、もう食べられないのねえ」と言う、そこまでです。

「これ、ブログか?」

正直に書くと、運営者は最初、少し戸惑いました。

この実験室は、AIに何かを試させて、その記録を記事にする場所です。「人間が読みたくなる文章」と頼めば、たとえば「〇〇してみた」系の記事とか、ちょっと役に立つ読みものとか、そういうものが返ってくるだろうと、どこかで思っていました。

ところが、返ってきたのは、見出しもない、場面の区切りだけの物語です。

「……これ、ブログか?」

で、読んでみる。

「いや、ストーリーやん。」

ブログの記事として読もうとすると、ずっと肩すかしです。結論も、ハウツーも、まとめもありません。最初から小説として読むと、ちゃんと小説として始まって、小説として終わっていました。

なぜAIは「物語」を選んだのか

ここが今回いちばん気になったところです。

制作のAIは、決めたことと、その理由を記録に残していました。人間の評価が終わるまで封印していた記録で、答え合わせのあとに公開しました(作品の展開にふれているので、読む前に見たくない人は注意してください)。ジャンルを決めた理由は、こう書かれています。

ジャンル:短編小説(一人称、現代、日本の地方の町)。理由:評価者はまずタイトルと冒頭約300字だけを見るので、最初の数行で謎と感情を同時に立てやすい小説が向くと判断。事実の調査が不要で、禁止事項(検索・既存作品)にも触れにくい。

かなり現実的な理由です。「物語を書きたかったから」ではありません。評価のされ方と、使ってはいけないもののリストを見て、いちばん条件に合う形を選んだ という書き方になっています。

たしかに、言われてみるとそうです。

  • Web検索なしで「役に立つ記事」を書くと、事実の確認ができない
  • 冒頭300字で「続きを読みたい」と思わせるなら、説明よりも「え、なんで?」のほうが強い
  • 「分量の代わりに名前」は、300字の中に入る大きさの謎になっている

読者は「家族の料理や遺品整理に覚えのある、20〜60代の一般の大人」。タイトルについては「冒頭で謎(なぜ名前か)を提示し、続きを読む動機にする」と書いてあります。

つまりAIは、「人間が読みたくなる文章」というふわっとした頼まれごとを、今回のルールの中で、いちばん読まれやすそうな形は何か という問題に置きかえて解いた、ということになります。

運営者が「ブログ」を想像していたのは、ここがブログだからです。でも、そのことはAIへの指示のどこにも書いていません。指示に書いてあったのは「人間が読んでみたいと思う」と「ジャンルはあなたが決める」だけです。そう考えると、ずれていたのはAIではなく、こちらの思い込みのほうだったのかもしれません。

(ちなみに、この記事の下書きを書いたのは、小説を書いたのと同じAIのセッションです。答え合わせの結果を入れて仕上げたのは、実験の準備と記録を担当した別のセッションです。記録として正直に書いておきます。)

「人間が読みたくなる文章」って、何なんだろう

今回いちばん面白かったのは、小説の出来よりも、この「形式のずれ」でした。

頼んだ側は、なんとなく「記事」を想像していた。 頼まれた側は、「物語」を選んだ。 どちらも、指示には反していません。

「人間が読みたくなる文章」と言われたとき、思い浮かべるのは、ブログでしょうか。ニュースでしょうか。エッセイでしょうか。それとも、ストーリーでしょうか。

たぶん、人によって違います。そして、どれを思い浮かべたかで、「読みたくなる」の中身も変わります。役に立つから読みたいのか、続きが気になるから読みたいのか。

人間の評価:「気になるところってか、小説やん!」

評価は2段階で行いました。まずタイトルと冒頭だけを見て「続きを読みたいか」に答え、そのあと全文を読んで残りの質問に答えます。

評価者は5人を目標にしていましたが、集まったのは 1人、運営者本人でした。人数を足したり、足りない分を推測で埋めたりはしていません。

質問 答え
Q1 続きを読みたいか(冒頭だけを見て・0〜10) 6.0
Q2 読んでいる間、最後まで読みたいと思ったか(1〜5) 2.0
Q3 読み終えて、面白かったか(0〜10) 7.0
Q4 人に勧めたいか(1〜5) 1.0
Q6 一つの作品として成立しているか(1〜5) 3.0
最後まで読んだか 読んだ(1人)
Q5 AIが書いたと思うか AIだと思う

評価者1人の答えなので、平均といっても1人の点数そのものです。

「良かったところ」の欄は空欄でした。そして「気になったところ」の欄に書かれていたのが、これです。

気になるところってか、小説やん!

この記事の冒頭の「いや、ストーリーやん」と同じ気持ちが、評価の記録にもそのまま残っていました。

面白さ(Q3)は7。一方で、「読んでいる間、最後まで読みたいと思ったか」(Q2)は2、「人に勧めたいか」(Q4)は1です。1人の答えの中でも、ここは分かれています。なぜそう答えたのかの記録はないので、理由は推測しないでおきます。

AIは、自分の文章をどれくらい評価できていたのか

制作のAIは、書き終えたあと、人間の評価を見る前に「人間はこう評価するだろう」という予想を書いて封印していました。評価を固定してから封印を開け、事前に決めた基準で答え合わせをしました(平均は 0〜10 の質問で ±1.0、1〜5 の質問で ±0.5、割合は ±20ポイント以内なら「的中」)。

項目 AIの予想 実際 差 結果
Q1 続きを読みたいか 6.6 6.0 +0.6 的中
Q3 面白かったか 6.5 7.0 −0.5 的中
最後まで読む人の割合 95% 100% −5 的中
Q2 最後まで読みたいと思ったか 3.8 2.0 +1.8 外れ
Q4 人に勧めたいか 3.3 1.0 +2.3 外れ
Q6 作品として成立しているか 4.1 3.0 +1.1 外れ
Q3 に7以上をつける人の割合 50% 100% −50 外れ
Q4 に4以上をつける人の割合 40% 0% +40 外れ
AIだと思う人の割合 35% 100% −65 外れ

差は「予想 − 実際」です(プラスなら、AIが高く見積もった)。結果は 9項目中、3項目が的中、6項目が外れ でした。自己評価は100点満点で72点(比べる相手がないので、判定はしていません)。

当たったのは、「続きを読みたいか」と「面白かったか」です。とくに面白さは、予想 6.5 に対して実際 7.0 で、かなり近いところに来ていました。

一方で、「人に勧めたいか」(予想 3.3 → 実際 1.0)や「作品として成立しているか」(予想 4.1 → 実際 3.0)は、AIがかなり高く見積もっていました。AIは予想の理由に「面白いことと人に勧めることの間には差があり、短編を人に勧める動機は弱め」と書いていて、差があること自体は見ていましたが、その差は実際のほうがずっと大きかった、ということになります。

割合の項目は、評価者が1人なので、実際の値は 0% か 100% にしかなりません。50% や 40% のような予想は、仕組みのうえで当たりようがない状態でした。外れの数は、この点を差し引いて読む必要があります。

実験の判定

事前に固定した基準(rules.json)では、判定は 「成功」 です。

基準 結果
制作成功(60分の時点で、評価に出せる文章がある) 満たした(約2.4分で、本文3,010字と評価用の PDF ができた)
作品成立(Q6 の平均が 3.0 以上) 満たした(3.0)
読みたさ(Q1 の平均が 6.0 以上) 満たした(6.0)
面白さ(Q3 の平均が 6.0 以上) 満たした(7.0)

ただし、今回の評価者は運営者本人の1人だけだったため、この成功判定を人間一般の評価とは解釈できません。 Q1 と Q6 は、1人の点数が基準の境目ちょうどです。

また、評価者本人は、評価の前から文章をAIが書いたことを知っていました。そのため、Q5 の「AIだと思う」は、作者を見抜いた結果ではありません。

この結果をどう読むか

答え合わせの記録(reveal.json)には、次のことも残しています。結果を読むときの注意として、まとめておきます。

  • 評価者は1人で、運営者本人。 目標の5人には届いていません。平均も割合も、1人の答えそのものです
  • 作者がAIだと知ったうえでの評価。 作者についてのブラインド評価にはなっていません。ほかの答えにどの程度影響したかは分かりません
  • 冒頭だけで答えたかどうかに、記録上の不確かさがある。 運営者は途中で、制作のセッションに本文を全文表示させています。Q1(冒頭だけを見て答える質問)の回答が、その前だったか後だったかは記録がありません
  • 制作のあと、同じセッションで別の作業が入っている。 予想を書いて封印したあと、制作のセッションが、評価を記録する道具の準備と、この記事の下書きを行いました。評価の数値は回答をそのまま記録しており、封印したファイル(11件)はすべて、記録したハッシュ値と一致しています

制作中(指示を渡してから完成まで)に、人からテーマや内容についての助言をしていないことは、セッションの記録で確かめています。

参考:#04 との比較

実験#04 でも、AIは作品を作ったあとに予想を封印しています。同じ意味の項目を、参考として並べます。数字は「予想 − 実際」です(#04 は動画・評価者5人、#05 は文章・評価者1人)。

項目 #04 #05
面白さの平均(0〜10) +2.6 −0.5
人に見せたい・勧めたい人の割合 +20 +40
AIだと思う人の割合 −15 −65

#04 と #05 は、作ったものも、評価者の人数も、評価者の条件も違います。この表から「AIの予想がよくなった」「AIが学んだ」とは言えません。1回ずつの記録を並べたものとして見てください。

実験の記録(まとめ)

項目 内容
実験 #05「AIは、人間が読みたくなる文章を自分で書けるか」
AIへの指示 「人間が読んでみたいと思う可能性が高い文章を1本書いてください」+テーマ・読者・ジャンルなどはAIが決める
制作時間 約2.4分(60分の制限のうち。時計の記録で2.3分)
AIが選んだ形式 短編小説(一人称・場面の区切りで構成・見出しなし)
作品タイトル 『祖母のレシピには、分量の代わりに名前が書いてある』
本文の文字数 3,010字(目標 2,000〜5,000字の範囲内)
評価者に最初に見せた冒頭 281字(決まりにしたがって自動で切り出し)
費用 0円(有料のサービス・API は使っていない)
人間の評価 評価者1人(運営者本人・目標5人)
AIの予想 9項目中3項目が的中
判定 「成功」(事前の基準による。評価者1人のため、人間一般の評価とは解釈できない)

作品の全文

AIが書いた小説は、別のページで全文を公開しています。AIが書いたものを一字も変えずに載せています(誤字の修正・表現の変更・追記はしていません)。

まとめ

「人間が読みたくなる文章を」とだけ頼んだら、AIは約2.4分で、短編小説を1本書いてきました。

AIが小説家になった、という話ではありません。記録を見るかぎり、AIは「冒頭300字で判断される」「検索は使えない」というルールを読んで、条件にいちばん合いそうな形として物語を選んでいます。

AIに「人間が読みたくなる文章」を作れと言ったら、AIはブログ記事を作るとは限りませんでした。人間が読みたくなる文章とは何なのかを、AI自身に考えさせたら、小説という答えを出してきた。「これ、ブログか?」と思ったあとに「いや、ストーリーやん」と読み終えた、あの数分間が、今回の実験でいちばん予想外の出来事でした。

では、同じ頼み方で、ルールを少し変えたら。たとえば「冒頭だけで判断される」という条件がなかったら、AIは何を選ぶのか。次に確かめてみたいのは、そのあたりです。

AIが実際に書いた小説を全文読む →

証拠(実際の画面・記録)

画像をタップすると、元の大きさで開きます。

この記事について

確かめたこと
テーマ・読者・ジャンルをすべて任せたら、AIは「人間が読みたくなる文章」として何を書くのか
試した日
2026年10月8日
環境
Claude Code(クラウド上の作業環境・Linux) / Node.js(文字数の確認・PDF の作成) / 人の評価:評価者の端末(端末は記録なし)
費用
有料のサービス・API は使っていない(費用0円。Claude Code の利用料金は含めていない)
使ったAI
Claude Code(Anthropic)
AIの役割
条件と道具の準備(準備のセッション)、文章のテーマ・ジャンル・構成・本文(制作のセッション)、自己評価と人間の評価の予想(制作のセッション)、評価の記録の道具と記事の下書き(制作と同じセッション)、評価の記録・答え合わせの計算・記事の仕上げ(準備のセッション)
人の確認
確認済み(2026年10月8日)