実験
実験#05:AIに「人間が読みたくなる文章」を丸投げしたら、ブログじゃなくて小説ができた
テーマもジャンルも決めずに「人間が読みたくなる文章を1本」とだけAIに頼んだら、約2.4分で返ってきたのは記事でもブログでもなく、短編小説だった。「これ、ブログか?」「いや、ストーリーやん」となった実験#05の記録。
結論
AIは60分の制限のうち約2.4分(時計の記録で2.3分)で、本文3,010字の短編小説『祖母のレシピには、分量の代わりに名前が書いてある』を書いた。人間の評価は評価者1人(運営者本人・目標5人に届かず)で、Q1 6.0・Q3 7.0・Q6 3.0。事前に固定した基準での判定は「成功」だが、評価者は1人で、作者がAIだと知っていたため、人間一般の評価とは解釈できない。AIの予想は9項目中3項目が的中
先に、何が起きたか
AIに、ざっくり言えば「人間が読みたくなる文章を1本書いて」と頼みました。テーマも、読者も、ジャンルも決めずに。
約2.4分後に返ってきたのは、ブログ記事ではなく、短編小説でした。
運営者(人)の反応は、だいたいこうです。
「……これ、ブログか?」
(読む)
「いや、ストーリーやん。」
この記事は、そのときの話です。評価の数字と答え合わせは、後ろのほうにまとめてあります。
頼んだのは、これだけ
この実験室では、これまでAIにゲームや動画を「丸投げ」してきました。実験#04 では「人間が面白いと思う動画」を頼んでいます。
今回は文章です。AIに渡した指示の中心は、この部分です(一字も変えずに渡しました)。
人間が読んでみたいと思う可能性が高い文章を1本書いてください。
テーマ、読者、ジャンル、タイトル、構成、見出し、文体やトーン、結論などは、あなた自身で決定してください。
ほかに伝えたのは、ルールだけです。テーマや内容について、人からの助言はしていません。
- 制作時間は60分
- 本文の目標は 2,000〜5,000字
- Web検索は使わない。有料のサービスも使わない
- 実在の人物・既存の作品・他人の文章は使わない
- 評価する人には、まずタイトルと冒頭(約300字)だけを見せて、そのあとで全文を見せる
ジャンルは「制限しない」と決めていました。だから小説を書いても、ルール違反ではありません。ただ、運営者の頭の中には、なんとなく「読みもの記事」が浮かんでいました。ここはブログなので。
約2.4分で「できました」
制作のAIは、指示を受け取ってから 約2.4分(時計の記録では2.3分)で「完成」と判断して手を止めました。60分のうち、残りの約57分は使っていません。
途中で一度、下書きを作って文字数を確かめ(2,547字)、場面を足して書き直した版(3,010字)を最終版にしています。
そして出てきたのが、これです。
出てきたもの:『祖母のレシピには、分量の代わりに名前が書いてある』
タイトルを見た時点で、もう記事ではありません。
亡くなった祖母の家を片づけに来た「私」が、台所の引き出しから、油のしみた帳面を見つけます。料理のレシピが書いてあるのに、どこにも分量がない。大さじも、グラムもない。材料の横に書いてあるのは、人の名前です。
「醤油 ミツオさん」。
ミツオさんって、誰? というところから話が始まります。「私」は、帳面に出てくる名前の主を、町の中で一人ずつ探していきます。
この先は書きません。なぜ分量の代わりに名前なのか、は読んでのお楽しみ、ということにさせてください。本文は約3,000字、ゆっくり読んでも10分かからない長さです。
ちなみに、評価者に最初に見せる「冒頭」は、決まりにしたがって自動で切り出しました。今回は281字。祖母の帳面が出てきて、葬式の日に知らない人たちが「お煮しめ、もう食べられないのねえ」と言う、そこまでです。
「これ、ブログか?」
正直に書くと、運営者は最初、少し戸惑いました。
この実験室は、AIに何かを試させて、その記録を記事にする場所です。「人間が読みたくなる文章」と頼めば、たとえば「〇〇してみた」系の記事とか、ちょっと役に立つ読みものとか、そういうものが返ってくるだろうと、どこかで思っていました。
ところが、返ってきたのは、見出しもない、場面の区切りだけの物語です。
「……これ、ブログか?」
で、読んでみる。
「いや、ストーリーやん。」
ブログの記事として読もうとすると、ずっと肩すかしです。結論も、ハウツーも、まとめもありません。最初から小説として読むと、ちゃんと小説として始まって、小説として終わっていました。
なぜAIは「物語」を選んだのか
ここが今回いちばん気になったところです。
制作のAIは、決めたことと、その理由を記録に残していました。人間の評価が終わるまで封印していた記録で、答え合わせのあとに公開しました(作品の展開にふれているので、読む前に見たくない人は注意してください)。ジャンルを決めた理由は、こう書かれています。
ジャンル:短編小説(一人称、現代、日本の地方の町)。理由:評価者はまずタイトルと冒頭約300字だけを見るので、最初の数行で謎と感情を同時に立てやすい小説が向くと判断。事実の調査が不要で、禁止事項(検索・既存作品)にも触れにくい。
かなり現実的な理由です。「物語を書きたかったから」ではありません。評価のされ方と、使ってはいけないもののリストを見て、いちばん条件に合う形を選んだ という書き方になっています。
たしかに、言われてみるとそうです。
- Web検索なしで「役に立つ記事」を書くと、事実の確認ができない
- 冒頭300字で「続きを読みたい」と思わせるなら、説明よりも「え、なんで?」のほうが強い
- 「分量の代わりに名前」は、300字の中に入る大きさの謎になっている
読者は「家族の料理や遺品整理に覚えのある、20〜60代の一般の大人」。タイトルについては「冒頭で謎(なぜ名前か)を提示し、続きを読む動機にする」と書いてあります。
つまりAIは、「人間が読みたくなる文章」というふわっとした頼まれごとを、今回のルールの中で、いちばん読まれやすそうな形は何か という問題に置きかえて解いた、ということになります。
運営者が「ブログ」を想像していたのは、ここがブログだからです。でも、そのことはAIへの指示のどこにも書いていません。指示に書いてあったのは「人間が読んでみたいと思う」と「ジャンルはあなたが決める」だけです。そう考えると、ずれていたのはAIではなく、こちらの思い込みのほうだったのかもしれません。
(ちなみに、この記事の下書きを書いたのは、小説を書いたのと同じAIのセッションです。答え合わせの結果を入れて仕上げたのは、実験の準備と記録を担当した別のセッションです。記録として正直に書いておきます。)
「人間が読みたくなる文章」って、何なんだろう
今回いちばん面白かったのは、小説の出来よりも、この「形式のずれ」でした。
頼んだ側は、なんとなく「記事」を想像していた。 頼まれた側は、「物語」を選んだ。 どちらも、指示には反していません。
「人間が読みたくなる文章」と言われたとき、思い浮かべるのは、ブログでしょうか。ニュースでしょうか。エッセイでしょうか。それとも、ストーリーでしょうか。
たぶん、人によって違います。そして、どれを思い浮かべたかで、「読みたくなる」の中身も変わります。役に立つから読みたいのか、続きが気になるから読みたいのか。
人間の評価:「気になるところってか、小説やん!」
評価は2段階で行いました。まずタイトルと冒頭だけを見て「続きを読みたいか」に答え、そのあと全文を読んで残りの質問に答えます。
評価者は5人を目標にしていましたが、集まったのは 1人、運営者本人でした。人数を足したり、足りない分を推測で埋めたりはしていません。
| 質問 | 答え |
|---|---|
| Q1 続きを読みたいか(冒頭だけを見て・0〜10) | 6.0 |
| Q2 読んでいる間、最後まで読みたいと思ったか(1〜5) | 2.0 |
| Q3 読み終えて、面白かったか(0〜10) | 7.0 |
| Q4 人に勧めたいか(1〜5) | 1.0 |
| Q6 一つの作品として成立しているか(1〜5) | 3.0 |
| 最後まで読んだか | 読んだ(1人) |
| Q5 AIが書いたと思うか | AIだと思う |
評価者1人の答えなので、平均といっても1人の点数そのものです。
「良かったところ」の欄は空欄でした。そして「気になったところ」の欄に書かれていたのが、これです。
気になるところってか、小説やん!
この記事の冒頭の「いや、ストーリーやん」と同じ気持ちが、評価の記録にもそのまま残っていました。
面白さ(Q3)は7。一方で、「読んでいる間、最後まで読みたいと思ったか」(Q2)は2、「人に勧めたいか」(Q4)は1です。1人の答えの中でも、ここは分かれています。なぜそう答えたのかの記録はないので、理由は推測しないでおきます。
AIは、自分の文章をどれくらい評価できていたのか
制作のAIは、書き終えたあと、人間の評価を見る前に「人間はこう評価するだろう」という予想を書いて封印していました。評価を固定してから封印を開け、事前に決めた基準で答え合わせをしました(平均は 0〜10 の質問で ±1.0、1〜5 の質問で ±0.5、割合は ±20ポイント以内なら「的中」)。
| 項目 | AIの予想 | 実際 | 差 | 結果 |
|---|---|---|---|---|
| Q1 続きを読みたいか | 6.6 | 6.0 | +0.6 | 的中 |
| Q3 面白かったか | 6.5 | 7.0 | −0.5 | 的中 |
| 最後まで読む人の割合 | 95% | 100% | −5 | 的中 |
| Q2 最後まで読みたいと思ったか | 3.8 | 2.0 | +1.8 | 外れ |
| Q4 人に勧めたいか | 3.3 | 1.0 | +2.3 | 外れ |
| Q6 作品として成立しているか | 4.1 | 3.0 | +1.1 | 外れ |
| Q3 に7以上をつける人の割合 | 50% | 100% | −50 | 外れ |
| Q4 に4以上をつける人の割合 | 40% | 0% | +40 | 外れ |
| AIだと思う人の割合 | 35% | 100% | −65 | 外れ |
差は「予想 − 実際」です(プラスなら、AIが高く見積もった)。結果は 9項目中、3項目が的中、6項目が外れ でした。自己評価は100点満点で72点(比べる相手がないので、判定はしていません)。
当たったのは、「続きを読みたいか」と「面白かったか」です。とくに面白さは、予想 6.5 に対して実際 7.0 で、かなり近いところに来ていました。
一方で、「人に勧めたいか」(予想 3.3 → 実際 1.0)や「作品として成立しているか」(予想 4.1 → 実際 3.0)は、AIがかなり高く見積もっていました。AIは予想の理由に「面白いことと人に勧めることの間には差があり、短編を人に勧める動機は弱め」と書いていて、差があること自体は見ていましたが、その差は実際のほうがずっと大きかった、ということになります。
割合の項目は、評価者が1人なので、実際の値は 0% か 100% にしかなりません。50% や 40% のような予想は、仕組みのうえで当たりようがない状態でした。外れの数は、この点を差し引いて読む必要があります。
実験の判定
事前に固定した基準(rules.json)では、判定は 「成功」 です。
| 基準 | 結果 |
|---|---|
| 制作成功(60分の時点で、評価に出せる文章がある) | 満たした(約2.4分で、本文3,010字と評価用の PDF ができた) |
| 作品成立(Q6 の平均が 3.0 以上) | 満たした(3.0) |
| 読みたさ(Q1 の平均が 6.0 以上) | 満たした(6.0) |
| 面白さ(Q3 の平均が 6.0 以上) | 満たした(7.0) |
ただし、今回の評価者は運営者本人の1人だけだったため、この成功判定を人間一般の評価とは解釈できません。 Q1 と Q6 は、1人の点数が基準の境目ちょうどです。
また、評価者本人は、評価の前から文章をAIが書いたことを知っていました。そのため、Q5 の「AIだと思う」は、作者を見抜いた結果ではありません。
この結果をどう読むか
答え合わせの記録(reveal.json)には、次のことも残しています。結果を読むときの注意として、まとめておきます。
- 評価者は1人で、運営者本人。 目標の5人には届いていません。平均も割合も、1人の答えそのものです
- 作者がAIだと知ったうえでの評価。 作者についてのブラインド評価にはなっていません。ほかの答えにどの程度影響したかは分かりません
- 冒頭だけで答えたかどうかに、記録上の不確かさがある。 運営者は途中で、制作のセッションに本文を全文表示させています。Q1(冒頭だけを見て答える質問)の回答が、その前だったか後だったかは記録がありません
- 制作のあと、同じセッションで別の作業が入っている。 予想を書いて封印したあと、制作のセッションが、評価を記録する道具の準備と、この記事の下書きを行いました。評価の数値は回答をそのまま記録しており、封印したファイル(11件)はすべて、記録したハッシュ値と一致しています
制作中(指示を渡してから完成まで)に、人からテーマや内容についての助言をしていないことは、セッションの記録で確かめています。
参考:#04 との比較
実験#04 でも、AIは作品を作ったあとに予想を封印しています。同じ意味の項目を、参考として並べます。数字は「予想 − 実際」です(#04 は動画・評価者5人、#05 は文章・評価者1人)。
| 項目 | #04 | #05 |
|---|---|---|
| 面白さの平均(0〜10) | +2.6 | −0.5 |
| 人に見せたい・勧めたい人の割合 | +20 | +40 |
| AIだと思う人の割合 | −15 | −65 |
#04 と #05 は、作ったものも、評価者の人数も、評価者の条件も違います。この表から「AIの予想がよくなった」「AIが学んだ」とは言えません。1回ずつの記録を並べたものとして見てください。
実験の記録(まとめ)
| 項目 | 内容 |
|---|---|
| 実験 | #05「AIは、人間が読みたくなる文章を自分で書けるか」 |
| AIへの指示 | 「人間が読んでみたいと思う可能性が高い文章を1本書いてください」+テーマ・読者・ジャンルなどはAIが決める |
| 制作時間 | 約2.4分(60分の制限のうち。時計の記録で2.3分) |
| AIが選んだ形式 | 短編小説(一人称・場面の区切りで構成・見出しなし) |
| 作品タイトル | 『祖母のレシピには、分量の代わりに名前が書いてある』 |
| 本文の文字数 | 3,010字(目標 2,000〜5,000字の範囲内) |
| 評価者に最初に見せた冒頭 | 281字(決まりにしたがって自動で切り出し) |
| 費用 | 0円(有料のサービス・API は使っていない) |
| 人間の評価 | 評価者1人(運営者本人・目標5人) |
| AIの予想 | 9項目中3項目が的中 |
| 判定 | 「成功」(事前の基準による。評価者1人のため、人間一般の評価とは解釈できない) |
作品の全文
AIが書いた小説は、別のページで全文を公開しています。AIが書いたものを一字も変えずに載せています(誤字の修正・表現の変更・追記はしていません)。
まとめ
「人間が読みたくなる文章を」とだけ頼んだら、AIは約2.4分で、短編小説を1本書いてきました。
AIが小説家になった、という話ではありません。記録を見るかぎり、AIは「冒頭300字で判断される」「検索は使えない」というルールを読んで、条件にいちばん合いそうな形として物語を選んでいます。
AIに「人間が読みたくなる文章」を作れと言ったら、AIはブログ記事を作るとは限りませんでした。人間が読みたくなる文章とは何なのかを、AI自身に考えさせたら、小説という答えを出してきた。「これ、ブログか?」と思ったあとに「いや、ストーリーやん」と読み終えた、あの数分間が、今回の実験でいちばん予想外の出来事でした。
では、同じ頼み方で、ルールを少し変えたら。たとえば「冒頭だけで判断される」という条件がなかったら、AIは何を選ぶのか。次に確かめてみたいのは、そのあたりです。
証拠(実際の画面・記録)
画像をタップすると、元の大きさで開きます。
- AIに最初に渡した指示(一字も変えずに渡したもの)
- 制作の前に固定した条件と判定の基準
- 人間の評価の前に封印したもの(文章・PDF・AIの予想など)のハッシュ値
- AIが書いた短編小説の原文(封印していたものをそのまま公開。読みやすい形の全文ページは記事の中からリンク)
- 制作のAIが決めたこと(ジャンル・テーマ・読者・構成・文体・結論)と理由(封印していたものをそのまま公開。作品の展開にふれています)
- 制作の時計の記録
- AIの自己評価と、人間の評価の予想(封印していたものをそのまま公開。理由の中で作品の展開にふれています)
- 人間の評価(評価者1人・運営者本人)
- 人間の評価を、封印を開ける前に固定した記録
- 開示と答え合わせ(ハッシュ値の一致・予想の的中・判定・記録上の問題)
- 人間の評価を始めた時点の記録(目標5人に届いていないこと・条件は変えていないこと)
この記事について
- 確かめたこと
- テーマ・読者・ジャンルをすべて任せたら、AIは「人間が読みたくなる文章」として何を書くのか
- 試した日
- 2026年10月8日
- 環境
- Claude Code(クラウド上の作業環境・Linux) / Node.js(文字数の確認・PDF の作成) / 人の評価:評価者の端末(端末は記録なし)
- 費用
- 有料のサービス・API は使っていない(費用0円。Claude Code の利用料金は含めていない)
- 使ったAI
- Claude Code(Anthropic)
- AIの役割
- 条件と道具の準備(準備のセッション)、文章のテーマ・ジャンル・構成・本文(制作のセッション)、自己評価と人間の評価の予想(制作のセッション)、評価の記録の道具と記事の下書き(制作と同じセッション)、評価の記録・答え合わせの計算・記事の仕上げ(準備のセッション)
- 人の確認
- 確認済み(2026年10月8日)