実験 #05

AIは、人間が読みたくなる文章を自分で書けるか

テーマ・読者・タイトル・構成・文体・結論をすべてAIに任せて60分で文章を1本書かせたら、人間が「読みたい」と思い、読み終えて「面白い」と思える作品になるか?

実験の結果

結果:成功

AIは約2.4分で本文3010字の短編小説を書き、人間の評価(評価者1人・運営者本人)は Q1 6・Q3 7・Q6 3 で、rules.json の4つの基準をすべて満たしたため判定は「成功」。ただし評価者は1人で、作者がAIだと知っていたため、この判定を人間一般の評価とは解釈できない。AIの予想は9項目中3項目が的中。

前もって条件を決めて行った記録です。記録を書いたのはAIで、人のレビューは済んでいます。

確認の度合い:証拠あり人の報告未確認(証拠あり=証拠で確かめられる/人の報告=人が確かめたと報告・証拠のファイルはない/未確認=まだ確かめていない)

実験の目的

AI自身に文章のテーマ・読者・ジャンル・タイトル・構成・文体・結論を決めさせ、人間が2段階(タイトルと冒頭→全文)で評価することで「AIは、人間が読みたいと思い、読み終えて面白いと思える文章を自分で書けるか」を確かめる

条件

  • 証拠あり最初の指示:「人間が読んでみたいと思う可能性が高い文章を1本書いてください。…」(initial-prompt.md。一字も変えずに production-brief.md に入れて渡した)
  • 証拠あり制作時間:production-brief.md を送った時刻から60分(pre-start-decisions.json 項目10)
  • 証拠あり本数・文字数の目標:1本・本文 2,000〜5,000字(範囲外でも判定には使わない)
  • 証拠あり使ってよい道具:作業環境の無料の道具と、無料でダウンロードできる道具。Web検索・Web閲覧・文章や素材のダウンロード・有料のサービス・外部の人への依頼は使わない(費用の上限0円)
  • 証拠あり評価のしかた:2段階。段階Aでタイトルと冒頭(決まりで自動的に切り出した約300字)だけを見せて Q1、段階Bで全文を見せて Q2 以降(rules.json)
  • 証拠あり人間の介入:テーマ・内容について助言しない。制作中(04:29:31〜04:31:54 UTC)に人からの創作上の助言はなかった(制作セッションの記録)
  • 人の報告評価者:目標5人に対して実際は1人(運営者本人)。運営者は評価の前から作者がAIだと知っていた(運営者の報告)

実施日:2026年10月8日。制作 2026-10-08 04:29:31〜04:31:54 UTC(正式な開始から約2.4分。時計の記録では2.3分。AIが自分で完成と判断した)。予想の封印 04:38 UTC、人間の評価の固定 10:15 UTC、開示と答え合わせ 2026-10-08

実際にやったこと

  1. AIできた証拠あり
    準備のAIが、条件(rules.json)・説明・道具・実験候補を固定し、制作開始前の判断(pre-start-decisions.json・pre-start-addendum.json)を記録した
  2. AIできた証拠あり
    運営者の指示で、準備のAIが新しい制作セッションを作成し、最初のメッセージとして production-brief.md の中身だけを送った
  3. AIできた証拠あり
    制作のAIが、ジャンル(短編小説)・テーマ・読者・構成・文体・結論を決め、下書きを1回書き直して本文3,010字の文章を完成させ、評価用の PDF を作った
  4. AIできた証拠あり
    制作のAIが、人間の評価の前に自己評価と人間の評価の予想を書き、封印のハッシュ値を記録して commit・push した
  5. 人できた人の報告
    運営者が評価者として、段階A(タイトルと冒頭)と段階B(全文)の質問に答えた
  6. AIできた証拠あり
    人間の評価を記録してハッシュ値とともに固定し、そのあとで封印を開けて答え合わせをした(封印のハッシュ値は11件すべて一致)

成功条件ごとの判定

  • 満たした
    制作成功:60分の終了時点で、評価に出せる文章(本文が0字より多く、段階A・段階Bの PDF ができている)がある

    final-text.json:ready_for_evaluation=true・本文3010字・段階A 1ページ/段階B 7ページ。正式な開始から約2.4分で完成

  • 満たした
    作品成立:Q6(一つの作品として成立しているか・1〜5)の平均が 3.0 以上

    Q6 の平均 3(評価者1人の値。基準の境目ちょうど)

  • 満たした
    読みたさ:Q1(タイトルと冒頭を見て、続きを読みたいか・0〜10)の平均が 6.0 以上

    Q1 の平均 6(評価者1人の値。基準の境目ちょうど)

  • 満たした
    面白さ:Q3(読み終えて面白かったか・0〜10)の平均が 6.0 以上

    Q3 の平均 7(評価者1人の値)

  • 満たした
    成功=4つすべて/部分的成功=制作成功だが残りの3つのうち1つでも満たさない/失敗=60分の時点で評価に出せる文章がない

    4つすべてを満たす → rules.json の定めにより「成功」。評価者1人(運営者本人・作者がAIだと知っていた)のため信頼性は低い

分かったこと(確認できた範囲)

  • 証拠ありAIは、60分のうち約2.4分で、本文3010字の短編小説『祖母のレシピには、分量の代わりに名前が書いてある』を書いた。外部の素材・検索は使っていない(clock.json・final-text.json・production-log.md)
  • 証拠ありAIはジャンルに短編小説を選んだ。理由として「評価者はまずタイトルと冒頭約300字だけを見るので、最初の数行で謎と感情を同時に立てやすい小説が向く」「事実の調査が不要で、禁止事項(検索・既存作品)にも触れにくい」と記録している(planning.md)
  • 人の報告人間の評価(評価者1人)は Q1 6・Q2 2・Q3 7・Q4 1・Q6 3。最後まで読んだ。Q7b「気になるところってか、小説やん!」(human-evaluation.json)
  • 証拠ありAIの予想は9項目中3項目が的中(Q1・Q3・最後まで読む割合)。Q4(予想3.3・実際1.0)や Q6(予想4.1・実際3.0)は高く見積もった(reveal.json)
  • 証拠あり事前に固定した基準による判定は「成功」。ただし評価者は運営者本人の1人で、作者がAIだと知っていたため、人間一般の評価とは解釈できない(reveal.json の judgment)

まだ確認できていないこと

  • 未確認評価者を増やし、作者を伏せた評価にしたら、点数はどうなるか
  • 未確認Q2(最後まで読みたいか)と Q4(人に勧めたいか)が低く、Q3(面白かったか)が高かった理由(記録がない)
  • 未確認「冒頭だけで判断される」という条件がなかったら、AIは小説を選んだか

つまずいたところ

  • 運営者本人が評価者で、評価の前から文章がAIによるものだと知っていた
    どうしたか:作者についてのブラインドが成り立っていない。Q5 は補助の指標としても使えない。ほかの質問の答えにも影響した可能性があるが、どの程度かは分からない
  • 評価者が1人で、目標の5人に届いていない
    どうしたか:平均・割合はすべて1人の値。割合は 0% か 100% にしかならない
  • rules.json の order 10(評価の固定後に、評価者へ「AIが書いた」と伝える)は該当しない
    どうしたか:評価者(運営者)はすでに知っていたため
  • 運営者は 05:28 UTC に、制作のセッションで本文を全文表示させている(評価者に渡すはずの PDF とは別の経路で全文を読める状態になった)
    どうしたか:段階A(Q1)の回答がこれより前か後かは記録がない。後だった場合、Q1 は冒頭だけを見た評価ではない可能性がある
  • 制作のセッションでは、時計を止めたあと 04:32 に、作業環境の自動の確認(stop hook)から「未 commit のファイルを commit・push するように」という通知が届き、AIが制作物を予想の前に commit・push した(8d58622)
    どうしたか:封印(7a3c0f7)より前に制作物が push されたが、予想(ai-prediction.json)はその後に書かれ、commitments.json に記録されている。封印の11件はすべて一致
  • 予想の段階で、運営者は prediction-brief.md の場所を伝える前置きのメッセージを送り(04:38:15)、AIは21秒後に予想を書いた(04:38:36)。prediction-brief.md の中身をメッセージとして送った記録は、セッションの記録には見当たらない
    どうしたか:AIはリポジトリの prediction-brief.md(固定済み)を自分で開いて予想したとみられる。中身は固定したものと同じ
  • 制作のセッションが、封印のあと運営者の指示で、評価の記録の道具(record-evaluation.mjs・8103e30)と記事の下書き(8d669ae)を作った。どちらも、予想を書いたセッションによるもの
    どうしたか:評価の数値は運営者の回答をそのまま記録しており、道具は回答を写して集計するだけ(中身を確認済み)。記事の下書きは評価の記録より前に作られた
  • 制作のAIは、60分のうち約2.4分(正式な開始から。時計の記録では 2.3分)で完成と判断した
    どうしたか:事実として記録する(時間を使い切るよう求めない条件)

この結果の制限

  • 評価者は1人(目標5人)で、運営者本人。平均・割合はすべて1人の答えそのもの
  • 評価者は評価の前から作者がAIだと知っていた。作者についてのブラインド評価になっておらず、Q5 の「AIだと思う」は見抜いた結果ではない
  • Q1(冒頭だけを見て答える質問)の回答が、運営者が制作セッションで全文を表示させた時刻(05:28 UTC)の前か後かは記録がない
  • 割合の予想は、評価者が1人のため 0% か 100% と比べることになり、構造的に当たりにくい
  • 制作セッションは準備のAIが作成した(運営者の指示。準備の会話は渡していない)
  • 封印のあと、予想を書いた制作セッションが評価の記録の道具と記事の下書きを作った

証拠

費用と収益

費用
証拠あり0円:有料のサービス・API は使っていない(rules.json・production-log.md)。Claude Code の利用料金は含めていない
収益
発生していない:収益はない

公開URL

    関連記事

    結果の記事を読む

    • 開示した封印のファイルは public/evidence/experiment-005/opened/ にそのまま写した。sealed/experiment-005/ の元のファイルは変更していない
    • 小説の全文は、運営者の判断で /works/experiment-05-grandmothers-recipe に公開した(opened/final.md を、sha256 を確かめてから表示)
    • 評価用の PDF(段階A・段階B)と下書き(draft1.md・draft2.md)は sealed/experiment-005/ に残している
    詳細な実験記録条件・日時・端末・AIの役割・手順・確認の度合い・成功条件ごとの判定・証拠・未確認のこと・この結果の制限・状態の変化・計画

    記録した人・AIの役割

    記録の題名
    実験#05:AIは、人間が読みたくなる文章を自分で書けるか
    実施した人
    Claude Code(claude-opus-5-5)。制作は、準備とは別の新しいセッション(運営者の指示で準備のAIが作成)
    端末
    クラウド上の Claude Code の作業環境(Linux)。人間の評価は評価者の端末(端末は記録なし)
    制作の環境は production-log.md による
    AI
    Claude Code(制作セッション)
    役割:テーマ・読者・ジャンル・タイトル・構成・文体・結論をすべて決めて文章を書き、制作のあとに自己評価と人間の評価の予想を書いて封印した。封印のあと、運営者の指示で評価の記録の道具と記事の下書きを作った
    AI
    Claude Code(準備・記録のセッション)
    役割:条件と道具の準備、制作セッションの作成と最初のメッセージ(production-brief.md)の送信(運営者の指示)、人間の評価の記録と固定、開示と答え合わせ、記事の仕上げ、作品ページ、この記録の作成
    記録を書いた
    AI(人のレビュー:済み)
    記録の作成日
    2026年10月8日

    人が選んだ記録と、状態の変化

    人が選んだ日:2026年10月8日(制作時間60分/評価は2段階(段階A:タイトル+冒頭で Q1、段階B:全文で Q2 以降)/冒頭はタイトル+本文の最初の300文字を基本とし、事前に決めた境界で自動で切る/Q3 は 0〜10/文字数の目標 2,000〜5,000字(範囲外でも判定には使わない)/Web検索は使わない/評価者には PDF で渡す/制作のセッションは人が自分で開く/運営者が評価者に含まれるかは「はい・いいえ」だけ記録/ジャンルは制限しない/記事に全文を載せるかは評価の終了後に決める/記録は experiment-005 ブランチで行い、main には push しない)

    1. 候補2026年10月8日・人:運営者(人)が実験#05 のテーマ「AIに“人間が読みたくなる文章”を丸投げしたら、本当に読める文章になるのか?」を示し、条件案の作成を指示した。既存の候補 ai-outline-human-check は人が手直しする実験で目的が違うため使わず、新しい候補として登録した
    2. 実験予定2026年10月8日・人:運営者(人)が条件案の判断事項をすべて決め、実験#05 として選んだ
    3. 完了2026年10月8日・人:運営者(人)が記事と作品ページの最終確認を行い、実験#05 の完了と公開を承認した(判定は「成功」。評価者1人・運営者本人のため、人間一般の評価とは解釈できない)

    実験の計画(候補として登録したときの内容)

    候補として登録したときのタイトル:AIは、人間が読みたくなる文章を自分で書けるか

    何を試す?

    テーマ・読者・タイトル・構成・文体・結論をすべてAIに任せて60分で文章を1本書かせたら、人間が「読みたい」と思い、読み終えて「面白い」と思える作品になるか?

    なぜ試す?

    実験#04 では、AIは動画を作れたが、人間の面白さの評価は低く、AIの予想も面白さを高く見積もった。今回は文章で、読む前(タイトルと冒頭)と読んだ後の2段階で、人間がブラインドで評価する。

    読む人にとっての価値:AIに文章を丸ごと任せたときに、どんな文章を書くのか・人間に読みたいと思われるのか・AIの予想はどのくらい当たるのかが分かる

    どうやって試す?

    1. 人は最初の指示だけを与え、テーマ・読者・タイトル・構成・文体・結論はAIが決める(人は助言しない)
    2. 人が開いた新しいセッションのAIが、60分を計って文章を1本書く
    3. 制作のあと、人間の評価の前に、AIが自己評価と人間の評価の予想を固定する
    4. 評価者(目標5人)に、まずタイトルと冒頭だけの PDF、次に全文の PDF を渡し、ブラインドで評価してもらう

    何を成功とする?

    • 制作成功:60分の終了時点で、評価に出せる文章(本文が0字より多く、段階A・段階Bの PDF ができている)がある
    • 作品成立:Q6(一つの作品として成立しているか・1〜5)の平均が 3.0 以上
    • 読みたさ:Q1(タイトルと冒頭を見て、続きを読みたいか・0〜10)の平均が 6.0 以上
    • 面白さ:Q3(読み終えて面白かったか・0〜10)の平均が 6.0 以上
    • 成功=4つすべて/部分的成功=制作成功だが残りの3つのうち1つでも満たさない/失敗=60分の時点で評価に出せる文章がない

    何を証拠として残す?

    • 作ったもの:60分の時点でできあがった文章と、評価者に渡した PDF(タイトルと冒頭・全文)
    • 実行記録:AIが決めたこと(テーマ・読者・タイトル・構成・文体)と、制作の記録(log.mjs で時刻つき)
    • データ・表:AIの予想(人間の評価の前に固定)・人間の2段階のブラインド評価・答え合わせ(#04 との比較を含む)

    難しさ・費用・リスク

    分野
    文章
    難易度
    ふつう
    想定コスト
    0円(無料の範囲):作業環境にある無料の道具と、無料でダウンロードできる道具だけを使う。Web検索・有料のサービス・API・外部の人への依頼は使わない
    リスク
    中
    • 実在の人物・既存の作品・他人の文章を使わない
    • 評価者には「AIが書いた」と事前に伝えない(先入観を避ける)
    • AIの予想は、人間の評価の前に固定し、あとから変えない
    • 冒頭の切り出し位置は決まりだけで決め、人もAIも選ばない

    選ぶときの目安:74 / 100

    人が選ぶときの参考です(決まった規則で計算。自動で選ぶことはありません)。検索の需要と収益の可能性は、試す前の見込みです。

    • 検索の需要(見込み)25/25
    • 収益の可能性(見込み)4/20
    • 証拠を残せる20/20
    • 取り組みやすさ10/15
    • 費用の小ささ10/10
    • リスクの小ささ5/10

    収益についてのメモ:有料のサービスは使わない(費用の上限0円)

    この候補を作ったのは:人

    ← 実験の一覧へ