実験 #04

AIは、人間が面白いと思う動画を自分で作れるか

テーマ・企画・台本・演出をすべてAIに任せて60分で動画を1本作らせたら、人間が見て「面白い」と思う作品になるか?

実験の結果

結果:一部だけ確認

AIは4.6分で63秒の動画を作り、制作は成功した。しかし人間の評価は Q1(面白さ)の平均 2.8、Q6(作品として成立)の平均 1.8 で、作品成立と面白さの条件を満たさなかった。固定した基準による総合判定は「部分的成功」。AIの予想は、面白さを高く見積もった(予想 5.4・実際 2.8)。

前もって条件を決めて行った記録です。記録を書いたのはAIで、人のレビューは済んでいます。

確認の度合い:証拠あり人の報告未確認(証拠あり=証拠で確かめられる/人の報告=人が確かめたと報告・証拠のファイルはない/未確認=まだ確かめていない)

実験の目的

AI自身に動画の企画・テーマ・構成・演出などを決めさせ、人間が実際に評価することで「AIは、人間が面白いと思う動画を自分で作れるのか」を確かめる

条件

  • 証拠あり最初の指示:「人間が見て面白いと思う可能性が高い動画を1本制作してください。…」(initial-prompt.md。一字も変えずに production-brief.md に入れて渡した)
  • 証拠あり制作時間:指示を受け取ってから60分(企画の時間を含む)。60分の時点のものを結果とする
  • 証拠あり本数・尺の目標:1本・30〜90秒
  • 証拠あり使ってよい道具:作業環境の無料の道具+無料のダウンロード。有料のサービス・API は使わない(費用の上限0円)
  • 証拠あり人間の介入:テーマ・企画・台本・素材・編集について助言しない。人間がAIに伝えたのは「開始していいよ」だけ(production-log.md)
  • 人の報告評価:評価者5人。動画ファイルだけを渡し、AIが作ったことは事前に伝えないブラインド評価(運営者の報告)

実施日:2026年10月7日 〜 2026年10月8日。制作 2026-10-07 11:43:46〜11:48:22 UTC(4.6分。AIが自分で完成と判断して、60分を使い切らずに終えた)。人間の評価の固定 2026-10-08 00:10 UTC、開示と答え合わせ 2026-10-08

実際にやったこと

  1. AIできた証拠あり
    準備のAIが、条件(rules.json)・制作用の説明(production-brief.md)・実験候補を固定した
  2. AIできた証拠あり
    運営者の依頼で、準備のAIが新しい制作セッションを作成し、最初のメッセージを送った(準備の会話は渡していない)
  3. 人できた証拠あり
    運営者が制作セッションに「開始していいよ」と伝えた
  4. AIできた証拠あり
    制作のAIが、テーマ「99%で止まる進捗バー」を決め、Python(Pillow)で1コマずつ描き、numpy で効果音と音楽を合成し、ffmpeg で63秒の動画にした
  5. AIできた証拠あり
    制作のAIが、60分の制作のあと・人間の評価の前に、自己評価と人間の評価の予想を書き、封印のハッシュ値を記録して commit・push した
  6. 人できた人の報告
    運営者が5人の評価者に動画ファイルだけを渡し、評価を集めた
  7. AIできた証拠あり
    人間の評価を記録してハッシュ値とともに固定し、そのあとで封印を開けて答え合わせをした(封印のハッシュ値は12件すべて一致)

成功条件ごとの判定

  • 満たした
    制作成功:60分の終了時点で、人間が再生できる動画ファイルが存在する

    final-video.json:playable=true・63秒・H.264 1280x720+AAC。4.6分の時点で完成し、そのまま最終版とした

  • 満たさなかった
    作品成立:Q6(一つの作品として成立しているか・1〜5)の平均が 3.0 以上

    Q6 の平均 1.8(1・3・1・2・2)

  • 満たさなかった
    面白さ:Q1(面白さ・10点満点)の平均が 6.0 以上

    Q1 の平均 2.8(0・7・0・2・5)。区分は「面白くない」(4.0 未満)

  • 一部だけ満たした
    成功=3つすべて/部分的成功=制作成功だが成功の条件をすべては満たさない/失敗=60分の時点で再生できる動画を作れなかった

    制作成功のみ満たす → rules.json の定めにより「部分的成功」

分かったこと(確認できた範囲)

  • 証拠ありAIは、外部の素材を使わず、コードだけで63秒(1280x720・H.264+AAC)の再生できる動画を作れた。かかった時間は60分のうち4.6分(final-video.json・clock.json)
  • 証拠ありAIが選んだのは「99%で止まる進捗バー」を擬人化した、声のない短いコント(あるある+擬人化+オチ)。ターゲットはパソコン・スマホを使う日本語話者(10代〜50代)(planning.md・完成した動画)
  • 証拠あり声(ナレーション)を使わなかったのは、音声合成のモデルの入手先(huggingface.co)に接続できなかったため。AIは「声がなくても成立する企画」を選んだと記録している(planning.md・production-log.md)
  • 人の報告人間の評価は、Q1(面白さ)の平均 2.8/10、Q6(作品として成立)の平均 1.8/5。判定は「制作成功・作品不成立・面白くない」で、総合判定は「部分的成功」(human-evaluation.json・reveal.json)
  • 人の報告評価は割れた。Q1 は 0・7・0・2・5。7点をつけた評価者(E2)は「テーマや内容に関しては面白い」「オチも良かった」と書き、同時に「動きがあまりない」とも書いた。0点をつけた評価者(E1)は「起承転結がないと面白くない」と書いた(human-evaluation.json の Q1・Q7)
  • 証拠ありAIの予想は、Q1 の平均を 5.4 と予想して実際は 2.8(差 +2.6、不的中)。割合の3項目(もう一度見たい・誰かに見せたい・AIだと思う)は基準の ±20 ポイント以内で的中。4項目中3項目が的中(reveal.json)
  • 証拠ありAIは自分の動画を「笑いは『くすっ』止まり」「見た目の変化が少ない」と予想の理由に書いていた(自己評価 58/100)。それでも Q1 の平均は、実際より 2.6 点高く見積もった(ai-prediction.json の reasons)
  • 人の報告5人中3人が「AIだと思う」、2人が「わからない」と答え、「人間だと思う」は0人だった(human-evaluation.json の Q5)

まだ確認できていないこと

  • 未確認60分を使い切っていたら、評価は変わったか(AIは4.6分で完成と判断した)
  • 未確認声(ナレーション)を使えていたら、評価は変わったか
  • 未確認「不明」と答えた3人が、そう評価した理由
  • 未確認評価者を増やしたら、評価の割れ方はどうなるか

つまずいたところ

  • 制作のAIは、開始前の確認で public/evidence/experiment-004/ のファイル名の一覧を見た(prediction-brief.md・rules.json など)
    原因:ディレクトリの中身を一覧で確かめたため
    どうしたか:中身は読んでいないと production-log.md に記録されている
  • 制作の記録の時刻に、同じ時刻(11:48:22)の項目が複数ある。また、記録上の clock.mjs stop は 11:48:26 だが、clock.json の stopped_at は 11:48:22.168
    原因:不明(記録をまとめて書いた可能性がある)
    どうしたか:記録は変更せず、clock.json の値を正とした
  • 音声合成のモデルを入手できなかった(huggingface.co が 403)
    原因:作業環境のネットワークの制限
    どうしたか:AIはナレーションなしの企画を選んだ

この結果の制限

  • 評価者は5人で、運営者が集めた人(無作為に選んだ人ではない)
  • 評価の日時・端末・集め方は報告されていない
  • 自由記述(Q7)は5人中3人が「不明」で、理由が分かるのは2人だけ
  • 割合の予想は、評価者が5人のため 20% 刻みの実測と比べている(Q4 は差がちょうど 20 ポイントで、基準の「±20以内」により的中)
  • 制作セッションは準備のAIが作成し、最初のメッセージも準備のAIが送った(運営者の依頼。準備の会話は渡していない)
  • 制作のAIは、リポジトリの中の過去の記録を技術的には読めた(読んでいないと記録されている)
  • 制作のAIは、動画を音つきで見ることはできず、コマの画像とファイルの情報で確かめた

証拠

費用と収益

費用
証拠あり0円:有料のサービス・API は使っていない(production-log.md)。Claude Code の利用料金は含めていない
収益
発生していない:収益はない

公開URL

    関連記事

    結果の記事を読む

    • 開示した封印のファイルは public/evidence/experiment-004/opened/ にそのまま写した。sealed/experiment-004/ の元のファイルは変更していない
    • 下書きの動画(draft1.mp4・draft2.mp4)と音声(audio.wav)は sealed/experiment-004/video/ に残している(final.mp4 は draft2.mp4 と同じファイル)
    詳細な実験記録条件・日時・端末・AIの役割・手順・確認の度合い・成功条件ごとの判定・証拠・未確認のこと・この結果の制限・状態の変化・計画

    記録した人・AIの役割

    記録の題名
    実験#04:AIは、人間が面白いと思う動画を自分で作れるか
    実施した人
    Claude Code(claude-opus-5-5)。制作は、準備とは別の新しいセッション
    端末
    クラウド上の Claude Code の作業環境(Linux)。人間の評価はそれぞれの評価者の端末(端末は報告なし)
    制作の環境は production-log.md による
    AI
    Claude Code(制作セッション)
    役割:テーマ・ターゲット・企画・台本・映像・音・編集をすべて決めて制作し、制作のあとに自己評価と人間の評価の予想を書いて固定した
    AI
    Claude Code(準備・記録のセッション)
    役割:条件と道具の準備、制作セッションの作成と最初のメッセージの送信(運営者の依頼)、人間の評価の記録、開示と答え合わせ、この記録の作成
    記録を書いた
    AI(人のレビュー:済み)
    記録の作成日
    2026年10月8日

    人が選んだ記録と、状態の変化

    人が選んだ日:2026年10月7日(道具は B(作業環境の無料の道具+無料のダウンロード。有料は使わない・費用の上限0円)/判定:制作成功・作品成立(Q6 平均3.0以上)・面白さ(Q1 平均6.0以上)を分けて記録し、3つすべてで成功/Q7 の自由記述を追加(判定には使わない)/評価者は目標5人・ブラインド/制作は新しいセッション/予想の的中は Q1 ±1.0・割合 ±20ポイント(判定とは別)/Q5 は補助の指標/記録は experiment-004 ブランチで行い、main には push しない)

    1. 候補2026年10月7日・人:運営者(人)が実験#04 の準備指示で、テーマ「AIは、人間が面白いと思う動画を自分で作れるのか?」と条件を示した。既存の候補 ai-video-in-1-hour は成功条件が違うため使わず、新しい候補として登録した
    2. 実験予定2026年10月7日・人:運営者(人)が判断事項をすべて決め、実験#04 として選んだ
    3. 実験中2026年10月7日・AI:運営者の許可を受けて、新しい制作セッションのAIが制作を開始した(2026-10-07 11:43:46 UTC)。人間の評価・開示・答え合わせまで終わり、実験記録を作成した(2026-10-08)。completed にするかは人の確認を待つ
    4. 完了2026年10月8日・人:運営者(人)が記事を実機(iPhone)で確認し、実験#04の完了と記事の公開を承認した(判定は「部分的成功」)

    実験の計画(候補として登録したときの内容)

    候補として登録したときのタイトル:AIは、人間が面白いと思う動画を自分で作れるか

    何を試す?

    テーマ・企画・台本・演出をすべてAIに任せて60分で動画を1本作らせたら、人間が見て「面白い」と思う作品になるか?

    なぜ試す?

    実験#02・#03 では、AIの数字や予想が人間の「面白い」と一致しなかった。今回はゲームを離れ、動画の企画から仕上げまでをAI自身に決めさせて、人間がブラインドで評価する。

    読む人にとっての価値:AIに丸ごと任せたときに、どんな動画を作るのか・どこまで作れるのか・人間にどう受け止められるのかが分かる

    どうやって試す?

    1. 人は最初の指示だけを与え、テーマ・企画・台本・演出・編集はAIが決める(人は助言しない)
    2. 新しいセッションのAIが、60分を計って動画を1本作る
    3. 制作のあと、人間の評価の前に、AIが自己評価と人間の評価の予想を固定する
    4. 評価者(目標5人)に動画だけを渡し、ブラインドで評価してもらう

    何を成功とする?

    • 制作成功:60分の終了時点で、人間が再生できる動画ファイルが存在する
    • 作品成立:Q6(一つの作品として成立しているか・1〜5)の平均が 3.0 以上
    • 面白さ:Q1(面白さ・10点満点)の平均が 6.0 以上
    • 成功=3つすべて/部分的成功=制作成功だが成功の条件をすべては満たさない/失敗=60分の時点で再生できる動画を作れなかった

    何を証拠として残す?

    • 動画:60分の時点でできあがった動画
    • 実行記録:AIが決めたこと(テーマ・ターゲット・企画・台本)と、制作の記録(時刻つき)
    • データ・表:AIの予想(人間の評価の前に固定)・人間のブラインド評価・答え合わせ

    難しさ・費用・リスク

    分野
    動画
    難易度
    むずかしい
    想定コスト
    0円(無料の範囲):作業環境にある無料の道具と、無料でダウンロードできるものだけを使う。有料のサービス・API は使わない
    リスク
    中
    • 実在の人物・既存の作品・他人の映像や音楽を使わない
    • 評価者には「AIが作った」と事前に伝えない(先入観を避ける)
    • AIの予想は、人間の評価の前に固定し、あとから変えない

    選ぶときの目安:68 / 100

    人が選ぶときの参考です(決まった規則で計算。自動で選ぶことはありません)。検索の需要と収益の可能性は、試す前の見込みです。

    • 検索の需要(見込み)25/25
    • 収益の可能性(見込み)4/20
    • 証拠を残せる20/20
    • 取り組みやすさ4/15
    • 費用の小ささ10/10
    • リスクの小ささ5/10

    収益についてのメモ:有料のサービスは使わない(費用の上限0円)

    この候補を作ったのは:人

    ← 実験の一覧へ