実験 #03

AIは「人間が面白いゲーム」を先に当てられる?

実験#02 では、AIの数字で良くなったゲームより、最初の版のほうが人間には面白かった。じゃあ、AI自身に「人間が面白いと思うもの」を先に予想させたらどうなるのか。遊ぶ前に予想を固定して、試した記録です。

結論

AIが1位に選んだ X4 は、人間では5位でした。人間が遊ぶ前にAIの予想とボットの数値順位を固定して比べましたが、AIの予想(順位相関 −0.300)もボットの数値(−0.335)も、事前に決めた基準では「外れた」でした。今回のゲーム・今回の評価者・今回の評価方法という条件では、AIの予想順位は人間の順位と一致せず、事前に定めた基準では失敗です。

実際にやったこと

  1. AIが企画4つの候補から選んだ
  2. ルールを先に固定成功条件・比べ方・計算式
  3. 5つの版を作るX1〜X5
  4. 予想と測定を固定AIの予想・ボットの数値順位
  5. P〜T に割り当て対応表はハッシュ値だけ公開
  6. 人がブラインド評価各3回・5段階+順位

結果

確かめたこと結果
5つの版を作り、スマホで遊べる確認
予想・数値順位・割り当てを評価の前に固定確認
人間の1位:X2(にぎやか)人の報告
AIの1位予想 X4 は、人間の5位人の報告
AIの予想:順位相関 −0.300(外れた)人の報告
ボットの数値:順位相関 −0.335(外れた)人の報告
評価者や作品を増やしても同じ結果か未確認

やってみて分かったこと

数字をやめて「AIの判断」にしても、ずれは縮まらなかった

実験#02 では、ボットの数値という物差しが人間とずれました。今回はAI自身の判断でも予想させましたが、AIの予想(−0.300)もボットの数値(−0.335)も「外れた」で、差は 0.035 とほとんどありませんでした。今回の条件では、物差しを数値から判断に変えても、人間との一致は良くなりませんでした。

AIの1位は、人間の最下位だった

AIは、ぎりぎりでよけるとボーナスが入る X4 を「惜しい瞬間と上達の実感がある」として1位にしました。人間はその X4 を5位にし、音・光・粒・画面のゆれを足した X2 を1位にしました。AIが最下位にした速い X5 は、人間の2位でした。なぜそう感じたのかは、感想の報告がないので分かりません。

ボットには見えないものがある

ボットは画面を見ずに遊ぶので、見た目と音だけが違う X2 を X1 と区別できず、同点にしました。人間の1位は、その「ボットには見えない違い」を足した X2 でした。

先に固定したから、「外れた」とはっきり言える

成功条件・比べ方・AIの予想・ボットの順位・対応表は、すべて人間が遊ぶ前に固定し、開示のときにハッシュ値が一致することを確かめました。結果を見てから解釈を変える余地がないので、今回は「外れた」と言い切れます。

途中で詰まったところ

ボットの順位で同点が出た

X1・X2・X4 は動きが同じなので、ボットの数値ではほぼ同じになり、同点になりました。計算式は変えず、事前に決めた同点の扱い(順位相関は平均の順位、ほかは X の番号順)で処理しました。

今回使ったもの

Claude Code
AnthropicのAI。今回は企画・ルールの固定・5つの版の制作・予想・ボットの測定・割り当て・答え合わせの計算を担当しました。
Chromium(Playwright)
AIの作業環境に入っているブラウザ。ボットはこの中で、5つの版を200回ずつ早送りで遊びました。
GitHub
予想・数値順位・対応表を、人間が遊ぶ前に commit して固定するのに使いました。

ここまでの結果

今回は、成功条件を満たせず、失敗という判定になりました。

このページの上の部分(結論〜ここまでの結果)は、下の実験記録をもとにAIがまとめたもので、人の確認は済んでいます。 条件・手順・証拠・確認できていないことは、下の「詳細な実験記録」にすべて残しています。

詳細な実験記録条件・日時・端末・AIの役割・手順・確認の度合い・成功条件ごとの判定・証拠・未確認のこと・この結果の制限・状態の変化・計画

実験の結果

結果:失敗

今回のゲーム、今回の評価者、今回の評価方法という条件では、AIの予想順位は人間の順位と一致せず、事前に定めた基準では失敗となった。AIの予想(X4→X2→X3→X1→X5)と人間の順位(X2→X5→X3→X1→X4)の順位相関は −0.300 で「外れた」。AIが1位に選んだ X4 は、人間では5位だった。ボットの数値順位も順位相関 −0.335 で「外れた」で、AIとの差は 0.035(差はほとんどない)。成功条件1・2は満たしたが、3(AIの判断が「当たった」)を満たさないため、rules.json の判定は「失敗」。評価者は1人・5作品・評価者は実験#02 を遊んでいるため、この結果だけでAI全般について結論は出せない。

前もって条件を決めて行った記録です。記録を書いたのはAIで、人のレビューは済んでいます。

確認の度合い:証拠あり人の報告未確認(証拠あり=証拠で確かめられる/人の報告=人が確かめたと報告・証拠のファイルはない/未確認=まだ確かめていない)

実験の目的

AIが遊ぶ前に予想した「面白さの順位」と、ボットの数値による順位が、人間が目隠しで遊んだときの順位とどの程度一致するかを、事前に決めた同じ基準で比べる

条件

  • 証拠ありゲーム:「さかさまラン」を土台にした5つの版 X1〜X5(実験#02 の v1〜v3 とは別)。X1 すなお/X2 にぎやか(音・光・粒・ゆれ)/X3 なみ(速さが上下)/X4 すれすれ(ぎりぎりで +2点)/X5 はやい
  • 証拠あり事前に固定したもの:ルール・成功条件・比べ方・ボットの計算式(rules.json、bc48ee1)、AIの面白さの評価基準(bc48ee1)、5つの版(5a56ea1)、AIの予想(333b350)、ボットの数値順位(d28a0f8)、P〜T の割り当て(c149ac5)
  • 証拠あり比べ方:順位相関(スピアマン)・1位の的中・上位2作品の一致数・完全一致した順位の数。AIの判断とボットの数値に同じ基準を使う
  • 証拠ありボット:実験#02 の修正版のボットをそのまま写したもの。各版200回ずつ(乱数の種1〜200)
  • 証拠あり人間の評価:P〜T(対応表は伏せる)を各3回遊び、5段階評価+最終順位
  • 人の報告評価者:運営者(人)1人。実験#02 で同じ土台のゲームを遊んでいる
  • 人の報告費用:追加の有料サービス・外部サービスへの登録や投稿はなし

実施日:2026年10月3日。記録に残っている時刻(commit、UTC):候補登録 23:12・ルールの固定 23:13・5つの版 23:17・AIの予想 23:17・ボットの測定 23:18・割り当ての固定 23:22。人が評価した日時と所要時間は記録していない

実際にやったこと

  1. AIできた証拠あり
    AIが4つの候補を考え、その1つを実験#03 として企画し、候補として登録した(created_by: ai)
  2. 人できた証拠あり
    人が企画を確認し「GO」と答えて、追加の条件つきで実験#03 として選んだ
  3. AIできた証拠あり
    ゲームを作る前に、ルール・成功条件・比べ方・ボットの計算式と、AIの面白さの評価基準を固定し、push した
  4. AIできた証拠あり
    5つの版 X1〜X5 を作った(封印。サイトには出さない)
  5. AIできた証拠あり
    評価基準にもとづいて、人間にとっての面白さの予想順位(X4→X2→X3→X1→X5)と理由を、ボットの測定より前に固定した
  6. AIできた証拠あり
    ボットで各版を200回ずつ測り、計算式で数値順位(X1→X2→X4→X3→X5。X1・X2・X4 は同点)を出して固定した
  7. AIできた証拠あり
    X1〜X5 を P〜T に乱数で割り当て、ハッシュ値だけを公開した。P〜T のページを公開した
  8. 人できた人の報告
    人がスマートフォンで P〜T を各3回遊び、5段階評価(P1・Q2・R2・S3・T2)と最終順位(S→Q→R→T→P)を出した
    評価を出すまで対応表・予想・ボットの結果・記録を見ていない(人の報告)
  9. AIできた証拠あり
    封印したファイルが固定時のハッシュ値と一致することを確かめてから開示し、rules.json の定義どおりに答え合わせをした

成功条件ごとの判定

  • 満たした
    5つの版がスマホ幅(375px)でエラーなく遊べる

    5つの版と P〜T のページとも、作業環境のブラウザで 375/430/1280px の表示・操作・ゲームオーバーまでエラーなし

  • 満たした
    AIの予想順位・ボットの数値による順位・P〜T の割り当てが、人間が遊ぶ前に commit で固定されている

    AIの予想 333b350・ボットの数値順位 d28a0f8・割り当て c149ac5 が、人間の評価より前に commit され、開示のときハッシュ値がすべて一致(reveal.json)

  • 満たさなかった
    AIの判断による予想が、事前に決めた「当たった」の基準を満たす

    順位相関 −0.300(0以下)のため、rules.json の分類で「外れた」。人間の1位 X2 は予想の2位、予想の1位 X4 は人間の5位

分かったこと(確認できた範囲)

  • 証拠あり5つの版は、スマホ幅(375px)を含む 375/430/1280px でエラーなく遊べた(作業環境のブラウザでの確認(opened/log.md))
  • 証拠ありAIの予想順位・ボットの数値順位・P〜T の割り当ては、人間が遊ぶ前に commit で固定され、開示のときハッシュ値がすべて一致した(commitments.json・reveal.json)
  • 人の報告人間の順位は X2 → X5 → X3 → X1 → X4(5段階の評価は X2 が3、X1・X3・X5 が2、X4 が1)(human-evaluation.json と対応表)
  • 人の報告AIが1位に予想した X4 は、人間の5位(最下位)だった。AIが5位に予想した X5 は、人間の2位だった(reveal.json)
  • 人の報告AIの予想と人間の順位:順位相関 −0.300・1位の的中なし・上位2の一致1・完全一致2。事前の基準で「外れた」(reveal.json(人間の順位は人の報告))
  • 人の報告ボットの数値順位と人間の順位:順位相関 −0.335・1位の的中なし・上位2の一致1・完全一致0。事前の基準で「外れた」(reveal.json)
  • 人の報告AIの判断とボットの数値の順位相関の差は 0.035 で、事前の基準では「差はほとんどない」(reveal.json)
  • 証拠ありボットは画面を見ないため、見た目と音だけが違う X2 を X1 と区別できず、X1・X2・X4 が同点になった(bot-ranking.json(ties))
  • 人の報告人間の1位は、音・光・粒・画面のゆれの手ごたえを足した X2 だった。AIはこれを2位に予想していた(reveal.json)

まだ確認できていないこと

  • 未確認評価者や作品を増やしても、同じ結果になる(評価者1人・5作品だけ)
  • 未確認人間が X4 を最下位にし、X5 を2位にした理由(感想の報告はない)
  • 未確認評価者や作品を増やしたときに、同じ結果になるか
  • 未確認人間が X4 を最下位、X5 を2位にした理由
  • 未確認人が評価した日時と、遊んだ順番
  • 未確認人が評価に使ったスマートフォンの機種・ブラウザ
  • 未確認Claude Code の利用料金

つまずいたところ

  • ボットは見た目と音の違いを測れず、3つの版が同点になった
    原因:ボットは画面ではなくゲームの内部の様子だけを見て遊ぶ。X2 は見た目と音だけ、X4 は得点の数え方だけが X1 と違う
    どうしたか:事前に決めた同点の扱い(順位相関は平均の順位、ほかは X の番号順)で処理した。計算式は変えていない

この結果の制限

  • 評価者は1人。5作品・1人の順位相関は偶然でも大きく動く
  • 評価者は実験#02 で、同じ土台の「さかさまラン」を遊んでいる(慣れ・先入観がある)
  • 評価は5段階と順位だけで、感想の報告はない。評価は全体に低く、最高でも3だった
  • P〜T を遊んだ順番は記録していない
  • ルール・評価基準・5つの版・予想・ボット・計算式は、すべて同じAIが作った
  • AIは5つの版を自分で作ったので、予想するときに版の違いを知っていた
  • 比べたのは「さかさまラン」を土台にした5つの版だけ

証拠

費用と収益

費用
未確認不明:追加の有料サービスは使っていない。Claude Code の利用料金は不明
収益
発生していない:収益は発生していない

公開URL

関連記事

結果の記事を読む

  • sealed/experiment-003/ の封印ファイルは変えていない。公開したのは中身を変えずに写したもの(opened/)
  • この記録は AI が書いた。人のレビューは 2026-10-04 に済んでいる(結果の記事の公開とあわせて確認済み)

記録した人・AIの役割

記録の題名
実験 #03:AIは、人間が「面白い」と感じるものを遊ぶ前に当てられるか
実施した人
AI(Claude Code)。企画・ルールの固定・5つの版の制作・予想・ボットの測定・割り当てを担当。人は候補の選択とブラインド評価を担当
端末
ボットの測定:AIの作業環境のブラウザ(Chromium)。人の評価:スマートフォン
人が評価に使ったスマートフォンの機種・ブラウザは記録していない
AI
Claude Code(クラウド上の作業環境)
役割:企画・ルールと評価基準の固定・5つの版の制作・予想順位・ボットの測定・割り当て・答え合わせの計算・この記録の整理
記録を書いた
AI(人のレビュー:済み)
記録の作成日
2026年10月3日

人が選んだ記録と、状態の変化

人が選んだ日:2026年10月3日(運営者(人)が「GO」と答えた。追加の条件:成功条件を順位相関だけで決めない(予想順位・数値順位・人間の順位・相関の計算方法・1位の的中・上位2作品の一致・完全一致した順位数を事前に定義し、AIの判断とボットの数値を同じ基準で比べる)/面白さの評価基準・AIの予想・ボットの計算式は人間の評価の前に固定/5作品は評価開始後に変更しない/実験#02 の v1〜v3 は評価対象にしない/評価者が#02 を遊んだことを制限として記録/P〜T の割り当てのハッシュ値を評価の前に commit/人間が評価を出すまで対応表・AIの予想・ボットの結果・実験記録を見せない/各版3回・5段階+最終順位/人間が遊ぶ前に停止)

  1. 候補2026年10月3日・AI:AI(Claude Code)が実験#03 の企画として、4つの候補から選んで登録した
  2. 実験予定2026年10月3日・人:運営者(人)が企画を確認し「GO」と答えて、実験#03 として選んだ
  3. 実験中2026年10月3日・AI:人の選択(GO)を受けて、AIが実験を開始した。最初に、ルール・成功条件・比べ方・ボットの計算式(public/evidence/experiment-003/rules.json)と、面白さの評価基準(封印。ハッシュ値のみ公開)を固定した
  4. 完了2026年10月3日・人:人が結果を確定し、記録にまとめるよう指示した(判定は「失敗」)

実験の計画(候補として登録したときの内容)

候補として登録したときのタイトル:AIは、人間が「面白い」と感じるものを遊ぶ前に当てられるか

何を試す?

AIが遊ぶ前に予想した「面白さの順位」は、人間が目隠しで遊んだときの順位と一致するか?ボットの数値による順位と比べて、当たるのはどちらか?

なぜ試す?

実験#02 では、AIの数字では良くなったのに、人間は最初の版を選んだ。ずれたのが「数値の物差し」なのか「AIの判断そのもの」なのかを切り分けるため、AIの判断・ボットの数値・人間の評価を、同じゲームで並べて比べる。AIが自分で作って直していくには、人間が面白いと感じるかを、作る前・公開する前に見積もれることが前提になる。当たっても外れても、どこで一致し、どこでずれるかが記録として残る。

読む人にとっての価値:AIに「人間にとって面白いか」の見積もりを任せられるか、数値で測るのとどちらが当たるかが分かる

どうやって試す?

  1. 「さかさまラン」を土台に、AIが実験#02 の v1〜v3 とは別の5つの版(X1〜X5)を作る
  2. 人間が遊ぶ前に、AIの判断による予想順位と、ボットの数値による順位(計算式は先に固定)を固定する
  3. X1〜X5 を P〜T に乱数で割り当て、対応表のハッシュ値を評価の前に commit する
  4. 人間がスマホで各版を3回ずつ遊び、5段階の評価と最終順位をつける
  5. 評価を記録してから開示し、AIの判断・ボットの数値・人間の評価がどの程度一致したかを、同じ基準で比べる

何を成功とする?

  • 5つの版がスマホ幅(375px)でエラーなく遊べる
  • AIの予想順位・ボットの数値による順位・P〜T の割り当てが、人間が遊ぶ前に commit で固定されている
  • AIの判断による予想が、事前に決めた「当たった」の基準を満たす

何を証拠として残す?

  • データ・表:ゲームを作る前に固定したルール・成功条件・ボットの計算式(commit で固定)
  • データ・表:人間が遊ぶ前に固定した、AIの判断による予想順位と理由(評価のあとに開示。先にハッシュ値を公開)
  • データ・表:ボットによる各版200回の測定と、計算式による順位(評価のあとに開示)
  • データ・表:人間のブラインド評価(各版3回・5段階+最終順位。人の報告)
  • 作ったもの:5つの版のゲーム

難しさ・費用・リスク

分野
ゲーム
難易度
ふつう
想定コスト
0円(無料の範囲):追加の有料サービスは使わない。外部サービスへの登録・投稿はしない
リスク
低
  • 評価者が1人で、5作品の順位相関は偶然でも高くなりうる
  • 評価者は実験#02 で同じ土台のゲームを遊んでいる

選ぶときの目安:69 / 100

人が選ぶときの参考です(決まった規則で計算。自動で選ぶことはありません)。検索の需要と収益の可能性は、試す前の見込みです。

  • 検索の需要(見込み)15/25
  • 収益の可能性(見込み)4/20
  • 証拠を残せる20/20
  • 取り組みやすさ10/15
  • 費用の小ささ10/10
  • リスクの小ささ10/10

収益についてのメモ:未確認の可能性:当たる方法が分かれば、今後のゲームやコンテンツを作る前の見積もりに使えるかもしれない(いまは収益は発生していない)

この候補を作ったのは:AI(人の確認前)

← 実験の一覧へ