実験

実験#03:AIに「人間が面白いゲーム」を当てさせたら、外れた

人間が遊ぶ前に、AIに「どのゲームが面白いと思われるか」の順位を予想させて固定した。人間がブラインドで遊んだ結果、AIが1位に選んだ版は、人間の5位だった。

結論

AIが1位に予想した X4 は、人間の5位だった。AIの予想の順位相関は −0.300、ボットの数値順位は −0.335 で、事前の基準ではどちらも「外れた」(差は 0.035・差はほとんどない)。判定は「失敗」。今回のゲーム・今回の評価者・今回の評価方法という条件での結果で、AI全般についての結論ではない

先に結論

AIが1位に選んだゲームは、人間では5位(最下位)でした。

人間が遊ぶ前に、AIの予想順位と、ボットの数値による順位を固定しておきました。答え合わせをすると、AIの予想の順位相関は −0.300、ボットの数値は −0.335。事前に決めた基準では、どちらも 「外れた」 です。実験の判定は 「失敗」 です。

ただし、評価したのは1人、比べたのは5つの版だけで、評価者は前の実験で同じ土台のゲームを遊んでいます。言えるのは「今回のゲーム、今回の評価者、今回の評価方法という条件では、AIの予想は人間の順位と一致しなかった」ということまでです。

#02 からの続き

実験#02 の結論は、「AIの数字では良くなった。でも人間が遊んだら、最初のほうが面白かった」でした。

ずれたのは、ボットの数値という「物差し」のせいなのか。それとも、AIの判断そのものがずれているのか。

そこで今回は、AI自身に「人間が面白いと思うもの」を先に予想させてみる ことにしました。テーマは、この実験室のAI(Claude Code)が4つの候補から自分で選んだものです。

5つの新しいゲーム

#02 の「さかさまラン」を土台に、AIが新しく5つの版を作りました(#02 の v1〜v3 は使っていません)。タップでボールが天井と床を行き来する操作は、5つとも同じです。

版 中身
X1 すなお 落ち着いた標準の版
X2 にぎやか X1 と同じ動きに、音・光・粒・画面のゆれを足した
X3 なみ 速さが波のように上がったり下がったりする
X4 すれすれ ぎりぎりでよけると +2点のボーナス
X5 はやい はじめから速く、短い時間で勝負がつく

遊ぶ前に、全部固定した

結果を見てから都合よく解釈できないように、人間が遊ぶ前に次のものを順番に固定しました。

  1. ルール:成功条件、比べ方、ボットの計算式。ゲームを作る前に固定
  2. AIの面白さの基準:「手ごたえ」「公平さ」「緊張と息つぎ」など6つ。これもゲームを作る前に固定
  3. AIの予想順位:5つの版を作ったあと、ボットで測る前に固定
  4. ボットの数値順位:#02 で直したボットで各200回ずつ遊ばせ、決めておいた計算式で順位を出して固定
  5. ページの対応表:X1〜X5 を P〜T に乱数で割り当て、中身を確かめるためのハッシュ値だけを公開

AIの予想・ボットの結果・対応表は、人間が評価を出すまで公開しない場所に置きました。比べ方も、順位相関だけでなく「1位が当たったか」「上位2作品がいくつ一致したか」「順位が完全に一致したのはいくつか」の4つを、AIとボットに同じように当てはめると決めました。

人間は P〜T をブラインドで遊んだ

評価した人は、どれがどの版か知らないまま、スマートフォンで P〜T を3回ずつ遊び、5段階の評価と最終順位をつけました(人の報告)。

P:1 Q:2 R:2 S:3 T:2 順位:S → Q → R → T → P

開けてみた

評価を受け取ってから、封印していたファイルを開きました。ファイルはすべて、固定したときのハッシュ値と一致しています。

対応表は P=X4、Q=X5、R=X3、S=X2、T=X1 でした。

1位 2位 3位 4位 5位
人間 X2 X5 X3 X1 X4
AIの予想 X4 X2 X3 X1 X5
ボットの数値 X1 X2 X4 X3 X5

(ボットの数値では X1・X2・X4 が同点。決めておいたとおり、番号順に並べています)

答え合わせ

尺度 AIの予想 ボットの数値 でたらめに並べた場合
順位相関 −0.300 −0.335 0
1位が当たったか 外れ 外れ 20% の確率
上位2作品の一致 1つ 1つ 平均 0.8
順位が完全に一致 2つ 0 平均 1

決めておいた基準では、順位相関が 0 以下なら「外れた」です。AIの予想もボットの数値も「外れた」 でした。AIとボットの差は 0.035 で、基準では「差はほとんどない」です。

AIの1位は、人間の5位だった

AIは、ぎりぎりでよけるとボーナスが入る X4 を1位に予想しました。理由は、「危なかった」が得点という目に見える形になり、ぎりぎりを狙うか安全にいくかを選べて、腕の差と上達の実感が出やすい、というものでした。

人間は、その X4 を 5位 にしました。

人間の1位は、音・光・粒・画面のゆれを足した X2。AIはこれを2位に予想していました。そして、AIが「見てから反応する余裕が少なく、公平さが低い」として最下位にした X5 は、人間の2位でした。

なぜそう感じたのかは、感想の報告がないので分かりません。

ボットには見えないものがあった

ボットは画面を見ずに、ゲームの内部の様子だけで遊びます。そのため、見た目と音だけが違う X2 を、X1 と区別できませんでした(同点)。

人間の1位は、その「ボットには見えない違い」を足した X2 でした。

今回分かったこと

  • AIは、5つの版を作り、予想・測定・対応表を人間が遊ぶ前にすべて固定して、ブラインドの比較を最後までやり通せた
  • 今回の条件では、AIの判断による予想も、ボットの数値も、人間の順位と一致しなかった(どちらも「外れた」)
  • 物差しを「数値」から「AIの判断」に変えても、人間とのずれは縮まらなかった(差は 0.035)
  • AIが1位に予想した X4 が人間の最下位になり、AIが最下位にした X5 が人間の2位になった
  • ボットには、見た目や音の違いが見えない
  • 先に全部固定していたので、結果を見てから言い訳する余地がなく、「外れた」とはっきり言える

今回分からなかったこと

  • 評価する人や作品を増やしても、同じ結果になるか
  • 人間が X4 を最下位にし、X5 を2位にした理由
  • #02 で同じ土台のゲームを遊んだ経験が、評価にどう影響したか

評価は1人、作品は5つで、5段階の評価も全体に低め(最高で3)でした。この結果だけで「AIは人間の面白さを予想できない」とは言えません。

次の実験につながる問い

  • 人間に短い感想をもらいながらAIが直したら、人間の評価は上がるか
  • 評価する人を増やしたら、AIの予想はどのくらい当たるか
  • ボットに「見た目や音」を測らせることはできるか

くわしい手順・数字・証拠は、実験#03 の記録ページ の「詳細な実験記録」に残しています。

まとめ

#02 では「AIの数字で良くなったのに、人間は最初の版を選んだ」。#03 では「AIが1位に予想した版を、人間は最下位にした」。AIは予想を立て、その予想が外れたことを、ごまかせない形で記録できました。外れたからこそ、次に何を確かめればいいかが、少しはっきりしました。

証拠(実際の画面・記録)

画像をタップすると、元の大きさで開きます。

この記事について

確かめたこと
AIは、人間が「面白い」と感じるものを、遊ぶ前に当てられるか
試した日
2026年10月3日
環境
Claude Code(クラウド上の作業環境) / Chromium(Playwright)でボットを実行 / 人の評価:スマートフォン
費用
追加の有料サービスは使っていない(Claude Code の利用料金は不明)
使ったAI
Claude Code(Anthropic)
AIの役割
実験の企画、ルールと評価基準の固定、5つの版の制作、予想とボットの測定、答え合わせの計算、記録と記事の下書き
人の確認
確認済み(2026年10月4日)