5つのAIに同じ2D横スクロールゲームを作らせて、 最後は実際に人間がプレイして比較しました。
今回確認したのは「コードを書けたか」だけではありません。 制作時間、自動テスト、そして実際に遊んだときの操作感まで見ています。
今回もっとも印象に残ったのは、 「自動テストが全部通ること」と「人間が快適に遊べること」は別だった という点です。
まずは動画で比較
実際の動きや操作感は文章より動画の方が伝わりやすいため、 YouTube本編では5モデルのプレイ映像を並べて比較しています。
動画が表示されない場合: YouTubeで直接見る
今回の比較条件
条件をできるだけ揃えるため、各AIには同じゲーム仕様と同じ基本方針を与えました。 外部ゲーム素材は使わず、Godot上のシンプルな図形やノードを使って実装しています。
共通仕様には、左右移動、ジャンプ、重力、足場、穴、敵の巡回、踏みつけ、 コイン取得、ゴール、カメラ追従、MISS/CLEAR、再スタートなどを含めました。
結果一覧
| モデル | 制作時間 | 実プレイ | 主な特徴・問題 |
|---|---|---|---|
| GPT-5.6 Tera | 約9分 | △ シビア | 最速。矢印キーが効かず、最初の穴もかなり難しい。ただし頑張ればクリア可能。 |
| GPT-6 Luna | 約10分 | ○ プレイ可能 | ゲームとして成立。移動しながらのジャンプが少し扱いづらい。 |
| GPT-6.1 Sol | 約16分 | ◎ 良好 | 左右移動・ジャンプとも自然。今回の比較では特に操作しやすかった。 |
| GPT-6 Astra | 約20分 | ◎ 良好 | 操作感はSolとかなり近く、大きな違和感はなかった。 |
| Qwen3.8-Flash-Next / Strata | 約3時間 | △ 問題あり | 自動テスト26/26 PASS。しかし実プレイでは後退できず、敵の移動にも問題が残った。 |
※制作時間・実プレイ評価は今回の手元環境と同一課題での検証結果です。モデル性能全体を一般化するものではありません。
GPT-6 Luna:約10分で完成
良かったところ
- 制作時間がかなり短い
- ゲームとして最後まで進められる
- Teraより実プレイ品質は明確に上
気になったところ
- 移動しながらのジャンプがやや難しい
- Sol / Astraと比べると操作感に差を感じる
Lunaは約10分と非常に速く、ゲームとしては十分成立しました。 一方、実際に操作すると、移動しながらジャンプするときに少し扱いづらさがあります。
GPT-6.1 Sol:約16分。今回かなり遊びやすかった
左右移動やジャンプが自然で、「普通にゲームを操作している」感覚に近い仕上がりでした。
制作時間は約16分。最速ではありませんが、 速度と完成後の操作性のバランスがかなり良い結果でした。
GPT-6 Astra:約20分。Solとかなり近い
Astraは約20分で完成しました。 実際に遊んだ体感はSolとかなり近く、左右移動やジャンプで大きな違和感はありませんでした。
今回の横スクロールゲームでは、 AstraがSolを明確に上回ったと感じるほどの差はありませんでした。 逆に言えば、どちらも完成品として安定していました。
Qwen3.8 / Strata:約3時間。26/26 PASSだったのに……
今回もっとも興味深かったのが、ローカル環境で動かした Qwen3.8-Flash-Next / Strataです。
RTX 4060 Ti 16GB環境でもゲーム制作まで進められました。 生成自体は実測でおよそ38~40 tok/sです。
そしてAI側の自動テスト結果は26項目中26項目PASSでした。
しかし実際に遊ぶと、後ろへ戻れない。
プレイヤーは前へ進めるものの、後ろ方向へ戻ることができませんでした。 さらに敵も右方向への移動が中心になる問題が残っていました。
それでもゲーム自体は最後までクリア可能です。 だからこそ、「起動する」「ゴールできる」といった確認だけでは見落としやすい問題だと感じます。
GPT-5.6 Tera:約9分で最速。ただし操作はシビア
Teraは約9分で完成し、今回の5モデルでは最速でした。 速度だけを見ると非常に優秀です。
一方、実プレイでは仕様に含めていた矢印キーでの移動が機能せず、 A / D+Spaceで操作する形になりました。
また、最初の穴を越えるジャンプもかなりシビアでした。 当初は「越えられないのでは?」と思うほどでしたが、 何度か挑戦すると突破でき、そのままクリアまで進めました。
「最短時間でコードを完成させる能力」と 「人間が気持ちよく遊べるゲームを作る能力」は同じではありません。
今回一番重要だったのは「人間が遊ぶ」というテスト
自動テスト自体が役に立たないわけではありません。 構文エラーや処理の抜け、明確な不具合を見つけるには重要です。
ただし、ゲームではそれだけでは足りません。
- キャラクターを思った方向へ動かせるか
- ジャンプの強さは適切か
- 穴を自然に越えられるか
- 敵の動きに違和感がないか
- 操作していてストレスがないか
AI駆動開発ではテスト自動化がますます重要になりますが、 ゲームのように人間の感覚が品質に直接影響するものでは、 最終的な実プレイ確認がまだ必要だと感じました。
制作時間だけを見ると?
| 速度順位 | モデル | 時間 | ひとこと |
|---|---|---|---|
| 1 | GPT-5.6 Tera | 約9分 | 最速。ただし操作性に難あり |
| 2 | GPT-6 Luna | 約10分 | 速い。移動ジャンプはやや難しい |
| 3 | GPT-6.1 Sol | 約16分 | 速度と操作性のバランスが良い |
| 4 | GPT-6 Astra | 約20分 | Solと近い良好な操作感 |
| 5 | Qwen3.8 / Strata | 約3時間 | ローカルで動くが修正ループが長かった |
Qwenは生成速度自体は約38~40 tok/sでしたが、完成までには約3時間かかりました。 エージェントが確認・修正・再実行を繰り返すため、 トークン生成速度とタスク完了時間は別物です。
まとめ
- SolとAstraは実プレイの操作感が良好
- Lunaは速く、ゲームとして成立しているが操作感に少し癖がある
- Teraは最速だが、操作面ではかなりシビア
- Qwen / Strataはローカル環境でも制作できたが、完成まで約3時間
- 26/26 PASSでも、人間が遊ぶと重大な問題が見つかった
今回は「どのAIが一番賢いか」を決めるというより、 同じゲームを作らせたとき、各AIがどんな失敗をするのか を見る検証になりました。
次は20B級のローカルモデルとして、Gemma系20BやGPT-OSS 20Bでも 同じゲーム仕様を使って比較してみたいと思っています。
今後、新しいGemini系モデルが一般利用できるようになれば、 Sol / Astraとの同条件比較も試してみたいです。
関連リンク
▶ YouTube本編:5つのAIに同じゲームを作らせて比較
※この記事は筆者の手元環境・今回のプロンプト・今回のゲーム仕様での検証結果です。 モデル性能全体を保証・断定するものではありません。

コメント