5つのAIに同じGodotゲームを作らせて比較|自動テスト26/26 PASSでも後ろに戻れなかった

AI関連の記事
AI GAME DEVELOPMENT BENCHMARK

5つのAIに同じ2D横スクロールゲームを作らせて、 最後は実際に人間がプレイして比較しました。

今回確認したのは「コードを書けたか」だけではありません。 制作時間、自動テスト、そして実際に遊んだときの操作感まで見ています。

約9分最速:GPT-5.6 Tera
約16分操作良好:GPT-6.1 Sol
26 / 26Qwen 自動テストPASS
約3時間Qwen / Strata
先に結論:
今回もっとも印象に残ったのは、 「自動テストが全部通ること」と「人間が快適に遊べること」は別だった という点です。

まずは動画で比較

実際の動きや操作感は文章より動画の方が伝わりやすいため、 YouTube本編では5モデルのプレイ映像を並べて比較しています。

動画が表示されない場合: YouTubeで直接見る

今回の比較条件

条件をできるだけ揃えるため、各AIには同じゲーム仕様と同じ基本方針を与えました。 外部ゲーム素材は使わず、Godot上のシンプルな図形やノードを使って実装しています。

ゲームエンジンGodot 4.7.1
画面サイズ960 × 540
ジャンル2D横スクロール
基本操作左右移動+ジャンプ
ステージ要素穴・敵・コイン・ゴール
評価方法自動確認+人間の実プレイ

共通仕様には、左右移動、ジャンプ、重力、足場、穴、敵の巡回、踏みつけ、 コイン取得、ゴール、カメラ追従、MISS/CLEAR、再スタートなどを含めました。

結果一覧

モデル 制作時間 実プレイ 主な特徴・問題
GPT-5.6 Tera 約9分 △ シビア 最速。矢印キーが効かず、最初の穴もかなり難しい。ただし頑張ればクリア可能。
GPT-6 Luna 約10分 ○ プレイ可能 ゲームとして成立。移動しながらのジャンプが少し扱いづらい。
GPT-6.1 Sol 約16分 ◎ 良好 左右移動・ジャンプとも自然。今回の比較では特に操作しやすかった。
GPT-6 Astra 約20分 ◎ 良好 操作感はSolとかなり近く、大きな違和感はなかった。
Qwen3.8-Flash-Next / Strata 約3時間 △ 問題あり 自動テスト26/26 PASS。しかし実プレイでは後退できず、敵の移動にも問題が残った。

※制作時間・実プレイ評価は今回の手元環境と同一課題での検証結果です。モデル性能全体を一般化するものではありません。

GPT-6 Luna:約10分で完成

良かったところ

  • 制作時間がかなり短い
  • ゲームとして最後まで進められる
  • Teraより実プレイ品質は明確に上

気になったところ

  • 移動しながらのジャンプがやや難しい
  • Sol / Astraと比べると操作感に差を感じる

Lunaは約10分と非常に速く、ゲームとしては十分成立しました。 一方、実際に操作すると、移動しながらジャンプするときに少し扱いづらさがあります。

GPT-6.1 Sol:約16分。今回かなり遊びやすかった

実プレイで特に好印象だったモデル。
左右移動やジャンプが自然で、「普通にゲームを操作している」感覚に近い仕上がりでした。

制作時間は約16分。最速ではありませんが、 速度と完成後の操作性のバランスがかなり良い結果でした。

GPT-6 Astra:約20分。Solとかなり近い

Astraは約20分で完成しました。 実際に遊んだ体感はSolとかなり近く、左右移動やジャンプで大きな違和感はありませんでした。

今回の横スクロールゲームでは、 AstraがSolを明確に上回ったと感じるほどの差はありませんでした。 逆に言えば、どちらも完成品として安定していました。

Qwen3.8 / Strata:約3時間。26/26 PASSだったのに……

今回もっとも興味深かったのが、ローカル環境で動かした Qwen3.8-Flash-Next / Strataです。

GPURTX 4060 Ti 16GB
システムメモリ96GB
推論エンジンStrata
量子化IQ3_XXS
実測生成速度約38~40 tok/s
制作時間約3時間

RTX 4060 Ti 16GB環境でもゲーム制作まで進められました。 生成自体は実測でおよそ38~40 tok/sです。

そしてAI側の自動テスト結果は26項目中26項目PASSでした。

26 / 26 PASS。
しかし実際に遊ぶと、後ろへ戻れない。

プレイヤーは前へ進めるものの、後ろ方向へ戻ることができませんでした。 さらに敵も右方向への移動が中心になる問題が残っていました。

それでもゲーム自体は最後までクリア可能です。 だからこそ、「起動する」「ゴールできる」といった確認だけでは見落としやすい問題だと感じます。

GPT-5.6 Tera:約9分で最速。ただし操作はシビア

Teraは約9分で完成し、今回の5モデルでは最速でした。 速度だけを見ると非常に優秀です。

一方、実プレイでは仕様に含めていた矢印キーでの移動が機能せず、 A / D+Spaceで操作する形になりました。

また、最初の穴を越えるジャンプもかなりシビアでした。 当初は「越えられないのでは?」と思うほどでしたが、 何度か挑戦すると突破でき、そのままクリアまで進めました。

Teraから分かったこと:
「最短時間でコードを完成させる能力」と 「人間が気持ちよく遊べるゲームを作る能力」は同じではありません。

今回一番重要だったのは「人間が遊ぶ」というテスト

自動テスト自体が役に立たないわけではありません。 構文エラーや処理の抜け、明確な不具合を見つけるには重要です。

ただし、ゲームではそれだけでは足りません。

  • キャラクターを思った方向へ動かせるか
  • ジャンプの強さは適切か
  • 穴を自然に越えられるか
  • 敵の動きに違和感がないか
  • 操作していてストレスがないか
Automated test PASS ≠ Playable game

AI駆動開発ではテスト自動化がますます重要になりますが、 ゲームのように人間の感覚が品質に直接影響するものでは、 最終的な実プレイ確認がまだ必要だと感じました。

制作時間だけを見ると?

速度順位 モデル 時間 ひとこと
1GPT-5.6 Tera約9分最速。ただし操作性に難あり
2GPT-6 Luna約10分速い。移動ジャンプはやや難しい
3GPT-6.1 Sol約16分速度と操作性のバランスが良い
4GPT-6 Astra約20分Solと近い良好な操作感
5Qwen3.8 / Strata約3時間ローカルで動くが修正ループが長かった

Qwenは生成速度自体は約38~40 tok/sでしたが、完成までには約3時間かかりました。 エージェントが確認・修正・再実行を繰り返すため、 トークン生成速度とタスク完了時間は別物です。

まとめ

今回の結果
  • SolとAstraは実プレイの操作感が良好
  • Lunaは速く、ゲームとして成立しているが操作感に少し癖がある
  • Teraは最速だが、操作面ではかなりシビア
  • Qwen / Strataはローカル環境でも制作できたが、完成まで約3時間
  • 26/26 PASSでも、人間が遊ぶと重大な問題が見つかった

今回は「どのAIが一番賢いか」を決めるというより、 同じゲームを作らせたとき、各AIがどんな失敗をするのか を見る検証になりました。

関連リンク

▶ YouTube本編:5つのAIに同じゲームを作らせて比較

▶ AI関連の記事一覧

※この記事は筆者の手元環境・今回のプロンプト・今回のゲーム仕様での検証結果です。 モデル性能全体を保証・断定するものではありません。

コメント

タイトルとURLをコピーしました