2026 年 8 月,一个由 11 位研究者组成的国际团队把市面上最聪明的几款编码智能体关进了一场全栈游戏开发的「闭卷考场」。考卷一共三段,对应游戏从立项到上线的完整生命周期。
第一段叫「白纸起手」:智能体拿到一段自然语言需求,要在空白工作区里从零写出一款完整可玩的游戏;第二段叫「修 Bug」:智能体接手一段能跑但有缺陷的游戏代码,要么根据报错修,要么自己发现隐藏问题;第三段叫「迭代优化」:智能体要在 6 轮对话里根据用户反馈持续打磨一款游戏,每一轮都不能把上一轮已经写对的功能改坏。
总共 97 个生成任务覆盖 11 个游戏品类、100 个修复任务取自 50 个真实游戏关卡(每个关卡预先注入 19-27 个 Bug)、再加 17 条优化链、每条 6 轮共 102 次请求。这一场考试的结果是——能写代码的那一段做得最好,能写「会玩」游戏的段落集体翻车。
第一阶段:让智能体「从零写一款游戏」,它能做到几成
白纸起手看似最难,其实最稳。
研究者把每道生成题做成了一个客观分——能不能跑通、能不能交互、有没有视觉资产、有没有音效、能不能玩到通关。智能体在这 97 道题上整体表现尚可:能写出可执行的基础玩法框架的概率在主流编码模型里都超过 60%。换句话说,「让 AI 一句话写出一款可运行的小游戏」这件事,到 2026 年已经不是科幻。
但「可运行」≠「可玩」。97 道题里有相当一部分产出是这样的:游戏能打开、人物能动、关卡能加载,但节奏失衡、难度曲线失控、目标玩家 30 秒就放下。研究者把这些表现用回归测试做了二次校验,发现智能体在「多个需求同时满足」这件事上失分最严重——给定「既要 RPG 升级、又要 Roguelike 随机地图、还要无障碍模式」,它通常只能把第一项写好。
第二阶段:让智能体「诊断并修复 Bug」,才是真正的下坡路
这一阶段是整个 GameXpert-Bench 含金量最高的一段。
研究者用50 个真实游戏关卡(这些关卡来自开放源码项目 + 人工审核),给每个关卡注入 19-27 个 Bug——既有能看到的崩溃型(运行就报错),也有隐藏的逻辑型(比如碰撞箱错位导致主角穿墙、计时器不归零导致残影)。Bug 注入方式分两类:显式缺陷(提供报错堆栈让智能体修)和隐式缺陷(故意只字不提,让智能体自己跑测试发现)。
结果非常刺眼。
面对显式缺陷,主流编码智能体平均能修掉 60%-70% 的可见 Bug——这部分它们已经很接近人类中级工程师。
面对隐式缺陷,平均修复率掉到 25%-35%。原因是:智能体在「没有报错提示、只有行为偏差」的场景里,缺少主动写测试用例的动机——它倾向于相信「能跑就对了」,不会想到去写边界条件测试。这跟它训练语料里代码生成偏多、调试习惯偏少有关。
更扎心的是修复的「副作用率」:智能体每修一个 Bug,平均引入 0.4 个新 Bug——相当于修三个老 Bug 就冒出来一个新 Bug。对比人类资深开发者 0.05 的水平,这个数字差了 8 倍。这条差距决定了「AI 修 Bug」目前还不能脱离人类监督独立运转。
第三阶段:让智能体「在多轮对话里保留已有功能」,最难
17 条优化链是这个考试里最短的一段,也是最暴露弱点的。
研究者用真实人类玩家和编码智能体的多轮对话轨迹(每条链 6 轮、共 102 次请求),让智能体在「不破坏已有功能」的前提下持续打磨一款游戏。比如:玩家说「难度太高」,智能体调参;玩家接着说「但别去掉挑战感」,智能体继续调;玩家第三轮说「加一个存档系统」——这时候游戏原有逻辑很容易被覆盖。
在第三、第四轮,主流智能体的「功能保留率」就开始下滑,到第六轮时平均只有 30%-40% 的原有功能完整保留。换句话说,对话轮次越长,智能体越容易「丢三落四」。这跟当前 Transformer 架构在多轮约束下的注意力衰减有关——本质上是一个「长上下文遗忘」问题,而不是「不会做」问题。
一个有意思的副发现:当优化链要求智能体在第六轮仍然能调用到第一轮的代码文件时,文件路径引用率从第二轮的 70% 掉到第六轮的 12%——智能体倾向于「重新写一份」而不是「改原来那份」。这是「写代码能力」和「维护代码能力」之间的鸿沟。
为什么这场考试比「写代码跑分」更值得看
过去两年,关于「AI 能不能写代码」的基准几乎全部聚焦在 HumanEval、Mbpp、Codeforces 类题目——一次性、独立、可被单元测试覆盖。
GameXpert-Bench 切进了另一个维度:完整游戏开发的全栈能力——程序逻辑、视觉资产、音频、界面、交互、可玩性必须同时运转在一个可执行产物里。这个维度的关键不是「会不会写」,而是「写出来能不能跑、跑了以后能不能玩、玩坏了能不能修、修完了能不能保持」。
研究者用三种互补的方式评估:实时游戏交互(让智能体或人类玩一遍)、确定性行为测试(检查碰撞、计时、状态转换)、产物级回归测试(之前的关卡还通不通)。这套评估设计本身就比单纯看代码可执行要严格得多。
它意味着什么
如果把 GameXpert-Bench 的结果翻译成玩家的话术,它说的是:
「AI 写游戏,已经过了『能跑』这道关;卡在『能玩』『能修』『能改』三道关。」
换句话说,2026 年下半年独立游戏团队可以把「从零起一款 demo」交给智能体,但要保留人类在「打磨手感」「查隐藏 Bug」「管住迭代不翻车」这三件事上的最终决策权。这一场考试最有价值的结论,不是「AI 已经多强」,而是「哪一段能力是真的强、哪一段能力是被高估的」。它把编码智能体的能力图谱,第一次切成了「创造」「诊断」「维护」三段,并各自打分。
对一个想用 AI 写游戏的小团队来说,这张图谱意味着:工具可以买,测试用例必须自己写——智能体不会主动替你写测试,这就是它不能独立修 Bug 的根因。
本文视角
这一场考试最值得收藏的不是分数,而是方法论——它把「写代码」拆成了「生成 / 诊断 / 维护」三段,并给每段单独打分。这种「按生命周期切段评测」的思路,未来两年很可能被复制到 AI 视频生成、AI 三维建模、AI 工业设计等领域。能不能写一帧,已经不是 AI 时代的难题;能不能跨多轮、跨修改、跨需求保持一致性,才是 AI 真正的下一道关卡。
参考资料:arXiv 公开预印本 2608.21833(2026 年 8 月),GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?
