
还记得那个「你是否在雪山救过一只狐狸」的灵魂拷问吗?
从 AI 短剧到网友二创,这个梗在三个月内被爆改出数千个版本,相关话题播放量超过 50 亿次。但现在,它不只停留在视频里了——有人把它做成了一款可以玩的游戏。
做出这款游戏的,是一个叫 Spellcaster 的 AI 游戏生成智能体平台。
这个游戏有几十个支线,根据用户不同的选择走向不同的结局。这件事有意思的地方不在于"雪山救狐狸"又多了一个游戏版本,而在于它说明了一件事:AI 生成内容正在从"能看"走向"能玩",是交互深度的再一次跃迁。
AI 生成游戏,究竟卡在哪里
在此之前,"AI 生成游戏"并不是一个新鲜话题。
Codex、Cursor、Trae 这类代码生成工具,甚至是 GPT、Fable 5 大模型本身,已经能根据自然语言写出一段可以运行的贪吃蛇或平台跳跃游戏。但真正用过的人都清楚,使用这些工具生成游戏时,大多会卡在三个地方:
- 生成的代码能跑,但平台高度超出角色跳跃极限,根本上不去;
而 Spellcaster 生成的游戏没有卡点,可以顺利通关:
- 运行时崩溃,把报错丢回给 AI,修完这个又坏三个;
- 美术素材要么是系统图形库画的矩形圆圈,要么是多个风格完全打架的 AI 生图拼在一起;

图 1 肉鸽类地牢游戏:通用代码智能体的生成结果
而 Spellcaster 则可以生成风格一致、符合要求的游戏素材:

图 2 肉鸽类地牢游戏:Spellcaster 的生成结果
这些通用智能体的问题不是传统意义上的"代码错误",而是更复杂的可玩性错误——代码、规则、数值、地图、素材、玩家行为没有作为一个整体被考虑进去。
这正是 Spellcaster 想解决的问题。
多智能体架构:从"生成代码"到"生成游戏系统"
Spellcaster 的核心思路,是把游戏生成从"自然语言转为代码"的单步翻译,变成一套多智能体协同的生成-验证-修复闭环。
用户输入想法后,系统不会直接生成代码,而是先将自然语言解析成结构化的游戏设计中间层,包含核心玩法、角色能力、关卡目标、胜负条件、敌人行为、道具机制和关键数值约束。
在此基础上,Rule Agent 负责生成规则,Level Agent 负责生成关卡,Asset Agent 负责调度和生成素材,权衡素材的美观性和协调性。Playability Agent 和 Simulation Agent 则对生成结果进行可玩性验证——检查关键路径是否可达、难度曲线是否合理、是否存在必死局。
一旦发现问题,Repair Agent 不会直接重写代码,而是先判断错误属于哪一层(规则冲突、数值不自洽、关卡不可达还是代码实现错误),再回到对应环节进行局部修复。
这套"生成—运行—观察—评估—修复"的闭环,让 Spellcaster 关注的不是"代码能不能跑",而是"游戏作为一个交互系统能不能成立"。
从用户输入想法,到拿到完整可玩的游戏原型,平均耗时约十五分钟。目前已在横版跳跃、塔防、跑酷、地牢肉鸽等品类上完成验证。
下一步:世界模型直接生成游戏画面
从公开规划来看,Spellcaster 的当前形态还不是终点。
现阶段的实现路径是:AI 生成代码和美术素材,通过游戏引擎运行——代码仍然是中间层。团队明确的下一代方向,是基于世界模型直接输出游戏画面,绕过传统代码和引擎渲染管线。
如果一个模型能够直接学习和预测交互世界中的状态转移,玩家的每一次操作就不再需要被代码解释成状态变化,而是由模型内部的世界表征直接预测下一刻的画面和反馈。这一方向与谷歌的 GameNGen 的研究路径一致,但目标是工程化落地,而非学术验证。
支撑这条技术路线的,是团队在智能体和世界模型方向的长期积累。Spellcaster 背后的 DarwinMind(杭州达迩文智能)长期布局多智能体系统与世界模型方向,核心成员来自浙江大学、南京大学、澳洲国立大学,联合创始人包括浙大博士生导师,长期从事世界模型、多模态大模型和智能体系统研究。
目前 Spellcaster 处于内测阶段,面向游戏开发者和内容创作者开放申请,并且官网也展示了部分由 Spellcaster 生成的游戏作品,其中包括"雪山救狐狸"的游戏版本。内测阶段开放的是核心自然语言生成游戏能力,后续版本将加入社区分享、数值调整、音效生成等功能。



