没想到 50 岁了我开始手搓小游戏:灵光闪现
过去半年,我有个强烈的体感,AI 领域里有一个现象更加频繁的出现了——“生成涌现(Generative Emergence)”。
当模型具备了足够的理解能力、上下文能力和执行能力之后,会突然表现出一些过去不可能、也没人预料到的创作能力:不是生成一段文字,也不是生成一张图片,而是生成一个系统。
Gemini 3.0 发布时就演示了“生成 OS 界面”的能力,比如通过一个 prompt 生成 MacOS 的模拟 UI,关键是大部分功能还是可用的:
AI 快速搭建复杂交互结构的能力越来越强,甚至让代码、界面、逻辑在一句话指令下可以自动组合成我们想要的功能,这让我想起很多年前,人们第一次在 iPhone 上看到可以通过“摇一摇”刷新界面的惊讶。技术的跃迁似乎总是突然出现——如同在黑暗中点亮的一盏灯。
国内也有类似的场景出现。上个月蚂蚁集团的同学跟我说,老池你玩玩我们刚发布的灵光 App,和别的 AI 助手都不一样,我们管这个叫全模态通用 AI 助手。
我用了之后感觉非常不一样。灵光的定位非常直接:让普通用户也能通过自然语言直接获得强大、可视化、交互式的 AI 服务。功能也让人眼前一亮,比如开眼,闪应用等等——这些我们稍后再说,因为灵光闪应用今天又升级了一个新功能,叫做 “闪游戏”。
什么是“闪游戏”?普通用户可以通过一句话生成小游戏,还能修改角色、改背景、改规则、加特效,最快30 秒就能跑起来,也能继续迭代。
比如我在等人的时候想和 AI 下一盘 9 X 9 的小型围棋怎么办呢?我选择用灵光自己做一个:
如果说之前的 AI 是在帮我们制作图片,分析报告,创作视频,那这一次,灵光展示的是另一种趋势:AI 正在学会把复杂体系直接生产出来。
我把这个叫做“生成涌现”。
1
AI 时代的创作门槛,到了一个新的边界:从写一段代码、做一张图片、写一份报告,来到了“做一个轻应用”“搓一个小游戏”“设计一套新系统”。新的创作时代徐徐拉开帷幕。
灵光这个 AI 助手从诞生开始,就和其他产品——ChatGPT、Gemini、DeepSeek 之类的——不太一样,它有三个方向:
对话:改变了人与信息交互方式,不仅仅文字回答,还可以生成 3D 模型、动态图表/动画、可交互地图等等。比如我说:什么是大模型里的注意力机制,图文并茂给我讲讲。
我不仅能够得到图文并茂的讲解,还有动画演示。对话从文字变成了多模态和结构化交互。
开眼:理解现实世界的“第三只眼”。点击主界面右下角的“眼睛”图标,就进入了开眼的世界。手机摄像头看到的,是你看到的,也是灵光看到的。
灵光可以实时理解这些影像:通过手机摄像头识别场景、物体、文字、动图,并能和用户进行语音或文字交互。我们还可以看图提问:这是什么,为什么会这样,怎么使用等等,还可以做文生图、文生视频等相关创作。
最有意思的是闪应用,可以让普通用户直接生成可运行的小应用。用户只需通过一句类似“做一个 XXX 应用”的自然语言描述,最快在 30 秒 的时间内就可以生成一个可编辑、可交互、可分享的小应用。
比如我说“基于番茄工作法给我做一个番茄时钟计时器”。30 秒之后,我将获得一个番茄时钟:
今天这次更新,把“闪应用”的一个重点能力——闪游戏,推到了前台。用户只需要说一句“帮我生成一个空战 1942”,灵光就能最快 30 秒完成一个可玩的版本,还能随时改人物、改背景、改规则。
在我看来,这意味着:生成式 AI 已经在尝试构建一个可运行系统,而不是单个内容模块。
传统意义上,游戏算是门槛很高的产品形式。需要考虑玩法、逻辑、画面、物理规则和交互链路等等,即便是最简单的“打地鼠”,背后也塞满几十个 if-else。
现在,用一句自然语言指令,AI 就可以拼装出:角色、世界、交互、状态、奖励、动作逻辑、UI、难度参数等等。
我们第一次看到 AI 的“理解并生成”能力在消费级产品上具象化。灵光这次更新的闪游戏,让这种“系统性生成”变得顺滑、可控,好玩极了。
2
我用灵光“搓”了一小时的游戏,发现这是一种前所未有的创作体验。生成速度快得惊人,大多数游戏 30 秒左右就能跑起来。
显然,AI 是在理解语义后写了一整套完整的游戏机制,我像是在看一个小型创意工厂现场造物。
作为 70 后我先做了个我们那个时代非常火热的围棋游戏。
1)请为我生成一个小型围棋对弈游戏(9×9 棋盘),包含界面、交互逻辑与可实际运行的功能。对手 AI 请模拟围棋业余棋手的对弈风格。
生成好之后确实可以对弈了,我发现对手棋力太差,继续调整,增加 AI 的棋力等级。这下对手的棋力终于和我差不多了,我发现下棋不用下到最后,差不多计算一下,谁赢谁输一目了然,于是加了个计算输赢的功能。经过几轮调整,一个可玩的围棋游戏就做好了:
2)做一个迷宫探索游戏,视野只有一小块区域,迷雾会缓慢移动或扩散,需要在限时内找到出口。30 秒,游戏搞出来了:
但我只能用手指触碰指引小黄球闯迷宫,屏幕都快戳烂了,60 秒根本找不到迷宫。于是我加了方向键控制走向,加了奖励道具,吃到后可见视野会扩大,加了音效,最后一个可用的迷宫游戏就出来了:
3)“做个雪人兄弟游戏”:它真的生成了一款可通关的游戏。
灵光识别出这是 90 后记忆中的游戏,于是自动构建地图、平台跳跃逻辑、敌人移动、碰撞检测、胜利/失败条件、冰块发射效果等。
更惊讶的是,它生成的不是“固定版”。
第二次生成,同样的指令,地图完全不同,难度不同,敌人数量也不同。这是“生成涌现”的核心特征:AI 开始自己理解“系统”,并能自动构建新的系统。
我又找出手机相册里墨墨的照片,告诉灵光,“把主角换成这只猫”。十几秒后,一只“猫版马里奥”出现了。随后我加了下雪的特效,背景换成落日,增加动态障碍物等等,最后成品就出来了:
如果我有时间可以一直优化,这种“把自然语言映射到结构化参数”的能力,是过去整个行业难以做到的。当你能随时重新生成、随时调整、随时换规则时,创作的成本就很低了。这可能就是我们一直在念叨的:真正的“创作平权”才刚刚开始。
事实上我还做了番茄时钟、跳一跳、空战 1942,都非常有意思,过程中我直接进入了创作心流状态。
3
为什么今天写闪游戏?网上不少人把灵光的闪游戏当作“有趣的小功能”,我觉得它的重要性是给出了一种趋势:AI 能够把复杂系统直接生成出来,并且能力正在向大众普及。
这件事在 2024 年还扑朔迷离,到 2025 年开始变得具象了。
Gemini 2.5 问世,首次强调了“生成网页/生成界面”的能力。到了Gemini 3.0 Pro,就可以直接生成 macOS 的模拟 UI,并且可以交互和使用。
各类 AI Agent 产品也显示出,模型具备了“系统级生成”的雏形。
一些开发者社区的实验也表明,AI 能够自动组合组件,并生成可执行应用。
灵光的不同之处在于,它不是开发者工具或玩具,而是普通人能用的消费级产品。这是重要的差异。
行业里很多“系统生成”案例都停留在技术演示阶段,但灵光这次把它做成了可以落地的用户体验,蚂蚁的同学告诉我,产品发布两周,已经有 330 万个闪应用在真实世界里创作出来了。
这说明 AI 进入了一个新的阶段:不是能不能做,做什么,而是希望谁都能做。其实这就是 AI 普惠。
生成式 AI 进入产品时代后,第一次在 C 端展现出系统级创作的可用性。
4
AI 的历史发展,有几条重要的脉络:从“生成内容”到“生成组件(UI/代码片段)”,再到“生成系统(应用和游戏)”,从替代某个环节,到替代整个生产链条。
创作者从会写代码的人,扩展到能说清楚自然语言的人。从懂设计的人,扩展到能说清需求的人;从能开发应用的人,扩展到所有人。
未来每个普通人都有可能是“系统制作者”。需要什么就让 AI 做一个,用完即走。在这个过程里,AI 不再是协作和协助的角色,而是一个建造者。自己设计机制、自己生成 UI、自己补全细节、自己完成执行路径。
在这种场景里,用户就从一个“制作者”变成了“导演”。我想,这是未来 AI 重要的交互形态之一。我们人类更多需要的是创造力和想象力。
330 万个闪应用已经出现,这是一个值得重视的数据。
娱乐类占比最高,意味着普通用户正在用更轻的方式表达创意、记录生活、甚至输出情绪。
未来,这可能会变成一种新的创作生态:用户生成系统,系统生成交互,交互反哺系统。就像当年短视频平台出现“人人都是导演”。
5
蚂蚁集团在 AI 时代一直挺低调的,不过今年以来明显加速,不仅推出了 AI 监健康管家 AQ,10 月还发布了两个万亿参数大模型,灵光 App 的推出也是一出手即不凡,上来就是这种“系统生成”难度级别的创新。
这里面包括了很多技术难点:全模态理解、多轮语义解析、模型生成优先级、动态交互编排、前端组件拼装、Runtime 运行时管理等等等。说白了闪游戏的本质就是在大模型之上构建了一个“实时可执行的应用生成框架”。这件事必须模型、工程、交互、架构都搞定才行。
灵光上线仅 6 天下载量就超过 200 万,下载增速超过了 chatGPT 和 Sora2,这说明用户对此是买单的。生成式 AI 正在把“人人都能创作”变成现实。
灵光闪应用在做的事情,让普通人第一次接触到“系统级创作能力”,让普通的个体拥有生产系统的能力。现在是小应用小游戏,未来就是大应用系统,更复杂的游戏。
这是一种在新的技术时代里产生的新型表达方式,也是一种新的力量。