从 Midjourney 到 GPT-image-2,三年变化
同一句提示词,三年。
从2023年开始,每次有新的AI生图模型发布,我都会用同一句话去测试:
"一对年轻的中国情侣,穿着夹克和牛仔裤,坐在屋顶上,背景是80年代的北京,可以看到对面的建筑。"
为什么是这句?因为它同时考验AI四件事:人物面部细节、服装质感、空间透视、以及对一个特定年代中国城市氛围的理解。
三年下来,变化肉眼可见:
2023年,人脸是糊的,看起来不怎么像人类,手指数量随机,80年代的北京长得像赛博朋克。
2024年,人像开始像人了,但细节经不起放大,背景建筑像AI自己发明的。
2025 年,AI 生图能力跃迁,nano banana 横空出世。
2026年,AI 生图新王GPT-image-2出来了。
你直接看图。
这不是渲染,不是修图,是一句话直接生成的结果。光影、面部、牛仔裤的褶皱、远处楼房的年代感——第一次觉得AI真的"看见"了80年代的北京。
同一句话,喂给不同时代的AI,就是一面镜子。
是不是理解了啥叫做:AI的进化不是线性的,是跳崖式的。