叶小钗

从Sora到Seedance,25.5亿播放背后,是一个熊猫头

AI训练营26-1期,3月初开班,欢迎咨询

在之前AI项目三大品类为:AI工作流 > AI客服 > AIGC(文字),但从去年开始,我这边关于AIGC(视觉)的需求就显著超过AI客服了,并且在下半年竟一度超过AI工作流,成为了第一品类!!!

由此可见,人们对于文生图、文生视频的容错率是很高的,因为这块的能力肯定不能跟文字媲美,换句话说:我们可以接受一个动画视频盯着一个熊猫头,但我们不能接受文字里的逻辑错误。

总而言之,因为我们对AI视觉的可接受程度之高,所以AI在这块也足够火热,相应的,最近刷短视频的时候,你有没有发现:很多视频下方都会出现一个小小的「AI 生成」标识。

娱乐领域已经在大范围使用 AI 生成作品了。包括插画、动漫、小说、短视频...

AI 正在悄无声息地进入内容创作的每一个角落。有时候划到一个视频,风景美得不像话,或者人物说话特别高清,但又总觉得哪里不对,好像哪里透着一股“科技味儿”。

甚至有时候,你都分不清这到底是实拍,还是AI生成的,我们也真的不得不感叹,AI在这块发展真快,前两年我们还在玩 Midjourney 生成图片,觉得挺新鲜;现在,AIGC 视频生成已经充斥着整个互联网。

我最近看了一份关于 2025-2026 年 AIGC 市场的报告,它正在实实在在地改变内容创作的门槛:

Image

所以,什么是 AIGC?我们今天需要再次聊聊这个话题!

AIGC

AIGC 全名:AI Generated Content。简单理解:

只要是 AI 生成的文字、图片、视频、音频、代码等等。都属于 AIGC 的范畴

AIGC 的核心定义是:在大模型驱动下,通过自然语言或其他指令形式,自动生成高质量内容的技术体系。

它的实践范围,本质就是,内容创作。其本质上是生成能力,常见形态包括:

类别
典型
代表产品
文本生成
写文章、写公众号、写小说、写代码、营销文案、自动总结
OpenAI GPT 系列、DeepSeek
图像生成
文生图、AI绘画、商品图生成、建筑效果图
OpenAI Sora、Midjourney、即梦
音频生成
AI配音、AI唱歌、语音克隆、AI作曲
ElevenLabs、Suno 等
视频生成
文生视频、数字人播报、AI动画、短视频自动制作
OpenAI Sora、即梦、可灵

围绕这个表格,商业场景也就展开了,比如:

  1. 内容创作行业:公众号矩阵、短视频脚本、自动新闻写作等,AI 让一个人顶一个团队成为可能。
  2. 电商行业:商品渲染图、自动客服、详情页生成,设计师在厕所瑟瑟发抖。
  3. 软件开发行业:代码补全与重构、一键搭建系统,这可以说是程序员的噩梦了。

整体受影响最大的,应该是短视频行业,因为这个领域流量特别大,以往一些镜头需团队耗时数周,如今文生视频工具输入描述即可生成动态画面。

其实从去年Google Veo 套件开始,从概念设计到分镜预览,AI 已经开始大幅降低了创作门槛,而发展到Seedance2.0,AI生成已经成为常态,而非技术噱头了。

下面主要着重谈及 AI 视频行业:

AI 视频行业

随着 AI 视频生成模型的不断迭代,正在改变传统影视行业。从拍摄成本、制作周期,到创作门槛,整个行业逻辑都在被重塑。过去拍一部影视作品,需要:场地、摄影、灯光、演员、后期...

现在,某些场景下,只需要:一段提示词 + 一台高性能设备,而这种趋势越来越明显。

以前我也觉得 AI 视频离我们挺远的,生成慢、效果差、时间短。还要不断的调整提示词,生成出来的视频也要考运气。

但是经过模型的厂商不断迭代,现在的AI视频生成有了很大进步,市场上得到的数据是:光是 AI 视频生成这个细分市场,2025 年就要达到 7 亿多美元,到 2032 年甚至能翻到 25 亿多。

这意味着什么?意味着大家不再是拿 AI 当玩具了,而是真的有人在用它干活、赚钱。事实也是,在一些AI短剧工作室,做出的精良的AI短剧在各大平台都有很好的收益。

特别是对于做内容的人来说,图像和视频是增长最快的领域。现在的 AI 视频,已经从“能看”变成了“好看”。快手,抖音这些平台上的 AI 内容播放量都在暴涨,很多时候你不看AI生成水印,可能真分辨不出来。

但是,凡是都是利益驱动的,如果后续平台打击AI内容,这块的前景到底如何,AIGC和人工的关系到底如何配合,还得磨合。

另一方面,AI视频的成本不低,某些场景下视频生成的算力成本确实比画图高,但这里得算性价比、也得考虑额外的成本;

比如,拍一条高大上的宣传片,人工、场地、设备成本不说,最烦的其实是管理成本;但用AI的话,在电商海报、口播视频这类场景,AI的成本简直是降维打击。

就在我写这篇文档的这几天,即梦又发布了新的视频生成模型 Seedance 2.0,整体效果和成本迎来了进一步优化,人人都是导演的时代,可能就在今年!

最后,我们来简单介绍下Seedance 2.0:

Seedance 2.0

这款模型在网络上得到了极高的评价,游戏科学 CEO、《黑神话:悟空》制作人冯骥在试用 Seedance 2.0 后,评价其为“当前地表最强的视频生成模型”,并称其标志着“AIGC 的童年时代结束”。

而且资本市场也非常认可即梦的新模型,因为 AI 视频太逼真,导致字节官方甚至限制了真人人脸上传。

在即梦 Seedance 2.0 之前,大家公认的是 Sora 视频模型是视频生成最好的模型,但是在即梦 Seedance 2.0 发布后,通过大家的测评发现,Seedance 2.0 已经可以和 Sora 平起平坐,有些地方甚至超过了 Sora,这也是为什么即梦 Seedance 2.0 在网络上得到了极大的反响。

Seedance 2.0 的核心优势在于多模态参考能力:

  • 支持上传文本、图片、视频、音频,这些素材都可以被用作使用对象或参考对象。
  • 你可以参考任何内容的动作、特效、形式、运镜、人物、场景、声音,只要提示词写得清楚,模型都能理解。
  • 简单来说:Seedance 2.0 = 多模态参考能力(可参考万物) + 强创意生成 + 指令响应精准(理解力很棒)。

互联网上大家都知道,我们与美国在 AI 基座模型上的差距还有不少,但是国内的字节、阿里、DeepSeek等大厂 都在不断迭代,与美国的差距在不断缩小。

在实践操作中,虽然针对即梦的新模型,AI 视频的制作后续可能会有新的方法论,但是我们这里还是以通用的主要流程来制作。

新手小白

对于新手来说,进入一个未知的领域,第一步就是调研,而不是拿着网上的某个观点就开始创作。你需要了解 AI 视频的模型有哪些,步骤是什么,费用怎么计算。类似这样的脑图:

Image

对 AI 视频有一个初步了解后,就可以开始制作了。

第一步:制作故事

一般来说故事的字数基本上决定了视频的长短,300 字差不多就是 60 秒~90 秒这样子。

故事也可以原创,直接让 AI 进行生成即可。这个比较简单,但最好是自己有大体思路,这样生成的故事就不会太离谱。然后人工进行审核,因为 AI 原创的故事有时会忽视逻辑性。

我们这边做demo,就随意来个望梅止渴:

东汉末年,曹操率领部队去讨伐盘踞在宛城的张绣。当时已经到了中午,烈日当空,天气十分炎热。将士们携带着沉重的武器,全身都被汗水浸湿,又热又渴,非常难受,给行军带来了严重影响。
曹操见将士们一个个舔着干燥的嘴唇,勉强行走,心里非常焦急。下令队伍原地休息,派人分头到各处去找水。过了好一会,派去的人全都提着空桶回来。
原来,这里是一片荒原,没有河流,也没有山泉,根本找不到水。曹操又下令就地挖井,士兵们挥汗挖土,但过了好长时间,也挖不出一滴水。
曹操心想,情况很严重,如果在这里久留,会有更多的人无法坚持下去。曹操略微思索了一下,猛地用马鞭指着前边的山坡。大声对手下的将士说:“这个地方我熟悉,翻过前边的山坡,就会有一大片茂盛的梅林,到了那里,你们每个人都可以尽情的享用个够。”将士们一听,就自然而然地想像起酸味,从而流出口水,顿时不觉得那么渴了。
曹操立即指挥队伍行进。经过一段时间,终于带领队伍成功找到了水源。大家痛痛快快的喝了水,精神焕发的继续行军。

第二步:人物制作

制作主要人物的三视图,为了保持 AI 视频的人物一致性。

因为现在的 AI 视频还无法进行长视频生成,只能 5s、10s,最大也就 15s。

Sora 模型倒是可以一次性生成 60s 的视频,但国外模型使用比较麻烦,也是需要抽卡的,不能每次都一次性生成想要的。

在望梅止渴的故事中,主要人物是曹操和士兵,所以需要把曹操和士兵的人物三视图制作出来。这个地方也确定了,视频的画风:

Image
Image

我这里制作画风为动漫画风。人物制作的提示词:

你是一位角色设计大师,请根据我提供的这份文档,结合文档中的历史时期,设计文档中出现的主要人物的造型,要求设计包含人物的发型,发色、体型、外貌、穿着等。以适用于即梦 AI 图片生成提示词的方式,把设计造型的文本发给我。

人物制作完成后,下一步就是分镜了,也是最重要的一步。

第三步:分镜制作

这个是分镜制作的提示词:

你是一名专业漫画分镜师 + 影视导演,请根据我提供的故事文本,自动拆分为清晰、可视化的分镜表格。
 要求:
1. 严格按照故事情节顺序拆分分镜,不遗漏关键信息
2. 每一个分镜必须画面明确、可直接绘制或拍摄
3. 分镜颗粒度适中(一个动作或情绪变化即可一个分镜)
4. 不扩写剧情,不新增原文不存在的情节
 输出格式:Markdown 表格,表格必须包含以下列:
 ● 分镜编号
 ● 故事片段(对应原文内容)
 ● 场景(时间 / 地点 / 环境)
 ● 画面描述(人物构图、动作、镜头内容)
 ● 镜头类型(远景 / 中景 / 近景 / 特写)
 ● 镜头角度(平视 / 俯视 / 仰视 / 侧面等)
 ● 情绪与氛围(紧张 / 压迫 / 温馨 / 阴暗等)
 ● 画面重点(观众第一眼注意的元素)
 风格要求:
 ● 偏向【漫画 / 动画 / 分镜脚本】
 ● 描述具备画面感,避免抽象词汇
 现在请根据以下故事生成分镜表格:
 【在这里粘贴故事正文】

然后会生成一个表格:

Image

分镜表格制作好之后,后面就是根据分镜的内容和对应的画面提示词,制作切合每一个分镜的图片。后续根据图片和自己的想法制作 AI 视频。

第四步:文生图,图生视频

根据分镜文档里面的场景,画面描述,镜头类型,镜头角度,情绪氛围等等,来描述这个画面关键的一帧画面,然后根据这一帧画面生成对应的短视频,一般就在 5 秒或者 10 秒。

这一步是比较消耗资源的,因为 AI 通常不会一次性就生成你想要的结果,你只能对生成的结果进行调优,当然提示词得描述清楚。现在的即梦新模型 Seedance 2.0 降低了抽卡的频率,AI 视频生成更加准确,但是也不是每次都能一对一生成想要的效果,抽卡是避免不了的:

Image
Image

在第二张图片中,很明显可以看出,士兵头盔上的水滴,这也是模型幻觉所造成的。

正常逻辑来说,在提示词的炎热环境下,是不会出现这种情况的。但我尝试让即梦去识别头盔上的水滴,让即梦去掉头盔上的水滴,但是即梦 3.5 识别不了,所以使用到了 Gemini 模型,帮我进行修改,它在画面修改这方面表现很强:

Image

这样可以更直观的看到对比,右边为修改后的效果。以此类推把分镜文档中的视频都生成出来即可。

第五步:剪辑

AI 视频都是需要剪辑的,剪辑的素材就是 AI 分镜视频。

视频剪辑推荐——剪映(也是字节产品)。剪映上手快,学习成本低,素材库丰富。如果不是大型工程视频剪辑或者特效处理,剪映应该是一个很好的选择:

Image

主要处理的就是这五件事:

  1. 音效
  2. 视频衔接
  3. 配音
  4. 字幕
  5. 转场

在剪映中处理好素材后,差不多一个 AI 视频就生成完成了。剪映的教程这里就不做说明了,在抖音、B 站学习 2 小时差不多就可以掌握基础剪辑。

最近想要体验即梦新模型的同学还是等字节放开模型规范化吧:

Image

现在即梦Seedance 2.0已经是不能正常使用的地步了,除非你购买更高权益的订阅,Seedance 2.0 fast 还能用一些,但是也需要等待非常长的时间。或者就是等2月24号后官方放开API调用,使用API进行体验使用吧:

Image

结语

随着 Seedance 2.0 这样的工具出现,内容的“生产成本”正在趋近于零,但“审美成本”和“认知成本”正在无限拔高。

它变成了一场关于“想象力”和“判断力”的较量,你能不能想到别人想不到的故事?你能不能在 AI 生成的 100 个结果中,一眼挑出最有吸引人的一个结果,或者自己做一个脑洞大开的故事。

冯骥说“AIGC 的童年结束了”,但这并不意味着人的退场。相反,这是“超级个体”时代的到来。AI 削平了技术的门槛,却让“人”的特质变得前所未有的重要,那就是创新。

点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信:

Image

往期推荐

《系统性:如何进入AI行业?》

《万字:Agent概述》

《万字:理解LangChain》

《万字:个人IP,包教包会》

《万字:RAG实战技巧,包教包会》

《万字:聊聊微调》


《2025年终总结》

《AI学习路线图》

《AI团队组织结构该如何设计?》

《生产级别的RAG系统》