Sota.AI Devs Park 是生成式AI产业加速器 Sota.AI 支持建设的专注于生成式 AI 领域的公益开发者社区,正在策划举办系列 Meetup,聚焦于同频交流生成式 AI 的前沿趋势与一线技术实践。社区共创伙伴有:HackingClub、CSDN CMeet、How+、5S SENSES、有新Newin 等彬复资本,关注数字经济、绿色经济和新消费领域的早期、成长期投资机会,专注于深耕行业研究,以研究驱动投资,用专注的精神、专业的能力为投资者带来长期稳健的回报。主要出资人包括险资集团、政府引导基金、上市公司、家族财富管理办公室等机构投资者等。
张周,彬复资本董事总经理,关注中早期投资,主导或参与投资和并购多个TMT、企业服务、AI 和 2C 领域项目,累计投资金额超过2亿美金。加入彬复资本之前,曾任职兰馨亚洲 Orchid Asia 担任副总裁,期间从事美元中后期投资和并购。此前也供职于罗兰贝格战略咨询 Roland Berger 担任咨询顾问,协助各大跨国公司制定集团战略和落地运营方面工作。

本期内容,系彬复资本董事总经理张周出席由 Sota.AI 举办的系列 AI 开发者 Meetup 上海站,做的同名分享。以下为分享的逐字转录:感谢主办方邀请,彬复资本一直关注生成式AI的发展,同时也紧跟这次技术范式的变化,在投后管理和寻找新机会上,既意识到了机会也感到焦虑,和大多数从业者一样,我们也在学习最底层的大模型相关技术,并高频更新行业信息,本次的分享也尽可能的更新到了行业最新的进展情况。也感谢之前嘉宾对于宏观技术和市场的分享,这里我就不重复了,直接进入本次主题和细节。首先,我们先看海外的生态格局,毕竟海外生态已经发展了5年以上的时间,涌现出了一批估值超过10亿美元的企业,我们将企业分为两个类别,左边是偏细分应用的公司,右边则是综合类的大企业。由于篇幅限制,公司还无法列全,毕竟仅通过调用OpenAI API的应用层公司就达到了上千家,这里我们仅列举了大家熟知或者在细分领域排名靠前的企业。本页的左边分成了两个维度,纵向维度是模态,包括了主流的文本/对话、图像/UI、视频、音频、3D和代码,而横向则代表主要的细分场景举例,包括了营销/内容、文娱游戏、办公/效率工具、生活/社交和垂直行业,可以看到在各个模态*场景中已经出现了一批头部企业,包括了营销*文本中的Jasper,A121,营销*(文本+图片)的Typeface,图片生成中的明星公司Midjourney,同时在效率工具*文本/对话中拥有明星创业者创建的Adept、Glean以及我们日常经常使用的Notion AI。在工具类的其他模态中还有视频生成和编辑的Runway、Descript等。在商业场景之外,还有些公司主打生活/社交和陪伴,比如每个人都可以定制角色的Character.ai。此外在垂直行业,例如法律和医疗里面也出现了一批优秀企业。本页的右边可能大家会更加熟知,这些企业的模型和产品可以理解为多模态+多场景,包括了OpenAI、谷歌Deepmind、Anthropic、Meta等。但是,即使海外发展了多年时间,生态格局远没有稳定。左边的细分应用型公司本身各自的竞争就比较激烈,不同公司都在尝试跨越多个细分场景或者模态,影响各自的竞争空间。同时,右边的大型企业也在发布自己的应用产品,给左边的细分应用型公司带来冲击,例如ChatGPT作为应用产品发布后,不少营销*文本类的公司就受到了不小的影响。所以站在目前的时间点要去判断海外后续应用型企业的发展前景,本身还是有难度的,这就给想Copy to China的一些应用型企业带来了更多的困惑,本身Copy的对象情况就不稳定,如何去确保本土化后的生态位终局。反观国内,我们也拜访和了解了目前国内大部分的生成式AI创新公司,总结了目前的生态情况,总的来说,相比国外,本土的技术发展时间较晚,大家的商业模式和定位还处于探索的阶段,各自的路线差异比较大,和海外的生态也会有比较大的区别,原因后文会重点展开。假设从底层到应用层的生态分析,国内典型有6种模式:1⃣️ 纯底层硬件/工具:包括底层算力/芯片,模型辅助训练,数据标注和采集;2⃣️ 硬件/工具+基础模型:根据底层资源(算力、数据集等)自建/优化基础模型(通常会开源),丰富生态同时增加行业对于其自身资源的需求;3⃣️ 基础模型+行业模型+应用层:自建基础大模型,根据行业数据微调行业/场景底座模型(通常可部署),根据下游任务进行模型微调/蒸馏/提示等,泛化和适配到更小的应用任务;4⃣️ 基础模型+行业模型:自建基础大模型,根据行业数据微调行业/场景底座模型(通常可部署),开放API调用或者直接开源赋能应用层公司;5⃣️ 行业模型+应用层:自建中等规模模型或微调成熟的开源基础模型,并根据场景设计产品;6⃣️ 纯应用层:调用/封装API,直接开发产品,不构建模型层。而在人才方面,我们看到市场上有分别5类团队比较活跃,包括:1⃣️ 高校科研系:通常是高校科研人才和外部商业化人员组成;2⃣️ 互联网大厂高管系:其创始团队来自原大厂AI业务负责人级别、特定产品线负责人级别、相关技术负责人级别等;3⃣️ 科技大厂高管系:类型包括AI技术大厂、智能终端大厂、智能汽车大厂、软件大厂等;4⃣️ 行业转型系:过去成熟产品包括智能客服、营销、CRM、数据库等,目前借助生成式AI的技术迭代原来的产品;5⃣️ 年轻创业系:例如高校毕业生、海归创业者等,可能是其第一份创业。目前国内已经出现了一批高质量的生成式AI创业企业,但相比海外生态仍然处于起步阶段。接下来,我们可以对比下目前国内外的生态区别,当然这个生态会随着生成式AI的发展不断演变,这些区别其实是由于客户需求和技术发展阶段的差异共同造成的。如果还是从生态位的层级拆分,海外更偏倒三角的结构,底层算力层面由个别厂商垄断(例如英伟达和谷歌TPU),往上的基础模型层也在趋于集中,头部企业如OpenAI、谷歌和Meta形成了比较大的优势,而到行业模型层,其实专攻特定行业并自建模型的企业数量并不多,即使要做垂直行业的应用模型,很多也会参考开源底座,而到了最上层应用层,基于纯API调用制作产品的企业数量十分庞大。国内目前更加像橄榄型结构,同样最底层的优质算力企业数量极少,最上层的基于API调用制作产品的企业数量也比较少,远没有到海外百花齐放的状况,但是,在基础模型和行业模型的企业数量较多,可以看到在行业模型层,有不少企业在垂直行业里面搭建专有模型,来更好的适配落地场景,同时在基础模型层,各大互联网企业、科技大厂、创业公司和高校数量也众多。造成目前生态差异的核心在于国内外客户需求和技术发展阶段的巨大差异。在应用层:国内纯工具类付费意愿低,且技术上国内基础大模型企业相比国外有差距,可用优质API数量少,而且生态发展时间短,大多数公司的产品还在迭代中;而在行业模型层,海外企业级客户Saas习惯好,付费意愿更强。而国内大企业私有模型和部署需求大,国央企数据保护要求高,更加需要可定制、可部署的私有模型,而且在技术上国内基础模型泛化能力目前仍不足,优质开源底座少;在基础模型层,基础大模型企业发展时间短,各家性能差距并未大幅拉开,这点也可以在最近的各大测评结果上看到,同时国内大厂多,数据沉淀和人才资源更加分散。最后在底层算力层,国内外的研发投入和技术壁垒都会极高,最后也都会走向企业集中。在这么复杂和多变的生态里面如何选择合适的身位尤为重要,我们评估下来虽然生成式AI和大模型的机会是巨大的,但是成功的路径还是如其他赛道一样,仍然比较狭窄,在选择“做什么”和“怎么做”两个问题上既要考虑传统创业的问题也要考虑新技术范式的特有属性。首先,我们先来讨论下“做什么”,其实要考虑的维度就已经很多了,传统维度包括客户需求、颠覆程度、壁垒构建,特有属性则包括技术趋势、技术收敛情况、技术成熟度。1⃣️ 客户需求:根据产品付费意愿和客群数量估算市场容量,同时考虑国内外的差异,例如工具类产品在国内的付费意愿和货币化率较低;
2⃣️ 颠覆程度:新产品从无到有的能力,优化现有流程的力度或者成本下降的空间;3⃣️ 壁垒构建:未来抵御后发者的能力,同时防御大厂产品泛化的能力,比如Jasper在ChatGPT应用推出后,用户量受到了影响;4⃣️ 技术收敛情况:这个问题比较关键,底层技术的趋同性和当前任务处理效果影响了企业生态位的选择,要达到“刚刚好”的状态,来平衡企业可获取的优势和商业化速度,这个状态比较难把握,例如文本类和视觉类的底层技术收敛情况是截然不同的,这个点后续也会有单独一页详细展开我们的看法;5⃣️ 技术趋势:即大模型的重点发展方向和创业方向的竞合关系,既要借助大模型的效率提升又要避免被大模型的泛化碾压,例如人工标注行业就可能受到借助大模型的低成本高效率的自动标注不断冲击;6⃣️ 技术成熟度:目前大模型本身能力和优化技术在产品落地的效果和可行性;7⃣️ 衍生产品:主赛道之外的衍生产品也要很多机会,例如向量/矢量数据库等。确定“做什么”之后,即产品和生态位选择后,仍然还要回答“怎么做”的问题,其实里面设计的考虑也很多。首先就包括做产业链的哪些细分环节,比如在海外比较热门的营销场景下,就包括从品牌营销、渠道营销、销售转化和客服服务四大环节和细分的20-30个子任务,而客群结构内也包括了中大客户、SMB和C端,同时大模型的技术选择也分为自建、开源应用或者API调用的不同方式,最后在产品交付形态中,也要选择是做Saas还是部署。
这些问题多且关键,以下篇幅我们就对其中几点做个讨论供大家参考。
首先,大家最关心的可能还是大模型本身的技术趋势,因为本轮的底层技术快速发展既是机遇也是威胁,如何确保搭乘技术变化的同时又避免被技术覆盖十分重要,我们也十分关注技术的发展,这里为大家简单举例了近期的技术发展趋势(截止2023年5月中)。我们会将底层技术趋势先划分为LLM和计算机视觉,因为这两个领域目前底层技术框架存在一定的差异,并且两者的技术发展阶段也并没有同步,拆开分析会更加清晰。这一页主要将LLM的技术趋势划分为了本身能力跃进、落地应用优化和多种能力集成。1⃣️ 本身能力跃进相信大家都在最先进的超大模型中见证了,包括由GPT4和PaLM2带来的更强的语义理解能力,也包括长文本的优化,同时思维链和数理能力的提升也归功于CoT和Self-planning的探索,人类对齐也不断完善了大模型本身生成的质量,当然除了单纯的参数量上升,模型训练的优化(例如激活函数、tokenizer、数据集等)也持续提升模型的表现,因此,以往不少中间任务将持续受到冲击;2⃣️ 落地应用优化的尝试也在不断增加,对于其他公司的机会就更多了,同时充满创新的可能,例如Meta的LLaMa和一系列轻量化的尝试使得大模型更加平民化,而算力优化(剪枝、知识蒸馏、量化等)也为场景落地降低了成本,更好的任务微调方法、Prompt engineering 和本地数据的应用方法则提升了场景落地的效果,更多的垂直行业应用得以快速实现和商业化;3⃣️ 同时,我们也把多种能力集成放在了LLM的章节里,因为无论是任务规划、工具调用、模型调用等自动化尝试的核心都需要借助LLM的逻辑能力,进行比较好的任务规划,但是这块能力还是需要不断提升,还有很大的优化空间(例如AutoGPT执行复杂任务时容易陷入自循环)。总得来说,LLM的发展趋势既有本身能力的不断跃进,需要关注大企业其能力的突破并观察其新能力和对下游原场景的威胁,但是不可避免的是,在场景落地、效果优化和其他功能上仍然需要很多其他参与方进行创新,这些也有很多机会,并且给垂直行业的产品带来了更大的需求。而计算机视觉我们也把其分为三类,包括图像任务(包括识别和生成)、视频任务和多模态,通过观察来看,视觉相比LLM的底层技术发展阶段还是落后的,有许多需要完善的地方。1⃣️ 图像任务:最近图像的突破点比较多,尤其在图像分割层面,诞生了号称GPT时刻的SAM模型,同时不同机构也陆续推出了改良的SAM模型,极大提升了效率,而且图片生成的可控性上,不断优化ControlNet也极大提升了下游生成任务的精准性,但是我们在日常交流中也发现目前很多图片生成其实在下游任务上效率较低,无论是生成的细节还是生成的匹配度都不足以支撑下游场景的良好应用;
2⃣️ 视频任务的技术阶段则落后于图像任务,虽然目前已经有可用的视频生成(Runway/gen-2),视频目标跟踪(TAM)以及视频理解(Vid2seq),但是其效果离较好的商用距离还比较大,亟需有更多的突破;3⃣️ 多模态则是视觉里面最值得期待但是也是目前最落后的底层技术,虽然3D资产的生成近期也发布了ShapE、Point-E以及之前的Nerf,但是其效果仍然不够优秀,同时在具身智能、环境感知、数字人等领域也缺乏足以打动下游客户的成熟产品,不过其中短期还是看到了很多可能性,例如在多模态嵌入近期发布了ImageBind(我个人也比较期待),统一了多种模态信息的嵌入,为未来的AGI创造了很好的前提。由此可以看出,计算机视觉的各类技术仍然还需要较多突破,不同企业对其可优化点很多(因此其实中小公司也有更多的机会),尤其在发展初期的视频和多模态领域,在技术的各个层级都有突破性的机会,不用太担心大厂的碾压,短期留给创新型企业的机会仍然很多。这一页会比较有意思,当然也是我个人的一点看法,相信大家在前文中一直听到一个词叫做技术收敛,我觉得应该用一页展开和大家讨论下,我相信很多人也会有一些创业的困惑,例如“到底要不要做自己的模型”,“是不是干脆使用开源模型就好了” “API调用可行吗”这个图左半部分展示了各种模态目前底层技术的收敛情况,位置越上代表底层技术收敛程度越高,例如文本类目前大家用的技术底座基本趋于decoder only的方式了,而图像生成也基本使用Diffusion的方式,但是在视频、3D和具身模态中,技术底座还是有很多讨论空间的,现有的技术框架仍然效果不好,并没有形成大统一的共识性底层技术路线。这个图的右边是和左边匹配的,代表收敛程度达到什么状态时,创业或者新产品的自有技术深度,我的结论是:1⃣️ 技术未收敛的模态(底层技术不统一或者未形成优秀的开源底座)存在基础大模型或者模型优化的机会,底层技术的创新和差异化机会更多,但是要警惕相关底层技术的发展速度;2⃣️ 技术收敛的模态(底层技术统一或者拥有较好的开源底座)更适合做行业优化(例如行业优化模型或者微调)或者纯应用层,但是要具备一定的场景壁垒,建立生态位。由于篇幅关系,我再讲一个和技术相关的点,大家平时肯定也会和我们一样阅读Paper原文,但是被新模型能力惊叹的同时,其实更要反向挖掘现有模型哪些能力短期是无法完善的,即目前其他人的机会,而且近期是个不错的时间点,因为受制于资源,各家的底层大模型(尤其是LLM)大概率不会再像前两年一样继续指数级的提升参数量了,那么目前还无法很好完成的任务可能只依靠大模型本身的能力泛化在短期内仍然难取得非常大的突破。
比如我们先来观察GPT4的能力,其实其仍然有部分任务效果不好,例如复杂的数理能力、复杂的写作和处理多步骤的任务等。同时大模型还有很多性能优化的空间,例如人类对齐Alignment,输出控制,长文本/序列的输入限制,工具使用上都还有较多的机会,同时即使在更加底层的技术层面,例如Embedding、tokenizer、函数的使用,数据集的优化也有机会去提升大模型本身的能力。此外,大模型基本很难去做的是细分行业的落地优化,也是其他人的机会,这里就包括了:微调/提示:根据细分场景的模型微调/提示优化,同时在微调和提示的使用中也有不少创新点,例如轻量化微调方式,提示中使用Prompt engineering/自动化提示;算力优化:适配下游客群的推理/训练算力,降低使用成本(例如量化、知识蒸馏、模型剪枝等技巧);训练任务设计:结合下游使用习惯,调整训练任务设计,最大化匹配下游目标;本地数据应用:向量/矢量数据库;其他:隐私安全、辅助训练等。例如大家可能都已经熟知的LLaMa,利用更好的模型优化技巧(包括更充分语料、更优化的算子等)实现较小模型(当然绝对参数量也不小)媲美更大参数量模型的效果,在此之后,基于LLaMa的开源底座(右图),许多研究机构和中小企业也利用自己的优化技巧实现了模型更轻量化的设计和训练,大幅降低大模型的获取成本,并且利于在终端的使用。最后,就创业公司壁垒构建这个话题再稍微展开下,除了底层技术外,其实构建壁垒的方式有很多种,当然壁垒越多越好,企业的安全垫也会更厚,我们观察下来,创业公司可以建立以下四个方面的壁垒:
1⃣️ 数据飞轮:数据飞轮是抵御大模型泛化非常有效的护城河,典型的数据壁垒可以总结为第一,数据可得性:非公开数据集和高质量数据集的获取;第二,数据集优化:数据清理的特色、训练数据的配比等;第三,训练任务的设计:例如掩码策略;2⃣️ 模型构建能力:复杂任务中,不同模型的选择和封装能力也能取得产品效果领先,技术非常收敛的模态中,底层模型能力并不会构成强壁垒(有可能会成为枷锁),但是根据验证模型的优化能力可以形成壁垒,并在终端任务上取得更优效果;3⃣️ 更加底层的技术:对于创业公司来说,纯底层技术的壁垒难构建,我们的观点是随着开源模型的逐步成熟,纯基础大模型的优势将会衰减,暂时的技术领先容易被快速的底层技术更新所取代,找寻大模型长时间无法泛化的细分任务存在困难;4⃣️ 应用优化:应用优化始终存在,且基于场景knowhow的优化能力将很难被单一的技术迭代打击,即使基础大模型未来在各个任务上表现良好时,仍然在效果提升、成本降低、产品设计上存在优化空间。多谢大家的耐心,不少问题还是没能完全展开,也希望大家都能赶上这次生成式AI大浪潮。🌲—end—
文案 | 张周
排版 | Dora
审核|Ryan
* 全部图片来源于张周在活动现场的演示 PPT
