Z Potentials

深度|AI Agent独角兽Sierra CEO:我们确实处在泡沫之中,但我认为泡沫有不同的形态

Image

图片来源:20VC

Z Highlights
  • AI市场泡沫与潜在价值:当前AI市场面临泡沫现象,尽管许多公司获得了巨额融资,但未来将出现一些具有真正市值的企业,类似于互联网泡沫后的成功公司。
  • 对话式AI的崛起:随着AI技术的提升,对话式AI Agent将成为品牌与消费者互动的主要方式。企业需要开发AI Agent以增强客户体验,实现更高效的客户服务。
  • 多模态AI的重要性:多模态AI,即能处理文本、图像和音频等多种数据类型的技术,将成为未来的重要趋势,提升用户与技术的交互体验。
  • 初创公司的挑战与机遇:AI初创公司面临技术实现、市场契合、资金筹集和合规性等挑战,但具备创新和敏捷性的公司将在快速发展的AI市场中获得成功。
Harry:Bret,我真的很兴奋见到你,我一直是你粉丝,你的职业生涯真的很令人难以置信。当我浏览你的成就时,真的是不可思议的。你小时候知道自己会成功吗?你有那种与生俱来的感觉吗?

Bret:我不认为是这样。当我小时候,我首先想成为Indiana Jones。虽然我知道那不是一份工作,但对我来说,他是我见过的最酷的成年人例子。当我上学并开始考虑工作时,我在高中认为自己想成为一名律师。但最后我在一个加油站找到了一份工作,然后通过努力,为附近的一个机械师建立了一个网站。在加油站工作时,我每小时挣4.25美元,这是当时的最低工资,而我为制作的网站却赚了400美元。所以我第二天就辞掉了加油站的工作,开始为我家乡的很多本地企业制作网站。大多数这些网站持续了几十年,因为事实证明,如果你是一个花店,网站上SEO优化不是必须的。我在1996年和1997年在互联网上留下的指纹比预期的要长久得多。甚至当我去了斯坦福大学,如果你在那之前见到我,我可能会说,我还是想成为一名律师。但后来我偶然的创业经历,加上我在互联网泡沫期间去了斯坦福,改变了这一切。进入斯坦福的第一个季度,我上了一门叫CS106A的课程,这是一个入门课程。其余的就是历史了。那时我对软件痴迷得无法自拔。我甚至在课余时间也会研究软件。

Harry:你认为人们天生就是企业家吗?还是这可以通过学习来获得?

Bret:我认为大多数事情是可以通过学习的。当然,在我的职业生涯中,我多数时候认为某些东西是天生的能力,但后来我重新调整了自己的看法,觉得只要足够专注,大多数人可以在大多数事情上有所进步。当然,我永远不可能成为奥运短跑冠军,也不可能赢得菲尔兹奖章。所以显然,我不是要轻视真正的天赋能力,但像公共演讲、领导能力,甚至不是菲尔兹奖水平的事情,比如变得擅长金融,我认为大多数人如果专注是可以提高的。

成为企业家最特别的地方是它的强度。我确实认为有一种特定的性格类型更适合成为企业家。如果你很容易焦虑,我觉得做企业家会很难,因为事情总是处于“着火”状态。这就是这份工作的本质。因此,我相信某种程度上不仅仅是后天的培养,还是有一些天生的因素在里面。但我也见过一些人,他们早期可能并不认为自己是企业家,但通过早期职业生涯中的一些经历,他们培养了对自己决心的信心,最终也成了优秀的企业家。而且如果你看看企业软件行业和消费者市场行业的区别,很多优秀的企业软件公司都是由晚年创业的企业家创立的,我认为这也很有趣。如果你看看PeopleSoft,尼尔可能是第二代的创始人。有很多这样的例子,所以我不认为企业家有某种简单的刻板印象。我真正认为这是美国和硅谷的一个标志性特点。而且我觉得我们应该继续敞开大门,欢迎任何想找到自己道路的人。

Harry:Bret,大家普遍认为哪些是天生的技能,但实际上可以通过学习获得呢?对我来说,人们总觉得,“哦,我永远不会是个采访者或内容创造者。”我会告诉他们,“听着,我刚开始也很差。”但我做了10年3000次采访,慢慢学会了一些,至少希望现在变得能让人接受了。就像去健身房一样。你觉得大家普遍认为是天生的技能,但其实可以通过学习的是什么?

Bret:领导力。实际上我遇到过很多这样的人,你可能听过这个说法,“哦,这个人是个天生的领导者。”当然,如果你是一个反社会人格者,你可能不会成为一个伟大的领导者。但如果你有一定的情商,成为不同规模组织的领导者绝对是可以学习的技能。很有趣的是,如果你遇到过在西方世界服役的人,大多数军队将领导力视为一种需要学习的工艺。这部分是因为你会通过军队的等级制度逐步管理越来越多的士兵,他们在很多层面上制度化了领导力的原则。相比之下,我觉得如果你进入大多数大公司,参与晋升讨论,公司可能会说,“这个人不是个天生的领导者。”那个人需要培训或学习这些技能。我认为并不是所有的企业都这样。但我确实觉得,公司应该更多地投资于正式的领导力培训,如何激励与你不同的人。如果你曾经管理过研究人员和销售领导者,那你就会知道激励和对话的方式差别非常大。我认为这是可以学习的技能。像任何技能一样,有些人天生更有倾向性,但我觉得这是可以通过学习获得的。

AI泡沫:相似于互联网泡沫,带来超额回报

Harry:我必须开始引入一些结构性问题了。过去几个月里,我们看到了AI领域一些巨额融资案例,其中一些AI巨头获得了大笔资金。Iliao最近筹集了10亿美元的种子轮融资。这是史上第一个10亿美元的种子轮融资。我在想,如果Elon再创立一家公司,可能会有10亿美元的种子轮融资。我的问题是,我们是否已经处于AI巅峰?这是否是泡沫的最终迹象?

Bret:我认为我们确实处在泡沫之中,但我认为泡沫有不同的形态。马克·吐温有句名言:“History doesn't repeat itself, but it rhymes。”(“历史不会重复,但总是相似。”)我认为AI泡沫会与互联网泡沫相似。而且我相信,凭借事后眼光,互联网泡沫的很多过剩可能是合理的。如果你看看世界上市值最高的公司,它们包括亚马逊。它们包括谷歌。如果你看看各个领域,还有PayPal、eBay。如果你看看企业软件公司,像Salesforce,如果我记得没错,它是在1998年创立的。所有这些公司都是在互联网泡沫期间创立的。

我认为人们在情感和认知上总是将互联网泡沫与Webvan和Pets.com联系在一起。但实际上,如果你看看当时关于互联网泡沫和经济转型的最乐观的陈述,并且快进将近30年后,可能那些说法是真的。当你看看亚马逊对商业的颠覆程度,数字技术对消费支付的转型有多大影响,它可能需要几波技术浪潮,比如智能手机和NFC,来真正实现这些愿景。而过去30年里,股票市场的巨大利润很大程度上来自于那些在互联网泡沫中创建的数字公司。我没有计算过当时烧了多少钱。但我认为,这并不意味着互联网对经济影响的兴奋是不真实的。所以我认为同样的事情会在AI上发生。我们将回过头来看,嘲笑一些过度行为。但我确信会有一个品牌定义型的、可能市值达到万亿美元的消费公司从中诞生,此外还有10多家企业软件公司,它们将持续下去,成为这些新技术的公众公司。所以我认为这既是一个泡沫,也同时存在一些可以更进一步发展的领域,就像1997年和1998年那样。不过我认为将泡沫仅仅看作过剩是危险的。事实上,它们可能会带来超额回报。

Harry:我能问一下,这次是否不同,因为风险定价的方式发生了变化?我的意思是Salesforce的首轮融资并不是在数十亿美元的估值上完成的。亚马逊的也不是。1998年至2002年期间的公司估值并不疯狂。而如今,像x.ai这样的公司筹集了180亿美元资金,这些公司可能会成为万亿美元公司,但稀释后,你得到的回报不到100倍。

Bret:我认为你说的很有道理,作为一名风险投资家,从这个角度考虑是完全合乎逻辑的。我更多地在思考其对经济的影响。我认为我们现在处在一个有更多资本的世界中,投资技术公司的结构也更加健全。你提到的过去20到30年的私募股权激增也反映了这一点,鉴于可用资本的数量,估值明显与过去不同,尽管我觉得当时也显得过高。我不认为人们在1998年能够理性地想到一家万亿美元公司,所以我认为你说的有道理。我也认为,从我的角度来看,我不是在投资,我是在创造。

我的观点是消费者行为将走向何方?大语言模型和 Agent带来的自动化将如何改变生产力、改变公司的结构、改变经济?你如何根据这些趋势定义一个具有时代意义的公司?弄清楚该投资谁、为什么投资是你的事。我很高兴提供我的看法。但在某些公司追求人工通用智能时,评估一家创造AGI的公司的估值是很难的。这些数字可能会非常疯狂。虽然我可能不会写所有这些支票,但我不会说这完全不合理,因为我确实认为这项技术在当前形式下具有巨大的价值。特别是当你展望类似超级智能或通用智能的未来时,像这样的平台拥有巨大的价值。这是一项非常不寻常的投资,但可能并非不合理。

Harry:在我们开始讨论之前,我也很喜欢你刚才提到的,风险投资者考虑的是倍数,而企业家则考虑的是代际定义型公司和其影响。你提到AGI以及它带来的潜在价值。但在这之前还有一个步骤,就是这些模型本身实际上已经如此先进,以至于它们捆绑了所有的软件产品并对其进行解构。你觉得是否存在一种威胁,那就是所有的东西最终都会被非常复杂的模型所替代?

Bret:我个人不相信这种情况会发生。回到类比,类比是危险的,但在这个情况下,我认为它们可能具有说明性。我实际上认为AI市场的商业化将像过去20年的云市场一样发展。如果你看看云市场,有三大类云软件。第一类是基础设施即服务,比如亚马逊网络服务(AWS)、Azure、Google Cloud等服务。然后是工具制造商,比如Snowflake、Databricks、Datadog——这些都是公司在向云迁移时所需的软件。接下来是软件即服务(SaaS),例如Salesforce、ServiceNow、Adobe,以及长尾的各种解决方案。我们之前谈到的那些市值在20亿到200亿美元之间的公开上市公司,有很多非常有趣且有价值的软件即服务解决方案。为什么这一切会这样发展?有人可能会说,尤其我曾听到过类似的言论,“Salesforce不就是云中的数据库吗?”但Salesforce不仅仅是个数据库。它是一个为销售、服务和市场团队提供的解决方案,价值巨大。同样,任何软件即服务应用程序也可能会有类似的轻视评论。

这就是为什么公司CIO、CTO、CEO们明白,他们实际上并不想自己去构建软件,他们只是想要一个有效的解决方案。软件就像草坪一样,需要持续维护,而不是写好后就能永远正常工作。构建和维护软件的总拥有成本非常高,我认为几乎所有决定自己构建软件而不是采用现成解决方案的公司最终都后悔了。我们已经看到从“自行构建”到“软件即服务”的世俗趋势。我认为AI也将遵循同样的趋势。现在的关注点是数据中心和模型,因为未来尚不明朗。现在最明确的投资方式是投资于堆栈中最低层的部分,因为无论上层发生什么,底层的那些部分将从上层AI工作中收取“税金”。但我不认为公司会希望拿着一袋浮点数来自己构建解决方案,因为我认为在AI上会发生与云类似的动态。

因此,在我的公司Sierra,我们提供的是解决方案。我们不会进行预训练,而是对其他人的模型进行微调,以构建解决方案。我们帮助公司构建面向客户的 Agent,主要是用于客户服务。所以对于像Sonos、SiriusXM和Chubbies这样的公司,以及像Harvey这样提供法律 Agent服务的公司,或者那些制作编码 Agent的软件公司,都是在使用我们的平台来构建这些服务。

如果你是某个公司的法务部门负责人或CTO,为什么要自己训练一个模型来构建所有的工作流?或者找IT部门合作,看看如何将这个模型用作代替助理的工具?你真正想要的是一个可以一键解决问题的推送式解决方案。因此,我不认为因为这些模型变得非常聪明,世界上购买软件的方式就会改变。而且,我对AI最感兴趣的领域并不仅仅是AGI,尽管大家都对AGI很感兴趣。这也是我选择与OpenAI合作的原因之一。但我对应用非常感兴趣。我认为这个领域还处于早期阶段。我看到有很多公司在说:“我们要真正构建一个解决问题的产品,而不仅仅是提高生产力。”我们将为那些非技术部门或买家量身打造解决方案,这将非常神奇。这里有巨大的价值。我相信这就是大多数公司想要购买软件的方式。

Harry:有几件事我必须拆解一下。你提到了公司想要购买解决方案,并需要它们在实施过程中具备简便性。我曾在Twitter上说过,我认为在未来3到5年内,AI服务公司将成为AI领域最大的赢家。我们已经看到很多咨询公司获得了数十亿的利润。实际上,有一家公司的收入比OpenAI还多。你是否同意AI服务公司将在这个社区中占据主导地位,并且在实施下一代应用层时将需要它们的参与?

Bret:在技术采用的早期阶段,你通常只有非常底层的平台构建模块可用,并且伴随着大量的专业服务支出。因为除了自己构建外没有其他选择。所以你通常会看到短期内专业服务支出激增,以及一些低层次的构建模块。我猜测你提到的那些收入,至少有部分是因为公司没有现成的软件即服务(SaaS)解决方案可用。他们看到像GPT-4这样的优秀模型,如果他们想将其应用到自己的业务中,在一两年前,他们唯一的选择基本上就是支付给这些公司,自己完成最后一公里的部署。随着解决方案的出现,实施变得更短更简单,我确实认为这类支出会减少。

我们公司所做的工作,正是减少软件配置的最后一公里。然而,我觉得这是一件有些复杂的事,你可能是对的,我也认为专业服务公司确实能提供很大的价值,特别是在变革管理方面。你可以想象,如果你有一个菲律宾的呼叫中心,由外包服务商管理,而你要将大部分案例迁移到AI处理上,这不仅是技术的改变,更是你公司运营方式的重大变革。

同样地,如果你想象这些技术变得更加先进,无论是重新技能培训你的员工,还是实际上重新组织整个部门的运营,因为有了AI Agent,这意味着你可以完全重构部门的运行方式。软件公司一直以来都不太擅长这一点,尽管这并不是它们的核心业务——帮助公司管理技术的采用。大多数软件公司试图成为公司可信赖的顾问,但到最后,他们对所销售的产品有既得利益。因此,往往有第三方介入以帮助公司真正管理这些变革会更好。所以如果我必须更简洁地回答这个问题,带着所有这些细微差别,我认为有些短期的专业服务支出,反映了AI应用市场目前不够成熟。

但我认为,当像Sierra这样的领域解决方案可用时,你不应该在业务中花费那么多来有效地部署它们。然而,随着AI改变和颠覆公司运营的方式,我希望最优秀的专业服务公司能够通过咨询部门帮助公司进行这种变革管理,并在这个过程中找到新的价值。因此,我认为如果你细化计算这些支出,收入可能会随时间改变。

Harry:随着AI的变革,令我印象深刻的一件事是模型之间的商品化速度。难道这不是最快被商品化的技术吗?每周我都看到新模型出现,比如Mistral,然后下周又是Gemini,再接着OpenAI又打破了纪录。然后Claude出现了,列出了五个其他模型无法实现的功能。我简直无从下手。你觉得这些是不是最快商品化的技术?

Bret:我们从宏观角度开始。我非常喜欢Reid Hoffman对这个市场的分类,他将其分为基础模型和前沿模型。基础模型指的是这些大型语言模型中的任何一种,它们可能不是最好的,或者参数数量不是最多的。但特别是在现在,有相对低参数量的模型可以达到或超过GPT 3.5的质量水平,这个基础模型市场非常重要,也非常商品化。我认为在这个市场中,如果你需要这样的模型,你应该下载Llama。就是这样,不需要太多的选择指南。或者也许用Mistral,但总之,选一个合适的开源模型并进行微调。

前沿模型市场则有些不同。我的观点是,我们在前沿领域看到了一些真正的飞跃。ChatGPT问世时,这是一个显著的跃迁,持续了一段时间。关于指令调优的见解以及GPT 3之后的GPT模型质量有了非常显著的不同。类似地,GPT 4推出后,虽然我没有计算它的具体领先时间,但它显然领先了相当长的一段时间。现在,很多模型正逐步追赶它。我觉得我们会看到很多渐进的改进,接着是质量上的飞跃。但回到市场本身,我对公司进行预训练的行为本质上持怀疑态度。除非你是一家AGI研究实验室,否则进行模型预训练我认为只是在烧钱。这就像是一个企业家来到你面前说,“我们要构建这个软件解决方案。”然后他们的第一步是手工搭建一个数据中心。而对于99%的软件公司来说,他们应该从基础设施即服务提供商那里租用服务器,不是因为这是最垂直整合、最有效的方式,而是因为这不是他们公司的核心业务。同样,在你探索和寻找产品市场契合度的过程中,最后一件你想做的事情就是花大笔前期资金来构建数据中心。

而且我认为,有一些公司由非常有才华的研究人员创立,他们产品计划的第一步就是构建、预训练一个模型。我认为,尤其是现在有这么多高质量的模型存在,比如GPT 4.0,或者你可以微调的开源模型像Llama 3.1,现在花钱进行预训练,除非你是巨头,否则我觉得是毫无意义的。

Harry:我能问一下,随着每个新模型的出现,是否还会有类似GPT 3.0到GPT 4.0这样的跃迁?显然,GPT 5.0即将推出,这是一个自然的推测。除非他们打算进行彻底的品牌重塑。

Bret:我是个风险投资人。你还记得90年代初的时候,Windows从NT变成了95,再到98,最后到2000年。你知道,或者类似的情况,也许我们可以看到这样的变化出现。

Harry:但我们不能持续看到这样的跃迁吧?我们现在处于一个开始看到回报递减的阶段吗?

Bret:这些问题对我来说是不同的。先从跃迁开始,也许会有,也许不会。我不认为会有一个必然的结论,认为我们一定会有跃迁。但我确实相信,开发AGI的最负责任方式是逐步迭代地部署。我之所以这么认为,是因为我们在考虑像社会影响、技术获取以及AGI安全性时,最好的学习方式是持续发布模型,从这些安全方面的经验中学习,从危害中学习,了解非常具体的漏洞,比如模型绕过,然后每一步都改进。我们可能会看到进展停滞,或者像你说的那样回报递减。AI进步的三个要素是:第一,数据;第二,算力;第三,算法和方法论。如果你回顾一下当前这波现代AI浪潮的短暂历史,一切始于谷歌的Transformer模型,这是一篇名为《Attention is All You Need》的论文,它改变了构建这些模型的规模,从而推动了许多后来GPT模型的突破。

接着是指令调优,这就是如何将一个模型变成一个聊天界面的突破。所以,即便是现有的数据和算力,整个计算机科学界最聪明的人都在思考不同的技术,有些人甚至在研究超越Transformer模型的东西。因此,这是一个可能会出现重大突破的领域。算力方面,你只需看看报纸上关于GPU投资的报道,这些集群正在变得越来越大。即便是相同数量的数据,训练都能对质量产生巨大的影响。

至于数据方面,虽然有人在写作讨论我们是否已耗尽了一些文本数据,但有许多公司正在进行有趣的工作,比如模拟数据、合成数据生成的探索以及多模态数据的研究。因此,针对每一个领域,你可能都能提出一个合理的知识性论点,认为我们即将触及瓶颈,但你无法为所有三个要素做出相同的推论——认为它们都会遇到瓶颈。就像任何重大科学努力一样,AI的进展将是这三个要素中的混合发展,结果我对这些模型向人工通用智能迈进的进展非常乐观,我对此感到兴奋。

Harry:我得一步步来处理这些问题,关于追求AGI的优先事项,以及构建对消费者有用的应用。公司必须有一个优先事项。我想我们在这一点上达成共识。那么,一个公司如何同时追求AGI并构建一个优秀的消费者或企业产品?

Bret:开发AGI的目的是什么?它应该是造福人类。那么造福人类意味着什么?我认为,OpenAI的使命是确保人工通用智能能造福全人类。这意味着很多事情,我认为对不同的人来说,这意味着不同的事情,这就是为什么OpenAI成为一个争议的焦点。因为在这个领域,使命很重要,而且这个使命可以通过你自身的价值观来反映出许多不同的含义。

但其中一个含义是“获取”。当你思考人们如何获取这种了不起的新技术时,有人可能会说,ChatGPT或许是提供AI普及获取方面的最大突破。我不确定在ChatGPT出现之前,是否有人真正设想过建立这样一个每个人都可以通过访问URL直接使用的对话 Agent。这并不是人们之前会考虑到的事情,也因此,它有一个有点滑稽的名字,因为它最初只是一个研究预览,结果却成了过去十年中最重要的产品之一。我认为,有一点让我觉得很有意思,那就是,这是向世界传递AI和AGI价值的非常重要的机制之一。我认为这与OpenAI的高层使命高度一致。

至于你所说的,在构建消费者产品时与开发AGI之间是否有冲突?当然有不同的要求,这也是所有这些研究实验室或使命驱动公司面临的复杂性所在。但如果说构建一个广泛使用的消费者体验与传递AGI的价值存在某种冲突,我是不认同的,因为你要如何传递这个价值呢?答案可以有很多种方式。但你真的希望确保一旦这些技术存在,能够让世界上所有人广泛获得它,并且是以负责任的方式。所以,我认为很多研究实验室找到了一种与大量人产生共鸣的形式,我对此非常高兴。

Harry:我明白你的意思,但我们这边的情况是,“不,我们不做那些事情,我们要打造一个谷歌杀手,这才是我们的目标。”然后你看看OpenAI,他们有企业产品,有企业部门,还有AGI和安全团队,它变得不太清晰。你明白我的意思吗?

Bret:这些问题确实非常复杂。我认为你可以把它描述为企业团队,也可以说,如果你希望确保这些模型的价值惠及全人类,那么你是否希望所有能够造福人类的产品都仅仅由OpenAI开发?因此,让开发者在其基础上构建是将价值传递给世界的重要部分。同样地,我认为,尽管这些决策确实复杂,但当你考虑如何以最大化的方式传递这些模型的价值时,我觉得这些想法也没有那么远离初衷。实际上,很多其他研究实验室也在做类似的事情,原因和使命与OpenAI的类似。我对其产生的影响感到兴奋。我最终认识到,许多我认识的创业者之所以进入AI领域,部分原因是他们在作为消费者使用这些模型时受到了启发。我认为这些模型现在对世界产生了非常积极的影响。

Harry:鉴于我们看到的人员和团队之间的一些互动流动,你认为知识是否属于公司专有?

Bret:当然,某些知识是专有的,但我也认为,现在很多公司追求的使命比任何一个组织都要大。类似地,许多从事AGI的研究人员要么来自学术界,要么是以前的学术研究人员,而学术界的精神是发表研究成果,尽管这在过去几年中有所变化。所以这是一个非常复杂的问题。但我认为现在,很多突破性的想法就像是空气中的一种共识。就像莱特兄弟发明了飞机,显然还有另一组人也在接近这一突破。他们是抓住机会的人。我觉得现在的情况也是如此,这些想法在不同的研究者之间传播交流。

AI可持续发展模式:成本下降,质量上升

Harry:我们提到了基础模型作为一种技术的商品化。我们还看到了价格战,在很多情况下,这似乎是一场“价格底线竞赛”。你怎么看在极高的训练和推理成本下,AI的可持续商业模式?

Bret:当我早前提到对公司进行预训练持怀疑态度时,基本是基于这样的前提:大多数公司应该将AI应用于构建解决方案。大多数公司应该有相对适中的训练成本,并且大多数成本应该与推理过程相关,推理成本应与产品的使用量和收入挂钩。这是因为如果你最终预训练了一个非常大的模型,你会有巨大的前期资本需求,你必须在另一端有一个非常有价值的商业模式来证明这一投资的合理性。所以首先,我认为公司应该专注于如何找到产品市场的契合点,在承担重大的训练成本之前,这种微调可能是可以的。

在推理成本方面,我其实认为AI的成本正在迅速下降。我见过很多人在追踪GPT模型的成本变化。值得注意的是,成本下降的同时,质量却在上升。所以我认为,在推理方面,许多这些使用案例的利润率可能会改善。有很多有趣的技术趋势,比如模型蒸馏技术——将一个大参数模型转化为一个较小的参数模型,同时保持类似的质量。这意味着你可以在训练一个非常大的模型后,使用更小、更便宜、运行更快的模型进行推理。

此外,硬件方面的改进也不容忽视。我对运行AI的成本可能遵循类似摩尔定律的趋势充满乐观。当然,摩尔定律并不是一条绝对的法则。但我认为这是一个趋势,而这是所有公司都非常期待的事情。

Harry:如果我们考虑到成本随着时间的降低,并且摩尔定律得以证明,同时我们也看到像Matter、亚马逊和谷歌这样的公司在未来三到五年内将投资惊人的资金,这是否与摩尔定律和成本降低相悖?你如何看待这两者之间看似矛盾的情况?

Bret:我认为,大型的超大规模数据中心运营商(hyperscalers)面临着一个挑战,那就是拥有并运行一个最前沿的模型和没有一个这样的模型之间存在巨大的差距。因此,这些公司做出这些投资决定是合理的,因为拥有这些前沿模型对于消费者产品或基础设施即服务(IaaS)供应商来说,价值巨大。对于未来的赌注,以及对AGI突破的赌注,我认为这非常合理。之所以谈到摩尔定律,是因为在基础设施即服务市场中,市场逐渐集中在少数几家公司手中,与AI相似,构建数据中心的规模越大,你就越能负担得起扩展数据中心的资本支出。这是一种现象,我认为这种投资应该由这些超大规模数据中心运营商来承担,因为资本支出的要求非常高。随着训练市场的集中化,收入也可能集中在这些提供商周围,这将有助于AI市场的发展。因此,这是一个复杂的情况。我认为这些公司由于AI的潜在影响而必须进行投资。这些资本支出数字确实让人瞠目结舌,但如果我处于这些公司的位置,我可能也会做出相同的决策。

Harry:我想问你,当你看谷歌和亚马逊时,他们的资金来源是云服务。而Zach和Meta没有云业务来作为资金来源来支持这些投资。这意味着Zack能做出什么不同的决策呢?你觉得没有云业务作为资金来源,他是否有其他的自由度?

Bret:是的,我想这是过去一年里让我改变观点的一个地方,那就是开源基础模型的影响速度比我预想的要快得多。当我们去年3月创立Sierra时,我的假设是,最终会有几个最前沿的模型,它们会由一些超大规模公司与研究实验室合作开发和资助,最终会有一个或两个重要的开源模型出现,这些模型相当于数据库市场中的Postgres和MySQL,最终会被大型科技公司采用,就像谷歌采用了Linux,Facebook采用了MySQL和Memcache,并且向这些项目上游贡献了许多补丁。

但我不得不说,马克·扎克伯格显著加快了这一进程,不仅仅是加速了时间表,还提高了模型的质量。Llama 3.1是一个非常高质量的模型。我认为这来自于你刚才提到的事实:他没有云业务作为资金来源,因此他的激励与那些云提供商不同。而我认为他在他的帖子中写得非常清楚,解释了为什么他相信这是正确的战略,这是一个非常清晰的表达。我认为这对市场整体来说可能是件好事。如果你看看云基础设施市场,你有许多专有解决方案,比如DynamoDB来存储数据,也有很多开源项目来管理基础设施,比如Kubernetes。然后还有像Confluent这样商业化开源项目的公司,他们基于Kafka进行商业化。所以我认为,一个健康的AI市场需要所有这些选项。你将会有最前沿的模型,它们是最优秀的,可以直接进行授权。云提供商可能会同时提供这两种选项。我觉得,如果你在构建这些最前沿的模型,你需要在质量上保持领先。我认为对于生态系统来说,能够有一个超级高质量的开源模型是非常好的。

Harry:这些公司不断开启的资金流是否会有停止的一天?有人曾说,这就像是他们的“曼哈顿计划”,一旦参与进来,你就无法停止,沉没成本已经在那里了。又是一笔20亿的投资,他们能停止这笔资金流吗?

Bret:是的,其中一个大问题是,创造出可能类似AGI的东西需要什么规模的超级计算机、什么方法和什么数据,或者需要什么样的经济突破来证明这些投资的合理性。没有人真正知道。你会听到很多关于这个问题的理论。但我认为,当你看到这些公司进行如此大的资本支出来投资未来时,我觉得这非常好。投资者很有理由想要看到这些投资的回报证明。要求一份电子表格来展示这些投资的回报是完全合乎逻辑的。但同时,拥有这样一种能够对人类产生巨大影响的技术的潜力,创造出这种经济价值,是非常令人感激的。

在每个阶段,你都会越来越清楚地看到它将如何被货币化,什么样的产品将会脱颖而出。在最初的浪潮中,出现了大量的“协作工具”。现在,正如我之前提到的,出现了更多的 Agent。我的直觉是,这里有巨大的潜在价值。我认为现在的局面是,你不希望在投资未来时“因小失大”。这就是为什么我提到我对初创公司进行预训练持怀疑态度的原因——这是一个我认为不合理的风险,因为你没有足够的资本结构来承担这个风险。你可能会让公司朝着悬崖飞奔,而你可能不会在到达悬崖前拥有足够的翅膀起飞。但如果你是一家像你提到的那样的大公司,你在思考如何在未来10年内大幅增加收入时,告诉我比这更好的选择吧。所以我认为对这件事持怀疑态度是可以理解的,但我也认为这是一个非常令人兴奋的未来。

Harry:每个上过节目的嘉宾都说我们将会看到市场的整合。我们采访了Adaptum的创始人、Character AI、Cohere,还有Reid,显然是来自Inflection的。你同意如果你不是核心公司之一,我们现在就处于一个整合市场中吗?

Bret:我认为我们会看到那些进行模型预训练的公司会发生整合。我认为工具和应用公司的成本结构不同,可能更可持续。所以,和任何市场一样,当有赢家时,你会看到整合,但我认为这一过程会更加缓和地展开。

创建Sierra,构建面向客户的AI Agent

Image

图片来源:Sierra官网

Harry:我想继续谈谈你提到的Agent以及Agent的未来。首先,Sierra可以做任何事情。那么,你为什么决定做Sierra呢?

Bret:让我先描述一下Sierra做什么,然后再解释为什么我觉得这非常令人兴奋。Sierra主要帮助消费品牌构建面向客户的AI Agent。比如说,如果你买了一台Sonos音响,或者你在使用过程中遇到问题,你将与Sonos的AI聊天,而这个AI是由我们的平台提供支持的。如果你买了一辆新车,车上有SiriusXM,你会和他们的AI Agent“哈莫尼”聊天。如果你访问像Olakai或Chubbies这样的零售网站,你会与他们的 Agent聊天。我认为Chubbies的 Agent叫做Duncan Smothers,这是一个非常有个性化的 Agent,帮助你处理订单查询、退货和换货等所有事务。所以,我们本质上是帮助公司为客户体验的各个环节打造他们品牌的AI Agent。

我认为这个领域对我们的客户和对我个人来说都非常令人兴奋的原因是,我们正处于对话式软件的时代。我记得在2007年,史蒂夫·乔布斯发布了iPhone,我猜你当时大概11岁吧,基于我们之前的对话。所以你可能不记得它有多令人震撼。这非常有趣的是,在企业界,当时的主流智能手机是黑莓。如果你和当时拥有黑莓的人交谈,他们会说:“我绝对不会在触摸屏上打字,黑莓的键盘是最好的。”人们至今仍谈论它的高效。但你快进10年,100%这些人都换成了iPhone。为什么会这样?我认为原因在于iPhone的多点触控界面,加上大触摸屏带来的所有好处,比如可以拥有全功能的网页浏览器,能够观看多媒体。

我们跨越了一个质量门槛,触摸屏相对于黑莓键盘实际上变得足够有效了,每个人都说:“这更好,我们就接受它。”现在我们拥有的智能手机数量比世界人口还多。如果你测量今天来自智能手机的人人机交互比例,相对于鼠标和键盘,应该是超过95%的。我认为随着GPT-4,我们在对话式AI的有效性上跨越了质量门槛,这意味着你现在可以与计算机进行对话,而且它真的有用。它能够理解细微差别,理解讽刺。你可以进行一个真正细致入微的对话,并且它真的能运作起来。

因此,我认为,如果你快进四五年,当你与任何消费品牌互动时,无论是你的保险公司、手机公司还是汽车租赁公司,你很可能会更多地与AI进行对话,而不是在网站上点击或在应用程序中浏览。就像移动应用没有完全取代网站,只是从网站中夺走了一些用例一样,当你想到去银行的网站和在手机上使用应用时,我不认为对话 Agent会完全取代应用程序和网站,但我确实认为每个公司都需要一个 Agent。我们常说,在1995年,公司在数字领域存在的方式是有一个网站,而在2025年,公司在数字领域存在的方式是拥有一个AI Agent。

所以在Sierra的背景下,在“Agent”这个词的背景下,我们正在帮助公司构建自己的 Agent,那个带有他们品牌标志的 Agent,可以处理客户想做的一切事情。真正完全实现这个愿景时,想象一下你能在公司网站上做的一切,那就是非常广泛的体验。因此,我对此非常感兴趣,因为它不仅仅是关于自动化现有的一些流程,或帮助解决客户服务问题。尽管这是其中一个重要的部分,但我们真的认为这是一个全新的数字体验类别,公司会愿意并且需要在对话式AI的世界中存在,而这并不容易实现,这就是为什么我们要构建解决方案来促进这一点。

Harry:为什么聊天是正确的形式?它是多模态的吗?比如,我能不能拍一张多米诺披萨的照片发给我的 Agent,然后它识别出这是一块超大17英寸的超级肉类披萨?你可以看出来我不是素食主义者。对所有素食主义者说声抱歉,我可能刚刚失去了我们的一大部分观众。我可以通过图片,比如我跑步时拍照,告诉它“我想要这个”。我们如何看待多模态功能,为什么聊天可能不是主要的界面形式?

Bret:我认为聊天、语音和多模态是有意义的形式因素,因为它们摩擦较小。如果你看看WhatsApp在全球的使用情况,这意味着你可以基本上作为一个企业存在于WhatsApp中,并且提供一个完全功能的客户体验。如果你考虑CarPlay,当你在开车时尝试使用应用程序时,你会发现其功能非常有限,对吧?但现在你可以想象,你在上下班的途中可以进行完整的工作体验。再看看五到十年前Alexa的爆炸式增长,每个人都把智能音箱放在厨房柜台上。我们家也有。目前来说,我们主要用它查询天气、播放音乐,对吧?但想象一下,它成为一个完整的计算机,你可以通过它叫一辆Uber,检查日程表,或者在做咖啡的时候回复一封邮件。无论是文本还是语音的这些对话体验,我并不是说它是每一个体验的完美形式,但就像你可能在手机上输入90%以上的邮件,而不是在键盘上输入。你不会说在手机上打字比在键盘上更容易吧?

这是一种便利性的因素。所以我提到的这些形式因素——在车里、在厨房里、在WhatsApp中,不需要安装应用程序——这些都是以降低摩擦为驱动的消费者体验。我认为,触摸屏已经主导了我们与计算机的交互,因为它们方便。你可以在很多地方与AI进行对话,而且你不需要说明书。我认为这将成为我们与计算机交互的主要方式。

Harry:你认为我们会看到手机不再是主要的界面吗?Zach推出了Ray-Ban智能眼镜。如果我可以自己对自己说话,为什么还需要手机呢?虽然看起来有点奇怪,但很正常,因为我确实经常自言自语,显然作为一个有点时间的风险投资人。我可以问自己,“嘿,叫辆Uber吧,我在这里。”我们会看到手机的消失吗?

Bret:这当然是有可能的,但我对此持保留态度。你回顾过去15年间的消费电子创新,很多公司,包括生产智能手机的公司,都试图推出替代或增强手机的设备,但大多数都没有成功。现在的手机非常擅长于许多事情,而且每个人都有一部,它已经完全取代了几乎所有其他类型的消费设备。短期来看,我的直觉是,手机与Ray-Ban智能眼镜或AirPods结合起来,你可能会减少查看屏幕的次数,但我的直觉是,由于智能手机的普及,它仍将成为主要的计算设备,用来支持这些对话式体验。但正如你提到的,随着对话式体验变得更加成熟,我总是选择大屏幕的手机,因为我喜欢大屏幕。

不过,很多事情都会改变。你可能还记得早期App Store上的应用程序都是拟物化的应用,比如手电筒,后来我们有了像WhatsApp、DoorDash、Uber、Instacart这样的移动原生体验。这些东西只花了一代时间就真正存在了。我觉得可能还需要一点时间才能看到“ Agent原生”的消费者体验和“ Agent原生”的设备。特别是对于消费电子产品来说,难点在于你需要这些消费者体验来引领市场。所以,这可能需要一段时间,但现在看起来它确实是有可能的。

Harry:WhatsApp是否最有条件成为一个应用程序商店,供每个大品牌在全球范围内创建自己的频道?然后你已经拥有了现有的分发渠道,拥有数十亿用户,集成到他们已经使用的功能和应用中。

Bret:我认为WhatsApp确实非常有优势,特别是如果你看看WhatsApp在像巴西和印度这样的地方的使用情况,它几乎已经接近这个地步了。但我认为,大型语言模型和 Agent技术,像我们在Sierra所开发的那些,打开了通往更完整体验的大门。我也认为,绝大多数移动平台也是如此。我认为,当你在手机上安装一个应用程序时,未来它可能既是一个应用程序,也是一个 Agent。比如说,当我们与客户合作时,我们希望让他们的AI Agent能够在任何成为主流消费者体验的形式中得到应用,你应该能够将你的 Agent安装到这些体验中。

创办Sierra面临的技术与人际关系挑战

Harry:在Sierra中,最难的事情是什么,你之前没有预料到会这么困难?

Bret: 我会描述一个技术问题,然后是一个围绕它的比我预想中更棘手的人际关系问题。生成式AI非常有创造力,但本质上是非确定性的。创建确定性是非常困难的,即相同的输入产生相同的输出,特别是因为如果你考虑人类语言的广度,它本质上就比大多数东西都不那么精确。同样,如果你赋予AI推理的能力,从定义上讲,你无法列举出所有可能的结果。因此,当你在为具有实际商业规则的企业构建工业级 Agent时,我们喜欢说,软件正在从“规则的时代”转变为“目标和护栏的时代”。这其中的挑战是,如何让企业能够表达他们的目标和护栏。

Harry:规则与目标和护栏之间有什么区别?护栏不就是规则吗?

Bret:当我想到规则时,想象一下你是一家零售网站。你可能在左上角有一个菜单,点击后可以过滤掉你所销售的所有项目:男装、女装、鞋子、袜子、裤子等等。你可能经历过这种情况,你已经基本上列举了人们与网站互动的规则。这就是类别。这是你可以点击的内容。如果你想,你可以让某人逐一点击网站上的所有页面,并验证它们是否看起来正确。现在想象一下你在网站上放置一个AI Agent。这是一个自由文本框,人们可以输入他们想要的任何内容。如果你明确列举出 Agent可以说的所有内容,它会感觉像个机器人。这实际上就是几年前聊天机器人给人的感觉。实际上,许多聊天机器人几乎都有类似的选择题选项,因为他们无法弄清楚如何表达这个范围,而且他们也没有自然语言理解能力来创建一个有意义的体验。因此,在 Agent的情况下,你希望赋予AI一定的自主权和创造力,让它理解并真正理解客户的问题。

但如果你假设你是一家流媒体服务提供商,你想用你的AI Agent来处理取消订阅的问题。当有人想取消他们的账户时,你应该做的事情之一就是问他们原因。你可能想提供一个折扣。如果那个人仍然想取消,你可能希望他们的订阅得到取消。目标可能是处理取消,而你可能希望给予AI Agent一些创造性的方式来呈现这些折扣,真正进行探索,像优秀的销售人员那样了解他们希望从流媒体服务中获得的价值等等。最终你希望取消。在这个过程中,有很多领域你想要赋予AI自主权和创造力,就像一位优秀的销售人员与客户进行谈话一样,方式应是同情而不强求,试图了解是否有保留他们作为客户的机会。这就是复杂性,充满了细微差别。你希望同情而不强迫,这就是需要大量自主权的地方。

Harry:如果AI说:“我想取消。”你怎么回应呢?“你是个混蛋。”

Bret: 是的,或者更糟糕的是,曾经有一家航空公司有一个聊天机器人,它产生了一个“丧失亲属”的政策。有个人在家中有亲人去世,聊天机器人却说,“机票归我们所有。”我不会在你的播客上提到这个品牌。但这是个相当糟糕的情况。因此,你不希望AI拥有过多的自主权,以至于在极端情况下,它产生了错误的信息。在你提到的案例中,你也不希望AI不当代表你的品牌。因此,当你创建一个由AI介导的客户体验时,比如对话 Agent,你需要能够清楚地声明AI应该做的目标和护栏,这些护栏可能涉及语言和品牌,可能涉及语调、推销力度等。然后相似地,比如说,这里有哪些可用的优惠等等。这就是我们在Sierra所解决的技术问题,我认为在这种新颖的方式上是相当创新的。

Harry:这是否意味着你只会看到在相对低风险的情况下采用这种 Agent实现?比如说,“嘿,我想要多米诺的退款。”听着,如果你搞砸了,可能也没什么关系。但如果涉及到财务系统,或者是你的销售系统,我真的不想搞砸一个亿的商业流程。

Bret: 我认为,随着AI的进步,你会看到这些 Agent被越来越多地应用于关键任务系统。因此,合理的采用曲线自然从相对低风险的交互开始,逐步推进。但我们的客户已经在使用它来创造收入,销售,或者管理订阅服务的流失等情况。我认为,随着公司对他们的 Agent的信心逐渐提高,他们会向风险更高的领域拓展。但这实际上与我们开始讨论时提到的挑战是不同的。

你知道,如果你考虑设计一个网站或设计一个市场活动,你可以对它有相当的控制。你可以列举客户可能看到的所有不同的排列组合。但在AI Agent的情况下,除了消费者能够对 Agent说任何他们想说的话,赋予它更多的自主权意味着它会更有同理心,会更令人愉悦,但这会减少你的控制。因此,我们与客户之间进行的非常有趣的讨论是,如果你希望你的 Agent拥有个性和同理心,你可能需要调高自主权,但伴随而来的风险也会增加。你可以将自主权调低到零,这其实是我们平台在高风险情况下支持的做法。在某些情况下,你可能不想要太多的创造性或非确定性,但在那种情况下,你的 Agent可能会听起来更机械,可能会退回到几年前的聊天机器人。因此,我们并不是在某个特定的客户工作流或品牌上提出明确的建议,而是进行非常有趣的讨论。

我认为,正如在网络迅速发展时,用户体验设计师这个新的职业类别出现了,尤其是那些不仅仅限于传统盒装软件设计用户界面的工作者一样。 Agent工程师的角色,负责在我们的平台上构建这些 Agent的角色,是非常重要的。同时,我们认为还有一个 AgentAI架构师的角色,他们是客户体验的领导者,负责对话设计以及塑造这些 Agent的行为。我们正在为这些不同的新角色构建产品和工具,我们认为这些角色同样重要,就像用户界面设计师或网络开发者一样。这让我觉得很兴奋,但也给我们的客户带来了这种自然的张力。我所说的张力并不是在个人层面上的,而是指在智力上的张力,这就是我们想赋予AI多少自主权。

Harry:另一方面,你赋予一名培训了一周的员工多少自主权?他坐在你位于底特律的客服部,可能在兴奋过度的情况下会对客户进行滥用。你知道,我总是觉得我们在谈论AI的幻觉时总是忘记这一点。我们总是说,AI会产生幻觉,但人类也会产生很多幻觉。

Bret: 这是现代大型语言模型的一个有趣特性。我认为,行业对所谓的生成式AI的定义挑战了我们对计算机的许多认知。计算机设计的目的是要可靠。你点击这个按钮,它每次都会有相同的反应。它们被设计为数据库,而不是为了创造性工作。它们的目的是快速给出事实,遵循我们设定的规则。你想想软件工程的工艺。如今,已经有完整的方法论来获得更加可靠的软件,这些方法涉及使用源代码管理工具,比如GitHub,以及使用不可变的二进制文件,以便在出现问题时可以回滚并恢复到昨天的相同行为。我们花了几十年时间来让事物变得可确定、可重复和可靠,但现在你在开发一款新的软件,它却是缓慢的、相对昂贵的、极具创造性的、而且相当非确定性的,这让人们感到惊讶。因此,我认为,人们正在通过“如何让AI像两年前那样变得确定”这种传统计算机思维来思考AI。

我们是否可以考虑,如果我们的销售人员或呼叫中心 Agent偶尔会脱离预设剧本,我们应该如何处理这种情况?你公司里可能会有操作机制来处理这些情况。那么,为什么不把处理AI的机制也运用在同样的方式上?是的,AI不会是100%可靠的,但你希望它有时能够超出预期,为公司提供价值。当我与许多客户讨论他们的AI Agent时,他们并不希望100%的确定性。他们对价值的看法是,AI Agent会在许多情况下提供极大的价值。

Harry:那是否意味着会有AI培训师来进行培训?我相信有些公司在使用这些 Agent进行直接的客户互动时,会在背后有培训师来观察它们的表现。这就像在好莱坞拍电影时,摄影师总是会在监视器前观察,查看每个镜头是否到位,或者在拍摄过程中进行实时干预。

Bret:我认为是的,随着这些AI Agent在实际中应用,这种“干预”确实会是一个重要的环节。你可以想象当这些 Agent正在与客户互动时,人工干预会是非常重要的。Agent不一定需要全天候工作,但它们可以在与客户交互时记录数据,以便在后续进行复盘。我认为,使用我们平台的很多公司正在尝试将数据采集和分析嵌入到AI Agent的工作流程中。例如,你可能有一个销售代表通过 Agent与客户交谈,这些数据可以用于提高 Agent的质量。许多客户会说,“我希望我能在后端监控 Agent的表现,评估客户的满意度,确保 Agent能够提供我们希望它提供的价值。”在这个过程中,关键的一点是能够建立一个反馈循环,让AI不断学习并改进。无论是通过直接观察与客户的互动,还是通过分析其提供的反馈和结果,所有这些都可以转化为对AI Agent的改进。这种方法将有助于提升 Agent的表现和客户的满意度。

Harry:我想问一下,作为一名风险投资人,如果我想成为最好的董事会成员,你见过许多不同类型的董事会和企业家,你有什么建议给我吗?

Bret:我认为最好的艺术形式是如何在不调入任何公司运营的情况下充分参与,并知道如何以CEO和管理团队实际听到的方式提供建议。所以找到与你合作的公司创造节奏的平衡,以获取你需要的信息。这样你就知道在哪里增加价值。那些对每个参与都一视同仁的董事会成员可能做的不对,因为不同的执行团队会以不同的方式听取建议,业务也非常不同。所以我认为真正独特的对待它,找到并操作节奏,你可以获得你需要的信息,就可以真正提供好的建议。

Harry:Bret,今天的讨论非常精彩,感谢你分享你的见解和经验。你对AI行业的观察和未来趋势的分析对我和听众都非常有启发性。

Bret: 谢谢你,Hary!我也很高兴能和你讨论这些话题。我相信AI的未来将充满无限可能,期待未来能够看到这个行业的持续发展和创新。

原视频:Bret Taylor: Why Pre-Training is for Morons & Companies Will Build Their Own Software | E1209

https://www.youtube.com/watch?v=vRhPc0zt2IE&t=1s

编译:Ying Yang

-----------END-----------

🚀 我们正在招募新一期的实习生
Image
🚀 我们正在寻找有创造力的00后创业者
Image

Image

Image

关于Z Potentials
Image