Z Potentials

深度|Perplexity CEO:我们的目标是打造一个新的生态:一种“agent浏览器”的全新产品

Image

图片来源:Semafor

Z Highlights

  • 如果我们能同时在智能和上下文这两条轴线上都做到自然、流畅、无缝,并且让UI保持熟悉感,那么agent和个性化就真正被“攻克”了。

  • 真正让硬件显得特别的,是软件。手机上最大的限制,并不是无法像一些监听设备那样获取手机外部的上下文,而是在于如何实现一种有agent能力的AI,能够调用第三方应用并替你执行任务。

  • 自动驾驶不仅仅适用于物理交通,也适用于数字劳作——有点像Elon说的那样,Optimus这个人形机器人是Tesla的下一个篇章,因为他们会把所有为“从A点到B点移动”所构建的技术,延伸到完成各种形式的实体劳动。现在发生的事情也是类似的——你把原本用于执行多步骤搜索、多步骤操作的技术,扩展到完成各种形式的数字劳作。它并不是为了单纯取代人,而是为了增强人类,相当于为他们提供一个“自动驾驶”模式,让他们腾出更多时间。

Aravind Srinivas是Perplexity Al的联合创始人兼CEO,曾在OpenAI、DeepMind等机构从事人工智能研究。Reed Albergotti是Semafor科技版主编。本次视频发布于2025年8月,Aravind Srinivas与Reed Albergotti进行了一场涵盖广泛话题的对谈,内容涉及公司推出的新Comet浏览器、AI竞赛的现状等。

Comet 浏览器的第一印象

Reed Albergotti:大家好,我叫Reed Albergotti,是Semaphore的科技编辑。作为一名记者,我报道科技领域已经超过10年。我的大部分时间似乎都花在打电话上,或者越来越多地是在视频通话中,尤其是自从疫情以来。很多采访都是为了纸媒文章准备的,但会有很多内容被“剪掉”而没有发表。所以我想,也许我可以尝试一种新方式,就是把本来就要做的采访录成视频,然后直接发布到YouTube。今天,你会看到我和Perplexity联合创始人兼CEO Aravind Srinivas的对话。Perplexity是一个AI搜索引擎,他们现在有一个宏大的构想,就是将他们推出的浏览器Comet Browser打造成一种类似AI操作系统的存在。我已经试用了这款工具,它非常强大,也能让你感受到,当AI真正开始在我们的生活中发挥作用时,未来的发展方向会是什么样。这次对话里有很多精彩的内容,希望你们喜欢。在过去两周我度假期间,我也在试用Comet。我的感觉是——它的功能真的很惊人。我之前发过一条帖子,说我甚至可以直接在United上订票或改签,然后让sidecar自动帮我完成。类似这样的事情非常方便。会让人感叹——哇,这真的可以看到你们的愿景,就是把它做成一个操作系统,对吧?

Aravind Srinivas:如果我们能处理那些异步的、可重复的流程任务——这些任务不需要实时运行、但会实时更新用户的状态——那么它就会开始让人有“操作系统”的感觉。因为从根本上来说,操作系统的一个特性就是有状态和后台进程,这些进程会有任务的运行进度状态,并且能自动保存状态、不互相冲突,有清晰的内存管理,同时让用户对所有正在进行的操作一目了然。依赖关系、内存管理,这些都是我们需要在agentic层面上构建的功能——不过对象是自然语言任务,而不是硬编码的系统。这样一来,浏览器本身就会像是你电脑中的一台“迷你电脑”。当你的浏览器可以通过本地MCP与电脑上的其他应用连接时,它几乎就像是“主应用”,而其他应用是它的外设。当然,这并不是我们的目标——我们并不要求用户只能用Comet。比如你用iMessage发几条信息是完全没问题的,不一定要通过Comet。但如果你愿意让Comet访问iMessage数据,那它也可以在任务中考虑到这些信息。

举个例子,我可能在iMessage上和你聊天,但我们之间的日程协调可能是在电子邮件里进行的,而且你可能还在短信里给我发过一些笔记。电子邮件并不能访问这些短信内容。假设我在开会前说“帮我准备一下和Reed的会议”,Comet可能会通过连接Calendar和Email来获取相关信息,但如果没有iMessage的权限,就无法调取短信内容。而我们不能把责任推给用户——不能说“用户错了,因为他没用Gmail”。用户可以随意选择WhatsApp、Signal、iMessage等工具,AI必须自己搞定一切,自动编排所需的全部上下文。这就是很多人称之为“context engineering”的东西。

所以你可以把它理解为两条轴线:一条是智能水平,另一条是上下文与个性化。智能水平可以从GPT-3.5、GPT-4、GPT-4.5、GPT-5一路提升,就像“高中水平”“博士水平”“能自己发明东西”的阶段。而上下文轴线则是从帮你写邮件的简单任务,发展到真正能替你执行复杂的、长时间跨度的重复任务,比如在你不想参加的会议上代替你、或帮你完成一些不想自己做的事。

在我看来,浏览器就是上下文的“GPT-5或6”,因为它能访问我们生活和工作中几乎所有的内容。你当然可以用一些硬编码的记忆功能来调取过往对话,但浏览器才是终极的上下文载体。如果我们能同时在智能和上下文这两条轴线上都做到自然、流畅、无缝,并且让UI保持熟悉感,那么agent和个性化就真正被“攻克”了。

Reed Albergotti:所以你是说,它能控制整个电脑,但现在很多东西本身就是基于Web的,或者至少都有Web版本,比如iMessage,我记得它也有网页版。我在不同浏览器之间切换,有时会遇到一些问题。比如我想对照我的信用卡账单和日历信息,并建立联系,但目前它还做不到。我猜这就是你刚才说的那些限制。那么问题是——这些限制主要是模型本身造成的,还是你们围绕模型所构建的一切造成的?

Aravind Srinivas:确实存在模型本身的限制,比如现在我们没法完成某些任务。我们当然会受到当前模型能力的约束——就像我们第一次见面时,Perplexity还在运行GPT-3.5,当时它已经被很多人认为是很有趣的产品了。但如果我回头看,会说相比今天的版本,那个版本幻觉非常严重。

Comet现在的agentic能力,就相当于Perplexity在2022年底(GPT-4出来之前)的答案引擎能力。再往后,等有一个比O3更强、具备更好长上下文能力、更可靠的指令执行能力、能进行多步操作和工具调用、同时价格更低并且有更多开源替代方案的模型出现时——那一天一定会到来——Comet就会变得更可扩展、更便宜、更可靠。所以我们不想等到那个时候才开始构建Comet。这种思路不太对。因为在AI领域,你必须在定位产品、技术和当前的技术栈时,默认假设模型迟早会变得很强,而且会很便宜。

Reed Albergotti:这其实就是你作为颠覆者的优势,你一直在和谷歌竞争,显然OpenAI也在做竞争产品。但你的意思是,你们愿意推出一个还没完全成熟的产品。这就是创业公司能做到的事,大公司就不一定会这么干。这有点像创新者的窘境。

Aravind Srinivas:哦,但也不能说是“还没准备好”。它已经足够有用,可以让人真正用起来。自从我们发布以来,用户发起agent查询的比例,以及把Comet设为默认浏览器的比例,其实一直在稳步增长。这说明它已经能从Chrome、Edge以及其他浏览器手里抢下市场份额。但我们的目标不是在老的市场上竞争,而是想打造一个新的生态:一种“agent浏览器”的全新产品类别。因为传统市场是不会消失的,我们不是在玩他们的那套生态。而当你是第一个入场的,那肯定是站在刀尖上。但明显很多用户愿意在它还不完美的情况下就尝试它。我们的等候名单已经接近一百万了,从浏览器发布以来翻了一倍。很多人愿意在产品有瑕疵的情况下也去用它,这说明它的价值被认可、被期待。我也相信,这个趋势只会越来越强,尤其是当更多玩家进入这个新市场,比如OpenAI给浏览器加上了agent功能。Chrome也一定会做点什么。而随着更多大玩家入局,普通人对“运行一次agent查询”这个概念的认知会提升,人们会慢慢开始通过浏览器自动化自己工作和生活的一部分。到时候,浏览器对每个人的意义都会变了——它不再只是用来作为互联网前端的工具,而是会开始像一个操作系统一样存在。

虽然我用的是iOS、Android、Windows或macOS,但这个浏览器本身会成为帮我统筹安排大部分生活和工作的主要流程的核心,其他后台进程反而不重要。这就是我们内部设定的目标,也是我们做Comet的原因。

AI 时代中的旧习惯

Reed Albergotti:它确实有用。这有点像互联网刚兴起的时期。那时候大家还会在地址栏输入“www.xxx.com”,有人告诉你,“不对,你直接在搜索栏打就行了”。AI现在的阶段就有点像那时候。甚至我自己在用电脑做一些事时,也会想——这事用AI做更合理啊,但就是习惯性用老方法。

Aravind Srinivas:我也是。主要两个原因:一是习惯了,二是已经练得很熟了。比如,我很擅长找邮件,因为我的记忆力好——不用搜“我和Reed上次聊某个话题的邮件”,我就能凭记忆大致定位时间和关键词,直接找到。但这项技能在未来会像“手算两三位数乘法”一样没用。小时候我也会这些,现在谁在乎呢?计算器、AI都能做。同样的,像背体育明星的统计数据,以前在朋友中很酷,现在没人关心,你直接谷歌或用Perplexity查就行了。冷知识、年份、历史人物这些也已经不再是聚会上的技能。

所以我们这代人在AI时代就像上一代人一样。要跟上时代,就要学会新技能、新方式。比如我现在看YouTube视频时,还会习惯性地去显示字幕,然后Cmd+F搜关键词,但谷歌的字幕识别错误率还挺高,常常找不到。然后只能用进度条慢慢找。但我完全可以直接问Comet:“带我跳到Reed讲Perplexity的那一段”,它就直接给我打开对应的时间戳,我一看就完事。还有比如我收到一个Google表格,上面列了我们要挖的人选名单。我还会一个个去LinkedIn搜名字、看简介。但我可以直接让Comet:“帮我看看这些人在LinkedIn的资料,并告诉我他们基于过往经历为什么适合Perplexity。”这样速度快得多。

Reed Albergotti:真奇怪LinkedIn自己都没做这个功能。

Aravind Srinivas:对啊,这也是我用Comet后的一个重要感受——我们没必要等各个网站自己去做AI功能。我们也不用为每个网站做单独的前端、单独的连接器,也不用让用户依赖它们的“专属AI”。我们只要做一个“通用agent”,像一个sidecar一样一直在你身边。无论你在Notion、LinkedIn、Linear、GitHub、Slack、Salesforce,还是在Databricks、Snowflake写SQL查询,你都能让Comet看一眼帮你优化,根本不用复制粘贴去Slack求助再回来改。这种感觉真的很特别,就像大家想象中的“一个AI助手帮你处理所有事”的愿景。而实现它,不只是模型变强,还要把它放在一个对人类来说无缝的使用环境里——AI和人类共享同一个前端,而不是分开。

Reed Albergotti:听起来还可以做一个专门面向“老一代用户”的功能——AI在后台观察你日常操作,然后给你推荐更高效的工作流,比如“你每天都这样做,其实可以省下很多时间”。

Aravind Srinivas:对,这就是理想状态——AI在看你笨拙又低效地做事时,会忍不住提醒你:“嘿,要不要试试这个?”但它不能让人觉得是在推销自己、想让你付费——否则就变成垃圾信息了。难的不是写出“主动提醒”的prompt,而是写出既主动又让人觉得“哇,这太酷了”的prompt。要是做不到,就别主动,因为一旦用户觉得烦,以后所有的提醒都会被忽略。

Reed Albergotti:对,还有一个信任问题——不仅是信任AI能做好事,还要信任它处理你的个人信息。我发现Comet好像不会去要我的密码,对吧?

Aravind Srinivas:对,这正是浏览器架构的魔力所在。它根本不需要知道你的密码——只要你把旧浏览器的cookies导入进来,就能直接保持登录状态。而且当你登录第三方网站时,你是在用人类的方式登录,不是给AI登录的。这样一来,AI也就无法代替你登录、接管账号,这在安全性上比通过服务器中转要好很多。

Reed Albergotti:嗯,这很有意思。我刚才其实在想——可能只是个小事,但比如说我用1Password,经常要登录。

Aravind Srinivas:是啊,这方面是可以做到的。

Reed Albergotti:对,可以做到。不过好像有些地方还不够完善,是吧?

Aravind Srinivas:对,这个他们会修好。iCloud密码这块还在等,因为我们还没拿到苹果的批准去支持它。

Reed Albergotti:既然说到苹果,我很好奇,因为这是基于Chromium构建的,而在iOS上,你只能用WebKit作为浏览器引擎。所以你是打算换一种方式让它在移动端可用,还是不打算做移动端?

Aravind Srinivas:在iOS上,你是没法用非WebKit引擎来渲染的。所有iOS浏览器都必须用类似Safari的WebKit引擎。所以一种可行的方法是用跨平台的方案,比如Kotlin Compose Multiplatform,你大部分代码都用它写(这有点像JavaScript,我们这里简化说法),然后它会编译成SwiftUI代码,再上架到AppStore。

缺点是你可能不能用最优的方式去做所有事,优点是你不需要为iOS和Android分别写两套代码。Android是支持Chromium的,所以这样可以复用我们在MacOS和Windows上已经写好的很多代码。另外iOS上还有一些限制,比如后台进程不能在客户端一直运行。如果App退到后台,它只能执行很短一段时间的任务,比如2–3分钟。如果是那种需要客户端和服务器频繁通信的“agent”任务,就只能在短时间内完成。比如必须30秒内做完,否则用户可能已经去看YouTube或Netflix了。所以架构上的挑战是:要么搞一个云端虚拟浏览器,让它帮你在后台跑这些任务;要么如果你非常在意隐私,那就必须让用户留在App里等它跑完,但这体验挺烦的。

我们也希望苹果能在政策上更灵活,比如对运行agent的App放宽后台运行时间限制。苹果当然会担心安全风险,比如黑客借这个后台进程入侵iPhone、控制其他App或窃取数据。我们希望能和他们一起找到解决办法,在此之前会尽量先做我们能做的部分。

Perplexity 会进入硬件领域吗?

Reed Albergotti:这些iOS(以及在较小程度上Android)的限制,是不是也是你和其他人谈到要做硬件的原因之一?

Aravind Srinivas:我对硬件的兴趣,不是因为苹果的政策限制。如果你真要做硬件,就必须做手机。你绕不开手机。当然,你也可以做一些苹果绝对不会让你在手机上做的事,比如24/7后台监听所有对话,像个“间谍录音机”。但这就是Johnny和Sam想做的那种设备——比如你在说话,不想打开MacBook去敲ChatGPT提示词,它就能直接帮你。其实用iOS的语音快捷方式已经能做到提问了。唯一能超越手机的,是AI不用你提问就能一直听,然后主动给出建议。但这前提是你得开着录音。如果iOS不让你这么干,你就得做个别的设备,比如挂件、项链、扬声器、麦克风或耳机。不过即便做硬件,你还是没法控制其他App,除非做个浏览器,或者这些第三方App给你API接口。

所以硬件并不能真正解决这些问题。它只能多获取一些用户日常的上下文信息,但这远不如通过浏览器获取上下文有用。浏览器还更安全、用户体验更好;而一直录音获取上下文这种方式,隐私风险太高了。想象一下你在和朋友说很私密的事,它也在录……那感觉挺吓人的。浏览器里你可以用隐身模式,零痕迹搜索,删掉查询;而实时录音是直接把你的环境音发到服务器上转写,这权限太大了。

Reed Albergotti:确实。不过我也好奇,人们今天愿意做的事情,和10年前比变化挺大。

Aravind Srinivas:我并不是反对有比手机更好用的AI设备。比如去看医生时,如果我们都有个设备能把对话转成文字,自动生成笔记、整理成病历,我也能带去看其他医生,这就很方便,不用第三方的数据库。只是为什么这些不能直接是iPhone上的App呢?一些特定行业的场景,比如记者采访,也有App能录音、自动转写、分角色,然后整理成写稿笔记。这些功能用设备也能做,但iPhone已经让大多数录音设备没必要存在了。有人还在用是因为怀旧,不是因为它更实用。

Reed Albergotti:你之前说过想做硬件,那是改主意了,还是说打算造手机?

Aravind Srinivas:不,我现在没有做任何手机,也没有在做硬件项目。真正让硬件显得特别的,是软件。手机上最大的限制,并不是无法像一些监听设备那样获取手机外部的上下文,而是在于如何实现一种有agent能力的AI,能够调用第三方应用并替你执行任务。

因为说实话,大家总爱批评苹果,但其实在很多方面Android比苹果还更封闭。至少苹果会提供SDK,让你访问他们自家的原生应用,比如AppleMail、Podcast、AppleMusic、Notes、Calendar。Android这边几乎什么都没有,你必须通过GoogleCloud才能访问Gmail和日历,即使它们是原生应用。最大的限制,其实是像Uber、DoorDash、Amazon这些应用,你根本没法直接调用。它们之间有“防火墙”,所以你只能通过浏览器访问,把这些第三方应用当作是移动浏览器上的标签页来打开。问题是,现在几乎没人关心移动网页的维护了,大家都只为App开发,所以开发者也不会花时间去维护网页版。这就让AI agent很难使用它们。当然,也有好处——agent并不在乎UI有多烂,只要信息齐全就能用。关键是工作流必须可用,比如点击按钮真的要触发动作。如果前端和JS代码有bug,而且没人维护,那就麻烦了。

所以更大的挑战,其实是把移动浏览器做到跨平台、异步、安全、隐私有保障,并支持语音控制。如果能把这套软件打磨好,硬件反而会是个巨大的干扰因素。一旦移动浏览器体验被彻底解决,它就会成为你手机上的“万能App”。到那时,才值得去想象做一款以浏览器为核心计算平台的手机——那会是个很有意思的场景。

Reed Albergotti:是啊,这样你几乎可以想象一种手机,它能间接控制其他应用——就像你刚才说的那样,可能是通过“跳出手机”,比如在云端的某个虚拟计算环境或容器里运行,然后再通过网页界面来操作。就像在手机外部执行一样,对吧?

Aravind Srinivas:对,因为你也可以想象另一种未来——一些第三方应用会把自己抽象成后端API或MSP服务。所以我们在这方面很灵活、很务实,并不想绑死在一种唯一的愿景上,这也是我不太喜欢MCP的地方——你要么全盘接受它,要么完全不用,它几乎不兼容其他方案。而我们Comet的策略是尽量兼容,比如MCP我们也会支持,因为现在很多模型都在后训练阶段被调成兼容MCP,如果agent在这种协议下运行得更好,那我们就会确保协议能够让第三方应用顺利连接到模型、获取上下文。至于是通过agent调用电脑,还是直接走后端API,都无所谓。

所以我们的愿景就是这样——我对未来的具体走向没什么特别的预判,也不想浪费时间搞什么“所有人必须接受我们的愿景”这一套。如果有人愿意来构建,或者有人不想被中间环节取代,那都可以。如果用户允许我们代表他们做一些事,我们就会去做,而且我们并不是作为一个聚合器在服务器端做这件事。换句话说,用户是真的在授权我们替他们执行操作。对于你作为第三方服务器来说,这应该感觉就像是用户自己做的一样。如果你仍然对此有问题,更多是你的商业模式的问题,而不是“服务用户”方面的问题。因为无论如何,在客服或其他方面,用户最后还是会回到你这里,不会回到我们这儿。

Reed Albergotti:既然说到商业模式,你提到有一百万人在等候名单上。是不是因为这些功能真的很耗Token、很贵?

Aravind Srinivas:不,这里面有很多原因,其中一个确实是这个,但主要原因其实是我们在基础架构层面需要做大量重写,以便原生支持Agent。这涉及大量客户端与服务器的通信。比如你启动一个任务去帮你在UberEats下单,或者在Instacart订购杂货,这个过程是:先控制网站去找食谱,再抓取所有原料,然后确定每个需要下单的商品,再一个个控制Instacart把它们加到购物车里,同时把当前进度回传给服务器上的Agent。这里有大量交互和日志记录,会产生非常多的连接请求。要让这些都能顺利运行,你需要一个非常稳定的基础设施。万一后端某个API中途挂了,你可不想看到“连接数超限”之类的傻乎乎的报错信息,这会造成非常糟糕的体验。所以我们要做很多兜底,比如从当前状态恢复执行轨迹,或者实现类似有状态MCP的机制。这些都是我们自己需要先解决的后端基础设施问题,和成本无关。

这里还有很多未知数,只能边走边解决,比如用户上报的bug,我们要去修复,还要给Agent建立一套严格的评测体系。不是针对“回答”功能的评测——回答部分我们已经做完了。这里是针对Agent的评测。因为这是唯一能追踪真实进展的方法,而且很难实现自动化验证任务完成情况。这不像写代码题,有唯一的正确答案。完成一个网页浏览任务的方法可能有很多种。我们要构建自动化的、不断扩展的评测集合,同时保证基础设施不出问题。

还要适配新模型,预测每个用户的成本——比如他们平均会发多少次Agent查询。然后决定如何扩大开放范围,比如核心的基本浏览功能(我们觉得这部分已经比Chrome好),以及各种AI原生功能——Agent、个性化搜索等。要预测普通用户和高频用户的使用模式,然后设计合适的付费门槛,比如达到一定次数的个性化搜索或Agent查询后就需要订阅,或者你可以继续把它当普通浏览器用,每天也会给免费用户一些额度。我们需要把这些数字搞清楚。很多团队在这里都犯过错,比如Cursor和ClaudeCode——他们一开始对使用量过于乐观,结果用户用得比想象中多得多,只好削减额度,结果让用户非常不满。我们想避免这种事故,所以宁愿慢一点、稳一点。我们每天都会发出几万封新邀请,每天也有更多人加入等候名单。同时,我们在不断降低成本,比如看是否能用更便宜的模型完成同样的任务(至少一部分),还在持续提升可靠性、让基础设施更可扩展。这些都需要时间。

拥有 AI 研究背景的优势

Reed Albergotti:拥有真正的AI研究者背景有多大帮助?我采访过你在伯克利的一个教授,他说你本可以成为AI教授,水平就是那个级别。给观众一个背景感知吧。作为一个从基础层面理解AI的人,这对你判断模型进步速度、什么时候推出什么产品,有多大帮助?

Aravind Srinivas:帮助很大,不只是我,我的联合创始人Dennis也有很强的背景,他在后端基础设施上比我更厉害。他做过搜索,曾在微软Bing工作,对那块很熟。他还和我的另一位联合创始人Johnny一起,打造了Quora的推荐算法。他们不仅懂可扩展的后端系统,也懂AI和神经网络的训练与推理基础设施,能在成本和质量之间做出合适的取舍,做出可长期支撑的架构决策,而不是短期的临时补丁。我和他们合作学到了很多。

与此同时,我的经验更多是在系统性思考任何问题,把问题本质提炼出来——这是我在博士期间锻炼出来的能力。准确来说,这不只是AI研究技能,而是解决问题和推理的能力。因为我现在并不紧跟每一个模型的最新细节,虽然我会追论文、会批判性地看,但我并不清楚像O3或Sonnet4这种系统训练时用的每一个技巧,比如它们是怎么做延伸推理的,怎么在长上下文中保持推理能力,以及如何确保随着上下文窗口变长,指令遵循能力不会下降。我现在已经不知道他们在预训练或后训练里做了哪些细节了。以前到GPT-4之前,我还能跟得上,也能追踪这些东西。但之后的进展实在太快,而且大部分都是闭源的,所以很难了解。尽管中国这边的出版物、论文和演讲会谈到很多基准测试和指标,但他们其实并不会讲自己用了哪些数据集,也不会说后训练做了什么处理。所以很难真正理解。

不过,我倒是非常清楚另一件事——比如一个查询没跑通,或者用户报告了一个bug,我们公司里包括我在内的技术顶尖人员,都可以立刻判断问题是出在哪:是搜索索引有问题?还是查询改写得不够好?或者是agent路由器在拆分步骤时没拆对?还是最后总结阶段出了错,虽然前面步骤都正常?

我们有一套很完善的流程去定位并解决问题,而我非常喜欢这个过程。它让我能继续关注细节。因为基本上,这就像是我在公司里做一个带有工程思维的客户支持代表,这会让你很快感知产品的当前局限,以及它会在什么地方出问题。而另一个很有帮助的点是——我自己就是用户。我会真的、持续、规律地用我们的产品,不仅是为了测试,而是像普通用户一样用。如果对我来说它都不好用,那我也会沮丧。比如我太太也是我们产品的重度用户,她给我起了个绰号叫“容易沮丧的专业用户”。她经常会说:“如果有人经常遇到bug,那他们为什么还要付钱用你的产品呢?”前几个月有bug还可以接受,但两年后还这样就不行了,你必须去修好这些东西。她的反馈很合理。

我理解修bug很难,每个工程师手上都有二十多个事情要做,而且没人愿意每天醒来都去修一堆bug,这会消磨掉构建新产品的乐趣。但实际上,只有每天修掉上千个bug,你才能领先竞争对手。很多人会问:“Perplexity能做到这个,为什么Google不行?”原因是这里有成千上万个bug,而且都是新的。Google搜索以前没遇到过这些问题,因为这是一整套新的技术栈,是为未来而构建的,不是把某个东西塞进旧系统就能马上跑的。这就是为什么需要时间。这也是为什么Google吸取了教训。之前在AIoverview里出现了各种滑稽的幻觉,他们已经认识到,如果自己不再是行业之王,那就必须放低姿态,把事情按正确的方式来做。

Reed Albergotti:顺便说一下,你觉得Google现在怎么样?他们处境挺难的——AI研究做得很强,是这个领域的领导者,但商业模式上总有一天要考虑自我蚕食。你觉得Sundar的表现如何?

Aravind Srinivas:他做得很好。老实说,如果我在他的位置,我也不知道该怎么做。这并不容易。他做对的事之一是发展云业务,我也得把功劳分给谷歌云CEO ThomasKurian,他把Google Cloud管理得非常高效,这种效率是顶级CEO级别的。也要称赞Sundar聘请了他,并给予他足够的权力去执行。现在Google Cloud的年收入大约500亿美元,YouTube约400亿美元,加上YouTube和Google One等订阅业务,大概也有接近100亿美元。所以Google Cloud+YouTube+订阅业务,已经是一个很庞大的业务组合。

当然,这些业务的利润率没有搜索广告那么高,这还是个风险。他们必须承认,有时需要经历几年阵痛,才能更强地回归。如果他们能走出来,就会像微软现在的状态——我不是贬义的意思,只是说微软如今是一个多元化的公司。微软不只是Windows,还有Azure、SQLServer、服务、游戏、LinkedIn、Github、Bing等等很多业务。Google也会变成这样——拥有多元的业务组合。不过,搜索的利润率会持续下降,这是毫无疑问的。因为AI agent型搜索最终必须站在用户一边才会赢,而不是去讨好广告商。当你能真正为用户提供价值时,用户会付费,但他们付的钱永远不会像广告商那么多——毕竟每个人的口袋都是有限的,而广告商有大把预算可花。所以,他们如何弥补利润的缺口?办法就是去打造更多利润率不错的业务,让市场认可他们营收的多元化,而不是只盯着高利润率。这样市盈率也会被支撑。他们的战略很清晰——每次看财报电话会议的记录,重点都是:我们业务很多元,搜索只是其中一部分。

Reed Albergotti:挺有意思的,很多人可能没意识到,你不仅有AI研究背景,其实你也很热衷商业,热衷于运营公司和组织。我挺好奇这兴趣是怎么来的。

Aravind Srinivas:我记得IlyaSutskever发过一条推文说:“为什么管理人这么难?这不就是用自然语言做分布式编程吗?”那条推文现在还在,他没删。说到底,商业并不是“去吃吃喝喝、说几句有魅力的台词、做SteveJobs那样的营销”那么简单,而是要亲自埋头去做。归根结底,它是一个问题求解过程,你会有各种约束。

作为初创公司,我们的约束特别多,比如没有品牌。我很清楚,一切都和分发有关。有了分发,你就会有另一类约束——比如你不能像Perplexity这样无限快地迭代,你不能每天让20个bug上线,因为在十亿用户的规模下,这种bug会真的损害你的品牌。所以你需要建立一套适合这种规模的系统和流程。当然,这种规模也有它的优势。比如即使你发布一个别人7个月前就做过的小功能,也会被认真对待,因为你有十亿用户的基础。

所以我明白,这到头来就是个约束优化的问题。这个技能并不是研究独有的,它适用于生活中的任何事。就算是家庭问题、预算有限,大家都会想出自己的创造性解决方案。

Reed Albergotti:但你对这事确实有热情。这是你从小就有的,还是后来学会的?

Aravind Srinivas:不是天生的,是我后来培养出来的,Google对我影响很大。我当时深入研究过这家公司。

Reed Albergotti:你还看过《InthePlex》之类的书,对吧,我们之前聊过。

Aravind Srinivas:不仅仅是那些事。我知道大家都在写那方面的东西,但他们还有一些产品品味是我很喜欢的。举个例子,我记得Kevin Crom在某个播客里提到过,他在创办Instagram之前是谷歌的产品经理,曾经参与Gmail项目。为了让你输入用户名和密码后邮件能非常快地加载出来(这是其他邮件客户端做不到的),他们会在你输入邮箱的时候,就利用cookie知道你的用户名,并且在你输入密码的过程中,提前、预判性地开始拉取邮件。这样用户就不会感到延迟。

这种极致优化的思路,只有那种真正想让用户开心、甚至在用户提出需求之前就提供体验的人才会有。我们现在做一些小功能时,也会套用这种理念。比如说,当你开启语音模式时,甚至在你鼠标移到系统按钮附近,我们就能提前向服务器发起连接请求。这类挑战是我特别喜欢和工程师们一起解决的。

Perplexity 的营销思路

Reed Albergotti:你们之前也做过一些品牌广告,效果怎么样?

Aravind Srinivas:李政宰(《鱿鱼游戏》的主演)那支广告效果特别好。几乎没有人说它不好,可能谷歌的人不喜欢吧,但其他人都觉得很棒。Instagram上的播放量有好几千万次,而且大家以为我们花了很多钱拍,其实制作花费很低。

Reed Albergotti:是找创意公司做的吧?你参与多吗?

Aravind Srinivas:我参与挺多的。我、公司另一位高管DmitrySheleno,还有品牌团队的几位同事一起做。我当时的要求是广告要有一种“闯关”的感觉,毕竟是《鱿鱼游戏》的男主出演,他要回答问题、通过关卡。Dmitry还提出场景要有点像《人生切割术》和《鱿鱼游戏》的结合。我们一起挑了一些问题。比如那个“披萨奶酪”的问题,我记得可能是我或者Dmitry想出来的。我们想让广告更有趣一点,还顺带引用了之前AI给出过的一个搞笑错误答案(说奶酪粘不住要用胶水)。所以我们在广告里给了正确答案,同时加一句“不要用胶水”,算是个彩蛋。

我们挑的问题都是那种现在用ChatGPT或Google都能查到、而且答案靠谱的事,不会选特别复杂的,比如“乌克兰GDP和乌干达比是多少”——因为如果你在酒吧或者Instagram刷到广告,没人关心这个。要抓住普通人。我得感谢MrBeast,我们开过会,我跟他聊过这个概念。他说如果目标是让上亿人看到,就得保持极度简单。比如比较Perplexity和Google——所有人都知道Google,而且广告里答案有明显区别,最好是一些日常问题,比如“衣服上有污渍怎么办”或者“披萨奶酪没粘好怎么办”。

我以前做广告时犯过错——拍得很精致、很含蓄、想讲深层主题,但没人看懂。现在既然“流量之王”亲口告诉我方法,那当然要听他的。

Reed Albergotti:这也挺有意思,因为你很会玩Twitter。

Aravind Srinivas:其实我不是特别喜欢那种直怼别人、搞表情包的方式,这不是我的性格。但算法就是会奖励这种做法。

我记得Mark Andreessen跟我说过,在Twitter上永远不要发100%正确的东西,因为没人会在意。最理想的互动量,来自那些50%正确、50%错误的内容。但要找到那种“刚好一半对、一半错”的说法其实很难,所以哪怕是60/40或70/30,也能有不错的互动量。比如说,如果你发“英伟达是全球最有价值的公司,他们做得太棒了”——虽然是真的,但没人会互动。

Reed Albergotti:记者很难去发“故意一半错”的东西。

Aravind Srinivas:是啊。记者更多是靠爆料,比如Mark Gurman,他的互动量就来自于爆料。

Reed Albergotti:没错,爆新闻是记者的核心工作。他好像还爆料过你们被收购的消息。

Aravind Srinivas:对啊,还有人说是Ben Evans之类的人在我们活动时故意放消息,制造并购传闻。但我们很明确没有那样做。我们对外的官方声明是“不知道有任何并购活动”,而且当时只是Meta的报道和Apple的报道碰巧时间接近。我们已经很明确地说过不想被收购了。我还在CNBC的采访里直接说过,我希望小型科技公司能赢下去,我们要继续走下去。没有比这更明确的表态了。

在我们推出Comet之前,很多人还不清楚我们到底要做什么,公司是不是在和ChatGPT或Google正面竞争。但Comet发布后,人们很快就明白了我们的方向、为什么它意义重大,以及为什么一旦用户登录Comet,他们在Perplexity上的查询量会成倍增长。这是一种“倍增效应”。而且,Comet的规模化分发,比起Perplexity,要容易得多,因为你可以在商业化方向做很多事情。

这也是我对公司新篇章感到兴奋的原因。有点像Google在推出Chrome之前先做的Google工具栏,这个产品当时帮了他们很大忙。工具栏的分发方式很聪明:每当你安装某个桌面软件,Google会付钱给这些软件公司,请他们顺带帮你在浏览器上装上Google工具栏。毕竟微软的IE不会主动帮Google做这个。这样一来,IE就被“打了补丁”,装上了工具栏,Google从工具栏带来的查询量增长了七到八倍。然后他们会把这部分新增流量的广告收入分成给那些合作的桌面软件公司。靠这种方式,Google扩大了分发规模,而当时负责这个项目的正是Sundar,后来他也主导了Chrome。

很多人其实不理解分发有多重要。分发不只是花钱让别人把你放到搜索栏上——那是老一套玩法,根本无法和Google竞争,因为他们的单次搜索广告收益远高于你,还掌握着整个广告网络和流量生态。所以你必须走出自己的道路。对我们来说,智能agent、商业化能力以及浏览器,可能就是这条路。

Reed Albergotti:那Meta有找过你们吗?

Aravind Srinivas:我不能评论他们是否接触过我们,但可以说,我们现在对任何并购都不感兴趣。我们对任何买家来说都是个高风险的赌注。就算Meta想做浏览器,他们竞争的对象也不是我们,而是Google。Google的资源庞大到惊人——或许他们现在不会太把我们当回事,但如果OpenAI也再次进入浏览器市场,他们就会紧张起来。那如果Meta也来做浏览器,这个战场会更加激烈。风险在于“大哥”太强大了,大到不论是巨头还是创业公司,很多人根本不敢尝试。但我们至少愿意去试。最终只有两种可能:要么赢,要么死。如果赢了,那就是在极其强大的对手面前取得的胜利,这会格外有意义。

Reed Albergotti:Ilia以前说过,同时在AI和产品两个层面发力的领域只有两个:自动驾驶和搜索。你觉得这句话现在还成立吗?毕竟你们现在已经进入了浏览器领域,某种意义上这就像一个操作系统了。

Aravind Srinivas:这个说法基本还是对的,但现在可能出现了第三个类别——它是搜索和自动驾驶的结合体:浏览器上的智能agent。浏览器就像一辆车,agent就像自动驾驶或FSD。我们现在还处在“自动驾驶辅助”阶段,还没到完全自动驾驶的程度。即便FSD有一天完全可行了,人们可能还是会偶尔想自己开车,为了怀旧,或者只是单纯觉得好玩。

拥有自己的视角挺好的。就像人们真正完全接受没有方向盘的汽车会需要一段时间——这里我不是说外面的车轮,而是说方向盘——因为人们会想要那种“这是辆真正的车”的感觉。否则,它就像是某个把你运送过去的盒子一样。而浏览器的情况也会类似——当很多AI agent变得完全可靠时,你可能根本不需要自己去浏览网站。你可以让它帮你付信用卡账单、读取银行对账单、订机票、选座位、点餐,所有事情它都能替你完成。但你可能依然会想自己登录某些站点,浏览一下其他记者写的文章。你当然可以把这个任务交给AI来做,但人类的多巴胺来源在哪里呢?就是那种在网上偶然发现一些有趣小东西时带来的快乐。

Reed Albergotti:所以我们其实是在扩展“自动驾驶”的定义。

Aravind Srinivas:是的,自动驾驶不仅仅适用于物理交通,也适用于数字劳作——有点像Elon说的那样,Optimus这个人形机器人是Tesla的下一个篇章,因为他们会把所有为“从A点到B点移动”所构建的技术,延伸到完成各种形式的实体劳动。现在发生的事情也是类似的——你把原本用于执行多步骤搜索、多步骤操作的技术,扩展到完成各种形式的数字劳作。它并不是为了单纯取代人,而是为了增强人类,相当于为他们提供一个“自动驾驶”模式,让他们腾出更多时间。说实话,如果你在一家节奏很快的公司工作,现在AI大厂的运转速度几乎和创业公司一样快,但没有人会抱怨去争取一个三到四天的工作周——因为在AI的帮助下完成了更多工作,然后能花更多时间陪家人、陪孩子,或者和朋友联系。是的,有些人想做AI朋友来获取更多用户使用时间并展示更多广告,但我们不想做那种事。

Reed Albergotti:我们还没聊到这一点,不过我们刚才稍微提到了一点商业模式——你怎么看待广告?有没有可能用广告来免费提供这些产品?还是说这种模式会被其他形式的商业或变现方式取代?

Aravind Srinivas:现在下结论还太早。我唯一能说的是,不要低估订阅市场。这是我迄今为止的一个错误判断。也要给OpenAI点个赞,他们向世界证明了可以打造一个100亿美元的营收规模,而且主要(虽然不是全部)是靠订阅——我记得他们大概有1000万到1500万付费订阅用户。

可能每年有三十到五十亿美元,单纯是来自人们自己掏腰包付费。以前没人觉得这事可能发生——大家会想:“有多少人会愿意上个月花二十美元?”我甚至觉得我们低估了每月200美元的潜力——会有上百万人愿意付这个价。比如,1000万人订阅Bloomberg Terminal,一年能带来大约100-120亿美元收入。Bloomberg存在的唯一原因就是这个,因为他们90%甚至92%的收入都是靠Bloomberg Terminal。我们真的低估了200美元/月的市场潜力,而且它还会发展成2000美元/月的级别。当AI的使用量扩大到每周或每天都有数亿人使用时——有几千万人每月付3美元,有几百万人付200美元,有几十万人付2000美元——你就能在不靠广告的情况下每年赚几十亿美元。

这是不是一家值得做的公司?这比最近几年几乎任何一家企业软件公司都更有价值,比Airbnb、DoorDash、Uber、Stripe这些都要大。那它能不能在没有广告的情况下做到年营收1000亿美元?还不好说,需要再扩一个数量级才行。

也有可能我们还能按“消耗量”收费——不仅是订阅,有些工作是AI替你完成的,这个价值可以按雇人完成相同任务的成本来定价。想想Task Rabbit——大家也花不少钱找人干活。如果AI周末也能干、随时能干,就不需要雇人、开会、做尽调,这样能节省很多时间。这些事会让AI的价值显得越来越高。你会逐渐接受给AI花更多钱,不是单纯觉得“我为什么要给聊天机器人掏钱”,而是觉得“我是在付钱给一个帮我办事的agent”。而且还会出现另一种变现方式——企业为这些AI agent带来的商业交易付钱。Expettia、OpenTable、Shopify都会用这种赚钱方式,商家会付钱。AI agent也能直接对接商家、本地商户、餐厅,就像DoorDash那样。当这种事发生后,就会有一条新的收入渠道,不依赖用户付费。agent公司赚到的钱,还能分给用户。

Reed Albergotti:你们的电商业务起步了吗?你们和PayPal还有一些其他支付公司有合作吧,现在有人真的通过Perplexity买东西吗?

Aravind Srinivas:我们还没完成集成工作,PayPal正在进行中。这也是为什么我说浏览器Comet是关键——Perplexity单独要驱动电商很难,但在Comet里,不管你是AI还是人类在用浏览器,都会买东西。上了浏览器,就会搜索、会购买,不只是为了搜索才用它。我在公司内部也说过——浏览器的市场规模甚至比我们的核心产品还大,因为它能覆盖那些根本不在乎AI的人群。

Reed Albergotti:对,比如如果我需要改机票,Perplexity的agent问我要不要升舱、买个更好的座位,你们可以从航空公司抽成。

Aravind Srinivas:对啊,比如从United拿到佣金,然后我再把一部分返给你作为积分,用在下次订机票时抵扣,这些都是驱动更多交易的好方式。

Reed Albergotti:我能想象未来会有微支付之类的模式。你们现在有200美元/月的套餐吗?你觉得人们会同时订OpenAI和Perplexity吗?

Aravind Srinivas:有可能,但我很难知道我的Max用户是不是也订了OpenAI Pro。肯定有人同时在付Claude Max、Perplexity Max、OpenAI Pro、Gemini Ultra的钱——只是为了都试试,因为这个领域很新很有趣。但最终,你不会在所有工具上都花钱——你会挑几个,比如Claude把自己定位成编程工具,Perplexity想做的是日常工作流的AI agent。ChatGPT则更像是“AI订阅”的默认选择,就像Google是大家默认的搜索工具。OpenAI现在的价值主张是捆绑更多功能——存储、照片之类的——每家公司都在差异化定位。但长期来看,这不会只是一个功能包,而是会收敛成几个核心领域,让你在这些领域做到别人无法匹敌的水平。

“我们现在为什么要卖公司?”

Reed Albergotti:所以,如果OpenAI也有浏览器,你们会不会也得做全套功能?比如帮我写代码之类的?

Aravind Srinivas:我们很清楚自己不可能什么都做。什么都做得“还行”很容易,但什么都做得“极好”很难。我们要在“搜索”“用网页执行操作”等领域做到最好,这里就有数百亿美元的市场。光靠这个就能做成一家几百亿美元市值的公司,甚至有可能冲击万亿市值。我们在这里打造的是一门庞大的生意,所以我们非常专注于此。这也是我说的——如果你手里握着一个数千亿美元的机会,你为什么要把它卖掉呢?而且如果你真的达到了数千亿美元的规模,你完全可以去追求万亿美元的机会。上一次诞生一家市值万亿美元的公司好像已经很久了,里面最年轻的一家还是 Facebook。因为Broadcom也成为了市值一万亿美元的公司,Tesla也是一万亿美元公司。但严格来说,它们都成立得更早一些。自从2010年或之后成立的新公司成为万亿公司已经过去很久了。我猜OpenAI会第一个达到。他们成立于2015年,所以其实比大家想象的还要早。

Reed Albergotti:他们确实成立很久了。他们是非营利组织,这又是另外一个故事。其实我在想,这会不会在某种程度上给你们带来……

Aravind Srinivas:不会。他们会转型,我想Microsoft和他们会找到一个对双方都有效的结构。他们继续下去很重要——现在AI这个词几乎和他们划上等号,而且是名副其实的。我们自己以及很多其他公司都在用他们的技术。

Reed Albergotti:你怎么看Grok?因为你看看这些不同的模型,他们最近在很多基准测试上都超过了其他模型。我知道这些基准要持保留态度,但它的进步速度很快,从无到有。

Aravind Srinivas:他们构建新模型的速度确实令人印象深刻,而且完全是在自己的集群上完成的,没有用Azure或者Oracle之类的。从开始到追上顶尖实验室的水平,以及做到这一点的速度,简直疯狂。

这是ElonMusk领导力的真实体现——那种强烈的紧迫感,以及高效的执行力。他花的钱并没有人们想象的那么多,虽然也不少。但更重要的是,这不是一次性发布,而是持续迭代。比如Grok2还可以,Grok3就很好,然后Grok4又更强。这样持续的增量更新让它们越来越好,所以这家公司非常有竞争力。

Reed Albergotti:那你觉得,在这些FrontierLabs里,谁最后会胜出?你看Google、xAI,现在Meta也想追上来,你怎么看?

Aravind Srinivas:很难说。在“势头”上,OpenAI、Anthropic、xAI和Google是主要玩家。

Reed Albergotti:所以你把xAI也算进去了,这挺惊人的。

Aravind Srinivas:是啊,不过这不是排名——在势头和开发者关注度上,Claude和GPT是主要模型,Gemini也做得很好。xAI的Grok App有用户,但API的使用量还没那么大。不过在能力和多模态方面,它确实在追赶,也许在某些方面还没到其他家的水平,但在核心推理和数学上做得很不错。所以这四家是主要的。

也不能忘了Qwen,阿里巴巴的模型。我相信DeepSeek很快会出新模型,这只是时间问题。所以这些也不能低估。中国的模型其实很强,而且是开源的,你可以直接用。所以这六家是主要的,包括DeepSeek和Qwen,因为它们不止做过一个模型,而且迭代很快,追赶的速度很惊人。

Reed Albergotti:对啊,这会很有意思。我想你们应该有很好的观察视角吧。

Aravind Srinivas:是的,我们对哪些模型在被用户使用有很清楚的洞察,那些没人用的模型我们就不会支持,因为这不值得花时间。这有点像现在的市场——我们能看到的,比基准测试能揭示的更多,那就是:到底有没有人在用你的模型。如果模型不好用,用户就会换到别的更好用的上去。

我们也在用开源技术构建自己的模型,但不会在这些基准上和别人竞争,唯一的目的就是让我们的用户愿意用它,而不是GPT或Claude,而且我们现在看到的采用率不错。

Reed Albergotti:这很有意思,因为你们没有额外成本,用户用起来也很方便。但我也在想,大家是不是已经习惯用现有的工具了。

Aravind Srinivas:确实,有一个很强的“留存效应”,OpenAI就是最大的受益者。ChatGPT作为一个App用起来很顺手,所以要让用户从它转到另一个App,非常难——你必须真的非常优秀才行,而且要在一些不是新奇性的用例里表现出色。比如Grok做的二次元或waifu角色,确实能吸引一些人下载App,但这不是大多数用户的高频需求,除非有人特别需要这种功能。市场领导者设定的标准就是,你必须不断差异化自己。这也是为什么我们觉得这是一场“军备竞赛”,而比聊天机器人更重要的能力,是能真正替用户做事,并且在前端提供一个不同于聊天机器人的、更高层次的抽象——比如浏览器。

Reed Albergotti:太好了。我知道我们聊得有点久了,但还有什么我没问到的,或者你们接下来有什么新闻吗?

Aravind Srinivas:差不多了。接下来如果有新消息我们会再联系,很高兴和你聊天,我一直很享受跟你讨论战略。你确实是个很有好奇心的人,这是我们最喜欢的用户类型,谢谢。

Reed Albergotti:我想这对记者来说也是个好特质。总之很开心聊天,改天再聊,希望你喜欢这次对话。

原文:Perplexity CEO Aravind Srinivas On Comet, Search, &The Future Of AI|Semafor Tech

https://www.youtube.com/watch?v=sM9xd8kkes0&ab_channel=Semafor

编译:Ziye Zhu

请注意,本文编译自文末载明的原始链接,不代表Z Potentials立场。如果您对本文有任何想法或见解,欢迎在评论区留言互动探讨。

Z Potentials将继续提供更多关于人工智能、机器人、全球化等领域的优质内容。我们诚邀您加入我们的社群,与我们共同分享、学习、成长。

-----------END-----------
Image
🚀我们正在招募新一期的实习生
Image
🚀 我们正在寻找有创造力的00后创业
Image
Image
关于Z Potentials
Image