深度|英伟达竞对Groq创始人:DeepSeek象征”斯普特尼克时刻2.0“;开源始终能够带来胜利
图片来源:20VC with Harry Stebbings
Z Highlights
他们虽然在训练上花费了大量资金,但通过利用其他高质量模型的数据进行优化,最终实现了高质量的输出。
Linux有转换成本,但我们发现LLMs几乎没有转换成本。
这就像Jevons悖论,降低成本反而会增加消费。
生成式AI则不同,它专注于在当下创造有语境、创造性且独特的内容。
开场白
Harry Stebbings:所以大家都看到了今天关于DeepSeek的新闻,它真的如大家说的那么重要吗?
Jonathan Ross:是的,绝对重要,它就像是Sputnik 2.0(ZP注:斯普特尼克时刻,代表敌对国家在某一科技上领先)。虽说他们在训练上投入了约600万美元,但在模型蒸馏方面的花费甚至更高。我无法替Sam Altman或OpenAI发言,但如果我是他们,我会准备开源我的模型来应对。因为很明显你会在这场竞争中落败,与其如此,不如尝试通过开源获得广大用户及社区的支持。开源始终能够带来胜利。
DeepSeek真的的重要吗
Harry Stebbings:Jonathan,我为此感到非常兴奋,我从很多不同的人那里听到了很多好消息,所以非常感谢你今天和我一起做这个紧急节目。
Jonathan Ross:不客气,不过在开始之前,我可以说件事吗?我觉得你的播客市场策略非常独特而且令人惊叹。我从未见过这样的策略,像是你通过采访每一个观众成员来吸引他们观看你的节目,让他们对你的内容欲罢不能。
Harry Stebbings:我原以为你要谈论我的口音,不过这个评价我非常欣然接受。是的,有时候,最大的收获是你亲自体验后才能感受到的。不过,我确实想开始谈谈DeepSeek。显然,大家都在谈论,这背后有什么背景?为什么你特别适合讨论DeepSeek?我们就从这里开始吧。
Jonathan Ross:我的背景是这样的,我在2016年参与了Google TPU的项目,这是Google使用的AI芯片。此外,我还创立了一家名为Groq的AI芯片初创公司,我们称其产品为LPUs。
Harry Stebbings:太棒了,希望每个人在介绍自己时都能像你一样清晰。现在,大家都看到了今天关于DeepSeek的消息,我想再次确认,这真的如大家所说的那么重要吗?
Jonathan Ross:是的,这绝对是个重大事件,可以说是新的Sputnik 2.0。甚至更有意思的是,它让我想起了那个关于NASA花费一百万美元设计一支可以在太空书写的笔,而俄罗斯人只带了一支铅笔的故事。这又是一次类似的重大事件。
创新点与蒸馏OpenAI
Harry Stebbings:为什么它如此重要,让我们来解读一下。
Jonathan Ross:直到最近,中国的模型一直落后于以Mistral为代表的西方模型。关注的核心在于计算能力的获取。但大多数人其实没意识到,很多公司可以从相同的数据提供商那里获取大致相同的数据,然后用GPU处理生成模型,再进行部署。他们可能会用一些自己的数据来取得细微优势,但基本上大家的起点是相似的。GPU数量越多,模型就越好,因为这样可以训练更多的token,这是规模法则的体现。据说,这个新模型是在更少的GPU和更有限的预算下进行训练。我听说他们的花费甚至比一些Meta高管的年薪还低,但这不完全正确,其中包含了一些市场宣传的成分。
Harry Stebbings:什么意思?
Jonathan Ross:他们的确在GPU上花了大约600万美元来训练模型。他们声称使用了2000个GPU花了60天训练,而这与最初的Llama 70B在4000个GPU上训练30天相似。最近,Meta使用了更多的GPU,但Meta的数据质量不如DeepSeek,因为DeepSeek用OpenAI的数据进行强化学习。
Harry Stebbings:这是蒸馏吗?DeepSeek如何利用OpenAI的数据获得更高质量的输出?
Jonathan Ross: 这有点像和一个知识渊博的人交流,并从中获得指导。和一个了解不多或提供错误信息的人交流,效果肯定不如前者。我们需要从LLMs的scaling law开始说明,即训练的token越多,模型表现越佳,但收益递减。关于这个scaling law,大家都忘记了一点,那就是它假设数据质量是均匀的。当数据质量更高时,用更少的token也能达到优秀效果。
回到我之前的经验,我曾看到一些有趣的现象,比如AlphaGo打败李世石。这个模型是通过现有棋局训练的,后来他们研发了AlphaZero,完全自我博弈取得胜利。通过让模型在低质量数据上表现良好,再自我优化,不断提升生成的数据质量和模型质量,就能突破scaling law的限制。DeepSeek就是这样做的。他们虽然在训练上花费了大量资金,但通过利用其他高质量模型的数据进行优化,最终实现了高质量的输出。
Harry Stebbings:所以,他们利用了OpenAI模型的数据,经过提炼后获得了更高质量的输出,对吗?
Jonathan Ross:正确,而且他们做了很多非常创新的事情,这就是为什么它如此复杂。因为一方面他们只是抓取了OpenAI模型,另一方面他们提出了一些独特的强化学习技术,这些技术非常简单。
Harry Stebbings:他们的表现如此出色,很多人觉得中国通常只是复制和模仿。
Jonathan Ross:不,他们确实有创新贡献。最佳的描述可能就是,如果你参加考试,并因答对而被标错,你只能与教授理论。但如果答案唯一且明确,那就没什么争议。他们的策略是,不靠人工检查“是”或“不是”,而是通过代码验证答案,完全自动化。
Harry Stebbings:我了解到,他们在奖励模型上进行了独特的创新。能解释一下吗?
Jonathan Ross:这个领域我了解不多,可能不会详细解释。也许你有些研究,可以说说看,我帮你判断是否合理。
Harry Stebbings:基本上,他们结合了不同类型的奖励模型以获得更高且更精确的输出,我对此有些不理解。
Jonathan Ross:这部分我确实不是很了解。
Harry Stebbings:我可以问你吗?OpenAI的模型能不能只是对DeepSeek模型进行蒸馏就得到?
Jonathan Ross:他们其实不需要,因为他们本身已经很优秀了。虽然可以这么做,但没有必要。
中美之争
Harry Stebbings:我们是否应该信任GPU的使用情况,还是需要对此持怀疑态度?
Jonathan Ross:我认为你不必怀疑,因为质量差异并不大。不过,我想说,为何他们要尝试走私GPU,其实只需登录云服务提供商就能租用GPU呢?这好像是出口控制中的一个大漏洞,只需登录、刷卡付款就能使用GPU。
Harry Stebbings:那么,scaling law是不必要的吗?
Jonathan Ross:并不是,它们还是有用的。问题在于,就像是曼加线一样,可以绕过,所以需要稍微封闭一些,还有一些可利用的空间。还要记住,OpenAI在无意间补贴了这个模型的训练,因为DeepSeek在使用OpenAI。据传,OpenAI可能在订阅方面盈利,但在API上,每生成一个token实际上是在亏损,而DeepSeek却利用这些进行训练。顺便提一下,OpenAI可能仍然拥有这些数据,理论上可以用来进行训练。
Harry Stebbings:George Chrisan今天在推特上说,这可能违反了美国的出口法,你怎么看?
Jonathan Ross:我不知道这会是一个出口问题。我知道很多人通过云服务提供商远程使用服务。我们实际上阻止了来自中国的IP地址,我相信我们可能是唯一这样做的公司。但这有点徒劳,因为可以通过租用服务器再登陆美国,然后我们就无法检测到。所以IP地址不是最佳解决方案,我们需要更复杂的手段。我认为这确实是个大漏洞。
Harry Stebbings:你提到封锁中国的IP地址,但也有人担心美国客户数据会回流到中国,你觉得这种担忧有道理吗?
Jonathan Ross:是的,这是最重要的担忧之一。用户已经习惯这些服务,当他们要求删除数据时,实际上只是标记为“删除”,并没有真正删除。当用户再次请求数据时,他们得到的只是标记“删除”的内容。这些还是好心公司的做法。有些政府比其他国家政府更可能利用这些数据。
Harry Stebbings:Jonathan,我们该怎么办?我完全理解你的担忧,比如TikTok,我们可以禁止并关闭它,因为那是个封闭的产品,可以不出售算法。但DeepSeek是开源的。
Jonathan Ross:是的,而且情况更复杂。我们之前拒绝运行任何中国模型,但最终不得不对DeepSeek做出艰难的决定,现在在Groq的API上提供它。
Harry Stebbings:为什么你决定为DeepSeek破例?
Jonathan Ross:当我们看到DeepSeek成为App Store上的第一名应用时,我们认识到用户会将他们的数据放进去,因此希望确保用户有选择的余地。他们可能会将DeepSeek视为另一个类似TikTok的应用。
Harry Stebbings:他们肯定会这样看待DeepSeek。你认为美国会在多长时间内对此采取行动?
Jonathan Ross:这很难预测。首先要考虑的是,未来六个月我们是否还会谈论DeepSeek R1?答案是否定的。我们可能会讨论R2、R3和R4,但R1只是一次性尝试。关键是他们是否会不断推出新颖的东西,而我们会不会一直追赶学习?当前的问题已经使模型的商品化变得非常明显。护城河是什么呢?我很欣赏Hamilton Helmer的七大力量理论。
Harry Stebbings:这是我最喜欢的理论之一,我们在每次投资中都要求使用它,每个人都必须填写。
Jonathan Ross:是的,营销的艺术是去商品化你的产品,而七大力量则是七种出色的去商品化方法。包括规模经济、网络效应、品牌、反定位、资源优势、转换成本和流程力量。那么,谁将采取什么行动?要承认的是,OpenAI的Sam Altman和他的团队有着强大的品牌优势,在这一领域无与伦比,这对他们来说是长久的资产。而Sam正在努力追求的是规模,这也解释了我们听到的关于Stargate项目5000亿美元的说法,但他目前拥有的力量是品牌,而他努力填补的正是这个缺口。其他公司又如何呢?
Harry Stebbings:在我们看到像DeepSeek这样前所未有的效率提升的今天,这是否让5000亿美元的目标显得不切实际?
Jonathan Ross:实际上,我认为这远远不够。原因是我们曾在Google遇到类似的状况。我们开发TPU是因为语音团队训练出的模型在语音识别上超过了人类,那是2011年或2012年。Jeff Dean,这位Google著名的工程师,给领导团队做了一个简短的演示,只有两页幻灯片。第一页是:好消息,机器学习终于有效了。第二页是:坏消息,我们负担不起。身为Google,我们需要将全球数据中心的规模扩大一到三倍,成本可能在20到40亿美元之间,而这仅仅是为了语音识别,你还想做搜索和广告吗?所以,每当有人训练出模型时,往往会庆祝一番,但在投入生产后才意识到成本之高,这就是我们始终专注于推理的原因。回到Google,我们通常在推理上花费是训练的10到20倍。现在模型被免费提供,推理成本会高到什么程度?我担保,现在考虑到测试时间的计算,花费会更高。例如,我问DeepSeek一个问题,它需要18000个中间token来给出答案。
Harry Stebbings:我记得Jensen提到,目前他们一半的收入来自推理。未来会是什么情况?
Jonathan Ross:我认为推理将占95%,这很合理。你不会为了成为心血管外科医生而花95%的时间训练,只用5%的时间做手术。相反,你会花少量时间训练,然后用大部分时间实践。
Harry Stebbings:你认为美国会对DeepSeek实施制裁吗?
Jonathan Ross:解决方案尚不明确,既有激励也有惩罚。美国可以选择封锁,但我不确定是否真的会这样做,因为似乎没有先例。另一种方式是提供激励,比如免费向中国或其他国家开放。
Harry Stebbings:汽车行业也有类似情况,中国的补贴正在冲击欧洲市场。
Jonathan Ross:冷战教会我们相互制衡的重要性。如果我们设置关税,对方也会采取同样措施。需要一种自动化的应对机制,比如对方补贴某个行业,我们也自动补贴相应行业,以避免单方面受损。
Harry Stebbings:DeepSeek是开源的,这如何改变一切?
Jonathan Ross:开源是其受欢迎的关键。如果不是开源,DeepSeek不会引起如此大的关注。开源总是胜出。以Linux为例,尽管初期人们对开源持怀疑态度,认为其不安全、功能不足、漏洞多,但最终它还是成功了。如今,人们期望开源更安全、漏洞更少、功能更强,专有软件如何与之竞争?
Harry Stebbings:人们常说,OpenAI的主要优势在于分发,尤其是在其他提供商之上。但DeepSeek的广泛使用正在削弱OpenAI的价值。
Jonathan Ross:确实如此,尤其是在定价方面,OpenAI正在失去定价权。如果我是OpenAI的负责人,我会考虑开源模型,因为显然在这场竞争中处于劣势,不如通过开源赢得用户和社区的支持。否则,只能依赖品牌等其他优势,但这并不足以维持竞争力。
Harry Stebbings:这可能吗?这不会蚕食OpenAI的主要收入吗?
Jonathan Ross:但如果不开源,收入也会被侵蚀。人们喜欢分发。以Dell为例,他们通过几十年的努力赢得了用户的信任。Super Micro的硬件虽然有趣,但最近也面临挑战。OpenAI已经建立了强大的品牌,即使切换到DeepSeek,用户可能仍会继续使用OpenAI。品牌是七大力量之一。
Harry Stebbings:所以,如果你是OpenAI的负责人,你会开源并免费提供它吗?
Jonathan Ross:我会这样做。在此之前,他们或许可以达成一些交易或其他协议,但开源将是我的最终选择。这是一个强势的立场,关键在于时机。如果在DeepSeek之后开源,可能会被视为被动回应,而非主动决策。
Harry Stebbings:这确实是一种回应,但不必回避,承认它是一种回应。
Jonathan Ross:是的,或许这是一个好的回应。你可以说,我们必须回应,但我们更好,让用户选择哪个模型。
Harry Stebbings:你认为OpenAI内部现在在讨论什么?
Jonathan Ross:这取决于职位高低。高层可能更关注如何保持士气、如何应对竞争,并面临许多艰难决策。基层员工则可能担心股权价值、工作稳定性等。高层需要做出坚定且一致的决策,恐惧往往是坏决策的驱动力。无论选择哪种策略,只要坚定执行并保持一致,都有可能成功。
开源与转换成本
Harry Stebbings:我们如何看待DeepSeek所倡导的开源价值观?这对Meta是有利还是有害?
Jonathan Ross:这是个好问题。我认为我们可以将LLMs(大语言模型)看作类似Linux这样的开源软件项目。Linux有转换成本,但我们发现LLMs几乎没有转换成本。
Harry Stebbings:这也是为什么分析云的概念不成立。很多人认为,云服务市场会有几个主要供应商,最终他们会赢得云业务。
Jonathan Ross:我们可以将“七大力量”框架映射到顶级科技公司。微软的最大优势是转换成本。我喜欢微软这家公司,但如果你走进一个房间,问谁在使用微软,很多人会举手;但如果你问谁喜欢使用微软,手就会放下。这本质上就是转换成本。
那么,生成式AI领域是否会打破这种局面?再看Meta,他们的优势是网络效应。Meta可以免费提供所有技术,我非常羡慕这一点,因为如果我有这种能力,我会开源一切,这样就不用担心竞争,还能获得全世界的帮助。因此,Meta由于网络效应,始终处于开源对其有利的位置。我相信他们更希望拥有类似Linux的LLMs生态,开源越多,他们的天然优势就越明显。
Harry Stebbings:如果你是Meta,你会采取什么不同的策略?
Jonathan Ross: Meta是一个非常强大的竞争者。如果这是一个专有的社交机制,他们通常会怎么做?他们会尝试复制并竞争,邀请用户加入或不加入。但在LLMs领域,“邀请加入”可能不适用。不过,好消息是,所有关于模型的信息都是公开的,Meta已经在做类似的事情,而且他们拥有更强的计算能力。问题是,他们是否愿意像DeepSeek那样对OpenAI进行蒸馏?我认为他们不会,他们在每件事上都非常谨慎,这可能是他们的劣势。
Harry Stebbings:我并不是在说不道德地赢得AI军备竞赛。
Jonathan Ross:我认为这种情况会发生,而且会改变游戏规则。让我们谈谈欧洲,我们几乎忽略了欧洲的存在。
Harry Stebbings:是的,我们目前只是旁观。
Jonathan Ross:在我看来,欧洲缺乏冒险精神。如果你做错了,会留下污点,一切都围绕着规避风险。而在美国,人们会说“尝试得很好,失败了也没关系,我会继续支持你”。这是两者之间的区别。
中国有很多优势,但最大的优势是人口规模。现在,印度也因为人口规模而具有优势,但中国在执行力上更胜一筹。实际上,印度曾一度请求中国帮助建设道路和基础设施,中国在这方面确实做得很好。他们有人口优势,也有组织纪律性和一致性。但AI的担忧是什么?如果LPU或GPU成为劳动力的贡献者,你可以通过制造更多芯片和提供更多电力来直接提升GDP。如果这种情况成为现实,中国的人口优势是否会减弱?他们担心在劳动力方面,美国或西方可能会赶上,尽管目前他们拥有巨大的人口优势。这也是为什么我希望欧洲能加入AI竞争,毕竟有5亿人可以参与其中。
Harry Stebbings:如果你向欧盟提建议,你会说什么?
Jonathan Ross:我会说,到今年年底,欧洲应该建立100个类似Station F(ZP注:Station F是欧洲的创业孵化器)的机构,到明年年底增加到1000个。你需要做的是聚集3000人,将他们与其他愿意冒险的企业家联系起来,让他们互相支持。当你周围都是愿意冒险的人时,你也会变得更具冒险精神,更容易迈出创业的一步。
Harry Stebbings:三年后这个领域会是什么样子?作为一个风险投资人,我的朋友们都在说,他们在这些基础模型公司上损失了数亿美元。
Jonathan Ross:你知道有多少公司在没有转型的情况下取得了巨大成功吗?
Harry Stebbings:很少,大多数都转型了。
Jonathan Ross:是的,所以接受现实,转型吧。我和很多LLM公司聊过,他们确实有一些好点子。实际上,我看了你和xAI创始人的采访,我认为他从一开始就看清了形势:模型将会商品化,这就是为什么他专注于产品。他从一开始就明白,产品比模型更重要。模型只是一个引擎,但汽车是什么?用户体验是什么?这才是关键。
AI的不同与结构性定位
Harry Stebbings:你认为三年后Perplexity会是什么样子?
Jonathan Ross:在筹集资金时,我经常被问到AI是否是下一个互联网。我的回答是否定的,因为互联网是一种信息时代的技术,专注于高保真复制和分发数据。电话、互联网、印刷机都属于这一类,只是规模、速度和能力不同。
生成式AI则不同,它专注于在当下创造有语境、创造性且独特的内容。因此,LLM只是生成时代的印刷机,是起点,随后会有更多发展阶段。就像在没有移动设备的情况下推出Uber一样,无法随身携带台式电脑,必须在正确的阶段进行。Perplexity在幻觉或混淆率下降的那一刻,定位非常精准。一旦模型足够好,不再需要检查引用,将开启一系列新行业。突然间,LLM可以用于医学诊断、法律工作等。在此之前,就像在智能手机出现之前创建Uber一样,毫无意义。然而,尽管目前用户需要检查引用,Perplexity已经有了实际业务,能够赶上这波浪潮。一旦混淆或幻觉问题得到解决,它将处于非常有利的位置。
Harry Stebbings: Mistral会存活下来吗?
Jonathan Ross:每家公司都必须找到自己的定位。xAI就是一个很好的例子,展示了如何围绕产品而非仅仅模型展开业务。
Harry Stebbings:像OpenAI或Anthropic这样的大型供应商是否可能转型?他们已经吸收了数十亿美元的资金。
Jonathan Ross:如果现在不能转型,未来被打乱时更无法转型。
Harry Stebbings:人们认为,随着模型的商品化和推理成本的降低,最终胜出的会是大型科技公司。你今天看股市了吗?股市受到了重创,你怎么看?
Jonathan Ross:你看到的是人们对训练需求减少的担忧。很多人仍然认为大部分计算用于训练,而有人在2000个GPU上训练模型会减少需求。这就像Jevons悖论,降低成本反而会增加消费。过去五到六年里,计算成本每十年下降一千倍,但人们购买的计算量增加了十万倍,花费了百倍的钱。因此,每十年花费的钱增加了百倍。降低成本会刺激需求。每次模型变得更便宜,开发者数量都会激增,随后略有下降,但斜率比开始时更高。更好的模型推动了对推理的更多需求,更多的推理需求又促使人们训练更好的模型,这个循环将持续下去。
Harry Stebbings:我刚刚买了一大堆Nvidia股票,因为它们下跌了16%。基于效率提高的理论,我们似乎不需要那么多Nvidia芯片来达到相同的效果,但我认为你仍然需要Nvidia的推理芯片,只是使用量会更大。因此,我认为这是本世纪最明显的买入机会。你对Nvidia也持乐观态度吗?尤其是考虑到你提到的Jevons悖论。
Jonathan Ross: 从长远来看,正如沃伦·巴菲特和查理·芒格所说,短期内市场是人气竞赛,长期来看是权重机器。我无法预测人气竞赛的结果,但就权重机器部分而言,这是一个误解。实际上,由于DeepSeek的出现,Nvidia的价值反而增加了。Jevons悖论最早由Jevons提出,尽管最近因Satya的推文而广为人知。然而,我比他更早意识到这一点。就像Satya喜欢说他是让Google跳舞的人一样,我要说我让Satya跳舞了,尽管他可能会对此有异议。
在他发布那条推文前不到一个月,我发了一条相关的小推文。Jevons在1860年代写了一篇关于蒸汽机的论文,他发现每当蒸汽机变得更有效率时,人们反而会购买更多的煤,这就是悖论。但从商业角度看,当运营成本下降时,更多的活动进入盈利区,人们会做更多的事情。因此,每当模型质量达到特定水平且token成本下降时,需求会显著增长。这就是价格弹性。
Jonathan Ross:很多人认为Nvidia的高利润率是他们的机会,但我记不清最新发布的具体数字了,确实非常高。我认为这回到了“七大力量”框架,利润率是他们的防御能力,这让我真正考虑到他们商业模式的强度。你认为这种利润率是我的机会,还是仅仅是你认为这种防御性就是利润率?
Harry Stebbings:今天有一个很好的业务,即卖大型机,利润率相当丰厚,因为似乎没有人想进入这个市场。训练是一个利基市场,利润率非常高,尽管长期来看它仍然值每年数千亿美元,但推理是更大的市场。我不知道Nvidia是否会这样认为,但我确实认为我们这些专注于推理并为此构建产品的人可能是Nvidia股票最好的助力,因为我们会承担低利润率高容量的推理业务,这样Nvidia就可以保持其高利润率。
Harry Stebbings:你认为世界会看到这一点吗?
Jonathan Ross:不,实际上在2024年底筹集资金时,我们仍然需要向人们解释为什么推理将是一个比训练更大的市场。记住,这是我们八年前开始时的论点。因此,我不明白为什么人们认为训练会更大,这根本不合理。
Harry Stebbings:对于那些不知道训练和推理区别的人来说呢?
Jonathan Ross:训练是创建模型的过程,推理是使用模型的过程。比如你想成为一名心脏外科医生,你会花几年时间训练,然后用更多时间实践。实践就是推理。
Harry Stebbings:我很高兴听到你对Nvidia的乐观态度。效率从这里去往何处?每个人都对R1的效率如此之高感到震惊,我们从中看到了什么?
Jonathan Ross:你将看到每个人都开始使用这种MoE(混合专家)方法。
Harry Stebbings:MoE方法是什么?简单来说,它就像信息的分段,引导到模型的最佳点。
Jonathan Ross:是的,MoE代表混合专家。当你使用Llama 70B时,你实际上使用了该模型中的每一个参数。而当你使用Mistral 8x7B时,你只使用了大约8B个专家中的两个,尽管有一些共享权重,但它要小得多。实际上,参数数量与你执行的计算量非常接近。现在,如果我有一个像R1这样的模型,我相信它大约有671B参数,而Llama有70B,还有一个405B的密集模型。R1有250个专家,每个大约有2B参数,然后它选择其中很小的一部分进行计算。这意味着你可以跳过大部分计算,就像你的大脑一样,当我说一些关于股市的事情时,并不是你大脑中的每个神经元都会激活,那些关于踢足球的神经元不会启动,这就是直觉所在。
之前有报道说OpenAI的GPT-4最初有16个专家,后来缩减到了8个,具体数字我记不清了,但它开始时更大,后来缩小了一些。而DeepSeek模型则相反,他们采用了非常多的专家。更多的参数就像有更多的神经元,更容易保留输入的信息。因此,通过拥有更多的参数,他们能够在较少的数据上获得良好的效果。然而,由于它是稀疏的,且采用混合专家模式,他们不需要进行那么多计算。部分聪明之处在于他们如何能够拥有如此多的专家,使得它可以如此稀疏,从而跳过那么多参数。
Harry Stebbings:但如果我们回到这一点,那么这就是他们如何变得如此高效的关键。那么下一个阶段是什么呢?因为他们可以如此高效地引导到所有专家那里,现在是什么?
Jonathan Ross:这是一个有趣的例子。Meta最近发布了他们的Llama 3.3 70B,它超过了他们的3.1 405B。他们的新70B超过了之前的405B,这让我感到惊讶。我以为他们是从头开始重新训练的,但实际上论文提到他们只是进行了微调。他们使用了相对较少的数据使其变得更好,这再次证明了数据质量的重要性。他们拿了旧模型,训练它,它变得更好,但新的70B超过了他们之前的405B。因此,现在你将看到的是,每个人都看到了这个DeepSeek架构,他们会说,我有数十万个GPU,我现在要用很多来创建大量的合成数据,然后我会尽可能地训练这个模型。
因为另一个问题是,虽然它是渐进的,但问题是,在这条曲线上你会在哪里停止,这取决于有多少人在做推理。你可以让模型更大,这会使它更昂贵,然后你用更少的数据训练它,或者你让它更小,运行成本更低,但你必须训练更多。因此,DeepSeek直到最近都没有很多用户,所以对他们来说,训练很多从来都不合理,他们宁愿有一个更大的模型。但现在你会看到所有这些其他公司要么制造更小的模型,要么尝试制造相同大小的更高质量模型,只是训练得更多。
Harry Stebbings:我们看到DeepSeek现在说,只有中国手机号码可以登录,这是新的注册方式,你认为这是什么情况以及结果是什么?
Jonathan Ross:们用完了计算能力,这就是为什么芯片初创公司会做得很好的另一个原因,因为他们用完了推理计算。你花钱制造模型,就像设计一辆车一样,但每辆车的制造都会花费你钱。每次你提供查询都需要硬件,训练随着你拥有的机器学习研究人员的数量而扩展,推理随着你拥有的终端用户数量而扩展。
Harry Stebbings:你认为DeepSeek对全球社区的反应感到惊讶,还是他们知道会发生这种情况?
Jonathan Ross: 我认为他们营销得很好。你看看一些出版物,他们让它听起来像是一个哲学问题,他们谈论他们在GPU上花了600万美元,每个人都只关注这一点,忽视了Llama的第一个模型是在大约500万美元的GPU时间上训练的,它以一种好的方式震惊了世界。然后忽略了他们在生成数据上花费了大量的钱,他们真的很擅长营销。我认为他们可能对它工作得如此好感到惊讶,但我想这就是他们想要的结果。
5000亿美元的Stargate计划
Harry Stebbings:还有什么是我未曾提问或我们未曾讨论的吗?
Jonathan Ross:或许可以探讨一下关于5000亿美元的Stargate。
Harry Stebbings:好的,关于这5000亿美元的Stargate,您有何看法?您相信这些数字吗?
Jonathan Ross:我对此进行了深入的思考。实际上,在看到Gavin Baker的推文之前,我自己也进行了类似的数学计算,结果非常相似。然而,与一些知情人士交流后,我发现一些评论实际上是他们已经取得的成果,但你继续追问时,他们会说也许有一些值得考量之处。我认为这是一个承认模型已经被商品化了角度,而基础设施在维持规模方面很重要,这是七大力量之一。所以我想你在那里看到的是试图从拥有角落资源或类似的东西转向规模经济。
Harry Stebbings:你认为这会成功吗?
Jonathan Ross:我认为在短时间内通过GPU达到这一目标并不现实,因为大部分计算属于推理范畴。如果你谈论的是建设所有电力、基础设施,这需要时间,这是基础设施,涉及资本支出。我认为真正的胜利在于品牌,我会在这方面加倍努力。我会雇佣顶尖的品牌公司,进行彻底的改造。
Harry Stebbings:三年后OpenAI的品牌会更强还是更弱?
Jonathan Ross:会更强,我认为他们会在这方面加倍努力,并专注于它。
Harry Stebbings:谁会输?
Jonathan Ross:那些不能适应变革的人,任何只想继续按照原有路线前进、重复过去做法的人都会失败。而且,变革的速度可能会加快。想想看,回到大型语言模型是印刷机的比喻,如果有几个来自古代文明的人突然发明了印刷机,你会说:“Uber来了,我想为此定位。”我们知道生成时代技术将走向何方。现在,每个人都在说:“我们知道这将变得多么庞大,让我们投入资金吧。”我不能成为那个不在这上面投资的人,因为我知道这会带来多大的优势,就像增加劳动力一样。因此,我认为我们将加速进入生成时代,而且速度会比下一个时代更快,因为我们已经知道它会是什么样子。
Harry Stebbings:我们是否有机会看到一个停滞期?就像自动驾驶的例子,我们经历了一段进展缓慢的时期,然后突然间一切都有了突破,我们会看到这种情况还是会继续加速?
Jonathan Ross:我认为自动驾驶面临的问题是,阈值必须非常高。如果你看看这些自动驾驶车辆行驶的里程数,它是一个巨大的数字,事故和死亡率每英里都在降低,但我们对机器的容忍度是零。当你写诗和代码时,情况完全不同,而不是进行手术或驾驶汽车。
Harry Stebbings:如果你是Elon Musk和xAI,你感觉如何?在这之后你感觉更好还是更糟?
Jonathan Ross:我可能会感到既好又坏。我会对自己在构建更多硬件上的赌注感到更好,我会对试图构建自己的模型感到更糟。为什么Elon要这样做?有那么多模型可以直接拿来用,为什么要自己制造?
Harry Stebbings:当你展望未来几年时,你是兴奋还是相当紧张?你可以说这是一个国际战争加剧的时期。
来几年时,你是兴奋还是相当紧张?你可以说这是一个国际战争加剧的时期。
Jonathan Ross:很久以前我就停止了有好日子和坏日子的想法。当你经营一个组织时,我对不同的事情同时感到兴奋和紧张。我最紧张的是,与核战争不同,你可以使用AI工具相互攻击。Google最近宣布了第一个由LLM发现的零日漏洞,这是之前未知的,这很吓人。
Harry Stebbings:零日漏洞是什么?
Jonathan Ross:你希望我能访问你的手机吗?
Harry Stebbings:不希望。
Jonathan Ross:这是一个国家行为,国家行为者拥有大量资源。如果他们启动大量计算并开始扫描漏洞,所有开源软件都暴露在外,甚至不仅仅是开源软件,都可以被试图入侵。他们现在可以自动化这些操作,无需雇佣人员手动完成。现在,防御也必须自动化,因为无法跟上自动化的攻击者。
若此情形失控,后果将不堪设想。更棘手的是,其规模之小,不足以致命,且具有可否认性,这恰恰是最难应对的部分。如今我们拥有了这样的能力,可能会因此陷入一场因后果无法预料而无法开战的冷战状态。至今,我只是在暗中观察,但这种情况可能会失控,我担心我们会见证更多的较量。而且让我假设,你是风险投资界的灯塔,你想激励欧洲的企业家冒险,而我是一个不想看到这种情况的人,因为我不想要竞争,所以当一个国家不想看到这种情况时,也许会破坏你的声誉,也许我会让你成为不受欢迎的人。这种情况在某种程度上可能比射杀一个人更为严重,却可以逃避责任。
这让我感到非常紧张,但同时我也感到兴奋,因为我们现在确实能够以我们所能想象的速度进行创新。你不再需要亲自实现每一件事,可以通过提示工程来解决问题。就像我们从硬件工程师转向软件工程师以提高生产力一样,现在你只需要一个提示工程师,他甚至不需要编写软件。我们的一位工程师开发了一个应用程序,你只需描述你想要构建的内容,程序就会为你构建它。由于我们的速度很快,你只需进行迭代,它就会为你构建一个能够实现惊人功能的应用程序。
Harry Stebbings:我只是不明白价值在哪里?因为你提到他们创建了这个工具,它允许你通过提示来构建应用程序。我相信你已经看到了Bolt.New,我不确定你是否看到了Lovable,它基本上是ChatGPT。是否有价值?每个人都说这些包装应用程序没有价值,每个人都说这些基础模型没有价值,价值在哪里?
Jonathan Ross:发现价值所在正是令人兴奋的一部分。但我认为,人们总是倾向于使用最高质量、最精致的产品。我认为这里有机会展现手工艺和工艺的魅力,关键在于完善细节。细节并非无关紧要,细节就是一切。我曾对这句话感到担忧:“如果你对你发布的第一个版本的质量不感到羞耻,你就等得太久了。”因为这里涉及到微妙和细微的差别,以及健全性和完整性。你想要的是一个不完整的产品,一个不能做所有事情的产品,这就是为什么你应该感到尴尬,但它不应该导致你的系统崩溃。这不是一个好的现象。所以现在你会看到,因为很容易想出一些东西,它虽然有些尴尬但确实有效,人们真的会重视精心制作的高质量产品。
Harry Stebbings: Jonathan,我非常感谢你为我解释了这么多不同的元素,并忍受了我的基本问题,你真是太棒了。坦白说,我非常感激你能在这么短的时间内接受采访。
Jonathan Ross:没问题,祝你好运,玩得开心。这真的是一个全新的时代。
原视频:Jonathan Ross: DeepSeek Special - How Should OpenAI and the US Government Respond | E1253
https://www.youtube.com/watch?v=4P6CUIPrrtU&t=1s
编译:Yihan Chen