InfoQ数字化经纬

DeepSeek“征服”硅谷后还有哪些隐忧

分享嘉宾 | 彭靖田
策划 | 极客时间
亮点内容:
  • DeepSeek 持续爆火,背后到底是什么原因;
  • DeepSeek 基础模型核心架构 DeepSeekMoE
  • DeepSeek R1 推理模型关键技术突破与原理解析
  • DeepSeek 有什么应用场景和案例。
  • 中美大模型未来竞争格局分析
大家晚上好,我叫彭靖田,是 Google 出海创业加速器的导师,也是 Google AI 开发者专家。今天我想重点分享几个问题。首先是 DeepSeek 和其他大模型相比,到底处于什么水平?它为什么突然火了起来?它的落地应用前景和挑战又是什么?最后,我想和大家探讨一下中美在大模型领域的竞争,这其实是一个长期的话题。在正式开始之前,我想先问大家一个问题:你们是什么时候听说 DeepSeek 的?
1 月 20 日,也就是春节前一周左右,国务院总理李强主持了一场座谈会,深度求索的创始人梁文峰参与了此次座谈,并就政府工作报告的征求意见稿提出了建议。这一事件从顶层设计层面体现了中国对 DeepSeek 技术突破的高度重视。
那么,DeepSeek 为何受到如此重视?它仅仅是中国人关注的对象,还是全球瞩目的焦点?数据或许能给出答案。通过 Google 搜索引擎的 Google Trends 来看,过去 30 天内,在美国 IP 属地的搜索数据中,我选取了三个关键词:DeepSeek、ChatGPT 和 LLaMA。1 月 11 日时,LLaMA 的搜索热度高于 DeepSeek,但自 1 月 20 日起,DeepSeek 的热度迅速攀升,仅用 1 到 2 天就超过了运营两年多、月活用户近 10 亿的 ChatGPT。
图片
再看美国各地区对 DeepSeek 的关注情况。加州作为美国创新高地,对 DeepSeek 的关注度很高,但最初超过 ChatGPT 的那几天,华盛顿特区的搜索热度更高。美国政府官员对 DeepSeek 表现出紧张情绪,甚至有官员宣称要禁止 DeepSeek,还有人主张限制芯片出口中国。从过去 30 天的整体数据来看,不仅是加州、华盛顿特区,马萨诸塞州(美国高校聚集地,如哈佛大学所在地)和纽约(华尔街所在地)等地,整个美国都在密切关注 DeepSeek 的发展,DeepSeek 并非仅仅是墙内开花的故事。
图片
从另一个角度也能看出 DeepSeek 的影响——首当其冲的是 ChatGPT。从流量和搜索相关问题来看,与 DeepSeek 相关的问题增长了 50 倍,而“DeepSeek 是否优于 ChatGPT”的问题增长了 41 倍。这表明,很多美国人开始质疑 DeepSeek 是否比 ChatGPT 更强大。事实上,DeepSeek 确实很厉害,美国一线专家如山姆·奥特曼、杨立昆等都对其赞不绝口。
图片
再看全球范围内的趋势,不仅仅是美国,亚洲、欧洲等全世界范围内都呈现出类似的趋势。DeepSeek 自 1 月底开始热度迅速上升,目前仍高于 LLaMA。这令人深思,因为 Meta 在 LLaMA 上投入了大量资金。我们称 DeepSeek 为 AI 界的“拼多多”,其成本仅为 LLaMA 的 1/10。通过这些数据可以看出,DeepSeek 早已出圈,它不仅在中国受到关注,还在全球范围内,无论是学术圈还是大众领域,都受到了广泛关注。
图片
DeepSeek vs 其他大模型
DeepSeek 与其他大模型相比,到底有什么独特之处。其实,大家现在谈论的 DeepSeek 更多的是指 R1 模型,也就是在 2025 年 1 月热度超过 ChatGPT 的那个版本。原因很简单,R1 是一个与 OpenAI 的 o1 同等级别的模型,但 o1 非常昂贵且没有开源,而 DeepSeek R1 完全开源,大家可以免费享受到与 o1 同等水平的智能体验。
在讲 R1 之前,我想先提一下 DeepSeek V2 版本。这个版本可以说是横空出世,它在 2024 年发布了多篇重要论文,包括 V1、V2、V3、R1 以及 DeepSeek MOE 等。其中,V2 论文提出了多头潜在注意力机制(MLA),这是对传统 Transformer 模型中多头注意力机制的重要改进。它能够显著降低算力和显存开销。此外,V2 还提出了稀疏大模型架构——DeepSeek MOE,这种架构在降低成本的同时,还能保持较高的性能。
图片
从效果来看,DeepSeek V2 在 2024 年 5 月的开放测试中,与其他大模型相比,表现非常出色。在二维坐标系中,左上角代表性能最好,而 V2 的性能接近甚至超过了当时的一些顶尖模型,如 Mixtral 8×22B。这表明,DeepSeek V2 不仅成本低,性能也非常强大。通过 MLA 机制,DeepSeek V2 的 KV 缓存需求仅为原来的 6.7%,大大降低了算力需求,同时提高了吞吐量。在推理任务和不同语言任务上,V2 的表现也非常接近 GPT-4 的早期版本。
图片
紧接着,在 2024 年 12 月发布的 DeepSeek V3 更是让人震惊。V3 不仅在性能上有了大幅提升,还能够与千问 2.5 72B、LLaMA3.1 405B 等大型模型相媲美,甚至在某些方面超过了 GPT-4o。V3 采用了混合专家模型(MOE)架构,这种架构的最大优势在于降低了训练和推理成本。V3 的模型体量为 6711 亿参数,但在推理时只需激活 370 亿参数,大大降低了成本。与 V2 相比,V3 将专家数量提升了一倍,参数总量提升了三倍,但激活值仅增加了 1.5 倍。相比之下,千问和 LLaMA 等模型采用的是稠密架构,训练成本更高。
图片
到了 2025 年 1 月,DeepSeek R1 的发布更是让整个行业为之震动。R1 不仅赶超了 OpenAI 的 o1 模型,还通过强化学习实现了复杂的推理能力。R1 的开源,为整个行业提供了新的方向。它证明了在不依赖昂贵标注数据的情况下,也能实现与 o1 相当甚至更好的效果。这无疑对 OpenAI 构成了巨大挑战,也让整个行业看到了 DeepSeek 的技术实力和创新潜力。
图片
DeepSeek 为什么突然火了?
在深入了解了 DeepSeek 从 V2 到 R1 的演进过程和其价值之后,我们再来看看 DeepSeek 到底有哪些技术细节值得我们学习和了解。在探讨这些技术之前,我们不得不回到一个核心问题:DeepSeek 为什么会火?从理性分析来看,任何技术的火爆必有其原因。一开始,DeepSeek 在圈内人中传播,大家开始讨论它有多厉害。随后,国内的总理座谈会和自媒体的分享推动了其在国内的传播,而在国外,主要是技术领域的 KOL 在分享。
那么,DeepSeek 到底有多火呢?这需要量化来看。AI 产品榜一直在记录这些数据。两年前,大家都认为互联网已经进入后半场,很难再出现像抖音、微信这样的平台级产品。然而,ChatGPT 的出现打破了这一认知,它以最快的速度突破了百万用户和亿级用户。而 DeepSeek 的表现更为惊人,它仅用了 18 天就达到了 1500 万的日活用户,这是 ChatGPT 的 13 倍增速。大家想象一下,一个 APP 每天有 1500 万用户在使用,服务器出现繁忙提示也就不足为奇了。因为 DeepSeek 没有那么多算力支持,它几乎是免费提供服务,用户量呈指数级增长,服务器压力自然巨大。更令人震惊的是,DeepSeek 仅用了 7 天就达到了 1 亿用户,而 ChatGPT 用了两个月。两个月是 60 多天,相比之下,DeepSeek 的增长速度简直令人难以置信。这两个数据足以说明 DeepSeek 的火爆程度。ChatGPT 已经让华尔街和全球技术界为之疯狂,而 DeepSeek 则以 13 倍于 ChatGPT 的速度增长,仅用 7 天就达到 1 亿用户,这无疑是 AI 界的一大奇迹。
除了用户增长速度,DeepSeek 被称为 AI 界的“拼多多”也值得关注。这是因为 DeepSeek V3 的训练成本仅为 LLaMA 3.1 的十分之一。LLaMA 3.1 有不同尺寸的模型,如 8B、70B 和 405B。DeepSeek V3 虽然有 6710 亿参数,但激活时只有 30 多亿参数,远低于 LLaMA 3.1 的推理成本。从训练成本来看,LLaMA 3.1 需要 3084 万 GPU 小时,而 DeepSeek V3 只需要 270 万 GPU 小时。即使不考虑 GPU 的购买成本和租赁成本,仅从训练所需的 GPU 小时数来看,DeepSeek V3 的成本仅为 LLaMA 3.1 的十分之一。这一成本优势是无可辩驳的。尽管有些媒体质疑 DeepSeek 的算法,但只要仔细阅读相关论文,就会发现 DeepSeek 的训练成本计算方法是标准且合理的。每家公司运营成本不同,我们只能公平地比较从零到一完成训练所需的 GPU 小时数。因此,DeepSeek V3 的低训练成本是完全合理且令人信服的。
图片
DeepSeek 如何做到便宜又好用?
DeepSeek 公司在过去一年中进行了多次模型迭代,取得了显著的技术创新和突破。V1 模型主要验证了 LLaMA 的工作,并提出了超参数的幂律关系公式。这一公式涉及学习率的衰减问题,尤其是在微调训练中,如何根据模型规模和数据规模灵活调整学习率。传统的余弦衰减方法虽然被广泛采用,但存在一定的局限性,而 DeepSeek 在 V1 阶段就开始探索更适合的衰减策略。V2 模型则提出了多头潜在注意力机制(MLA)和 DeepSeek MoE 架构。V3 模型在网络架构上沿用了 V2 的设计,并引入了无辅助损失负载均衡策略与多 Token 预测(MTP)。这些改进进一步提升了模型的性能和效率。而 R1 模型则是全球首个基于强化学习训练的大模型,它不仅追平了 OpenAI 的 o1 模型,还实现了更复杂的推理能力,成为 DeepSeek 技术突破的标志性成果。
重点讲讲 MoEs 技术
我们重点探讨两个技术点:一是 DeepSeek 的 MoE 架构是如何发展而来的;二是 R1 模型如何通过强化学习实现推理能力的突破。V2 模型的两个重要技术创新是 MLA 和 DeepSeek MoE。MLA 改变了标准 Transformer 中的注意力机制,而 MoE 架构则对全连接层进行了改造。MoE 技术的核心在于将模型的不同部分分配给不同的“专家”来处理,从而实现并行化和高效训练。
MoE 技术的发展可以追溯到 1991 年,当时 Hinton 提出了自适应局部专家混合的概念。这一概念的核心是将不同的网络能力分配给不同的专家,并通过门控网络来决定输入数据应该由哪个专家处理。2013 年,Ilya 等人将深度学习与 MoE 思想相结合,提出了深度 MoE(DMoE)的概念,允许在深度神经网络的不同层中应用 MoE。
图片
2017 年,Hinton 和 Jeff Dean 进一步探索了大规模 MoE 模型的可能性,引入了稀疏性概念,使得模型能够在不增加计算量的情况下扩大规模。
图片
MoEs 与 大模型结合后的技术发展
MoE 技术是一种将多个专家网络组合在一起的方法,每个专家负责处理输入数据的不同部分,从而实现更高效和更灵活的模型训练。这种技术在深度学习领域已经得到了广泛的应用,尤其是在大模型中。
早在 2017 年,Google 的 Hinton 和 Jeff Dean 团队就进行了一项重要的研究,探索了在 LSTM 网络上应用 MoE 技术的可能性。当时,他们构建了一个拥有 1370 亿参数的 MoE 模型,这在当时是一个巨大的突破。然而,由于 Transformer 架构在 2017 年才刚刚被提出,因此他们的研究并没有在 Transformer 上进行实验。但到了 2020 年,Google 的 GShard 项目进一步推动了 MoE 技术的发展,他们开始探索如何将 MoE 技术与 Transformer 架构相结合,以实现更高效的模型训练。
GShard 项目的一个重要目标是解决多语言翻译问题。在没有 GPT-4 之前,多语言翻译是一个非常复杂的任务。假设全球有 100 种常用语言,要实现这些语言之间的任意翻译,就需要大量的模型。具体来说,如果每种语言对都需要一个单独的模型,那么就需要 9900 个模型来完成 100 种语言之间的任意翻译。这是一个非常庞大的数字。因此,Google 提出了一个大胆的想法:是否可以用一个模型来完成所有这些翻译任务?这个想法最终在 GShard 的后续论文中得到了验证。他们发现,只要模型足够大,即使训练数据很少,模型也能够学会进行多语言翻译。这一发现为 DeepSeek 的发展提供了重要的启示。
图片
除了理论上的探索,GShard 在工程技术方面也进行了许多有意义的实验。他们发现,MoE 技术非常适合用于分布式训练。在分布式训练中,模型的不同部分可以在不同的 GPU 卡上进行训练,从而提高训练效率。GShard 提出了一种“top-two gating”的方案,即在每次训练中只与两个最相关的专家进行通信。这种方法大大降低了通信成本,提高了训练效率。这一技术后来被许多其他研究团队所采用。然而,尽管 MoE 技术在理论和工程上都取得了显著的进展,但在实际应用中仍然存在一些挑战。例如,如何训练大量的专家,以及如何确保这些专家之间的差异性,都是需要解决的问题。DeepSeek 在这些方面进行了深入的研究,并提出了一些创新的解决方案。他们通过细粒度的专家分割和设备限制路由等技术,成功地提高了模型的性能和效率。这些技术不仅降低了通信开销,还提高了模型的训练速度和质量。
图片
在大模型领域,MoE 技术的应用已经成为了一个重要的研究方向。许多团队都在尝试将 MoE 技术与大模型结合,以提高模型的性能和效率。其中,Mixture AI 是一个非常有名的例子,它被称为欧洲的 OpenAI。然而,尽管 Mixture AI 成功地将 MoE 技术应用于大语言模型的训练中,但他们在开源方面的尝试并没有持续下去,原因可能在于他们没有像 DeepSeek 那样进行更多的创新。
图片
DeepSeek 在 MoE 技术上的创新主要体现在两个方面。首先,他们解决了如何训练大量专家的问题。在传统的 MoE 模型中,专家的数量通常不会太多,因为训练大量的专家是非常困难的。这就好比一个老师带 8 个学生和带 100 个学生的要求完全不同,而且要求每个学生的成绩都好,难度可想而知。更重要的是,我们希望这 100 个学生各不相同,各有特长,这更是难上加难。DeepSeek 通过细粒度的专家分割,成功地训练了 160 个路由专家,这些专家各有所长,能够处理不同的任务。同时,他们还引入了两个共享专家,这些共享专家负责处理一些常识性的知识,例如理解文本的含义。
其次,DeepSeek 在设备限制路由和负载均衡方面进行了优化。这些技术的引入主要是为了解决通信开销的问题。在分布式训练中,模型的不同部分通常会在不同的 GPU 卡上进行训练,这就需要在训练过程中进行大量的通信。如果通信成本过高,就会严重影响训练效率。DeepSeek 通过限制每个 token 最多访问 3 台设备,并采用三级平衡损失(专家级、设备级、通信级),成功地降低了通信开销。此外,他们还在训练框架和 CUDA 层面上进行了优化,进一步提高了训练效率。
这些创新使得 DeepSeek 的 MoE 技术在性能和效率上都取得了显著的提升。与传统的 MoE 模型相比,DeepSeek 的模型不仅能够处理更复杂的任务,而且训练成本也大幅降低。例如,他们的 V3 模型在参数激活稀疏性方面表现优异,每个 token 仅激活 21B 参数,总参数为 236B,训练成本较 DeepSeek 67B 降低了 42.5%。
DeepSeek R1 Game Changer
DeepSeek 的 R1 模型被称为“游戏规则改变者”,它通过一系列创新的训练方法和成果,彻底改变了大模型的训练和应用方式。R1 模型的训练过程分为三个阶段。第一阶段,R1 Zero 通过强化学习训练,无需监督微调(SFT),直接在基础模型上应用大规模强化学习。第二阶段,通过冷启动数据对 V3 模型进行微调,增强其推理能力。第三阶段,结合规则奖励和神经奖励模型,对齐人类偏好,进一步提升模型的性能。接下来,我将详细解释这三个阶段的训练过程及其背后的原理。
第一阶段:R1 Zero 的强化学习训练
R1 Zero 是 R1 模型的基础版本,它的训练过程完全依赖于强化学习,而没有使用传统的监督微调(SFT)。这一阶段的目标是让模型具备推理能力,即能够生成中间思考过程和最终结果。R1 Zero 的训练方法如下。
  • 强化学习目标:R1 Zero 的训练目标是准确率和格式奖励。格式奖励要求模型在生成结果时,必须包含中间思考过程(think)和最终结果。这种格式化的输出方式类似于 Alpha Zero,后者通过自我学习而非学习人类棋谱来提升性能。
  • 训练方法:R1 Zero 使用了 GRPO(Group Relative Policy Optimization)算法,这是一种简化的强化学习方法,通过投票机制解决价值估计问题。GRPO 在海外引起了广泛关注,因为它简化了训练成本,提高了训练效率。
  • 成果:R1 Zero 通过强化学习自主发展出了长链思维能力。模型发现,思考过程越长,准确率越高。这一发现是 R1 Zero 训练过程中的一个重要突破,标志着模型能够通过自我学习提升推理能力。
图片
第二阶段:冷启动数据与推理能力增强
在第一阶段的基础上,R1 Zero 生成了冷启动数据(cold start data),这些数据用于进一步增强模型的推理能力。这一阶段的训练过程如下。
  • 冷启动数据:R1 Zero 生成的冷启动数据包含了中间思考过程和最终结果,这些数据被用来对 V3 模型进行微调。通过这种方式,V3 模型获得了更强的推理能力。
  • 强化学习训练:在微调后的 V3 模型基础上,R1 Zero 再次进行强化学习训练,但这次训练中加入了语言一致性(consistency)的要求。这一要求确保模型在生成结果时不会混用不同语言,除非是专有名词。
  • 成果:通过冷启动数据和语言一致性的强化学习训练,R1 Zero 生成了更高质量的推理数据。这些数据不仅避免了语言混用问题,还进一步优化了模型的推理能力。
图片
第三阶段:最终的 R1 模型训练
在前两个阶段的基础上,R1 模型的最终训练过程如下。
  • SFT 知识数据:除了推理数据,R1 模型还需要一些常识知识(knowledge)。这些知识数据来自 V3 模型的基础版本,通过模型生成而非人工标注。
  • 强化学习与规则验证:R1 模型在训练过程中结合了强化学习和规则验证(rule-based verification),通过拒绝采样等方法进一步提升模型的性能。
  • 成果:最终的 R1 模型不仅具备强大的推理能力,还能够生成高质量的中间思考过程和最终结果。这一模型的性能在多个基准测试中得到了验证,证明了其在推理任务上的优越性。
蒸馏模型
除了 R1 模型,DeepSeek 还发布了一系列蒸馏模型。这些模型通过使用 R1 生成的推理数据进行训练,显著提升了性能。具体来说:
  • 蒸馏过程:R1 生成了 80 万条推理数据,这些数据被用来对现有的开源模型(如 LLaMA 和千问)进行蒸馏训练。通过这种方式,这些模型的性能得到了显著提升。
  • 成果:经过 R1 推理数据蒸馏的模型在多个任务上的表现超过了原始版本。例如,经过蒸馏的 LLaMA 模型在某些基准测试中接近甚至超过了闭源模型的性能。
图片
在 R1 模型的最终论文中,DeepSeek 团队不仅展示了其原理和成果,还分享了他们在研究过程中的一些尝试和经验教训。
首先,R1 Zero 的训练过程验证了在无监督场景下激励复杂推理行为的可行性。R1 Zero 能够在没有任何监督微调(SFT)数据的情况下,通过强化学习训练出具有推理能力的模型。这一过程中,R1 Zero 能够生成长达数千个 tokens 的思考过程,这在以往的模型中是难以想象的。关键在于冷启动数据的使用,这些数据由 R1 Zero 生成,并用于训练 V3 基础模型,使其具备推理能力。随后,V3 模型通过强化学习进一步训练,生成了更符合语言一致性的 R1 Zero 版本。最终,这些经过强化学习训练的 R1 Zero 模型能够生成高质量的、语言一致的推理数据,这些数据与知识数据结合,用于训练最终的 R1 模型。整个过程不仅展示了技术的创新,也体现了 DeepSeek 团队在模型训练上的巧妙设计和艺术性。
DeepSeek 团队也经历了一些失败的尝试。例如,他们尝试使用蒙特卡洛树搜索(MCTS)结合其他模型的方法来复现 OpenAI 的 O1 模型,但最终发现这种方法并不适用。DeepSeek 团队以一种友善和中立的方式指出,他们尝试了这种方法但未能成功。此外,他们还尝试使用过程奖励模型(PRM)来训练模型,这种方法由 OpenAI 公开,涉及使用人工标注的过程奖励数据来训练模型。然而,DeepSeek 发现,直接使用这些人工标注的中间思考步骤数据进行监督微调是不可行的。原因在于,人类很难准确地写出最优的中间思考步骤,这使得基于人工标注数据的训练方法存在局限性。DeepSeek 通过实验发现,模型自身生成的推理数据比人工标注的数据更能有效地提升模型的推理能力。
DeepSeek 在开源方面的表现非常出色,从第一代 V1 模型开始,就一直坚持开源策略。这不仅包括大家熟悉的 R1 等七个模型,还有像 Prover、Code-V2、VL2 等众多版本和相关代码。这种开放的态度体现了 DeepSeek 真正致力于开源的精神。如果要论及真正的“OpenAI”,DeepSeek 无疑是强有力的候选者。它毫不保留地将研究成果第一时间公开,不仅分享成功的经验,也坦诚地告知哪些路径未能走通,为其他研究者提供了宝贵的参考。
DeepSeek 落地应用前景与挑战
DeepSeek 的落地场景已经非常广泛,涵盖了各个行业和领域。如果你想知道它在某个特定行业或地区的应用情况,只需在搜索引擎中输入“DeepSeek 落地”并加上相应的行业或地区名称,就能找到大量相关信息。目前,几乎所有行业和高校都在围绕 DeepSeek 展开研究和应用探索。
关于当前的技术局限和挑战,我认为这是一个非常有趣的话题。最近,我听到一个很有趣的现象,今年最出圈的一句话是“服务器繁忙,请稍后再试”。这虽然是一个现象,但显然不是 DeepSeek 真正的技术局限和挑战。大家应该把这当作一个玩笑,不要被一些自媒体为了博取流量而传播的不实信息所误导。
就 DeepSeek R1 模型而言,我认为它可能面临以下技术局限和挑战:
  1. R1 模型发布得非常快,在 V3 发布后仅一个月就推出了。我相信 DeepSeek 内部肯定在迅速推进 R2 或其他版本的开发。从 R1 的训练过程来看,它是基于 R1 Zero 生成的 COT 数据和 V3 基础模型生成的知识数据进行监督微调得到的。然而,在这个过程中,V3 模型如何更有效地生成这些数据,以及 COT 数据的质量是否可以进一步提高,从而增强 R1 模型的通用能力,这些都是未来可以继续优化的方向。此外,R1 模型的输出格式也可能需要进一步调整。
  2. R1 模型目前主要处理中英文,但随着 DeepSeek 的全球化发展,它可能需要支持更多语言,如韩语、日语、德语、法语和西班牙语等。这将是 R1 模型未来需要进一步提升的方向。
  3. 提示词的敏感性也是一个问题。需要设计更鲁棒的提示词工程方法,使模型在不同提示词下都能稳定输出高质量结果。
  4. 推理能力蒸馏,需要进一步探索如何将推理能力蒸馏到更小的模型中。已经有公司在尝试替代 Transformer 架构,因为 Transformer 本身存在一些局限性。
  5. 安全性也是一个重要问题。自从 DeepSeek 上线以来,就有很多人提出各种敏感问题。未来,DeepSeek 可以在强化学习、监督微调或其他环节中增加安全性机制,以确保模型的输出既安全又无害。
图片
未来中美大模型竞争的一些展望
展望中美大模型的未来,合作与竞争的关系是一个不可忽视的议题。尽管目前竞争激烈,但我认为合作大于竞争。全球范围内的合作趋势正在形成,例如即将在法国举行的一场大会,所有大模型科技公司的高层都将出席。法国政府也在推动一项类似美国“星际之门”的上千亿欧元投资计划,以支持 AI 发展,并向 DeepSeek 伸出橄榄枝。这表明,全球性的合作是大势所趋。技术共享,尤其是开源技术,更是推动了这种合作。
当然,商业层面的竞争不可避免。陆奇老师在 2 月 11 日的演讲中提到,大模型时代已经进入下半场,即推理驱动阶段。上半场,像 OpenAI 的 GPT 那样,通过知识驱动的方式,让模型吸收大量人类历史知识,从而能够回答各种问题。然而,下半场更注重推理能力,就像人类大脑的两种思考方式:一种是快速且不假思索的,另一种是需要深思熟虑的。推理驱动的模型更接近后者的思考方式,这对于复杂任务如写小说或编写复杂代码至关重要。DeepSeek R1 的出现,让开源社区真正进入了推理驱动的赛道,这是非常了不起的成就。
对中国来说,这是一个巨大的机会。首先,DeepSeek 诞生于中国,这表明非海归博士也能取得全球领先的成果。其次,中国拥有大量年轻人才,他们将成为未来十年的中坚力量。此外,国产 AI 算力生态和芯片平台正在快速迭代,有望迎头赶上。还有一个重要优势是中国用户对端侧智能和便利的接受度更高,这为大模型的推广提供了便利。因此,我希望大家保持乐观,积极拥抱新技术。大模型将影响众多行业,其影响力甚至可能超过互联网。
最后,我想分享 DeepSeek R1 输出的一句话:“意识不是一个二进制的开关,而是一个连续的光谱。”这句话非常优美,它提醒我们,意识并非非黑即白的存在,而是一个连续的过程。重要的是意识能带来什么,而非单纯讨论其是否存在。这同样适用于 DeepSeek,我们应关注它能为我们带来什么,以及我们能用它做什么。
彭老师 AI 大模型系列学习推荐
《AI 大模型应用开发实战营》:0 基础入门 AI 大模型的通识课。一站式掌握硬件、理论、LangChain 开发框架和项目实战技能,从大模型原理、框架技术架构、项目需求分析、功能设计到模型对比、覆盖实际开发各个环节。点击“阅读原文”了解课程内容。
嘉宾简介:
彭靖田,谷歌出海创业加速器导师,加州大学访问学者。
连续创业者:才云科技 AI 技术合伙人(20 年字节全资收购) ,品览联合创始人兼 CTO(23 年股权退出),上海载极数据创始人(24 年)提供大模型解决方案与咨询服务。
开源贡献者:Kubeflow/ TensorFlow/ Kubernetes。
行业布道者:Linux CNCF 程序委员会成员,大模型开发 / 微调训练和深度学习课程学员 10 万 +。
 直播预告
2 月 11 日至 2 月 27 日,AI 前线视频号将联合霍太稳视频号带来 DeepSeek 系列直播,解析 DeepSeek 爆火背后的技术突破、商业化路径与行业影响。从 纯强化学习复现 o1 能力到算力控制,从创新文化到 AI 竞争格局,每场直播都深度解析一个关键问题。
📅欢迎扫码二维码预约直播,一同探索 DeepSeek 如何引领 AI 领域的创新与未来!

图片

 会议推荐
在 AI 大模型技术如汹涌浪潮席卷软件开发领域的当下,变革与机遇交织,挑战与突破共生。2025 年 4 月 10 - 12 日,QCon 全球软件开发大会将在北京召开,以 “智能融合,引领未来” 为年度主题,汇聚各领域的技术先行者以及创新实践者,为行业发展拨云见日。现在报名可以享受 8 折优惠,单张门票立省 1360 元,详情可联系票务经理 18514549229 咨询。
图片
今日好文推荐
DeepSeek的横空出世早有“先兆”
如何叠加管理能力成为管理者,而不是放弃技术成为管理者
在 AI 大模型浪潮里,如何用数据做出最优决策?
数据库将成为下一波受 AI 影响最大的行业
奇富科技:大模型进入金融核心场景,Agent 提供了很大启发