在2024年春节,最出圈的产品是OpenAI的Sora,发布了一个Demo,说自己可以一次做出长达60秒的视频,震惊了全球。但,那只是OpenAI的“样板间”,再等大半年,Sora才开始陆续开放测试。而2025年的春节,全球都被一家中国AI公司DeepSeek的最新模型震惊了,从美国新任总统特朗普,到马斯克、黄仁勋、奥尔特曼,再到各个领域的科学家,都纷纷地跳出来评论。跟Sora不一样的是,DeepSeek靠的是物美价廉的“经济适用房”,获得了全球的关注。不过在春节,当突然发现打开短视频,漫天遍野都是“DeepSeek让美国人跪了”“中国AI公司手撕OpenAI,突破美国芯片限制”,连春节各个饭局上,讨论的都是这款现象级的产品,甚至还从群里看到了有人连DeepSeek名字都没有记住,就开始尬吹。所以咱们如果是非AI领域专业人士,如果要谈起来DeepSeek,我们可以了解哪些东西呢?在24年5月,我们团队内部就已经开始使用了DeepSeek,从得到App里的学习助手,到一键记笔记功能,再到Get笔记里的文字润色功能,DeepSeek每一个版本的更新,我们都要做内部评测,并且会用到线上的真实场景。所以今天我就从我的角度为你梳理下,关于DeepSeek,我们普通人可以知道的8件事。
01
1月20日,DeepSeek正式发布了自己的R1新模型,这个模型在性能上已经能与OpenAI的o1模型打成平手。
但OpenAI的名字虽然叫做OpenAI,其实一点儿也不开放,所以全球用户虽然能使用他们的o1模型,但是完全不知道其背后的原理,只能在OpenAI的限定下使用。
而DeepSeek这次发布的R1模型,是一款对标o1的推理模型,后面我会简单的介绍下训练和推理的区别。火爆是因为DeepSeek把这个模型不但开源了,还把其中的过程都写成了论文同步出来。
对于大部分AI开发团队来说,这个新模型开源可以免费使用,在成本上要比使用OpenAI的模型节省非常多,并且又可以按照自己企业或者产品的需求进行二次改造。
而对于顶尖的科研团队来说,DeepSeek同时公布的技术论文的价值才更高,全球有很多团队使用他们的方法,也成功的复现了AI在某一时刻,突然智能涌现的现象。
如果要类比的话,大家可以想象成安卓系统的开源。当年安卓开源后,全球都涌现出了一大批的智能手机厂商,让整个生态蓬勃发展,可以与苹果的封闭iOS系统一决高下。
DeepSeek的胜利,其实就是开源世界的胜利。
DeepSeek并不是一夜之间冒出来的新公司,从24年1月,DeepSeek开源了国内首个MoE模型,然后24年5月开源了V2模型。
其实V2模型已经呈现出了他们的全部特点。
首先是极致性价比,注意,DeepSeek的产品绝对不是仅仅的便宜,如果只是便宜的话,这次也压根不会引起这么多AI大佬的关注。
当时V2模型, 他们的API价格,就掀起了国内所有大模型的降价狂潮。我用数字大家更容易直观感受到,对于API来说,有输入和输出两个环节,相当于你给AI系统输入文字,需要付一笔钱,而AI系统处理完,给你输出结果,又需要付一笔钱。
在V2系统时,全球最强大的GPT4版本,输入一百万字符,需要人民币217元,而DeepSeek只需要1元,AI处理完,输出一百万字符,需要人民币434元,DeepSeek也只需要2元。而国内模型,当时的文心一言,输入输出也需要120元。所以DeepSeek在去年5月就以一己之力,把国内的大模型价格全部都打骨折了。
当然,到了最新发布的R1模型,他们的API定价是输出每百万字符16元,是同级别OpenAI o1模型的3%。
没有开发者会拒绝一款能让自己降本几十倍的技术方案。DeepSeek的V2模型征服的更多是中国开发团队,而R1模型,靠着极致的性价比,征服的是全球范围内的中小型技术开发团队。
例如我们在去年6月份推出的Get笔记产品,如果使用ChatGPT的4o模型,我们每天在润色环节上的花费大约是2000美金,而如果用DeepSeek的V2模型,花费在120美金左右。那么一年下来,使用DeepSeek就能让我们这种刚刚上线的小产品节约450万人民币,大家可以设想下,那对于很多用户量超级大的产品来说,每年下来,会节约非常多的技术成本,也许对于很多产品来说,就因为更换一个底层模型,就从一家亏损企业变成了盈利企业了。
除了极致性价比之外,由于R1的完全开源,全球的开发者和研究人员都可以自由访问和修改代码。所以最近从独立开发者到很多大学或者企业的研究团队,都在基于DeepSeek的新模型,做自己的研究。
而之前,这些如果要选择开源模型,就要用Meta的llama,但他们并没有一款高性能的推理模型,如果要选择能自己思考的推理模型,就要用OpenAI的o1,但这个是闭源模型,会受到非常多的限制。
所以DeepSeek横空出世,大家突然发现了一款能力强,可塑性强,还能定制,并且使用成本还非常低的产品,火爆也就是理所应当的事情了。
我看到一些短视频自媒体博主,把DeepSeek的开源策略,解读为“品格高尚,就像当年的白求恩一样,无私奉献”。其实这就有点强行上价值了。开源或者闭源,都只是商业社会的技术团队的一种选择而已,各有各的好处,只有利弊之分,并不是道德上的谁比谁更高尚。开源所有模型和论文,对于DeepSeek来说,其实是一场“阳谋”。如果只依靠他们一家团队,根本没办法兼顾到那么多的应用场景,也不会有很多领域的专有数据,而没有这些的话,就没办法更快的迭代。另外开源后,就意味着全球很多专业的技术人员,会在DeepSeek现有的能力基础上,开始研究和迭代,也许新的技术突破就会产生在这些场景中。例如R1发布之后,全球顶级的实验室和大学,都在使用这个模型做自己的任务,在过程中,发现问题,会在开源社区里同步和讨论。所以AI大神,图灵奖获得者,同时也是脸书AI的首席科学家杨立昆在社交媒体上赞扬DeepSeek时,说:“不要把这个简单的当做中国AI技术超越美国,而应该是开源模型超越专有模型的胜利。”当然,他这个说法,我们也要辩证的来看待,因为在DeepSeek出名之前,开源模型的课代表就是脸书旗下的Llama系列。我们在看DeepSeek的相关报道中,经常看到两个词,一个叫做“训练”,一个叫做“推理”。例如我们会看到,这次在报道DeepSeek时,有一个数字会被反复的提起,那就是他们V3版本的训练成本为558万美元,而OpenAI的4o模型的训练成本大约为7800万美元。单单从成本上来看,DeepSeek完成了很多底层技术层面的创新。那对于AI模型,如果用通俗的话,应该怎么理解训练和推理呢?我特意请教了一下我的DeepSeek AI助理,它特意拿厨师做饭来给我解释这两个名词。预训练就相当于厨师学做满汉全席的过程。那么首先就是海量菜谱的输入,可能对于厨师来说至少要先了解1000本菜谱背后的风格和流派,AI模型会先吃进整个互联网的海量文本,从维基百科到小说新闻,相当于一个人读了两亿本书。其次是要去找规律训练,例如厨师可能在训练中,会发现只要做糖醋排骨,就需要先炸后炖,而AI就要学会“因为……所以……”,“一边……一边……”这样的语言逻辑,同时也要去理解当看到一句话说“天上乌云密布”,就要理解作者的意思是天要下雨了。然后还要学会建立知识网络,要去分析海量词库之间的关系,例如看到苹果这个词,既要知道是一种水果,还要理解这是一家手机公司。所以预训练过程,是非常耗费时间和金钱的,因为这是一个让计算机学会知识的过程。而推理过程,是让厨师在顾客点菜时现场做菜。例如你说要点一个适合感冒病人的食谱,那么作为一个厨师来说,就要去拆解关键词,先要理解需求,我说感冒病人的食谱,就要经过思考,知道这意味着口味清淡容易消化,不能有辛辣的食物。然后要调用自己之前学习的知识,马上要去想到哪些食物适合病人吃,例如白粥易消化,鸡汤有营养等等。最后再调用自己的做菜技能,把每种适合病人吃的食物做出来。这两个阶段都非常重要,不过这次DeepSeek的出圈,正是因为他们在推理阶段做出了非常多的技术突破。因为之前的AI公司,更注重的是训练阶段,并且属于那种不计成本的训练,还拿厨师来举个不恰当的例子,相当于川菜馆找一个厨子,也让他去学会全球所有的菜系,从墨西哥菜越南菜到法国鹅肝日本寿司,都要学会才能上岗。而这次DeepSeek把重点放在了厨师上岗之后的突击学习,例如把会每天要做的一些川菜反复的训练学习,这就节约了大量的算力和成本。如果关注一下美国媒体对DeepSeek的报道,会发现有一个词频繁出现,那就是“斯普特尼克时刻”。这是一个源自冷战时期的科技术语。在1957年,苏联成功的发射了人类第一颗人造卫星“斯普特尼克1号”,就是这件事情对当时的美国产生了极大的冲击。这让美国上上下下意识到,自己自以为在科技上的领先优势已经被苏联颠覆了,并且这种卫星技术暗示苏联可能具备了远程核打击能力,顺带着,美国也自我反思,认为自己理工科基础教育存在很大的缺陷。就是这个斯普特尼克时刻,在1958年推动了NASA的成立,发布了《国防教育法》,大幅增加在理工学科的资金投入,启动了庞大的阿波罗计划,最终在科技水平有限的情况下,成功登月。所以美国人把这次DeepSeek的突破称之为斯普特尼克时刻,一方面是对DeepSeek的肯定,但另一方面,这也就意味着中美AI之战在某种意义上,刚刚拉开帷幕。06
如何看待从特朗普到黄仁勋到奥尔特曼纷纷谈论DeepSeek最近DeepSeek绝对是特朗普最经常提起的中国公司,频率超过了TikTok。例如他在27号的共和党会议上,就表扬了DeepSeek,说“当你听说有人提出了一些新东西,总会对我们有想法上的启发。这是非常积极的发展,毕竟与其投入几十亿的资金,不如花费更少的钱,但愿能得出同样的解决方案。”他也表示DeepSeek给所有的美国科技企业敲响了警钟,必须要专注于竞争才能赢得胜利。因为DeepSeek在训练中节省了大量的显卡和算力,并且在论文中透露了他们并没有用英伟达最新最强大的硬件基础设施,这让英伟达的股价在1月27日当天,暴跌了16.86%,市值在一天之内蒸发了约5900亿美元,这就创下了美股历史上,单日最大的市值下跌纪录。另外OpenAI和克劳德等一批美国顶级AI公司的创始人,都纷纷站出来评价DeepSeek的最新模型。这对于DeepSeek这样一家中国公司,肯定是一种超一流的肯定,但是这背后也意味着美国的AI企业,不会再把中国AI公司当做落后于他们的跟随者,而会当做势均力敌的对手。在足球赛场上,英国足总杯经常出现豪门被爆冷的情况。例如在2012赛季,英格兰第五级别联赛的卢顿队以1比0战胜了英超球队诺维奇,成为了英超时代的惊天冷门。第五级别联赛,就基本上相当于我们大学里的全校乒乓球冠军,居然在正式比赛中,战胜了国乒孙颖莎,就是这么逆天。但是这种被爆冷,很多都是因为对自己能力的过度自信造成的。而DeepSeek这次给美国科技圈带来的冲击就是这样,以前其实只有中国企业经常说AI领域中美争霸,但美国AI企业是不把中国对手放在眼里的,在他们看来,中国依赖的更多是模仿,是跟随,所以会一直保持对中国AI企业两年左右的领先优势。这次DeepSeek让很多美国技术大神意识到,中国的AI企业和年轻的科研人员,也能做出震惊世界的成果,所以接下来,不单单是DeepSeek,包括其他的 中国AI企业都会受到重视,会像重视OpenAI一样重视中国AI的进展。一举一动,都会引起关注,从芯片到算力到数据到人才到资金,双方真刀真枪的战争就开始了。无论是资本市场,还是新闻媒体,包括专门给企业家写自传的作者,还有短视频平台上的自媒体从业者,都希望讲述故事越简单越好,塑造出一个堂吉柯德式的英雄人物。因为我们特别喜欢那种故事,就是一个科学家或者一群科学家,不修边幅不问世事,闭关十年,一开门,端出一个让世界震惊的科研成果出来。所以我们如果在微信里搜DeepSeek的话,会发现有不少人的言论,动不动就是拳打OpenAI,脚踢英伟达。但实际上,OpenAI的o1模型是第一个上线的推理模型,而DeepSeek的R1是在能力上逼近o1,成本上大幅节省的第一个开源推理模型,所以从我加的定语中,咱们必须知道,DeepSeek本身就是站在OpenAI已经实现的技术上,继续向前推进了一步。在这里,我想岔开一下,讲科技史上另一个我们不太注意的产品。19世纪70年代,大约1875年左右,妇产科医生斯蒂芬-塔尼在巴黎动物园散步的时候,偶然间发现了一些小鸡孵化器,发现一些刚刚孵出的小鸡在孵化器温度适宜的环境中蹦蹦跳跳,他的脑海里就跳出了一个创意。过几天,他就聘用了动物园的家禽饲养员奥迪尔-马丁,让他来制造一个类似小鸡孵化器的设备,用于为刚出生的婴儿提供类似保护。最早期的恒温箱就是用热水瓶提供温度支持的,非常粗糙,但是在500名婴儿中开始使用这个装置,新生儿死亡率就从66%降低到了38%。而接下来这个婴儿恒温箱的产品,经历了各种技术的迭代,到了1930年,当时的婴儿恒温箱已经有了氧气辅助等先进功能。而二战之后,这个装置成为了美国每家医院的标准装置之一,有一个数据就是1950年到1998年,婴儿的死亡率又降低了75%。因为这个发明,属于直接拯救生命的,所以在20世纪中,拯救了无数婴儿的生命。不过单从产品功能来说,经过一百多年的发展,我们很难说还能有什么改进的地方。事实是,婴儿恒温箱让欧洲和美国这种发达国家,每1000个新生儿只有10个会不幸夭折,但是在利比里亚和埃塞俄比亚这种发展中国家,1000个新生儿中,会有100多个无法活下来,而这已经进入了21世纪。2008年,麻省理工学院的教授普莱斯蒂洛去印尼访问时,发现他们的8台被发达国家捐赠的婴儿恒温箱都停止工作。因为当地电压不稳,温度又很高,造价高达4万美元的婴儿恒温箱又非常娇贵,当地没有人看得懂,也没有人会修。后来普莱斯蒂洛想要解决这个问题,遇到了一名医生,名叫乔纳森-罗森。罗森经常去各国旅游,他观察后发现,任何一个小城镇哪怕没有空调,也会有修车铺,所以他就想是不是可以用随处可见的汽车零件来制作婴儿恒温箱呢?三年后,他们真正做出了可用的设备,供暖靠的是旧车头的聚光灯,汽车仪表盘的风扇用来保持空气流通,动力来源于摩托车的电瓶。整个下来的成本不到100美元,更重要的是,这种恒温箱的任何一个零件发生了损坏,哪怕小镇上,都有人可以维修。这个产品原型出来的时间是2011年。从1875年到2011年,光是婴儿恒温箱这么一个简单的产品,就经过了无数次的迭代,并且我们会发现,没有前面的进展,也就没有后面的产品。之所以会举这个例子,就是对于AI领域也是一样的道理,无论是第一个提出婴儿恒温箱概念的斯蒂芬-塔尼还是150年后迭代这个产品的普莱斯蒂洛,每个人的创新都是有价值的。在现在的科技领域中,一种主流的创新模式就是从相邻的地方进行探索。因为一旦对边界进行新的探索,那么之前的边界就会重新扩展,相当于我们走在一所魔法城堡里,你每打开一扇门,都会进入一间新的仿制,会发现一些新的、别有洞天的美景,你不能因为进入的第三个房间特别漂亮,就说不应该有前两个房间。而DeepSeek就是从OpenAI推开的一扇门,走了进去,然后推开了另外一扇门,看到了门外的风景。08
不要神话DeepSeek,他们面前还有太多要解决的问题当看到国外媒体都在讨论DeepSeek的时候,我内心中还是洋溢着非常纯粹的民族自豪感,但是,这种支持不能变成无脑的捧杀,因为他们也面临一些问题。从去年五月一直到现在,DeepSeek都是我们Get笔记背后的一家技术提供方,只是其中一家,并不是我们润色环节的首选模型。原因非常简单,那就是单独只算成本的话,用DeepSeek非常划算。但我们需要的是提供给用户稳定的服务,而DeepSeek更像一个科研团队,在工程能力上距离国内的其他 大厂AI 团队差得太远了。他们的接口服务非常不稳定,并且也无法保证QPS的灵活调整。什么叫QPS呢,就是每秒钟可以承受的用户数,对于企业产品来说,可能平时每秒只有10个人访问,当时遇到热门活动,每秒钟可能飙升几十倍。例如我们在跨年上发布了Get笔记,平时的润色接口每秒钟达到20位用户同时请求就足够了,但是在跨年上,这个接口一下子达到了每秒钟3万的突发请求。这样的灵活调整,DeepSeek无法保证。并且我们自己观察,每天下午的4点到6点,DeepSeek的服务总会卡顿和超时。所以从作为一个科研团队拿出一个好的模型,到变成一家好的技术团队提供好的服务,这中间还有很多的课需要补。今天用这八条内容,给大家简单地分享一下DeepSeek爆火背后的八个关键点。这家迅速走红的中国AI公司凭借开源模型、极致性价比以及强大的推理能力,成功吸引了全球的目光。然而,技术突破背后,DeepSeek仍面临着工程能力、服务稳定性等严峻考验。它的成功,虽然为全球AI竞争增添了新的变量,但也暴露了其在实际应用中的潜力与挑战。随着AI行业的加速发展,DeepSeek能否突破瓶颈,实现从科研到市场的平滑过渡,仍需时日。未来,DeepSeek是否能在这场全球AI竞赛中稳居前列,值得我们拭目以待。后续他们有任何的进展,我也会及时跟大家同步。这篇内容依然是我在得到AI学习圈里的日更内容,这是第381篇。
最近几天,有很多新同学加入AI学习圈,我强烈推荐大家进圈先去查看新手必看指南,方便你对应需求去找到解法。毕竟AI不是某一个工具,而是一整个兵器库,而AI学习圈就是要帮你练好这十八般武艺。
特别提醒一句,如果你订阅了AI学习圈年度会员,我为大家准备了一份AI年度特辑电子手册。这本小册子,梳理了过去一年AI领域发生的大事,还有我跟智谱、秘塔等国内一线AI公司创始人的完整对话内容,还有学习圈同学共同推荐的27个好用AI工具。你可以在我的公众号后台回复“领取”,就能获得年度特辑电子版了。
