DeepseekV4,要从根上推翻“算力至上”
针探STI
Science and Technology Innovation
作者 / 针探局 岳轻
从“深度求索”转向“广度求索”
预热那么久、期待值拉满,全世界AI玩家盯着日历等。结果DeepSeekV4一发布,舆论场陷入了一片诡异的宁静。
硅谷几个大V第一时间跳出来表示“跑分没打过GPT-5.4,没打过Gemini 3.1 Pro”。国内某些KOL也阴阳怪气的总结称“开源到底是不行,黔驴技穷了”,AI还得看ChatGPT,还得看Gemini,那才是人类之光。
诸多言论,像极了一个长期压抑的人终于逮到发泄口,揪着“DeepSeekV4不够强”这一点,疯狂想要证明“东大AI落后十年”的陈词滥调。
奇妙的是,他们全都选择性地忘了去年,忘了R1发布那天英伟达单日暴跌17%,华尔街资本夺路狂奔,市值一天蒸发6000亿美元。忘了硅谷从傲慢的认为“中国AI落后十年”,到震惊于“DeepSeek怎么做到的”,中间只用了短短72小时。
更奇妙的是,V4发布时,官方大大方方坦坦荡荡的表示:“V4的能力水平仍落后GPT-5.4和Gemini 3.1 Pro约3至6个月。”
可问题是,当你还在拿跑分当标尺,DeepSeek已经换赛道了。这是一场根本不在同一个维度上的竞争。就像有人在高声争论谁的超跑零百加速更快,而这边在修铁路。你问他这辆火车零百加速是多少、比超跑差了多少,他都不知道怎么跟你聊。
我们先从几个角度,拆解下DeepSeekv4,到底想要做什么。
A.
先说V4最粗暴的动作,降价。
4月25日降了75%,4月26日再降,全系输入缓存命中价格被打到首发价的1/10。V4-Pro的缓存命中价低至0.025元/百万Tokens,V4-Flash做到了0.02元。知乎上有高赞回答感慨说,有种手机流量从5元1G变成5毛1G的感觉。特别是在全民养龙虾后、算力价格飙涨的背景下。
但这个价格是怎么降下来的?不是烧钱不是补贴,也不是互联网公司惯用的“先亏死对手再涨价”那一套。V4是从底层架构上,把推理成本给削平了。它自研了一套稀疏注意力架构,把Pro版单Token算力压到了V3.2的27%,KV缓存压到了10%。翻译成人话就是,过去要花100块钱电费干的活,现在27块就能干。
这都不能说是降价,而是直接把计价表和计价规则换了。而要理解这个降幅的冲击,我们就得回看一个老生常谈的话题——在华尔街的眼中,AI到底是什么?
是一场以生产力为表、金钱为里的资本游戏。这个游戏里有一张最重要的王牌——定价权。
游戏里的货币叫“算力”。一层一层的从业者告诉你:训练大模型需要海量算力,推理大模型需要海量算力,所以你需要海量的高端芯片,需要海量的云服务,所以你理所当然要支付高昂的溢价。
但问题是,1单位算力也就是1token,到底应该等于多少现实货币?这个定价是谁定的?凭什么由他们定?又凭什么让全世界接受他们的定价,然后用这套定价体系虹吸全球财富?
这就是华尔街AI游戏的底层逻辑。不是用枪炮摁着你的头,而是用“奇观”让你心悦诚服:给你看GPT-5有多大,给你看Gemini-3有多猛,告诉你“AGI就在眼前了”,然后账单就递到了你手里。
一旦你开始问“这东西真值这么多钱吗”,游戏就开始出现BUG。这就是R1发布时华尔街资本踩踏出逃的根本原因。R1并不是最强,但它是开源的,关键是作为一个顶级模型它训练成本极低,那凭什么我要支付几十倍几百倍的溢价去买“奇观”?
V4做了同样的事,只是方向不同。不是在冲击巅峰,而是在推平门槛。
为什么R1发布后华尔街恐慌,V4发布后却反响平平?因为华尔街看懂了DeepSeekV4的表层逻辑——普惠。既然你要玩普惠,那行,只要不影响老爷们继续讲故事建奇观玩游戏,大家就心照不宣。
B.
而V4真正的底层逻辑是,用技术跃迁,拿回算力定价权。
今天的AI产业,有一个所有人都默认的前提:AI的进步,必须靠堆更多算力、更多芯片、更大规模来实现。
我们从不否认这一点,但真的只有这一条路吗?
这个假设最大的受益者是谁?是芯片厂商,是云服务商,是整个以“算力稀缺”为叙事的供应链。链条的逻辑是:想做更好的AI吗?买更多芯片。想更快吗?租更多云服务。想做大做强吗?先交钱。
V4做的事,等于在告诉所有人,不一定。
V4没有卷参数规模,卷的是单位算力产出的价值密度。它的混合注意力架构用了一个更拟人的逻辑:假如要从一本1000页的书里找到所有相互关联的章节,笨办法是一页页的对比,每两页之间都要重算一遍,关联组合指数级增长,人力和精力消耗直线飙升。
聪明的办法是先快速浏览一遍,把每页的核心内容压缩成一句话摘要,然后只在摘要之间做关联判断,只在大概率相关的页面之间做精细对比。
两步叠加之后,原本几千次的“翻阅动作”被压缩成了几十次,工作量大减。
翻译成更直白的话就是,同样一块A100芯片,在你的架构上一天干100个活,在V4的架构上一天能干400个活。花同样的电费,交出的成果量相差几倍。既然一块A100能跑出接近H100的效率,那凭什么买H100的价格由你说了算?
这不是在争“谁更聪明”,而是在争“谁来定义聪明的成本”。而且V4已经完整适配华为昇腾NPU。从训练到推理,全链路都在国产算力集群上完成验证。下半年昇腾超节点批量上市后,这个成本还能继续往下压。
这动摇的不是一个模型排行榜上的座次,而是整个AI产业链的利润分配根基。因为一旦证明了最好的AI不一定需要最贵的门票,那整个定价体系就开始崩塌。
V4发布后,国外几个真正有分量的评价同样值得关注。其中一个AI领域大V的总结很有意思:这不是一个冲破天花板的SOTA模型,这是一个把地板抬高的基础设施模型。
做一个极致速度的超级跑车,全球只有几个富豪能开,这叫“冲天花板”。把铁路铺到每一个市、每一个县城,让人人都能长途旅行,这叫“抬地板”。V4的策略讲通俗一点,就是让那些原本被成本挡在门外的中小团队,可以进场了。原本因为太贵而没法跑通的商业模式,可以开始了。
V4最大的价值不是超越一个模型,而是重新定义AI的入口。
C.
最后,有一件事必须重新再讲一次:V4是在全面换装国产算力卡的背景下诞生的。
国产算力卡和当前国际顶级芯片之间,仍然存在差距,这是一个无需争辩的事实。这个事实面前,如果DeepSeek选择“继续卷高度”,那它的天花板是被物理锁死的——算卡不如人,算力不如人,再怎么冲极限,也会在冲到某一层之后撞上硬件之墙。
V4的选择,恰是这个现实约束下的最优解。不卷深度卷广度,不做奇观做基座。
不必过度苛求DeepSeek。从第一次惊艳世界开始,就已经代表着中国AI走了一条不同的路。这条路短期内不一定最耀眼,但长期看却是最适配自身环境的。
更值得留意的是另一个现象:从DeepSeek出来的那些技术骨干,几乎撑起了大模型的一个时代。
罗福莉去了小米,担任核心算法负责人。郭达雅加入字节跳动,担任Agent方向负责人之一。阮翀投身自动驾驶,进入元戎启行,还有很多没有主动站到聚光灯下的人正散落在各大厂和创业公司担任技术一把手,正逐渐把在DeepSeek时思考的技术方向落地。
这是一场还没有到结算时刻的棋局。收官之后,再说孰优孰劣、孰输孰赢。