V4来了,算力慌了吗?
还记不记得DeepSeek-R1发布时,英伟达应声暴跌17%,创下了历史单日最大跌幅记录;然而这次DeepSeek-V4更新时,英伟达却单日大涨4%。
周末市场讨论热度最高的无疑是已经预热了两三个月的DeepSeek-V4大模型,大众的预期被吊得极高,且普遍将其与华为昇腾的逻辑直接划上了等号。
但经过机构与专家的多场闭门电话会议后,产业内部得出的结论和反馈并没有大众那般亢奋。普通投资者在评价事物时往往容易陷入“二极管思维”,觉得要么是“夯爆了”,要么就是“拉完了”,这种极端的关注度往往会高估事件短期的爆发力,却又严重低估了其中长期的深远影响。
因此,我们需要拨开表面的喧嚣,客观、理性且深度地去拆解这起明牌事件背后的市场预期差、信息差以及复杂的产业博弈。
首先要明确的最大预期差在于,周五盘中发布的DeepSeek-V4仅仅是一个预览版,真正更完善的正式版要等到后半年才会更新发布。这意味着目前大家在全网看到的各种评测和声音,都仅仅是基于这第一代预览版所做的定量或定性分析。
从定性的角度来看,V4大模型确实已经达到了国内与国际的第一梯队水准。它保留了自研的稀疏注意力机制,并成功实现了对Token的压缩,带来了极大的效率提升。在推理阶段,其使用的GPU和显存大幅下降,整体消耗仅为原来的三分之一,实现了极其显著的降本效应。
这种降本直接体现在了极具破坏力的定价上:V4-Pro的价格仅为ChatGPT-4.5的六分之一,是Claude最先进模型的七分之一;而V4-Flash版本的价格更是只有V4-Pro的十分之一左右,相当于海外同级别模型六十分之一到七十分之一的价格。
虽然V4-Pro在极限上限、领域知识支持以及细节遗漏等方面,与海外绝对顶尖的大模型相比仍存在一些差距,但它在平均分数和稳定性上已经全面领先国内模型(在国内排名约第五、第六名),且其百万上下文的价格远低于海外顶尖模型,差距超过了50倍,同时也只是国内同类模型价格的六分之一到十分之一。
更具想象空间的是,官网介绍中明确标明,未来当昇腾950 Pro上线时,价格还会进一步大幅压缩。专家预计,到了下半年接近四季度,随着950超节点批量上市,V4-Pro的价格还可能再大幅下调60%甚至到80%。
必须郑重声明的是,这种断崖式的价格下探并非传统意义上的行业恶性“价格战”。这是DeepSeek结合自身技术优势与生态匹配所制定的底层商业战略。
随着持续降本,未来V4-Pro的百万Token成本有望降至10元以下,Flash版本甚至能降至1元以下,这将极大拉升全球对DeepSeek模型的调用量。
再配合比纯模型智能能力高出30%以上的Agent智能体,以及接下来电脑端和手机端智能体应用的全面爆发,将大幅推动DeepSeek在全球的普及,并以此构筑专属于国产算力的市场生态。在等待下半年国产算力真正放量之前,V4大模型还需要不断打磨自身,这也是为什么官方在发布后的第二天就开启了为期10天的2.5折优惠补贴活动,其核心目的就是为了快速收集海量数据进行后训练,以支持后续模型的进一步迭代升级,让后半年的正式版能够更加惊艳。
面对GPU和存储整体消耗降为原来三分之一的数据,很多投资者会悖论式地担忧:这是否会对算力硬件和算力租赁行业构成重大利空?
这种担忧在当初R1发布时也曾出现过,但随后被市场彻底证伪。
要搞清楚这个问题,必须对中美大模型的发展路径有清醒的认知。美国大模型走的是“力大砖飞、大力出奇迹”的路线,因为他们拥有最顶级的算力、存力和CPU,资源管饱且优先供己,训练顶尖大模型游刃有余。
反观国内,我们无法通过合规渠道获取海外最高端算力,而国产先进制程的大规模放量又要等到下半年。在这个算力青黄不接的窗口期,国内大模型只能追求“以巧破力”,将“省”字诀发挥到极致。
在产业逻辑里,当有人提倡通过软件层面去压缩消耗、提升效率时,其本质恰恰说明了底层硬件的极度稀缺与迫切需求。因为在硬件供给无法快速释放的背景下,没人会吃饱了撑的去优化无关紧要的东西。
DeepSeek-V4虽然提升了内存和算力的效率,但由于当前HBM的容量和带宽远小于算力卡的实际算力,这种软件层面的优化实际上是在解放HBM对重复任务的处理压力,变相增大了内存的带宽和容量,从而真正释放出GPU被压抑的真实算力。
如果不做这种“挤牙膏”式的软件减配与优化,系统效率的提升就无从谈起。这就如同没人会嫌弃自己电脑的性能太强或手机的电池太大一样。在进行科技产业分析时,我们需要的是基于常识的“模糊的正确”,而不是拘泥于技术细节的“精确的错误”。
另一个重大的预期差在于对“国产算力”的误解。很多非专业的自媒体将V4模型与国产算力完全划上了等号,这种基于民族气节的观点虽然令人振奋,但在投资上却极易产生误导。
真实的产业现状是:V4大模型完整的预训练,依然是建立在海外英伟达高端算力基础之上的,我们目前仍未完全摆脱对英伟达的依赖(因为只有英伟达B200以上的显卡才支持FP4精度的量化)。
虽然在训练端也对国产算力进行了验证,但这仅仅是在Flash版本里进行了涉及核心算法效率和训练收敛速度的小规模验证对比,并非全量部署。至于更强大的Pro版本,原本也规划了尝试验证,但经过评估后发现赶不上发布的节奏而作罢。
事实上,大模型在推理端的算力适配从2024年底就开始了,花费了一年半的时间才完成大部分高难度算法的适配。而训练端的适配难度更是推理端的两倍以上(因需覆盖的算子规模和种类极其庞大),目前国产大模型在训练端的适配仅进行了半年多,预计完全跑通还需要整整一年的时间。
正因如此,只有英伟达的最高端算力才能支撑当前大模型的预训练,这也解释了为何算力租赁行业至今仍能维持极高的景气度与机构关注度。国产算力(如昇腾芯片)的规模出货与算力租赁当前的高景气在现阶段是并行不悖的。
在推理侧,目前V4已经成功支持了华为的910B、910C、昇腾950芯片,并且寒王的部分算力卡也已完成适配。官方文章明确指出,后半年当950芯片释放以及超节点建立起来之后,将大幅放大V4的推理能力并带来推理成本的断崖式降低。
虽然这项技术已在论文中提出并经过验证,但目前尚未真实部署到昇腾节点中供大众享用。未来,随着更强的950芯片和超节点带来更充裕的算力,接下来的续训练(后训练)极有可能会迁移到昇腾平台上进行。
但由于昇腾950目前尚未大规模量产出货,预计用昇腾跑完一个完整的预训练流程要等到明年。实际上,正是为了与950PR芯片进行深度的磨合与适配,才导致了V4大模型发布节奏的延后。
产业的基本面需要一步一个脚印去兑现,绝不可能一口吃成个胖子去提前透支明年的预期,这需要尊重客观规律。
客观认知到中美大模型仍存在半年到一年的差距后,我们就能平和地看待评测中V4似乎“并不惊艳”的表现,杜绝膨胀的自信,踏实跟踪国产大模型的脚步。
当前资本市场对DeepSeek的生态位存在明显的误解:从上一代的V3.1、3.2开始,DeepSeek的核心目标就不再仅仅是去死磕闭源模型的性能,而是作为开源大模型的龙头,肩负起技术普惠和生态适配的重任。
它率先从训练端导入国产芯片,主动解决国产算力存在的痛点,并将大部分技术开源,这极大地降低了行业过去使用国产芯片的恐惧心理,加速了国产算力全链条的生态适配与发展,也为将来的国产算力创造了更庞大的需求。这些潜移默化的改变将在未来半年甚至更长时间的行业生态中引发巨变。
面对未来潜在的更剧烈的地缘脱钩或严格的出口管制,DeepSeek与华为实际上是在扛起中国AI大模型“民族化”与底层硬件国产化的大旗,重塑对海外CUDA生态的依赖,解决的是“有和没有”的生存问题。
正如美国《赢得AI竞赛行动政策文件》中所指出的:“谁拥有最大的人工智能生态系统,谁就能够制定全球的人工智能标准,并获得广泛的经济和军事利益。”
资本市场此刻可能还在短视地纠结于短期性能跑分,但产业的更上层关注的早已是背后的生态霸权;性能的差距尚可用时间去弥补,但生态的争夺已是刻不容缓。
那么,承载这一宏大生态的底层性能瓶颈该如何解决?
这不可避免地要落到大家最关心的“昇腾链”上。首先必须明确一个结论:近期昇腾链的新高行情,炒作的是全年出货量不断上调的预期,而绝非短期内的一季报业绩释放。昇腾产能从无到有、再到良率爬坡,本身就需要一个漫长的物理过程。相关企业从验证通过、接单中标、订单交付到最终确认收入,这同样需要一个完整的财务周期。
从供给节奏来看,昇腾950PR芯片在4月底才刚刚进入量产,预计5月底完成爬坡,到6月份出货量才有望达到6万颗以上。而性能更强悍的950DT芯片预计要在7月份才进行测试,直到11月中旬才会正式开始出货。
为了媲美海外高端算力,我们采用了“小芯片大连接”的超节点模式,用庞大的物理空间和极高的功耗(得益于国内充沛的电力)来换取性能,这项技术已经通过了大厂的验证。而采用了950PR芯片的昇腾超节点,预计要到9月份才会迎来规模化的出货。
这意味着,950芯片出货量和需求的超预期,要到下半年的三、四季度才会逐步体现在企业的业绩报表上。即将公布的一季报反映的仍然是老款910芯片的业绩(910在集群性能和生态系统上相对缺乏优势,且受制于生态需求和良率供给问题),因此大概率会低于市场的狂热预期。
机构真正瞄准的是下半年的基本面大反转。从下半年开始,国产先进制程将明显放量。2024年昇腾芯片出货量约为60万片,机构预期今年将翻倍至120万片,明年更是预期达到240万片。
随着DeepSeek-V4利用华为CANN生态不断动摇CUDA的统治地位,叠加国产先进制程设备和材料的全面导入与放量解决了历史良率问题,昇腾链正在迎来正式的反转,针对950芯片的加单甚至催单现象层出不穷。
为了彻底打破算力瓶颈并保障未来的GPU供应,国内已经预备了庞大的“5年50万片每月产能”的先进制程扩产计划。
伴随产能的充裕,昇腾的商业模式也在发生蜕变:以前因产能不足,芯片从不对外单卖,互联网大厂只能购买整机;而随着下半年放量,昇腾将酝酿共享生态,引入分销商进行销售。全年需求量预期的不断上调也催生了供应商体系的扩容:近期昇腾链在背板连接器模组和液冷环节引入了一些新的供应商,这并非因为原有厂商不够优秀,而是由于原有厂商扩充产能需要周期,新供应商由此迎来了从0到1的切入契机,尽管目前尚未拿到明确的市场份额。
最后,补充一个关于商业航天领域的重要预期更新:原定于4月28日发射的“长征十号乙”网系回收火箭,根据机构了解的最新信息,为了全力保障发射任务的圆满成功,对标上级重大任务部署要求并达到既定任务验收标准,以便在关键时期形成必要的战略警示与外部制衡,其发射时间已被调整至5月中下旬。
投资者需要及时更新产业预期,避免盲目埋伏于已经发生变化的计划之中。