福总讲实话

国产算力闭环:业绩与模式双爆发!

今年开年以来的这四个月时间里,国内科技产业一条最为核心的投资主线被反复验证,那就是整个“国产算力的闭环生态”。

这个闭环的底层逻辑非常宏大且清晰:我们要用国产设备制造出国产芯片,再用这些芯片去服务于国产大模型,最终向全世界输出极具性价比的廉价Token。

在这个闭环中,涵盖了自主可控、先进制程、昇腾产业链以及算力租赁等多个关键环节。经过前期的深度耕耘与持续跟踪,在刚刚过去的四月底年报和一季报密集披露期,这条主线迎来了全面的业绩收获。

不仅此前在市场错杀时被反复强调的算力租赁板块交出了爆表的业绩,那些曾被市场忽略的半导体靶材也实现了业绩的集体超预期。

此外,伴随着先进制程扩产的前道设备,特别是光刻机领域先后演绎了“刻”与“光”的逻辑,以及后道封装测试环节、光刻胶等,纷纷用创出新高的业绩,实打实地证明了国产替代的推进速度与极高的产业景气度。

在底层硬件高歌猛进的同时,国内AI应用端也迈出了具有行业标杆意义的一步:豆包正式开启了商业化收费之路。目前豆包推出了标准版68元、加强版200元、专业版500元的分层订阅模式。

虽然基础的免费版依然存在,但如果用户需要处理诸如制作PPT、进行复杂数据分析或影视制作等进阶任务,就必须付费使用。

这背后的底层原因在于,复杂的任务会消耗成倍的算力与推理时间,带来极其庞大的硬性成本。目前,豆包的日均Token使用量已经突破了惊人的120万亿,在过去短短三个月内翻了整整一倍,相较于其刚发布时更是暴增了1000倍。

在当前中国AI应用普遍面临着“叫好不叫座”的变现困境下,豆包通过分层订阅来探索高价值场景,是对C端用户付费意愿的一次极其重要的测试,同时也是为了覆盖日益高昂的算力和推理成本。

这一现象进一步确证了当前算力极度供不应求的产业现实,使得短中期能够缓解燃眉之急的算力租赁,以及中长期依靠国产算力卡和H200引入而放量的数据中心(AIDC),其稀缺性价值被进一步放大。

全球范围内的算力紧缺与涨价逻辑也在不断被更多的数据所实锤。

在美股市场,5月4日北美H100和B200的算力租赁服务价格较4月30日分别大幅上涨了22%和6%,直接带动了美股数据中心和算力租赁板块的大幅走高。

这轮涨价的背后,是北美几大头部云厂商明确上调了对AI资本开支的前瞻指引。这种疯狂的涨价同样精准地反映在了底层的现货黄牛市场上:在4月中旬,一台B300服务器的现货报价还是545万元;到了4月30日,黄牛的报价已经攀升至643万元;而到了五一假期即将结束时,B300服务器的价格已经悍然突破了700万元大关。

紧缺、涨价、满产满销,这些因素促使算力租赁、存储以及CPU成为了能够与海外逻辑产生共振的北美算力最强方向。

但需要特别指出的是,与存储和CPU“只要愿意出高价就能买到”的逻辑不同,GPU相关的算力租赁叠加了一层严格的出口管制属性,这变相且强硬地收紧了供给,在需求呈指数级爆发的当下,其景气度获得了额外的溢价。

这里存在一个巨大的市场信息差:虽然服务器的采购价格越来越高,算力租赁新签的服务价格也会水涨船高,但头部算力租赁玩家的拿货出厂价其实并没有改变。

因为这些头部企业本身就是英伟达的全球云服务合作伙伴,能够以无中间商赚差价的方式拿到最便宜的一手货源。相比于那些被迫去抢700万一台第三手货源的二线厂商,头部玩家的净利率空间要庞大得多,进一步印证了“拿卡能力决定强者恒强”的行业铁律。

随着豆包在达到3.45亿月活用户后将重心转向付费运营与转化,AI应用端付费习惯的形成将有效降低底层的算力投入压力,并直接催生了算力租赁行业下一步的重大商业模式升级——“Token分成”与“Token工厂”。

这一模式在今年二季度已经开始逐渐落地。从海外Nebius收购Eigen AI并转型为Token工厂的动作就可以看出,这代表了算力服务演进的必然方向。

传统的算力租赁是一门重资产的资源生意,厂商按月向客户收取固定的服务器租金,客户购买的是底层硬件的物理控制权,收益稳定但存在刚性上限。

而Token分成模式不再按卡计费,而是按照大模型实际产生的Token调用量进行收益分成。在这个模式中,服务器折旧和电力消耗属于刚性的固定成本,这意味着由Token调用带来的超额分成收益,几乎全部都能转化为纯利润,为算力租赁环节打开了极高的利润弹性。

Token工厂则是支撑这种分成模式的新型算力生产与服务形态。它从系统工程的角度出发,通过平台级的调度、算力软硬件的深度融合以及模型推理的极致优化,来大幅提升吞吐量并降低单Token的成本。

未来的计算设施将转型为专门生产Token的工厂,其核心商业竞争指标将从单纯的算力规模,让位于每瓦的Token吞吐量与能效比。算力企业只有构建起这种平台级的调度能力,才能满足大模型厂商极高的合作门槛,进而切入到高附加值的Token分成体系中。

在实际的商业落地中,这种模式展现出了极其夸张的盈利潜力。以某家正向Token工厂转型的公司为例,其计划将各类以闭源为主的模型部署在自身的算力中心,基于API调用的Token与模型公司进行分成,预计将切走高达70%的Token收入。

因为对于大模型厂商而言,现阶段模型能力再强,如果没有底层算力转化为Token输出,就不会有任何实质性收入,因此他们愿意让渡60%到80%的销售收入给算力服务商。

在这样的分成比例下,只要日均AI调用量跨越了约定的阈值,优秀的软件优化甚至能让Token服务带来的收入达到传统裸算力租赁的5到10倍,推动头部厂商的净利率从15%强势逼近30%以上,测算下来两年多即可完全收回成本。

该公司目前计划在五象云谷落地4个万卡集群,二期AIDC的电力容量将达到一期的10倍,并筹备了约300亿的资金规模来支撑这一战略。

那么,Token工厂究竟是如何通过精耕细作来实现如此大幅度的毛利提升的?

答案在于对算力的极度精细化切割与错峰调度。

传统的长约租赁模式下,设备租出后使用效率完全取决于单一客户;而在Token工厂模式下,通过将算力“按需切分”,白天与夜晚的用户、长短任务的时间差、复杂与简单任务的模型匹配,都被完美地错开和调度。

这种方式在不增加任何硬件成本的前提下,极大地提升了算力的整体使用率。

假设每日的有效使用时长从当前的约8小时提升到12小时,算力的使用效率就能直接跃升50%。为了快速抢占市场,目前Token工厂的初期收费标准仅为市场主流大模型对外报价的7折左右;未来即便Token市场价格下跌,凭借有效时长的拉升依然能够对冲降价风险,从而保持远超传统租赁模式的长效盈利能力。

这种商业模式的演进,彻底打开了传统算力租赁行业的天花板与市值空间。

然而,在市场对算力租赁板块极度亢奋时,也必须保持清醒的理智,不能简单地对价格进行线性外推。产业专家明确测算过,700万一台的B300已经是大厂采购的盈亏平衡线,再往上突破将导致五年内都无法收回成本。

未来依然潜藏着诸多变数与风险:比如互联网大厂联手限价采购、竞争对手相互举报导致灰色渠道彻底收紧、地缘缓和带来H200的放开,以及今年八九月份到明年国产先进制程产能翻倍甚至翻两倍的扩出。

更深层次地看,硬件的高溢价本质上来源于算力的短期稀缺,但技术的演进有着一条残酷的规律:凡是足够贵、足够重复、足够刚需的东西,最后都会被整个产业链一点点优化掉。当前的AI之所以吞噬着海量的GPU、内存和CPU,是因为很多模型还处于早期阶段,训练粗糙、推理昂贵、显存浪费严重且调度效率低下;企业为了抢夺时间窗口,只能被迫买单最贵的芯片。

一旦成本越过临界点,整个行业就会自动切入降本模式,通过模型压缩、量化、蒸馏、稀疏计算、新架构、边缘部署以及自研ASIC等手段,让同样的任务消耗更少的算力。今天需要顶级GPU集群才能跑通的任务,几年后可能只需要中端的纯国产芯片,再往后甚至能在本地设备上直接运行。摩尔定律的经典速度虽然放慢了,但通过架构优化、先进封装和并行计算,单位计算成本长期下降的趋势依然不可逆转。

尽管短期内算力缺口依然坚挺——正如谷歌CEO在一季报电话会议中所透露的,最近算力受限直接影响了云收入的上限,且未来24个月内仅能消化50%的积压订单,这意味着强劲的需求能见度已延伸至2028年——但硬件的高毛利绝不可能永远维持。

拉长到10到15年的维度,算法效率的提升、云厂商自研芯片的量产、开源生态的成熟以及客户议价能力的增强,都将逐步压缩单纯的硬件溢价。近期外媒报道DeepSeek估值逼近450亿美元,且国家大基金正领投谈判。

大基金过去主要投资中芯、长存等半导体制造硬件,现在开始重金投入软件和模型,其核心目的就是为了彻底打通整个生态闭环,创造出“中国设备-中国芯-中国模型”的宏大产业生态。

硬件赚钱靠的是阶段性的稀缺,而软件的优化会不断稀释这种稀缺;真正能够跨越周期、享受长期复利的公司,不能仅仅停留在倒卖昂贵的芯片上,而必须最终蜕变成为平台、生态与行业标准的制定者。