Z Potentials

Z Potentials|对话安纳智芯:所有人都想造下一个GPU,但我们想开启下一个时代

Image
Image

过去几年,一个判断逐渐成为全球数字计算发展中的共识“卡点”:短期缺卡,长期缺电,一直缺存储。

Agent 需要更低成本地完成长链路任务,机器人需要在物理世界变化前做出控制决策,6G 需要在大规模天线系统中实时处理信号……一个更具体的问题也被推到台前:当大模型算力继续向前,能不能把复杂约束下的答案更快、更低成本地求解出来?

于是,被数字计算压制了半个多世纪的模拟计算,再度以光计算、自然计算、热力学计算、物理计算等不同“分身”被推到台前。资本也在持续押注。

在硅谷,2025年才成立的美国公司Unconventional AI种子轮就拿下4.75亿美元融资,由Lightspeed Venture Partners和A16Z领投,估值逼近45亿美元。

在中国,同样是2025年年底才成立的安纳智芯,也因为做出了可以在“精度上媲美数字计算”的模拟计算芯片,并获得由经纬创投领投、峰瑞资本、阿尔法公社以及老股东讯飞创投、中赢资本跟投的亿元级天使轮融资。

相比于光计算、热力学计算等不断出现的新标签,他们更愿意把安纳智芯定义为一家现代模拟计算芯片公司。因为在他们看来这些新标签,本质上都是模拟计算的不同“分身”。

通过基于新型存储器的模拟计算架构,他们成功第一次让模拟计算在精度层面接近甚至对齐数字计算,并以矩阵方程求解这一长期缺失的基础算子为切口,重新定义计算机的底层能力边界。

从他们的角度,GPU时代的竞争,本质上是在既定范式里做渐进式优化;而模拟计算所面对的,则是一次关于“计算本身是否可以换一种范式”的问题。

本期,Z Potentials与模拟矩阵计算技术开创者孙仲(北京大学人工智能研究院研究员)、安纳智芯CEO向锐,围绕这一条被重新打开的路径展开对话。

关于模拟计算为何在历史中长期退场,又为何在AI时代重新出现;关于矩阵求逆为什么可能成为训练与具身智能的核心算子;以及在数字计算统治世界七十年之后,一种新的分工是否正在浮现:让矩阵归模拟,让逻辑归数字。

以下是本次访谈的对话实录,经编辑修改,enjoy~

  • 人类文明在每一个阶段,只要想发明一种计算工具,去帮助人类做计算加速,或者替代一部分脑力劳动时,最先想到的其实都是模拟计算

  • 矩阵求逆(除法)是“知果求因”,用反向求权重加速大模型训练

  • 光计算、热力学计算、物理计算、自然计算……本质上都是模拟计算

  • 高精度是模拟计算最重要的研究哲学

  • GPU 时代中国是跟随者,模拟计算这条路上,中国可能第一次是定义者

  • 让矩阵的归模拟,让逻辑的归数字

01 模拟计算的一大步:实现可以媲美数字计算的精度

ZP:你们团队的研究成果去年入选了“国内十大科技新闻”,被评价为“解决了模拟计算的世纪难题”,模拟计算已经存在这么久了?

孙仲:应该说模拟计算已经存在了上千年。人类文明在每一个阶段,只要想发明一种计算工具,去帮助人类做计算加速,或者替代一部分脑力劳动时,最先想到的其实都是模拟计算。

第一台数字计算机ENIAC诞生(1946年)之前,人们就已经在研发模拟计算机——这不是偶然,而是因为模拟计算符合人类独特的认知方式。

我们在场景A里解决了问题,到了场景B天然会尝试用类似的方法去解决。虽然没有任何理论告诉你类比会成立,但人类就是会这么思考。

模拟计算,就是类比计算。它的本质是把一个数学问题,直接类比到一个物理系统上,让物理系统自己把答案算出来,而不是先把问题转成0和1,再映射到物理信号上,这就是它最准确的定义。模拟计算的优点也非常突出:快、省电、并且是最自然、最符合人类直觉的方式。

那为什么到现在为止,依然是数字计算而非模拟计算占据统治地位呢?核心就是因为:精度差异。

数字计算只需要区分0和1,因此很好的保证了精确性。在摩尔定律的赋能下,早前数字计算获得了巨大的发展机会。可以说如果没有摩尔定律就没有今天的数字计算。因为除非我们有足够多甚至可以浪费的资源做前提,那就没有人会愿意用上万个晶体管,只为了做一个乘法或加法。

可对集成电路、对底层计算原理理解比较深的人来说,数字计算很低效。很难相信人类的大脑真的在做逻辑门运算,有无数个AND、OR、NOT在脑子里跳。

而模拟计算恰恰相反,它是一种更自然、更符合物理本质,也更具有物理直观性的计算方式。

安纳智芯正在做的,就是把模拟计算最大的缺陷,也就是精度问题攻克,我们的模拟计算现在可以实现媲美数字计算的精度,这是真正把模拟计算的精度往前推了一大步。

02 一步 vs 亿步:当模拟计算原生实现矩阵除法

ZP:安纳智芯的核心技术是矩阵求逆(除法),这和大家都在专注优化的乘加路线不同?

孙仲:人类发明计算机,真正想解决的计算问题就是加减乘除,所以只要你设计的计算机能够做加减乘除,理论上就可以完成所有计算任务。

从标量进入矩阵空间也是一样。无非是矩阵加法、矩阵减法、矩阵乘法、矩阵除法——也就是矩阵求逆。

过去无论是存算一体、还是GPU,大家主要都在做乘法。或者更准确一点,是做矩阵乘法。但我们提供的,是另外一个更核心、更难的基础算子——矩阵求逆,这也是我们和现有路线最核心的区别。

如果把乘法理解成一个前向传播的过程。我们知道原因,然后去推结果。除法则是知果求因——你已经知道了结果,也知道背后有原因A、B、C、D。但你不知道它们各自的权重是多少,这个时候你要做的就是反推,最后你可能算出来,A是0.1,B是0.3,C是0.5,D是0.1。

这个过程就是矩阵求逆。在一般的理解中,从原因推结果,很容易。从结果反推原因,会很难。所以我们做的最核心的事情,就是去加速这个过程——也就是把原本最难的那个基础算子,做得足够快。

如果把它类比到AI里面,其实就非常好理解。前向传播,是推理;反向求权重,是训练。

你已经有了输入,也有了输出,但你不知道中间的权重参数。你要不断去反推,把权重找出来,这个权重本质上就是AI模型里的参数。所以从AI的角度看,我们真正在加速的,是大模型训练。

ZP:具体讲讲AI训练为什么要用矩阵求逆加速?

孙仲:现在AI训练主流基本都是一阶方法,国内有两家大模型公司开始用二阶优化器。

在模型训练中,一阶优化更像是摸着石头过河。你走一步,看一步,再走一步,再看一步。很多时候,你可能要走10000步,才能走到那个最低点,也就是优化问题里的能量谷底。

但二阶是一个反向求权重的过程——不仅知道你现在往哪里走,还知道地形是弯的,坡度是怎么变化的。所以它可能100步,甚至更少,就能到同样的位置,而且往往能找到更低的能量点。也就是说,它最终训练出来的模型,可能不仅收敛更快,而且效果更好,更准确。

二阶很好,但问题是太贵了,因为二阶优化涉及矩阵求逆。

矩阵乘法很简单:规模扩大10倍,算力投入大概也是10倍。但矩阵求逆不是线性的。很多情况下,它是平方、甚至立方复杂度。这意味着,当规模扩大10倍,你的计算成本可能变成100倍,甚至1000倍,这个代价就太夸张了。

所以矩阵求逆,就是整个二阶优化里最关键的那个算子。安纳智芯要做的事情,就是把矩阵求逆在芯片层直接做快,给用户一个天然适合做矩阵求逆的计算单元。

如果这件事成立,整个AI训练中一阶和二阶的权重都会快速调整。

ZP:矩阵求逆没法做在GPU里面吗?

孙仲:在NVIDIA GPU这样的数字芯片里,没有原生做矩阵除法的能力。

它做除法的方式,是把一个除法问题分解,然后通过软算法上的迭代,最后把它变成一连串矩阵乘法,不断逼近最终答案,而非直接求解。这个过程,步数会非常多。

一个512×512的矩阵方程,在数字芯片里完成一次求解,大概需要几亿次乘累加才能逼近那个除法的答案。

模拟计算芯片则是原生求解,一步就能完成,不是迭代逼近,而是真正的一步完成。所以这不是快一点,或者省一点,而是计算范式本身不同。

在我们的芯片真正问世之前,世界上没有任何一颗芯片可以原生做到这一步,这也是为什么我们觉得,这件事非常有意义。

ZP:二阶优化在具身智能这些领域也会有应用吗?

向锐:当然有。准确地说,不只是二阶优化,而是矩阵求逆本身,在具身智能里本来就是一个非常核心的算子。

机器人每天在做的无非三件事:预测、判断、规划。这三件事本质上都在解方程。

比如你想让机器人走到某一个点。结果你已经知道了,问题是怎么走过去?每一个关节该转多少度,每一个执行器该输出多少力,每一步该怎么走,这些都不知道。而当你知道结果,但你要反推原因,就是矩阵求逆。

不管是今天大家讲的具身智能,还是更传统的机器人、工业自动化。你想要最优控制,才能以最小能耗、最短路径、最高稳定性完成动作,这些本质上都是优化问题,最后几乎都会退化成矩阵方程求解。

ZP:大家都相信真正的智能最终要靠 scaling。你觉得在数字计算占据主流的情况下,模拟计算路线也能帮助模型实现scale up吗?

向锐:在scaling这件事上,我们没有任何问题。很多新型计算范式喜欢强调“快了1万倍、10万倍”。但很多时候,它们说的是计算核心内部速度,不包括输入输出,不包括前后接口。

从一开始设计芯片时,我们就把这个问题考虑进去了。我们的芯片前后都是有接口的。它处于数字域之内,和现在所有的设备、计算中心、计算环境,本质上是相匹配的。

更直白地说,我们的选择一定是数模混合,没有数字(计算)你解决不了精度问题。

GPU怎么互联,我们也可以怎么互联。因为我们对数据的要求和GPU是一致的,可以直接接入现在已经scaling的算力。

ZP:可以再具体点解释你们认为的模拟计算和数字计算之间的关系?

孙仲:打个比方。比如你要建长城,长城是用砖砌起来的。模拟计算矩阵求逆可以直接给你砖,但数字计算不是这样,它手里没有砖,它可能只有沙子、泥土这些原料,先烧制成砖再去建长城,所以它不是不能做,而是它绕得太远,成本太高。

当然另一方面,如果你要的不是砖,比如你要的是一个三角形,或者是别的特殊结构,那我们可能没有现成的。那你还是得回到原来的方式,用泥土(数字计算)一点一点去堆。所以我觉得,未来更合理的状态,一定是互补。

不是谁彻底取代谁,而是谁更适合做什么。我们认为的理想的分工应该是:让矩阵归模拟,让逻辑归数字。

03 从0到1:做高精度模拟计算的定义者,而非优化者

ZP:为什么偏偏在这个时间节点,一些非主流AI芯片和新计算路线纷纷涌现?

向锐:从2012年算起,GPU高速发展到今天也已经十多年。任何一个成熟的技术路线,发展到这个阶段,都会开始思考下一步是什么。没有人会觉得GPU可以永远持续下去,它一定会被替代,就像CPU不会永远统治计算一样。

这一点在国外更明显。在硅谷,几乎没有投资机构再去投一家和英伟达正面竞争的GPU公司。因为真正有价值的机会,一定在更远的下一代计算方式。

数字这条路,大家已经非常熟悉了;而另外一条能走的路,自然就是模拟。

ZP:黄仁勋在GTC上也提到,他们开始投资一些光计算公司。与此同时,市场上也开始出现各种新的概念,像光计算、热力学计算、模拟计算、自然计算、物理计算,这些名字都很火。但这些东西背后,到底是CPU、GPU故事的延续,还是说它们真的代表了不同的计算范式?

孙仲:你刚刚说的这些,本质上都是模拟计算,都是analog computing。

比如光计算,本质上就是光模拟计算;热力学计算,本质上就是热力学模拟计算;本质上,它们都在强调,不再经过抽象,而是直接做类比,直接做映射,直接利用物理世界本身的规律去完成计算。

所以如果你从物理和数学的底层去看,整个计算世界其实没有那么多故事。真正的底层结构,就这两个维度:1经典和量子;2数字和模拟。

ZP:你提到,矩阵计算会专注覆盖90%的核心场景,而且它不像CUDA那样,一开始就依赖上层大量的软件封装和开发者生态。那如果未来有其他公司、其他团队,也开始做类似的产品,你们的护城河在哪里?

向锐:很多人说英伟达最大的护城河是它的大生态。

我觉得这句话,放在今天讲是对的。但如果你回到NVIDIA成立的第一天,它是没有这些东西的,那个时候,它怎么从1993年的英伟达,走到今天的英伟达?

那是一个非常漫长的过程。英伟达早期硅谷有90多家GPU公司,英伟达只是其中一家,技术路线其实都很接近,甚至早期英伟达也犯过很多错误。

但黄仁勋做了一件很关键的事情,先把最硬核的工程能力做到极致。先保证,当芯片解决这类问题的时候,它就是最优秀的。

十几年前,英伟达最担心的,也不是CUDA生态。它担心的是自己能不能活下来,能不能在图形处理方面比其它所有人都做得更好。有了这个基础之后,才有后面的生态,才有CUDA,才有今天的开发者社区。

所以我们现在做的事情也一样,在这个阶段,我们首先要保证,安纳智芯的芯片在解决我们擅长的问题时,工程能力就是最强的。等这个基础建立起来之后,我们才会逐步构建属于我们自己的生态。

那个时候,真正的护城河才会慢慢形成。

ZP:那有没有一些比较明确的指标,可以去评估你们和同行之间的差距?

向锐:目前我们的模拟计算可以做到与数字计算相媲美的精度,并且形成了全球首个矩阵方程求解加速器方案,这在公开记录中是全球领先的。对我们来说,最关键的差异,不在于一和二,而在于有和无。

有没有真正跨过高精度这道门槛才是本质区别。如果从芯片层面来看,我们肯定是第一家基于新型存储器实现高精度模拟计算芯片的团队。

ZP:Jeff Dean之前在一次采访里提到,做硬件,尤其是像TPU这样的芯片,往往要提前好几年去判断未来的技术范式。因为从设计、流片到量产,本身就是一个非常长期的过程。很多时候,你今天做的芯片,是在赌几年之后整个AI会往哪个方向走。那你们怎么看模拟计算是否面临同样的挑战?

孙仲:我觉得这里有个重大区别——像TPU这样的数字芯片,它诞生的时候,整个数字计算其实已经发展了70多年。

从1947年晶体管发明开始,到后来设计GPU、TPU,整个数字世界已经非常成熟了,所以他们面对的问题,其实是99%到99.1%的提升。看起来只是0.1%,但非常难,因为你已经站在一个高度成熟的体系里,每往前一步,代价都很高。

但我们不是在优化一个已经定义好的世界,我们本身就是高精度模拟计算这个方向的定义者。

尤其是高精度模拟计算这个方向,具备商业化可能性的,我们现在真正能看到的竞争对手其实非常少。

ZP:那会不会还有一种可能性,就是低精度的模拟计算未来可以在一些新场景更快速的商业化落地?

孙仲:所有计算机的发展规律都一样,一定是先把精度做到天花板,再根据场景需求往下做取舍,而不是一开始就在地板上说这样也够用了。

精度问题必须先解决,这是所有计算机的基本逻辑。数字计算也是这么走过来的。从8位,到16位,到32位,到64位,先把精度做到足够高,满足几乎所有计算场景。然后才开始往下优化,从FP32到FP16、FP8、INT8、INT4。

精度和能效永远是一组权衡,你想要更高精度,就要投入更多资源,花更多时间。早些年,整个行业都沉浸在一个思路里,模拟计算功耗低、速度快,哪怕精度低一点也没关系,很多场景4-bit、2-bit就够用了。

但实际上只要有极小概率会出问题,这样的路线最终都不会被采用。后来我们意识到:如果精度问题不解决,模拟计算永远只能是一个研究中的技术,永远进不了真正的大规模计算。

所以我们做了一个很激进的决定:不再接受“低精度够用”这个前提,而是直接去解决高精度。我们坚定地想把模拟计算真正做成 a new computer,一台新的计算机。

04 被高估的是忽略精度谈性能,被低估的是应用场景的广度

ZP:芯片设计到流片到量产,你们现在到哪个阶段了?

向锐:第一次流片已经投片,第二次流片也进入排期,目前团队在紧锣密鼓地做相应工作。

ZP:之前有一些报道提到,模拟计算或者非冯诺依曼架构,似乎和先进制程有关系。是这样吗?

向锐:目前来看,制程和我们的计算范式革新,是解耦的。

当然我们同样希望用最先进的制程,如果有一天,中国自己的先进制程完全突破了,那我们当然也希望第一时间用上。

ZP:大家会觉得,模拟计算作为一种非冯诺依曼架构,某种程度上是在挑战过去几十年的计算机体系,甚至是和数字计算完全不同的一套范式。所以外界对它天然会有不少期待。那在这些期待里,有没有一些被高估和被低估的地方?

孙仲:模拟计算最被高估的一点,是很多人在不讨论精度的前提下,去宣称巨大的算力提升和能效提升,并且拿出非常漂亮的性能数字。

过去大家做存算一体,很多应用集中在AI推理。AI推理在低精度下依然能工作,这件事本身是成立的。但问题在于,低精度并不能覆盖所有场景,一旦你面对一些极端情况,或者更广泛、更严肃的通用计算需求,低精度往往是不够的。

高精度不是一个“可选项”,它应该是一个“必选项”。你必须先证明,你的系统在高精度条件下依然成立,依然能跑,依然有优势,然后我们再去比较它的算力、能效、成本。

向锐:而最被低估的地方,是它的应用场景。

目前我们讨论了很多AI、具身智能,以及一些特定的商业场景,但这不是这项技术的全部。从19世纪的桥梁力学分析,到20世纪的信号处理,再到21世纪的AI,矩阵方程求逆贯穿于人类社会的方方面面,每个小场景都可能遇到这种需求。

比如电池BMS里面有一个非常重要的线性拟合过程就是矩阵方程求逆;具身智能领域更是数不胜数,AI领域、通讯领域,矩阵方程求逆是一个非常核心的过程,但一直没有专属的矩阵方程求逆加速方案。

所以安纳智芯的芯片不应该只被视为AI或具身智能领域的工具,它会影响更多层面,甚至有些层面现在我们都想象不到。但正是因为技术底层的这种变化,会让很多场景变得更好,更适合未来的发展。

05 闭环已形成:矩阵加速、训练低成本、端侧后训练

ZP:能不能帮我们梳理一下,安纳智芯从底层驱动力到技术路径选择,再到最终应用,整个逻辑链条是什么样的?

向锐:安纳智芯这家公司的诞生,首先是源于矩阵运算需求的爆发,这是最基础的驱动力。

在这个矩阵运算里,有两种路线,一种是数字计算,一种是模拟计算。模拟计算天然适合做矩阵运算。为什么之前不能做?因为精度问题。我们刚好解决了这个精度问题。所以逻辑上已经形成了一个闭环。

在模拟计算里,安纳又选择了作为电路类的模拟计算,比光、热或者其他物理计算更有优势,成熟度更高,而且它不光是计算,还有存储能力。

矩阵运算分为加减乘除。安纳智芯一直在攻克矩阵方程求解这个慢且昂贵的难题。在应用方面,我们的领域不是数字计算里的通用场景,而是矩阵加速,尤其是大规模AI训练中的矩阵加速,我们既能让训练变得低门槛——毕竟绝大多数人都希望在端侧快速拥有自己的模型;也能让AI变得更安全。

同样可期的是具身场景。现在机器人已经很灵活了,可以跳舞、做运动。但具身智能专家跟我们抱怨现在所有的具身智能都是“岗前培训”,它为什么不能进工厂?因为它没有办法做“岗前培训”。

“岗前培训”翻译过来就是后训练。后训练需要芯片,如果拿数字芯片去做后训练,会非常庞大、功耗极高,在端侧设备上无法实现。我们这块芯片的出现刚好填补这个空白。所以对AI的影响,第一就是让训练成本变得非常低,未来很多场景都可以做后训练,让AI模型更适配个人、更适配公司。

以及在另外一些端侧场景,我们的芯片可以让自动驾驶更密集打点,安全性和各方面都会变得更好。无人机也一样,更灵活、更迅速、更节能。

ZP:聊到最后,你们怎么看自己在这条路线上的位置?

向锐:我相信我们已经跳出了框架,在另外一个地方开辟了新的路径来解决原有的难题。

我们可能会面临新的问题和挑战,但跟数字芯片时代完全不同。毕竟打败GPU的不会是下一个GPU。

请注意,此次访谈内容已经过精心编辑,并得到了孙仲和向锐的认可。有兴趣加入公司的读者可以通过Z Potentials 联系公司 ,我们也欢迎读者通过留言互动,分享您对本访谈的看法。

Z Potentials 将继续提供更多关于人工智能、全球化市场、机器人、智能硬件等领域的创业者访谈。我们诚邀对未来充满憧憬的您加入我们的社群,与我们共同分享、学习、成长。

Image
Image
Image
Image
Image
Image