Z Potentials

Z Potentials|专访Aether AI黄碧薇:第三代因果AI领头人,一位不追热点的女科学家重新定义世界模型

图片
Image

文|武静静

推荐语

当大模型、视频生成与具身智能掀起一轮轮浪潮时,Aether AI创始人黄碧薇却选择了一条“慢”路:让 AI 真正理解世界背后的因果规律。值得一提的是,这条路,她已经走了十余年。

作为美国加州大学圣地亚哥分校(UCSD)助理教授,黄碧薇的学术轨迹几乎与因果 AI 的当代演进同频。她亲历并推动了这个领域多个关键方向的突破。但与许多研究者不断向外开疆拓土不同,她的路径始终向内、向下——追问本源。

起点,源于本科时一门神经网络课程,激发了她对“大脑如何启发 AI”的兴趣;随后,她进入中科院神经所,投身计算神经科学,试图用机器学习理解大脑。但她逐渐发现,现有工具无法解释神经元之间纷繁复杂的交互,相关性统计在真正的生物系统面前显得苍白。

转折发生在德国马普所。当她第一次接触到因果理论,并被辛普森悖论震撼后,一个念头清晰浮现:仅仅依靠相关性,永远无法触及系统运行的本质。于是,她转身前往卡内基梅隆大学(CMU),深耕因果发现与 Causal AI,追寻更底层的世界规律。

当大模型时代呼啸到来,学术界与工业界几乎一边倒地拥抱规模化(Scaling)信仰。黄碧薇却保持了反思:“很多技术路线,如果不试到一定阶段,人们是不会相信它走不通。而现在,大家慢慢开始意识到,只靠记忆和模式匹配,很难让系统真正具备理解能力。”

在她看来:真正的智能,最终必须理解世界为何如此运转,而不只是预测下一步会发生什么。

从计算神经科学到因果 AI,再到今天的因果世界模型,每一次转向看似跨度巨大,但吸引她的一直是:“如何从更本源、更深层的角度去理解问题。”这种近乎执拗的追问,也让她成为因果 AI 领域少数走向创业的人。

2026年,黄碧薇创立了因果世界模型公司Aether AI ,并迅速完成约 2000 万美元的种子轮融资,由经纬创投领投,英诺基金、SWC Global、九合创投等机构联合参投。

这是一条少有人走的路。如今世界模型几乎都沿着3D、视频生成或者 JEPA 等路线不断演进,而Aether AI 作为一家创业公司,试图构建一条没有人定义的第四条路径——让模型真正理解状态之间如何迁移、规律如何演化,通过因果关系复刻物理世界的底层运行法则。

他们更长远的目标,是建立一套贯穿系统层、基础模型层、神经网络架构层乃至 Transformer 底层机制的全新范式,推动 AI 从“相关性驱动”走向“因果驱动”。

Aether AI 的第一站落在 Physical AI,但机器远非终点。生物、材料、金融乃至科学发现,都可能成为同一套因果世界模型的延伸场景。

“我们更像一家 Frontier Lab。”黄碧薇希望搭建的,并不是一个针对单一场景的产品公司,而是一种新的算法范式,重新定义智能何以可能。

Highlight

  • 因果视角能让人在科学研究甚至现实生活中,一下子看清问题的本质。而不是仅仅看表面。理解背后的因果关系和整个数据生成方式,你就有一个 unique(唯一)且最本质的解。

  • 我独立之后也意识到一个问题:那时候我们太注重单点突破和理论创新,从而忽略了把它做成一个系统(system)。因为你只有真正做成系统之后,它才能在实际中真正用起来。

  • 我不喜欢去 follow(盲从)热点。我必须自己觉得这个事情是真正有意义、真正合理的,我才会去做。我不会因为市场上大家都在做,我就去做。

  • 做科研非常依赖直觉。但这个直觉是通过不断学习、在更广(broad)和更深(deep)的维度上训练出来的。

  • 我们一直强调的是理论和算法上的突破,去想算法和模型架构怎么设计得更精巧。但这样做的代价是,我们忽略了数据量和模型 size 的层面,同时也没有想过真正做一个可用的应用给大众,在系统层面的考虑是缺失的。

  • 我们定义的世界模型,必须是能够 understand(理解)物理世界背后的规律——它是怎么从一个 state(状态)迁移到下一个 state 的。如果你要去复刻物理世界,必须通过这个模型来模拟物理世界规律的变化。

  • 我们的因果世界模型和其他最本质的区别其实就是整个系统工程,是从底层定义到最终实现都完全不同的第四条路。

以下是本次对话的实录,经Z Potentials编辑修改。enjoy~

01 德国马普所,从计算机到神经科学,再到因果AI:三次转向背后的同一个“真问题”

ZP: 欢迎黄碧薇老师,我看你本科选的是计算机专业,后来怎么会对神经科学感兴趣?

黄碧薇:大三那年上人工神经网络课,是我第一次接触AI。当时的网络只是简单的三层结构,但我开始好奇:能不能从人脑中获得灵感来改进AI?

于是大四我去了上海徐家汇的中科院神经所做毕设。那儿的实验室不做传统生物实验,而是用物理和机器学习的方法去理解大脑、反哺AI。这种交叉方向让我很兴奋,也坚定了我从人脑角度探索AI的想法。

在神经所,我开始接触机器学习的基本算法,同时学习神经科学的基础知识。原本的出发点是「用人脑启发AI」,但实际操作中我发现自己越来越倾向于反过来——用统计学和机器学习的方法去理解大脑的运作机制。

这两个方向并不矛盾。后来我逐渐意识到,它们是一个相互促进的循环:更好的AI工具能帮我们理解大脑,对人脑更深入的理解又能启发下一代AI。

ZP:当时你做这个方向的选择在计算机专业算是主流吗?

黄碧薇:不算主流。那个年代主要分两种,一种是直接毕业工作,可能是一些偏 Software Engineer(软件工程师)层面的码农工作;如果继续深造读博的话,绝大多数人早期是往 data mining(数据挖掘)、早期的 Machine Learning 以及 CV(计算机视觉)方向走。

ZP:后来就去了德国马普所?

黄碧薇:对,因为实验室有人去了那边, research氛围不错,神经科学方面做得非常好,我就申请了。

ZP:申请德国马普所(Max Planck Institute)的时候,最开始的专业是计算神经科学,后来为什么会从事因果AI方向的研究?

黄碧薇:去德国第二年的夏天,我去听了几个 lecture(讲座),其中有一个就是讲因果的,那是第一次接触和听说这个话题。

讲座里一个例子吸引了我——辛普森悖论(Simpson's Paradox)。当时教授举的是治疗肾结石的案例:肾结石分大结石和小结石两种,治疗方法有 A 和 B 两种。如果把数据拆开单独看,不管是针对大结石还是小结石,方法 A 的成功率都更高;但如果把所有患者的数据合起来看,你会发现方法 B 的总成功率反而反超了 A。

如果不具备因果视角,你就会觉得这违背常识、不可思议。但如果引入因果分析,你就能瞬间看清这个悖论背后的变量关系,并且当面对一个新病人时,能够清晰地做出正确选择。

那一刻我意识到,因果视角能让人在科学研究甚至现实生活中,一下子看清问题的本质。而不是仅仅看表面。理解背后的因果关系和整个数据生成方式,你就有一个唯一且最本质的解。

ZP: 所以追根溯源去研究一个最本质的问题,是吸引你做这个方向的核心原因。

黄碧薇:是的。还有一个原因是我当时感觉研究大脑神经所用的机器学习或统计学工具非常不够。与其用一个不太好的数学工具去解一个很难的问题,那是不是更应该从底层开始把数学工具构建得更好?等工具足够好之后,自然而然就可以去解决很复杂的神经科学问题了。

比如我当时处理过一些记录视网膜脉冲(Spiking)的微阵列(Microarray)数据,需要研究视网膜神经元跳动的节律、它与外界刺激的关系,以及它们之间存在怎样的模式(Pattern)。当时用了一些行业的标准工具,但这些工具只能做表面关联,无法让人理解背后的成因,也解释不清神经元之间在功能性上是如何相互影响的。

神经科学的核心问题之一,就是厘清神经元之间的交互机制。比如对比正常小鼠和视网膜病变的小鼠,到底是哪些神经元、在怎样的连接过程中受到了主要影响?这些最核心疑问用当时的传统工具是根本无法真正理清的。这也最终促使我决定跳出来,去底层做因果 AI 的工具库。

ZP:听完讲座你就快速付诸行动了?

黄碧薇:对,我立刻去找了实验室的老师。恰好我们硕士阶段有三个轮转(Rotation)机会,于是我加入了因果研究实验室。

ZP:你在三个 rotation 里都做了什么?

黄碧薇:马普所当时在 causal discovery(因果发现)、causal AI 方向基本上是全世界最全面的地方。

作为 master program的学生,去做什么样的 rotation 是很灵活的。我的第一个 rotation 去了做 dynamical system(动力学系统)的实验室;第二个去了做实验的实验室;第三个我就正式接触并进入了因果领域。

ZP:从因果 AI 的发展历程来看,你在马普所研究这个方向时,大家主要关注什么问题?

黄碧薇:对于马普所来说,那一阶段主要是做 causal discovery,即如何从观测数据里学到背后的因果关系和因果结构。

马普所那一套方法论算是继承或走了CMU(卡内基梅隆大学)的那条路。CMU 其实是 causal discovery 领域的开创者,他们在 1989 年到 1997 年之间活跃,并开创了这一代范式。我加入因果领域的那段时间,反而是马普所最活跃。后来 CMU 大概从 2014、2015 年开始又爆发了第二波。

ZP:当时在马普所对你影响比较重要的导师是谁?他们在关心哪些问题?

黄碧薇:导师包括 Kun Zhang(张坤)和Bernhard Schölkopf(施尔科夫),他们对我的影响特别大。比较早期的时候,大家最关心的还是 causal discovery 的一些基础问题,包括在有 distribution shift(分布偏移)的情况下怎么做 causal discovery,以及开始萌生了 causal AI 的早期工作。

给世界模型加上因果,她要让机器人真正理解“为什么”|对话Aether AI创始人黄碧薇 图片说明:黄碧薇与她的导师们以及其他因果领域学者

CMU 开创了这个领域,而马普所则开创了因果causal discovery 方面的第二代方法论范式,叫做基于 functional causal model(结构因果模型)的方法。我那时候做的就是这块。

所以现在普遍认为,从causal discovery来看,CMU 的Peter Spirtes、Clark Glymour 和Richard Scheines算是第一代开创者;Bernhard Schölkopf和Kun Zhang等算是第二代的开创者。

ZP:第二代方法论核心的转变是什么?和上一代本质区别在哪里?

黄碧薇:从方法上举个例子。CMU 以前的第一套方法是利用 conditional independence test(条件独立性检测)去寻找变量之间的因果图。但这套方法有个限制,比如无法区分到底是A cause B还是B cause A。

直到 2006 年,一个日本学者【注:指Shohei Shimizu等人】发现,如果进一步利用数据的非高斯性(non-Gaussianity),就可以找到任何两个变量之间的因果方向(到底是A cause B还是B cause A)。他开创了第二代,接下来 Bernhard、张坤他们把这一套方法论发展得更加完善。

02 在CMU锤炼出的科研哲学,黄碧薇的因果AI求真之路

ZP:后来你进入CMU读书,又是怎样的契机?

黄碧薇:当时张坤从马普所去了CMU,开创了第二波的范式,我就申请了CMU,在CMU期间,他是对我影响更大的导师,他在早期的时候非常hands-on(亲力亲为),看问题非常深入,能够把东西做到极致。这种富有洞察的思考能力影响了我,到后期,我就慢慢独立去寻找并解决问题了。

马普所和 CMU 这两个地方最大的不同在于,美国大家还是更努力一些,节奏更快,我在CMU 对事情的理解更深入了,整个做研究的过程是“先 deep(深)然后再 broad(广)”。

现在回想起来,我独立之后也意识到一个问题:那时候我们太注重单点突破和理论创新,从而忽略了把它做成一个系统(system)。因为你只有真正做成系统之后,它才能在实际中真正用起来。

ZP:你在 CMU 期间一些重要的研究方向是什么?

黄碧薇:一是如何在复杂的环境下找到背后的因果结构,并从理论上证明,同时在算法中 infer(推断)出来。

比如,实际中我们往往只能拿到少部分的观测变量,但背后可能还存在各种各样的隐变量(latent variables)。那么,如何仅仅从少部分的观测变量里,推断出背后有没有隐变量?隐在哪里?有多少?相互之间怎么影响,以及怎么影响我们的观测系统?

此外,当数据存在 distribution shifts(分布偏移)、nonlinear(非线性)、以及存在 bias(偏差)和 missing value(缺失值)的时候,如何从算法中推断出背后真正的因果结构。我和我导师在这块做到了最前沿。

Image

第二个方向是Causality(因果关系)与 Machine Learning、AI 的结合。

我们做了很多工作,主要研究如何从因果的角度更好地解决各种传统的机器学习任务。例如强化学习、迁移学习、泛化能力、表示学习(representation learning)、非稳态预测,以及最简单的分类和聚类等等。在大多数常见的机器学习任务上,用因果的角度去介入,都获得了更好的 performance(性能)以及更高的 data efficiency(数据效率)。

ZP:你在 2015 年去了 CMU。那时候其实深度学习已经到了一个开始爆发的阶段,你应该能感受到这种鲜明的对比。

黄碧薇:博士前几年我没太碰深度学习,一直在做理论证明。当时外界觉得机器学习是"炼丹",搞理论的人会觉得纯经验主义的工作不够漂亮,我的导师们比我还偏理论,主张做扎实的理论工作,没必要追热点。

ZP:当时市场上深度学习这么热,你没有动摇过或者想过直接换方向吗?

黄碧薇:没有,我不喜欢去 follow(盲从)热点。除非我觉得这个事情真正有意义、真正合理,我才会去做。

ZP: 从最初对计算神经科学感兴趣,到后来做因果 AI,一直驱动你做研究和改变的那个最底层的那个“元问题”是什么?

黄碧薇:我一直都想要从更本质、更本源的角度去理解问题,然后解决问题。这几次方向的改变,其实是一次次在深入,想要从一个新的、更深邃的视角去看待并尝试解决问题。

ZP:做研究的人如何定义“更本质”这件事情?这似乎是一种很难被量化的直觉。

黄碧薇:做科研非常依赖直觉。但这个直觉是通过不断学习、在更广(broad)和更深(deep)的维度上训练出来的,直觉经过训练会变好,当你懂的东西、储备的知识(knowledge)更多了,你的泛化能力和看事物的能力就能直接看到更底层。

特别是在做数学证明的时候,你必须有一个非常好的 intuition(直觉)——感知到往这个方向走应该是能够走通的,然后再一步步往细里做。

03 重新审视大模型:Scaling之外,还缺什么?

ZP:后来你毕业并走向独立研究,最大的变化是什么?

黄碧薇:我开始重新审视我们以前走的这条学术道路。

说实话,以前我们一直觉得大模型这种“简单粗暴”的东西在数学上是很不漂亮的,但为什么它会这么火、这么成功?我反省自己并总结出来:

以前我们在学术界的时候,确实不会去考虑 scalability(可扩展性)这个事情,不会想去通过堆数据、堆模型 size(尺寸)来解决问题。我们一直强调的是理论和算法上的突破,去想算法和模型架构怎么设计得更精巧。

但这样做的代价是,我们忽略了数据量和模型 size 的层面,同时也没有想过真正做一个可用的应用给大众,在系统层面的考虑是缺失的。

ZP:之前做因果方向的人好像很少有人想过要出来创业,这是为什么?

黄碧薇:我觉得有两方面原因。

做因果(causality)的人和做深度学习(deep learning)的人,性格气质是明显不一样的。做因果的那派社区,因为需要花大量时间去理解和推导理论证明,所以整体风格非常偏理论和数学化。他们不那么爱宣传自己,因果社区的人基本上都不怎么用 Twitter。

后来有一年顶会上,Yoshua Bengio 还有另外一个老师做了两个 keynote talk,整个泛 AI 领域才开始意识到因果很重要。后来大家就喜欢把“因果”这个词加到论文里显得很 fancy,但事实上,真正核心懂因果的人其实非常少,

我在前期做理论研究的时候,也是不管外面发生了什么、扎得很深。但是当我完全毕业、成为独立的 PI 之后,我会用一个独立的眼光去看待这个世界,看得更广。这也是为什么我最终决定走向创业的契机之一。

ZP: 最开始就是想做一个Frontier Lab 形态的公司吗?

黄碧薇:是的。在具身智能领域,前三年大家比较着急,绝大多数人都在 follow原有路线。大家试了三年多,现在开始意识到原来的方式不太行,这恰巧给我们提供了一个非常好的 timing。

对我来说,也意识到了 scaling(可扩展性/规模化)的重要性,大数据带来的信息量是非常庞大的。

但在高校和学术界,往往受制于算力显卡等调用资源的限制。要做出一个有 impact的“系统”是几乎不可能的。

而工业界也意识到了现在泛 AI 范式面临的问题,并且很认同 AI 不能只停留于表面,而是要走到更深层,去理解背后的规律和因果关系。只有这样才能从本质上解决目前 AI 面临的一系列问题,比如 hallucination(幻觉)、泛化性差、理解力差等等。

04 视频生成、3D、JEPA之外,用因果AI定义世界模型的全新技术范式

ZP: 为什么会认为定义整体因果 AI 发展的下一个阶段应该是在 Physical AI(物理人工智能)?

黄碧薇:大概有四点原因。

首先,我们现在正处在从虚拟、数字世界转向物理世界的一个技术转折点上,大家已经不满足于 AI 仅仅在数字世界里提供帮助,而是希望 AI 真正“有脑又有身体”,能替我们在物理世界上干各种各样的事情。

另外,对于数字世界来说,LLM(大语言模型)那套范式在语言任务里相对已经做得还不错了,继续做这一块能带来的技术增益比较小;但对于物理世界,我们都还处在一个非常前期的阶段,一旦做出来,它的增益是非常巨大的。

第二点,物理 AI 的模态很多,它有视频(video)、自然语言(natural language),也有各种传感器信号(sensor signal)和时间序列(time series)。我们借助 Physical AI 可以构建一个带 action(行动)和 decision making(决策)的多模态 foundation model(基座模型),能更好地帮助我们下一步延伸到其他更复杂的领域。

第三点,相比于 Scientific Discovery(科学发现)等任务,物理 AI 或者说具身智能的 task反而是比较简单的。它的数据组织得更好,缺失值比较少,隐变量也比医疗健或金融等领域要少。

ZP:今年世界模型海内外主流路线其实主要就是 3D 生成、视频生成和 JEPA这三条路。你们的因果系统和其他路线的差异在哪儿?

黄碧薇:我们定义的世界模型,必须是能够理解物理世界背后的规律——它是怎么从一个 state(状态)迁移到下一个 state 的。如果你要去复刻物理世界,必须通过这个模型来模拟物理世界规律的变化。

但是现在大家提到的路线,都没有那么触及本质:

• 视频生成模型:目前大家只要看生成的视频画面不错就行了,没有真正走到理解物理规律和因果关系这一步。

• 3D 生成模型:它更在乎的是空间智能,偏重于 3D 渲染那一部分。

• JEPA 路线:它也没有真正走到理解规律和因果关系那一层。通过去掉 decoder(解码器),从而在特征空间里去掉了一些像素层面高频的、不可预测的信息(如噪点)。

他们三个都是从表面的不同角度去入手,而我们是真正走到理解因果规律这一步,从而可以去复刻物理世界,这才叫世界模型。这个世界模型以后不仅可以用在物理世界,在生物、材料、金融世界里也类似。

我们可以把生物世界模型作为模拟器,去理解不同的基因网络之间是如何相互因果影响并导致某个结果的,从而直接在模拟器里做生物学实验。

ZP:你之前提到在 JEPA 上面加了一层因果模块这种方案不够本质,为什么?

黄碧薇:市面有公司也在讲因果,通常有两种:一种是结合了目标检测和实例分割(Object segmentation),把物体(Object)分开后看能不能做得更好一点;另一种是因为有了自回归(auto-regressive)模块,实现了“利用历史数据预测未来(past data predict future)”。但这些都没有真正触及本质。

JEPA 路线在模型较小、算力卡少时可以用起来,且只能在比较简单的任务和数据集上运行,但很难应用到复杂实际场景。因为它把整个 decoder 去掉了,可能导致它会漏掉一些像素层面的高频信息。但这些信息比如物理操作中的接触面 contact、摩擦力 friction 等在物理世界中其实是非常重要的。

我们的因果世界模型和其他最本质的区别其实就是整个系统工程,是从底层定义到最终实现都完全不同的第四条路。大家现在也逐渐意识到,系统最终要实现的目标必须是真正“懂因果”的。

ZP: 如果原本做传统深度学习的团队现在想把“因果”这层补上去,核心的门槛和挑战是什么?

黄碧薇:核心是他们很难真正从各个 level(层次)把整个模型和系统变成真正懂因果的。因为他们没有接受过这种系统性的思维训练,缺乏底层的系统性理解,方法论层面的迁移也不是那么容易的。

ZP: 在技术层面,你们现在的系统或模型架构大概分成了哪几个层次?

黄碧薇:从 high level 来说,我们要实现整个因果系统,大概分了四个层次:

第一层:系统层(System Layer)。我们要实现一个以因果驱动的智能体系统(Causality-driven Agentic System)。它对比的是现在大火的 Openclaw、Hermes 等 Agent 方案。目前那些方案的问题在于它们本质上还是在“死记硬背”以往学过的动作和 task序列。这导致它们缺乏泛化能力,而且token 消耗量极大,很难具备真正的思考和推理能力。

第二层:基座模型层(Foundation Model Layer)。我们要实现的是因果世界模型。它对比的是现在的 LLM(大语言模型)和 Sora 等视频生成模型。现在的模型都是表层的 pattern matching(模式匹配),而我们要让模型真正去学到背后的因果演化系统。

第三层:神经网络架构层(Architecture Layer)。我们要实现的是真正的模块化神经网络架构。像人脑一样,不同的区域管不同的功能,不同区域通过连接来协作完成复杂任务。它对比的是现在的 Dense模型和 MoE模型。现在的 MOE 模型在实现方法上其实是不合理的,比如 10 个专家之间的 overlap特别大,做的事情差不多;而且真正 routing的时候,可能永远只有一两个专家被选中在干活,其他人都在闲着。

第四层:最底层架构层(Transformer Layer)。现在的 Transformer 本质上做的是 next-token prediction,学到的是统计相关性。我们要在保持 Transformer 能够 scaling 的前提下,做一些架构上的根本改变,使它真正直接去学习因果关系。

Image

至于在学习方法层面,我们结合了 SFT(监督微调)、RLHF/IL等,在具身智能的决策里,我们先通过模仿学习构建基础的 policy model,再加上强化学习。强化学习能让智能体在一个开放、完全没有见过的环境中进行自我探索。

05 既懂理论又懂工程:一支真正“懂因果”的复合团队

ZP:你们目前在内部的实验中,已经看到明显的泛化或者可以 scaling 的成果了吗?基础模型的参数量有多大?

黄碧薇:在泛化层面我们已经看到了非常多的进展。内部评测发现,我们在机器人操作、locomotion 和长程任务上,相比传统世界模型实现 25%-50% 成功率提升和 5-10 倍样本效率提升,且在任务、环境、奖励函数变化下保持泛化。

ZP:展开讲讲你们最近的成果?

黄碧薇:就拿我们最近发表的一些文章来举几个例子吧。

首先是一项关于 Task-centric representation(以任务为中心的表征)的研究。我们在执行任务的时候,视频(video)中虽然会看到非常多的全局信息,但其实真正和当前任务相关的,可能只有桌子上的这一个杯子。

所以在刻画任务相关模型以及做 policy model(策略模型)的时候,我们让模型学会“只看该看的”,把无关信息当作噪声过滤掉,这样决策更准、效率更高。

第二,隐变量恢复。现实中很多因素观测不到,比如户外机器人跑步时会受风力干扰。我们让模型能够感知到这类“看不见的影响”,并把它还原出来。对长程任务来说,这种能力很关键——一步偏了,后面全偏。

第三,持续学习。机器人面对的不是单一任务,而是十个、几十个新任务。我们在研究用什么顺序、什么方式去学这些任务,能让它既不忘记旧的,又能高效掌握新的。

最后还有一项工作,是关于如何让我们生成的视频更加符合物理规律、更好地满足动作控制。手还没碰到杯子,杯子自己先飘起来了。它只看过“杯子和手同时出现”的画面,但不理解“手碰到杯子杯子才会动”这个因果关系。我们在解决这个问题,让生成的视频真正符合物理规律。

当然,这些是具体技术点上的研究,整体系统层面的结果还在推进中。

ZP:要切入Physical AI这个领域,绕不开真实物理世界的数据问题,你们打算怎么解决机器人的遥操或真实数据供给?

黄碧薇:我们用了三层数据来训练:第一层是海量视频和模拟器数据,覆盖各种物理场景;第二层是第一人称视角的操作数据;第三层是真实的机器人遥操数据,用来做最后的对齐。

ZP:团队目前的构成大概是什么情况?

黄碧薇:一部分成员负责模型训练、数据以及系统工程,另一部分则更偏重于底层算法层面的技术创新。团队里既有来自CMU、UCSD等高校的因果理论研究人员,也有在大模型基础设施和机器人全栈层面有丰富工程经验的成员。同时,像张坤教授这些因果领域的前辈大拿也是我们的官方顾问,随时为我们提供支持。

ZP:如果放眼到未来 5 年甚至更远,你希望打造一家什么样的公司?

黄碧薇:我希望打造一家真正从技术底层进行突破,从而能带来商业和应用双重突破的公司。真正让机器人用起来,甚至让一些生物医学领域的疾病得到本质上的解决。

ZP:在你的设想里,5 到 10 年后的 AI 应该具备什么样的能力?

黄碧薇:机器人一定会走进千家万户。当机器人进入家庭、深入到生活方方面面时,安全性、可控性就成了首要问题。这绝对不是现在这种完全黑盒的 AI 可以解决的,它必须理解背后的因果规律,才能做到技术上的绝对可控。

我对发展速度比较乐观。只要大家找准一个比较好的方向,整个世界可以进化得很快。未来在因果世界模型的驱动下,机器人生态、生物制药以及 longevity(长寿/健康)等层面都将迎来巨大突破。

06 炉边闲话

ZP:接下来是几个快问快答。你最近关注的一篇论文或内容是什么?

黄碧薇:最近看到的比较有意思的文章/给我注入了新的想法的文章《Much Ado About Noising: Dispelling the Myths of Generative Robotic Control》,  https://arxiv.org/pdf/2512.01809。 

这篇论文认为,机器人中的 diffusion/flow policy 之所以强,并不是因为它们真正学会了复杂的多模态动作分布,而是因为“噪声注入 + 监督式迭代计算”带来了更好的控制归纳偏置;因此,未来机器人控制模型可能可以更简单、更高效,而不必迷信完整生成式建模。

ZP:你最欣赏的科技公司是哪个?

黄碧薇:我最近觉得Anthropic 确实非常不一般。无论是整个组织的凝聚力、管理还是迭代速度都非常快,他们做事情是非常 top-down(自上而下)的。

从长远来看,我一直以来特别看好 Google。我觉得 Google 做事是比较长远的,他们真的在做一些未来的事情,有着非常强大的文化魅力。

ZP:在科研和创业之外,你有什么用来充电的兴趣爱好吗?

黄碧薇:需要放松的时候,会出去 hiking或者去海边走走。

ZP:如果用一句话来形容你心目中的 Physical AI 时代?

黄碧薇:从当前进展来看,我觉得它正处于早上六点的状态,天快亮了,太阳马上要升起来。

ZP:如果给刚开始做 research、准备读博的人一些建议,你有什么小的 tips?

黄碧薇:如果是真心想去做 research 的话,还是要稍微静下心来,花点时间做一些更本质、在未来更有长远影响力的工作。

请注意,本次访谈内容已经过编辑整理并已获得黄碧薇的认可,仅代表受访者个人观点。欢迎读者通过留言互动,分享您对本访谈或Aether AI的看法。Z Potentials 将继续提供更多关于人工智能、全球化市场、机器人技术等领域的创业者访谈。我们诚邀对未来充满憧憬的您加入我们的社群,与我们共同分享、学习、成长。

图片
图片
图片
图片
图片
图片