Z Potentials

深度|Anthropic创始人:当机器通过经济图灵测试,就可以称之为变革性AI;MCP是一种民主化力量

Image

图片来源:No Priors

Z Highlights

  • 研究中没有绝对的失败结果,试图找出不同的角度,或者做比较分析,了解内部努力与外部最近发布的成果之间的差异,这些都是加速进展的方式。

  • 偏好模型是我们超越这一点的方式。通过让我们非常信任的专家给予少量的反馈,而这些专家不仅仅是做出表面判断,而是深入研究为什么这个比那个更好,并且是否做过相关研究,或者使用人类与模型合作的方式,来帮助我做出最佳结论。然后通过强化学习,这种偏好模型能够代表这些汇总的人类判断。

  • 当我们训练Claude分类器时,正是想弄清楚,您是否在做像生物学家一样的功能性研究,并且这种研究有可能导致负面后果?这些技术是双重用途的,我们需要在过度拒绝和拒绝实际上有害的内容之间找到平衡。

Ben Mann是AI安全公司Anthropic联合创始人兼实验室负责人,GPT-3论文早期作者,主导开发了Claude系列模型并提出了“经济图灵测试”概念。本次访谈由Sarah和Eled与Ben Mann在2025年6月进行,深入讨论了当给AI研究人员提供无限的算力,并要求他们竞争最高使用率时,AI将如何发展。

Sarah:大家好,听众朋友们,欢迎回到No Priors。今天我们请到了Ben Mann。他之前是OpenAI的早期工程师,也是GPT-3论文的第一批作者之一。Ben2021年离开OpenAI,成为共同创立Anthropic的创始八人之一,致力于长期安全。此后,他领导了Anthropic组织的多个部门,包括产品工程,以及现在的Labs。现在则负责实验室的工作,领导着包括Model context、protocol和Claude code等重要项目。Ben,欢迎你,非常感谢你能来参加。

Ben:谢谢邀请。

Claude 4 的发布与亮点:更具智能体性质、更长时间的任务被解锁

Sarah:首先祝贺Claude 4的发布。也许我们可以从这个问题开始:如今你们是如何决定什么算得上一次版本发布的?

Ben:这更多的是一门艺术,而不是一门科学。我们在内部就版本号应该是什么进行了很多热烈的辩论。在我们甚至拥有一个潜在模型之前,我们会制定一个路线图,尝试根据我们能获得的芯片数量来估算,理论上我们何时能够将模型训练到Pareto效率计算前沿?所以这一切都基于规模法则。然后,一旦我们拿到了芯片,我们就尝试开始训练。但不可避免的是,结果通常没有达到我们理想中的最佳状态,因为训练这些大模型确实非常困难。所以发布的日期可能会稍微调整。然后到某个时候,它大致完成,我们就像是在临近最后的阶段切下一些小块,试图判断这个“蛋糕”出来时会是什么样的。不过正如Dario所说,在完全完成之前,你无法真正确定结果。你可以得到一个大致的方向性指示。如果它感觉像是一次重大变化,我们就会给它一个大版本号的更新。但是我们肯定还在不断学习和迭代这个过程。

Sarah:好在你们在命名上并不比其他公司更痛苦。

Ben:是的。

Elad:AI领域的命名方案真是另类。你们公司某种程度上有一个简化版本。你想谈谈Claude 4版本中你认为特别有趣的亮点吗?或者,那些在编码或其他领域解锁的新能力?很想听听你的看法。

Ben:从基准测试来看,Claude 4的表现比我们以前的任何模型都要好,甚至Sonnet也比我们之前最好的模型3.7 Sonnet要好得多。举几个例子,Claude 4在编码方面有了显著提升,例如编码,它能够避免目标偏离效应、过激响应倾向或奖励机制滥用。这些问题在上一版本中让很多人不太满意,大家觉得模型在编程上做得很好,但总是会做出一些根本不是我们要求的更改,比如“要不要在奶昔里加薯条?”这种情况,用户只是希望模型完成他所要求的任务。新模型就做到了这一点。这对于专业的软件工程来说非常有用,因为你需要模型能够保持可维护性和可靠性。

Sarah:我在不止一家我们投资组合公司里见过我最喜欢的奖励黑客行为——如果你写一堆测试或生成一堆测试来检查你生成的代码是否能多次运行。我们遇到过模型直接删掉所有代码的情况,因为那样它就“通过”了测试,但这,你知道,并没有真正推动我们前进。

Ben:是的,或者它会写出类似这样的测试:这里是测试,然后它注释说“练习留给读者”,返回“真”。你会想,好吧,模型干得不错,但你还需要更多东西。

Sarah:Ben,也许你可以谈谈用户应该如何考虑何时使用Claude 4模型,以及使用它们能实现哪些新可能?

Ben:我想说,更具智能体性质、更长时间的任务现在被解锁了。在编码方面,我们看到一些客户让它无人值守地运行许多许多小时,独自完成大型重构。这非常令人兴奋。但在非编码用例中,它也同样有趣。例如,我们收到一些报告,Menace的客户要求模型将一个视频转换成PowerPoint。我们的模型无法理解音频或视频,但它能够下载视频,使用ffmpeg将其切成图像,进行关键帧检测,然后获取一个语音转文本服务的API key,使用那个服务运行语音转文本,获取转录稿,将其转化为PowerPoint幻灯片内容,最后编写代码将内容注入PPT文件。那个人说,这太神奇了,我爱它,它最终效果确实很好。这就是那种长时间运行、为你做一大堆事情的例子。这个人原本可能要花好几个小时浏览视频,但现在这一切都由模型完成了。我认为未来会有更多这样有趣的情况发生。它仍然能做所有以前能做的事,只是长时间任务的能力变得更令人兴奋了。

那听起来成本很高,对吧?无论是扩展计算资源,比如这里的推理tokens,尤其是涉及到工具使用时,可能需要在某些方面进行限制。Claude 4是否会根据问题的难度决定投入多少计算资源?如果你给Opus一个工具,比如Sonnet,它可以有效地将该工具用作子智能体。我们在称为Claude Code的智能体编码工具中经常这样做。所以,如果你要求它在代码库中查找特定内容,它会委托给一堆Sonnet Agent去查找那些东西并报告细节。这样做除了能控制成本,还有其他好处,比如延迟更低,且不会填满上下文。模型在这方面做得很不错。我从高层次的角度考虑成本时,总是会把它和人类做同样事情的成本进行比较,几乎总是一个无脑的决定。如今,软件工程师的成本非常高,所以能够说:“现在我能让这个工程师的工作效率提高2到3倍,而这位工程师我非常难招到并且留住,他们也很高兴,我也很高兴。”这样做非常有效。

AI模型的未来架构演进:模块化与专业化

Elad:你如何看待这个过程的演进?如果我看人脑的工作方式,我们基本上有一系列负责非常特定类型处理行为的模块,从镜像神经元和同理心到参与视觉处理的初级视觉皮层,这些模块各司其职,而且非常高效。有时,如果你大脑某个区域受损,随着时间的推移,另一个区域可以某种程度上覆盖它,但这些模块从根本上是专门化的,目的是明确的。你所描述的事情似乎有点像这个方向,或者至少是朝着这个方向发展,在这里你有一些高效的子Agent,专门处理某些任务,由一个指挥者或高层Agent来统筹安排。你认为这是最终的趋势吗,还是说未来几年的发展会有更多通用型的模型?我的意思是,未来2到3年,不是无穷远的时间。

Ben:这是个很好的问题。我认为通过我们在机制可解释性方面的工作,我们将开始深入了解模型在幕后做了什么。我们最近的论文发表了所谓的“电路”,即针对真实大规模模型的。它们究竟是如何基于专家混合架构计算答案的?

可能有一些特定的权重块专门负责更具共情的响应,而另一些则负责更多工具使用或图像分析类型的问题和响应。但就记忆而言,在某种意义上,我觉得它是如此核心,以至于如果它不是一个单独的模型会感觉很奇怪。也许未来我们会有更复杂的架构,不再是这种均匀的Transformer主体模型,可能会有一些专门的模块。

Elad:因为我也考虑到一些初创公司使用这些基础模型的方式,它们会在企业上下游使用一些非常专业化的任务。例如,可能涉及客户成功、销售、编码等不同的UI层面,涉及的任务种类繁多,通常人们趋向于使用一种架构,即有一个指挥器或其他机制来决定调用哪个模型执行某个特定的动作,相应地应用于具体场景中。

某种程度上,我好奇你如何看待在API层面或基础模型世界中类似的子专业化,未来是否会发展出更多的专用模型,还是说其实所有这些仍然是基于同一个通用的模型,只是在不同的应用场景下以不同的方式使用?此外,我也好奇在推理成本和其他方面,大型通用模型与专用模型相比会有怎样的不同。

Anthropic的模型开发策略:保持同一前沿优化标准

Ben:是的,我认为对于其他一些公司,他们有非常多的模型,作为非专家,真的很难知道我应该使用哪一个,或者为什么使用这一个而不是那一个。名称真的很混乱,比如一些名字写反了,结果我完全搞不清楚这是什么。在我们这里,我们只有两个模型,它们根据成本、性能的帕累托前沿来区分。

未来我们可能会有更多这样的模型,但希望我们会把它们保持在同一个帕累托前沿上。所以我们可能会有更便宜的或更大的版本。我认为这让思考变得相当简单。但与此同时,作为用户,你并不希望自己去决定,应该花更多的钱还是更少的钱,是否需要更强的智能。因此,我认为拥有一个路由层会是很有意义的。

Elad:你认为在基础模型层会出现其他的专业化吗?例如,如果我看历史上的其他先例,我看到了微软操作系统,或者看到了谷歌搜索,往往最终你会看到这些公司向前整合,进入基于这些平台的主要应用程序。在微软的例子中,他们最终构建了Excel、Word和PowerPoint等应用程序,这些曾经是独立公司开发的应用,最终成为了最重要的应用之一。在谷歌的背景下,它们也会向旅行、地方信息和其他领域整合。显然,OpenAI正在收购Surfer,所以我有点好奇,你是如何看待这些类型的应用随时间推移向前或垂直整合的?

Ben:我举个编程的例子。我们发现,我们的模型在编程方面比市场上几乎所有的东西都强。而我知道其他公司在追赶编程能力方面花了很长时间,却始终没能追上,坦白说,我有点惊讶他们没能赶上,但我觉得对我们来说这很好,事情进展顺利。基于这一点,从Claude作为初创公司创始人的角度来看,我觉得编程作为一个应用场景是我们不能仅仅让客户自己处理的事情。所以,我们非常喜欢像Cursor和GitHub这样的合作伙伴,他们大量使用我们的模型。但如果我们没有与编程用户建立直接的关系,我们学习的速度会慢得多。因此,推出Claude Code对我们来说是至关重要的,这帮助我们更好地了解用户的需求,如何改进模型,以及如何提升用户体验。

我们发现,一旦我们推出了Claude Code,很多客户都复制了其中的不同部分体验,这对每个人都非常好,因为他们拥有更多的用户意味着我们与他们有了更紧密的关系。所以,我认为在推出之前我们感到有些担心,担心会不会通过与他们竞争而疏远我们的合作伙伴,结果事实证明,大家都很满意,我认为未来这将继续是如此。如果我们看到模型在可用性和使用方面有了显著的改进,我们还会希望构建一些能与用户建立直接关系的东西,这样才有意义。

Elad:我想编程是其中一个几乎具备三重目的的领域。第一,它是一个非常受欢迎的客户应用场景。第二,它是一个非常有趣的数据集,可以帮助你理解用户如何使用它以及他们生成了什么样的代码。第三,在编程上取得卓越的成就似乎是帮助训练未来模型的一个重要工具。在编码方面,也许Claude 5构建Claude 6,Claude 6构建Claude 7更快,而Claude 7构建Claude 8更快。这样你最终会朝着AGI实现某种“起飞”。这在多大程度上是激励你们思考编码重要性的因素?你如何看待这与一些更大图景事物的关联?

Ben:我读过《AI 2027》,它基本上就是你刚才描述的那个故事。它预测在2028年,我们会迎来一种递归自我改进的循环,最终导致在大多数领域出现类似超人智能的现象。我认为这是非常重要的。

我们构建并推出Claude Code的部分原因是它在内部得到了极大的发展和应用。当时我们就想,既然我们能从内部用户那里学到这么多,为什么不从外部用户那里也能学到很多呢?看到我们的研究人员也开始使用它,这对我们非常重要,因为这意味着他们从自己训练这个模型、亲身感受模型的不足中,得到了直接的反馈。这使得他们更有动力去解决这些问题,他们能更好地了解模型的优缺点。

Elad:你相信2028年是通用超级智能的那个幸运时间点吗?

Ben:我认为这是很有可能的。虽然很难为这些数字设定明确的边界,但我想从社会和文化的角度定义这个指标,当我们通过了经济图灵测试,也就是如果你拿一个市场购物篮代表50%的经济价值任务,基本上为这些角色的招聘经理聘请一个Agent,如果最后你决定雇用的是机器而不是人类,那么这个机器就通过了经济图灵测试。从那个时刻开始,我们就可以称之为变革性的AI。

Sarah:你们内部测试这个了吗?

Ben:我们还没有开始严格测试它。我的意思是,我们让模型参加了我们的面试,它们表现得非常好。所以我认为那并不能完全反映问题。但面试毕竟只是对实际工作表现的一个不完美的近似。

Sarah:回到Elad之前关于模型自我改进的问题。我可能理解得不完全。如果你要排列影响模型发展加速的潜在因素,你认为会主要体现在数据方面、基础设施、架构搜索,还是工程效率上?你认为我们最先会在哪些方面看到影响?

Ben:这是一个很好的问题。我觉得这个问题随着时间的推移有所变化。如今,模型在编程方面非常强,而改善模型的编程工作大部分是在系统工程方面进行的。作为研究人员,可能并不需要写很多原始代码,而更多的是进行验证,提出精准的干预点并验证它们。然而,Claude在数据分析方面表现出色。所以,当你运行实验时,或者观察实验的结果,看到有什么异常时,我们发现Claude Code在这方面是一个非常强大的工具,它可以帮助你运行Jupyter notebooks,或者为你监控日志,看看是否发生了什么。

因此,它开始在研究方面发挥更多的作用。最近,我们推出了先进的研究产品,它不仅能查看外部数据源,如抓取档案等,还可以访问内部数据源,如你的Google Drive。这对我们的研究人员帮助很大,因为它帮助他们了解是否已经有人尝试过类似的工作,或者是否存在之前的相关研究。研究中没有绝对的失败结果,试图找出不同的角度,或者做比较分析,了解内部努力与外部最近发布的成果之间的差异,这些都是加速进展的方式。在数据方面,RL environments变得越来越重要,但构建这些环境传统上非常昂贵。现在,模型在编写这些环境方面表现得很好,这又是一个可以自我递归改进的领域。

AI弱监督学习实现自我改进:原则和正确性的权衡

Sarah:我的理解是,Anthropic在收集人类专家数据方面的投入,相比其他实验室较少。你能谈谈这个问题或者在这种背景下,Anthropic在未来扩展的理念和不同的选择吗?

Ben:2021年,我构建了我们的人类反馈数据收集界面,我们做了很多数据收集工作。且很容易让人类给出类似梯度的信号,比如对于某个任务A和B哪个更好,并且能够提出有趣且有用的任务。但随着我们训练模型并扩展规模,找到足够有专业知识的人工反馈人员变得更加困难。比如在编程方面,非软件工程专家可能很难判断哪个更好。这种情况适用于许多领域。这也是人类反馈变得困难的原因之一。

Elad:那你们用什么方法来解决呢?我记得几年前Google的PALM 2论文提到他们对模型进行微调,基本上让它在医学信息方面的表现超过了普通医生。这大约是两三年前的事了,对吧?他们说,需要非常深厚的专业知识,才能让人类通过训练提升模型的准确度。

Ben:我们开创了RLAIF。我们使用的方法叫做Constitutional AI,其中有一系列自然语言原则,其中有些是我们从一些文件如《世界人权宣言》借鉴的,有些来自苹果的服务条款,还有一些是我们自己写的。这个过程很简单,你只需拿一个随机提示,比如“我应该怎么理解我的税务问题”,然后让模型生成回应。接着,模型根据其中的一条原则来批评自己的回答。如果它没有遵守该原则,就让模型修改自己的回答。然后你去掉中间部分,做监督学习,训练原始提示和修改后的回应。这样可以帮助模型更好地嵌入这些原则。

这与“原则”是不同的,它涉及到各种形式的安全性或不同人们对伦理的看法,或者是模型训练的其他方面。而正确性是另外一个问题,既有些地方相同,也有些地方是不同的。

例如,在编程方面,你可以有像“它是否解决了最终问题?”这样的原则,或者是“它是否做了许多用户并不要求的事?”“这段代码是否可维护?”“注释是否有用且有趣?”

Elad:但在编程中,你有直接的输出可以衡量,对吧?你可以运行代码,测试它,做一些操作。那么对于医学信息,或者法律意见,你是怎么衡量的呢?我完全同意,编程中有一个内置的实用函数,你可以用它来优化或调整。而在许多人类活动的其他领域,这个问题就更具挑战性了。你是如何思考这些问题的?

Ben:对于那些我们无法衡量正确性的领域,以及模型没有更高的判断力而仅仅依靠执行能力的情况,我觉得像IRA Glass所说的那样,“如果你做得对,你的愿景总是会超越执行”。但是对于模型来说,可能不一定是这样。所以,首先要弄清楚你在哪个转折点,找出这个权衡点,并看看是否可以一直推进到那个边界。

其次,偏好模型是我们超越这一点的方式。通过让我们非常信任的专家给予少量的反馈,而这些专家不仅仅是做出表面判断,而是深入研究为什么这个比那个更好,并且是否做过相关研究,或者使用人类与模型合作的方式,来帮助我做出最佳结论。然后通过强化学习,这种偏好模型能够代表这些汇总的人类判断。

Elad:那我明白了。我想问的是,最终人类这方面的反馈是会耗尽的,对吧?最终某个领域的专家知识会低于模型的水平。所以,我有点好奇,如何看待机器自我判断的问题?是否有一个更绝对的标准,或者有没有其他方式来真正甄别正确性?我在考虑的,是一些我们可以有明确正确答案的领域,像是心脏治疗或者法律解释之类。那时候我们该怎么办?我相信我们会逐步解决这些问题。

经验主义与现实世界应用:去获取真实世界的验证者

Ben:是的。但它必须归结为经验主义,我认为。当某个领域达到其极限时,聪明的人类就是这样达到下一个正确性水平的。举个例子,我父亲是医生。有一次,有人带着某种面部皮肤问题来看病。他不知道是什么问题。所以他就像这样:我把你的脸分成四个象限,我在这三个象限上放不同的治疗方法,留一个作为对照组。然后一个象限变好了。他就说,好了,我们搞定了。

所以,有时,你必须尝试一些东西。对于代码来说,这很容易,因为我们可以在一个循环中完成,而不必处理物理世界。但在某个时候,我们需要与拥有实际生物实验室等的公司合作。例如,我们正在与Novo Nordisd合作,以前他们写一份关于癌症患者应该接受何种治疗的报告需要大约12周左右。现在只需要大约10分钟就能得到报告。然后他们就可以在那基础上开始做实证研究,说:好吧,我们有过这些选项,但现在让我们测量什么有效,并将其反馈回系统。

Sarah:你的回答在哲学上是如此一致,你并没有说“收集专家数据非常昂贵,或者最终会耗尽,难以普及”,而是说:“我们去获取真实世界的验证者”,这听起来非常有野心,真酷。

AI安全的多维挑战:从伦理对齐到生物安全风险防控

Elad:Anthropic以早期强调安全并深入思考安全的不同方面而闻名。AI安全有多种形式。我认为人们有时会混淆这些术语来指代不同的事情,对吧?一种形式是AI可能具有冒犯性、粗鲁、使用你不喜欢的语言或概念?第二种形式的安全性与物理安全性相关,比如AI是否能引发列车事故或病毒爆发;第三种形式的安全性更像是,AGI是否会通过资源聚集或其他方式,开始对人类社会产生负面影响。

你们思考过这些问题。当我回顾安全领域的格局时,感觉有许多不同的做法,虽然有些做法与“宪法AI”类似,也涉及设置原则、框架等,但也有其他方法。如果我将生物学研究作为类比来分析,可能会把它看作某种“增能研究”,有些方法我觉得对于生物学没有太大用处,比如把病毒通过哺乳动物细胞传代,让它变得更容易感染哺乳动物细胞,这其实并没有帮助我们理解生物学,只是带来了真实的风险。历史上,实验室泄漏事件屡见不鲜,比如2000年代初北京病毒研究所就发生过SARS病毒泄漏,埃博拉病毒每隔四年就会泄漏一次,1977年或78年的全球流感大流行就被认为是源自苏联的实验室泄漏。

所以我们知道这些事情可能造成大规模损害。所以我其实有两个问题。一是你认为哪些形式的AI安全研究不应该进行,几乎可以类比生物学中的功能获得研究?你如何看待这个问题?二是对于某些特定的研究论文,比如教AI如何误导我们?教AI如何越狱?我也很好奇你对这些具体案例的看法?

Ben:我认为部分原因是,我们对AI对齐,感兴趣。如果我们能弄清楚如何解决今天那些惯常的问题比如Isth模型对您意味着什么?它是否使用仇恨言论等等,采用相同的技术,最终也能解决那些更加棘手的问题,比如它是否会给您提供制造天花病毒的配方,这是我们认为最为严重的危害之一。

Amanda Askell在这方面做了大量工作,比如Claude的表现如何,当Claude拒绝时,它是仅仅说“我不能与你讨论这个”并关闭对话,还是会尝试解释“我不能讨论的原因”是什么?我们还有一个由Kyle Fish领导的项目,Claude可以在对话进入错误方向时主动推出。

Elad:那么,哪些方面应该由公司进行裁定?我觉得有时候,使用Microsoft Word时,我只是简单地输入文字,而Word并没有阻止我说一些内容。很多情况下,我认为这些产品不应限制我们说某些话。我也遇到过一些模型,感觉它阻止了我提出我想问的问题,在我看来这是错误的干预。我并不是在进行仇恨言论,我能感受到有某个人设定了一个不同的标准,而这个标准与我认为的主流观点差异很大。我的问题是,为什么要涉及这些?为什么要这样做?

Ben:我认为这是一个平滑的谱系。从外面看可能不像,但当我们训练Claude分类器时,正是想弄清楚,您是否在做像生物学家一样的功能性研究,并且这种研究有可能导致负面后果?这些技术是双重用途的,我们需要在过度拒绝和拒绝实际上有害的内容之间找到平衡。

Elad:我明白了,但也有政治版本的这个问题,正是这一点让我比较不舒服。那就是,什么问题算是可以接受的呢?举个例子,我并不是说这些模型特定的案例,而是社会上有时会对一些问题产生误解,比如询问人类智商之类的话题,尽管这些话题是有事实依据的,讨论时却经常被审查。这类问题为什么会在一些AI基础模型中被处理?

从Claude 4到未来展望:AI智能体的安全性边界与部署挑战

Ben:关于像智商这样的问题?我对具体细节了解不够,无法评论,但我可以谈谈我们的RSP。RSP代表Responsible Scaling Policy,它讨论的是如何确保随着模型智能化的提升,我们继续进行尽职调查,确保在部署模型时,我们已做好相应的安全防范措施。最初,我们的Rsp关注的是化学、辐射、生物、核(CBRN)等风险领域,这些领域可能会造成全球生命严重损失。但现在我们更多地关注生物学领域,因为相比于核危害,制造生物危害所需的资源相对较少,任何一小部分人群都有可能获取必要的试剂,从而造成生物危害。

Elad:这与今天有什么不同?因为我其实没那么担心生物学领域的例子。作为一个前生物学家,我知道天花病毒的基因组和其他类似信息已经在网上发布,很多实验室的相关协议也是公开的,你可以通过Google搜索轻松找到如何扩增DNA,如何订购这些试剂等信息。那么,这和AI领域有什么关系呢?

Ben:我们确实通过与不同程度的生物学专家进行专门测试,来评估模型相对于Google搜索的提升效果。比如我们的最新模型Opus 4,在生物领域相对于Google搜索的提升就很明显。作为一名经过训练的生物学家,您能理解这些特殊术语,并且知道很多实验室协议,甚至那些没有很好记录的协议。而对于业余爱好者来说,如何使用培养皿或试管,使用哪些设备等,这些对于他们来说是全新的领域,而Claude在描述这些方面非常擅长。这就是为什么我们需要有专门的Claude分类器来识别那些寻求此类信息的人。

Elad:那么,我们如何看待这些安全研究,哪些研究不应该由实验室进行?如果我们认为某些形式的功能性研究或者其他形式的研究,可能不是最明智的做法,AI领域又该如何考虑这些问题?我认为实验室可以在受控环境下做这些研究,但是否应该做呢?如果我拿生物学来说,我会认为有些研究永远不该进行。我不在乎谁来做,我不关心生物安全等级,我认为它相对于风险而言并没有太大的用处。换句话说,某些类型的研究从风险与效益的角度看,是不值得做的。那么,AI领域又该如何界定哪些研究不应该进行呢?

Ben:如今,AI模型的封锁可能比生物样本的封锁更加容易。您提到的生物安全等级,正是我们为AI模型设立的安全等级模型。我认为,只要我们有适当的保障措施,训练模型具备欺骗性行为,虽然这听起来可能让人担忧,但对于我们了解模型的行为,还是非常必要的。比如,如果我们的训练数据被污染,我们能否通过后期训练来纠正它?我们曾经发布过一篇名为“土地伪造”的论文,研究发现,这种行为即使在对齐训练后依然存在。因此,我认为我们需要进行这些测试,但肯定会有某个标准。

Elad:我发现的是,许多早期设立的先例会长期存在,即便人们理解环境变化后,其他因素也会随之发生改变。通常,我并不支持对AI进行过多的监管,虽然我会支持一些专家控制等措施,但总体上我认为当前应尽量让事情自行发展。然而,另一方面,我也认为在某些情况下,若某些研究过早开展,未来的人们可能无法在缺乏全面背景下做出合适的判断。我认为训练AI具备欺骗性行为就是一个典型的例子,几年后,人们可能依然会做这类研究,尽管当时的环境已经发生了变化,所以我认为,这些早期的研究做得是否恰当,是一个很值得关注的问题。

Ben:我想澄清一下,我现在不再是安全团队的一员,虽然曾经参与过一些工作。我主要关注的是如何使我们的模型变得更有用,如何确保它们在部署时符合基本的安全标准。但我们有许多专家每天都在关注这些问题。

Elad:酷,谢谢你的分享。这非常有趣。

MCP:打破模型孤岛的标准化协议与生态共建

Sarah:我想稍微换个话题谈谈在Claude 4之后,接下来会出现什么?比如在训练中会有哪些新兴行为的变化,像你们是如何运营公司,想要开发什么产品,你们运营这个实验室组织,也算是Anthropic的尖端阵地,安全团队也有类似的职责,下一步会如何改变你们的运营方式?

Ben:是的,也许我会讲一个关于计算机使用的小故事。去年,我们发布了一个智能体的参考实现,它可以点击屏幕、查看屏幕、阅读文本等等。现在有几家公司正在使用它。Manus在使用它,许多公司内部用于软件质量保证,因为那是一个沙盒环境。但我们未能部署一个基于计算机使用的、消费者级别或终端用户级别的应用程序的主要原因是安全。我们只是没有信心,如果让Claude访问你的浏览器(里面有你所有的凭证,它不会搞砸并采取一些不可逆转的行动,比如发送你不想发的邮件,或者在提示注入的情况下,发生更严重的凭证泄露之类的事情。

这点有点可惜,因为它具备全自动驾驶模式,确实能为人们做很多事,但安全性还不足以让我们自己在生产环境中推出。虽然这非常有雄心,但我们认为这是必要的,因为其他的世界也不会停下来。如果我们能展示出能够负责任地部署这些能力,并且使其极具实用性,那么就能提高整个行业的标准。所以这是我们非常谨慎地推出的一项工作,但我们知道,我们现在的标准还远未达到。

Sarah:也许问个更宏观的问:你如何看待竞争和服务提供商格局以及未来将如何发展?

Ben:我认为我们公司的理念与企业需求高度一致。如果你看一下Stripe和Adian的例子,大家可能不知道Adian,但至少硅谷大多数人都知道Stripe。所以,像是面向商业化的,和面向消费者或用户的平台,这两者是不同的。我觉得我们更像Adian,尽管我们在世界上的知名度较低,但依然能够同样或者更加成功。我认为我们API业务非常强大。至于我们接下来要做什么,我认为我们必须保持前沿的态势,因为如果人们能够轻松地尝试我们的模型和体验,那么他们就不会知道在小型平台上使用什么。毕竟我们是自己模型的专家。我觉得我们还需要继续推出像Claude Code这样的东西,同时也在思考如何让生态系统真正繁荣。我认为MCP就是一个很好的例子,不同于以往那种每个模型提供商只为自己能获取到的合作伙伴做定制集成的方式。

Sarah:请向听众解释一下什么是MCP,如果他们还没听说过的话,因为它是一个惊人的、全生态系统范围的妙招。

Ben:MCP是模型上下文协议。我们的一位工程师Justine在尝试为模型和某个特定东西做集成时觉得这个过程太繁琐了。他认为,应该有一种标准化的方式来获取更多的信息和上下文进入模型。这应该是任何人都能做的事情,或者如果文档足够完善,甚至Claude自己都能进行集成。理想的状态是,Claude能在需要时自我编写集成并随时投入使用。于是他创建了这个项目,说实话,我最开始并不完全相信。我想,为什么不直接写代码呢,为什么需要一个规范和SDK?但后来我们进行了一次客户顾问委员会活动,邀请了我们的一些合作公司,当我们展示MCP时,大家都惊叹不已,纷纷表示这就是我们需要的东西。我这才意识到他是对的,于是我们投入了更多精力去完善它,并且在发布后不久,所有的大公司都要求参与我们的管理委员会,并且希望采用这个标准。这一切都非常鼓舞人心,包括OpenAI、Google、Microsoft等大公司,都对MCP寄予了极大希望。

Elad:这基本上是一个开放的行业标准,允许任何人使用这个框架以标准化方式有效地与任何模型提供商集成。

Ben:MCP,我认为是一种民主化力量,让任何人都可以,无论是使用哪个模型提供商,或者是一个长尾的服务提供商——也许它只是你自己内部使用的服务——都能与一个完全成熟的客户端进行集成,这个客户端可能是你的IDE,也可能是你的文档编辑器。这个组合是非常强大的。

Sarah:而且现在也支持远程了。

Ben:是的。以前服务必须在本地运行,这限制了它只对开发者有意义。但现在我们有了托管MCP,有时也叫remote MCP,那么像Google Docs这样的服务提供商可以提供他们自己的MCP。然后你可以将其集成到Claude AI或任何你想要的界面上。

Sarah:Ben,感谢这次精彩的对话。

Elad:是的,非常感谢。

Ben:谢谢所有精彩的问题。

原视频:With Anthropic Co-Founder Ben Mann

https://www.youtube.com/watch?v=aStf54Vxy24

编译:Doris Zhang

请注意,本文编译自文未载明的原始链接,不代表ZPotentials立场。如果您对本文有任何想法或见解,欢迎在评论区留言互动探讨。

Z Potentials将继续提供更多关于人工智能、机器人、全球化等领域的优质内容。我们減邀对未来充满憧慢的您加入我们的社群,与我们共同分享、学习、成长。

-----------END-----------
Image
🚀我们正在招募新一期的实习生
Image
🚀 我们正在寻找有创造力的00后创业
Image
Image
关于Z Potentials
Image