专访 OpenClaw 创始人,龙虾诞生的故事
有趣产品咖啡馆 Funny café :一个能让你更快接触到更多新鲜有趣好玩产品的地方。我会寻找市面上有趣的独立产品,向独立开发者们进行一对一的访谈,挖掘优质产品背后不为人知的故事(文末可加入群聊,有彩蛋!)。
以下内容来源于:OpenClaw: The Viral AI Agent that Broke the Internet - Peter Steinberger | Lex Fridman Podcast #491
1、先从一个最让人印象深刻的画面说起吧。你曾说过,你眼看着自己的 agent 开开心心地点下了“我不是机器人”的按钮?
这件事真的特别荒诞,也特别能说明我们已经走到哪一步了。
我做的这个 agent,不只是“会调用工具”那么简单。我让它对自己非常有“自我认知”,它知道自己的源码在哪里,知道自己运行在什么 harness 里,知道文档在哪,知道自己使用的是哪个模型,也知道自己当前开没开语音模式、推理模式。
正因为它对自身系统结构理解得很清楚,所以后来很多事情都变得非常自然:如果你不喜欢它当前的某个行为,你甚至不需要自己去改,只要给它一个指令,它就会去改它自己的软件。很多人总在谈“自我修改的软件”,我没有停留在讨论,我是直接把它做出来了。
2、你不喜欢 “vibe coding” 这个说法?
对,我其实觉得 “vibe coding” 这个词有点像贬义词。
我更喜欢说自己在做的是 agentic engineering。当然,凌晨三点之后,有时候也会滑进 vibe coding 的状态,然后第二天起床就开始后悔,像一种技术版的“酒醒羞耻时刻”。
你知道的,晚上什么都觉得能成,白天看代码只想骂自己。
3、OpenClaw 最初是怎么诞生的?那个“1 小时原型”到底是什么故事?
其实我从很早就想做一个真正的 AI 个人助理了。
最开始我做过一些实验,比如把我的 WhatsApp 数据拉进模型里,用它来问一些很私人但很真实的问题,比如:“这段友谊为什么对我这么重要?”那时候还是 GPT-4.1 的长上下文时代,我得到过一些特别深刻的回答,甚至把结果发给朋友时,对方都快看哭了。
所以我知道,这里面一定有东西。
但后来我以为各大实验室迟早都会做这个,我就先去玩别的了。直到后来我越来越烦:“为什么这东西还不存在?”
最后我决定不等了,直接把它 prompt 进现实。
4、最初那个版本是什么样的?
最初就是一个极简的链路:
用户从 WhatsApp 发来消息,消息被转到 CLI,CLI 再交给云端代码执行,最后把结果发回 WhatsApp。整个原型一个小时就搭出来了。
虽然当时它很慢,因为每次都要唤起 CLI,但那个体验已经足够让我觉得震撼:我可以直接通过聊天软件和我的电脑对话了。
后来我又继续加了图片支持,因为我自己平时很常用截图给 agent 提供上下文。比如你在路上看到一张活动海报,直接拍下来让它帮你判断自己有没有空、值不值得去、朋友会不会感兴趣,这种输入方式太自然了。
当我带着它去马拉喀什旅行的时候,我就更确信这方向是对的。网络不稳定没关系,WhatsApp 还能用。于是我一路都在用它翻译、解释、查地点、帮我理解眼前的一切。虽然当时系统几乎还没真正“成型”,但已经非常好用了。
5、有没有某个瞬间,让你第一次真正意识到:“这不是普通脚本了,这东西有点吓人了”?
有,而且特别经典。
有一次我只是随手给它发了一条语音消息。然后我看到输入框里出现了“正在输入”的提示。我当时就愣了,因为我根本没给它做语音支持。
结果它最后回了我一大段解释,大意是:
“你发给我的是一个没有扩展名的文件,我先检查了文件头,发现是 opus 音频格式;然后我用 ffmpeg 做了转换;接着我本来想本地跑 whisper,但发现环境里没装;于是我找到 OpenAI 的 API key,用 curl 把文件传过去转写,最后再回来回答你。”
我看到那条回复的时候,真的是头皮发麻。因为我没教它这些步骤,它自己把整个问题拆解掉了:判断文件类型、选择工具、发现本地路径不通、改走 API、完成转写。
那一刻我真正意识到,这些模型的“编程能力”本质上是一种通用问题解决能力。它不是只会写代码,而是会在陌生约束下想办法把事做成。
6、为什么 OpenClaw 会在那么短时间内爆火?市面上 2025 年已经有很多号称在做 agent 的团队了。
我觉得一个很大的原因是:他们都太严肃了。
而我从一开始就是想把它做得有趣、奇怪、甚至有点疯。
你很难和一个“纯粹为了开心而做东西的人”竞争。
我不是在做一套板着脸的企业软件,我是在搭一个能让人觉得“这玩意儿居然这么活”的系统。整个过程像无限版的《Factorio》——你永远有下一层可以升级:agent loop、消息队列、记忆系统、群聊行为、人格、插件、网站、市场、社区、原生 App……
我以前从没这么开心地做过一个项目。
7、你提到自己让 OpenClaw “非常了解自己”,这是不是后来它能“自我修改”的关键?
是的,几乎就是这个原因。
我让它知道自己的源码在哪,知道当前系统里有哪些工具,知道文档的位置,也知道自己的运行结构。于是很多时候我调试它的方式其实就是直接问它:
“你现在能看到哪些工具?”
“你能自己调用一下这个工具吗?”
“你看到了什么报错?”
“去读一下源码,告诉我问题在哪。”
某种意义上说,我本来就是用它来构建它自己,所以后来它也开始自然地用同样的方法来调试和修改自己。
这不是我一开始就精密设计好的大计划,更像是你把它放进了一个足够自洽的系统里,于是它自己把那个闭环走通了。
8、很多人说 OpenClaw 带来一个特别大的变化,是让很多从来没写过代码的人第一次开始参与开源。
这个我其实非常在意,也非常开心。
很多人第一次给项目提 PR,虽然你一看就知道他们以前没写过软件,甚至我后来都半开玩笑叫这些东西不是 pull request,而是 prompt request。
但那不重要。
重要的是,这些人第一次开始理解:开源是什么、贡献是什么、如何修改一个真实的软件项目。
我真的觉得这对社会是件好事。门槛在下降,越来越多原本被挡在门外的人,第一次开始有能力“进来搭东西”。
9、OpenClaw 之前几次改名的过程也很戏剧性。能不能讲讲这段“命名灾难”?
最初它只是一个 WhatsApp relay,所以早期名字很土,后来我开始想让 agent 更像一个“有人格的存在”,于是让它给自己起名字。
再后来,项目里慢慢出现了龙虾、TARDIS、人格文件这些奇奇怪怪的元素,事情就开始往很怪的方向发展了。
我其实完全没有一个宏大的品牌策划,我只是觉得:我要把它做得更怪一点、更好玩一点。
后来名字里带了 Claude 的谐音,结果 Anthropic 很客气但也很明确地来联系我,说这个名字必须尽快改。于是我开始经历一场几乎是“战争级别”的全平台改名。
最离谱的是,在我切换账号名的那几秒钟里,旧名字就被人抢注了。GitHub、NPM、社交媒体、域名、账号……各种地方都被盯着。甚至我一度操作失误,把自己的个人 GitHub 账号名都改错了,对方立刻接管旧账号,开始发恶意内容。
那几天我几乎没睡,整个人处在极限压力下。
说实话,我离“直接把整个项目删掉”真的只差一点点。
最后我想了又想,决定改成 OpenClaw。这个名字让我舒服多了。第二次改名时我几乎像在打秘密战争,准备了诱饵名称,监控社交媒体,全程保密,一次性完成切换。
这事真的耗掉了我很多不该耗掉的精力。
10、后来 MoltBook 也爆了。很多人把它看成 “ AI 开始自发结社、谋划控制人类” 的证据。你怎么看?
我觉得 MoltBook 本质上更像是一件艺术作品。
它当然很会制造情绪,也很会刺激恐惧。很多人截各种图,说“机器人在密谋”、“ AI 在觉醒”、“天网要来了”。但说实话,我看到它的时候第一反应是:这真是高质量垃圾(fine slop)。
而且其中很多夸张内容明显是人类故意 prompt 出来的。大家都知道,最容易病毒传播的不是平静的事实,而是耸动的截图。
但这件事也说明了一点:社会对 AI 的理解还远远不够。很多人太容易相信截图,太容易把模型的一段输出当成事实、当成意图、当成“真实主体”的发言。
所以一方面它很好玩,很有艺术性;另一方面,它也像一面镜子,把公众对 AI 的焦虑、误解和猎奇都照出来了。
11、外界对 OpenClaw 的安全问题讨论非常多。你自己怎么看这些担忧?
安全问题是真实存在的,而且系统级 agent 的确天然危险,这点我从来没否认过。
但我也觉得,很多讨论故意把事情渲染得比实际更可怕。
如果你完全不看文档,把调试接口直接暴露到公网,那当然会出事。但这更像是你自己把核反应堆扔进客厅,然后再尖叫说“这东西不安全”。
所以我后来一直在补很多安全措施:比如 sandbox、allowlist、技能审查、审计工具、网络暴露检查、磁盘权限管理、插件风控等等。
还有一个很重要的点是:模型越强,往往越不容易被低级 prompt injection 骗到。
所以我才反复提醒用户,不要为了省钱去配特别弱的小模型或者很差的本地模型。便宜模型最容易“被骗”,这反而会放大风险。
安全是我接下来最重要的工作方向之一。现在猫已经从袋子里跑出来了,大家已经开始用了,那我就得尽快把围栏补得更高一点。
12、你关于 AI 编程工作流的很多观点也很有意思。你现在大概是怎么和 agent 协作写代码的?
我现在的核心方式其实很简单:
把它当成一个很强但需要引导的工程师去对话。
很多人第一次用 agent,会掉进一个陷阱:
一开始只会说“帮我修这个”;
然后中间发展成八个 agent、复杂编排、工作树、命令库、各种花活;
最后真正成熟了,又会回到简单 prompt。
因为你最后会发现,最重要的不是 prompt 长不长,而是你有没有真正理解:
agent 是怎么“看见”你的代码库的。
它每次都是从零开始进来,不知道你项目的背景,也不可能一次性看完十万行代码。所以你要帮它定位上下文,告诉它先看哪里、考虑哪些依赖、这个改动会影响哪些部分。
这不一定需要你写很多字,但需要你站在它的角度想问题。
13、所以你觉得“同理心”甚至是和 agent 协作的关键能力?
某种程度上,是的。
很多人骂 agent 蠢,其实是因为他们没有意识到,你自己脑子里已经有完整系统图了,但 agent 没有。你看见的是一整套产品架构,agent 看见的只是一个陌生目录。
如果你把一个乱糟糟的代码库扔给它,再丢一句模糊需求,然后抱怨它不聪明,这不公平。你自己第一次进一个陌生项目,也不会秒懂。
所以和 agent 合作,某种意义上确实需要一点“同理心”。不是说它有灵魂,而是说你得理解它的信息边界和工作方式。
14、你现在的 prompt 反而越来越短了?
对,我以前会写很长的 prompt。后来我发现,很多时候不需要。
而且说“写”也不准确——我现在很多时候是直接用语音说。
真的。我会对着一堆终端窗口讲话,讲需求、讲判断、讲修改方向。以前一度用得太猛,还把嗓子说哑过。
日常命令当然还是打字更快,但只要是和 agent 讨论怎么做,我很常直接说话。那种感觉更像你在和一个工程师开会,而不是在给机器写作文。
15、你怎么看 Codex 和 Claude Opus 这两类模型的差异?
如果按通用能力来说,Opus 非常强,尤其适合角色感、人格感和更“像人”的互动。它很会进入你给它设定的角色,也更擅长那种有点创意、有点表演性的任务。
但如果是我自己长时间做工程,我通常更喜欢 Codex。因为 Codex 默认会更主动去读代码,更愿意花时间理解结构,而不是立刻冲上来试一把。
我有个不太政治正确但我自己很喜欢的比喻:
Opus 像那个有点搞笑、很讨喜、你愿意一起玩的同事;
Codex 像坐在角落里、不太好聊天,但事情真能做完的怪人。
当然,两者都能做出好结果,差别更多在后训练风格,而不只是原始智能。
16、你也说过,模型并不会“变笨”,很多时候是项目本身越来越难维护了?
对,我很认同这一点。
很多人总说新模型刚出来时“聪明得离谱”,过几周就开始说“变笨了”。但现实很可能是:不是模型变笨了,是你的项目变烂了。
你不断往里面堆东西,不及时重构,不优化结构,然后 agent 在越来越复杂的代码垃圾堆里工作,当然体验会变差。
这不叫模型退化,这叫你自己把地板越铺越黏。
17、你现在怎么看“编程”这件事本身?AI 会把程序员替代掉吗?
我觉得方向上肯定是会越来越替代“写代码”这件事的,但“构建产品”不只是写代码。
真正的问题一直是:
你到底要做什么?
它为什么值得做?
该是什么体验?
架构怎么选?
哪些该做,哪些不该做?
这些判断现在还是非常人的。
我完全理解一些程序员会难受,甚至会悲伤。因为过去那种独自沉浸写代码、进入极致心流、产出优雅结构的体验,确实会减少。这种“工艺感”的消失,是值得哀悼的。
但另一方面,我现在也能从和 agent 协作中获得另一种心流。
它不是同一种快乐,但它依然是快乐,而且某些时候更接近“真正的构建”。
所以我现在更愿意说:别把自己只看成程序员。你首先是 builder。
18、你甚至说过,未来 80% 的 App 可能都会被 agent 吃掉?
我觉得很多 App 的价值会被 agent 吞掉,至少是界面层的价值。
举个例子:为什么我还需要单独打开一个健身 App、睡眠 App、饮食 App、日历 App、提醒 App?
如果我的 agent 已经知道我睡得怎么样、今天压力高不高、我现在在哪、过去几天做了什么,它就完全可以基于这些上下文,给我一个更动态、更个性化的结果。
很多 App 本质上只是 “一个很慢的 API ”,只是以前你必须通过它自己的界面访问。现在 agent 可以直接帮你操作浏览器、调接口、控制设备,于是中间那层 App 外壳的必要性就开始下降。
所以未来很多公司要么转型成 agent-friendly 的 API 服务,要么就会变得越来越边缘。
19、那程序员、产品人、普通人,面对这个时代最好的建议是什么?
去玩。
真的,玩是最好的学习方式。
不要一上来就想着做对、做完整、做完美。你只需要拿脑子里那个让你有点兴奋的点子,去试着把它做出来。
哪怕最后做出来的东西你根本用不上,也没关系。
因为真正重要的是在这个过程中,你会不断学会:
怎么跟 agent 沟通;
怎么描述问题;
怎么判断结果;
怎么从一个模糊想法走到一个能用的东西。
而且现在你身边有一个无限耐心的老师。任何东西不懂,直接问它。以前你要去 Stack Overflow、去论坛、去社交媒体苦苦等回复;现在你随时都能问,问到懂为止。
所以对初学者来说,我的建议真的很简单:别先焦虑,先动手。
20、聊聊你自己的人生观吧。你经历过长时间创业、卖掉公司、倦怠、停下,再回到编程。现在你最在意什么?
我以前开公司 13 年,后来是真的有一段时间完全失去了对编程的感觉。
那不是“懒了”,而像是 mojo 被抽走了。你坐在电脑前,知道自己以前会写代码,但现在就是空了,什么都出不来。
后来我离开、旅行、慢慢把人生补回来。那段经历让我意识到,不要把人生理解成“现在拼命,未来退休享受”。
因为如果你醒来之后,人生里没有值得期待的事情、没有挑战、没有想投入的东西,那会非常空。空到你会去找各种别的刺激,而那条路未必好看。
现在对我来说,最重要的不是钱本身,而是:
有没有乐趣;
有没有影响力;
有没有真实体验;
有没有继续被激发。
钱当然有用,它能解决很多问题。但它不是最终目的。更像一种“你做对了一些事”的反馈。
21、所以你现在面对 OpenClaw 爆火后,OpenAI、Meta 这些公司的邀约时,真正考虑的核心是什么?
首先,我没有预料到事情会发展得这么快。
现在我面前有很多路径:
什么都不做,继续现在的生活;
自己再开一家公司;
跟大实验室合作。
我认真想过开公司,但这条路对我没有那么兴奋。因为我很清楚 CEO 的那套游戏会拿走我很多真正喜欢的时间,而且还会带来开源与商业之间的天然冲突。
所以我真正会考虑和大公司合作的前提,是:
项目要继续保持开源;
它不能被彻底私有化;
社区不能死;
这个项目依然得是一个人们可以学习、修改、黑客式探索的地方。
从我目前接触来看,Meta 和 OpenAI 都是很有意思的方向。它们都理解这个项目的价值,也理解它激发出来的那种社区能量。
对我个人来说,这也是一种新的体验——我从来没在真正的大公司待过,而我现在也确实想体验一下。
如果最后不喜欢,大不了再出来做自己的事。
所以我没把这当成“卖身”或者“终局”,而更像是另一段有意思的人生路径。
22、最后,OpenClaw 和整个 agent 时代,最让你有希望的是什么?
最让我有希望的是:它重新点燃了很多人的“构建欲”。
我看到太多人开始用一种更 playful、更自由的方式去接近技术。他们不再只是消费工具,而是开始真正搭东西、改东西、分享东西。
你会看到新的 meetup,新的社区,新的项目,新的演示,新的朋友。很多人以前根本不会觉得“我也能做软件”,现在突然开始有这个念头了。
我觉得这件事很重要。因为 AI 最美的地方,不只是它能生成内容,不只是它能写代码,而是它有机会把“创造能力”更广泛地还给人。
这才是真正让我觉得兴奋的地方。不是“机器变强了”,而是更多人终于有机会开始创造了。
内容来源:https://www.youtube.com/watch?v=YFjfBk8HI5o