- 链接:https://www.lennysnewsletter.com/p/how-we-built-grok-bot-in-a-month- 嘉宾:Roman Ugarte,Grok Bot 产品负责人,早期加入 Cursor- 主题:Grok Bot 如何在一个月内从零做出;AI Agent 应该是什么产品形态;为什么要给 Agent 自己的电脑;如何做产品、组织、增长与 moat。Roman 对 Grok Bot 的最终愿景非常简单:**每个人都应该拥有一支 AI bot 团队,既帮你工作,也帮你处理生活。**他认为 Grok Bot 真正改变的并不是模型,而是人与 AI 的关系。今天大部分产品仍然是:> 人打开一个 AI → 创建一次对话 → 给任务 → 看过程 → 检查结果 → 修改 → 再继续。**“这是一个有自己电脑的同事。我把事情交给它,然后去做别的事。”**## 1. Grok Bot 是怎么开始的:真的从一张白纸开始Lenny 问 Grok Bot 最初是怎么来的。Roman 说,他们很早就意识到 Cursor 在 developer / engineer 场景积累了大量关于 Agent 的经验,但一直有一个问题:**如果不是 coding,而是普通 knowledge work,一个真正好的 Agent 产品应该是什么样?**他们没有从 Cursor 里抽一个模块慢慢改,而是建立了一个非常小的内部团队。- 使用 private Slack channels;- 目标只有一个:做一个面向知识工作的 Agent 产品。从第一行代码到内部可用版本,大约只用了 **一个月**。这个产品每天都要做大量没有先例的“小决定”。如果一开始就几十个人参与,大家不断讨论未来 6~12 个月路线、组织协调、跨团队需求,他们根本不可能一个月做到这个状态。**这种探索期需要少数人每天连续做上百个 judgment calls。**产品做出来以后,他们在 SpaceXAI 内部的 all-hands 上发布。内部开发 Grok Bot 的人喜欢它并不能说明什么。开发者天然知道产品怎么用,也知道哪里可以绕过去。结果发布后的一周内,很多原来每天使用 ChatGPT 或其他聊天式 AI 的员工,开始把大量日常 Agent 工作迁到 Grok Bot。OpenAI、Anthropic 等公司的路径很自然:为什么不直接给 Cursor 加一个 knowledge-work 模式?Roman 说,这个决定**一点都不 obvious**,内部讨论了很多次。Cursor 本身当然也能处理非编程工作,而且 coding agent 在很多普通任务上已经非常强。- Cursor 的品牌首先让人想到 coding;- 原有产品的各种设计假设都是围绕 programmer;- 新功能不断通过新的 tabs、modes、panels 加进去。**shipping your org chart。**公司内部可能有三支团队、三个产品方向,于是 UI 里正好出现三个 tab。最后呈现出来的其实是三个产品哲学被硬塞进同一个窗口。这样他们可以控制每一个 pixel,并围绕“knowledge worker 如何与 AI 同事合作”建立一套完整、一致的产品逻辑。Roman 并不认为“独立产品”永远是正确答案。他甚至提到 Codex 后来采取了相反方向,把更多东西合并起来。**对于 Grok Bot,当时从零开始给了团队巨大的自由。**# 3. 为什么亲自 onboarding 200~300 个用户正式发布前,核心团队大约花了两周时间,亲自 onboarding 了 **200~300 人**。核心开发者自己坐在那里看一个真人困惑 20 分钟,会产生一种 dashboard 给不了你的压力:**“这个东西明天必须修掉,因为明天我还要亲自给另一个用户做 onboarding。”**这也是 Roman 认为人工 onboarding 特别有价值的原因之一。## 一个自然出现的模式:Chief of Staff内部使用一两周后,人们开始创建 5~10 个 bot。一些员工开始挑出表现最好的 bot,把它“晋升”为:以后用户主要和这个 Chief of Staff 说话。**这是内部文化导致的特殊玩法,还是人类面对一组 AI Agent 后自然会形成的组织方式?**所以做外部 onboarding 时,他们刻意没有告诉用户应该建立 Chief of Staff。Roman 的原话意思是,他们不想 **lead the witness**,不想诱导实验结果。# 4. 用户到底需要看到 Agent 的多少内部过程Grok Bot 和很多 Agent 产品一个明显区别是:所以 Grok Bot 的设计更接近 Slack:- 必要的时候,它主动给一些 progress update。但不会看到它每一次 tool call、每一个 click、完整 reasoning stream。但几乎没人真的想看长长的 chain-of-thought 和 tool-call log。**Agent 的内部机制应该越来越被抽象掉。**# 5. 为什么早期用户不能只找 Silicon Valley AI 圈的人200~300 个 early users 并不只是所谓 influencers 和 AI power users。Lenny 自己属于这一类,因为他用过很多 AI 产品,能够快速比较。但 Grok Bot 团队还故意寻找一些他们平常完全接触不到的人。有人给他演示了一下 Grok Bot,他变成了非常重度的用户,而且后来成了特别有价值的 bug / feature feedback 来源。- Shopify integration 某一步不稳定;这些问题,SpaceXAI 自己 dogfood 一辈子也不一定遇得到。**Silicon Valley AI bubble。**这个 bubble 有价值,因为里面的人会推动 frontier。但如果 Grok Bot 真想成为 mainstream user 和普通公司的工作方式,就必须主动逃出这个 bubble。他甚至认为这种 Agent 对 non-developer 可能比 developer 更重要。# 6. 内测到发布的三周:他们主要做的是“删东西”- 约 1 个月:第一行代码 → internal beta;- 约 3 周:internal beta → public launch;- 录制节目时:public launch 也才约 3 周。尤其因为开发团队自己需要 debug,他们把很多内部东西直接做进了产品:- developer-like observability;> ruthlessly simplify the product.另一个主要工作不是加“大 feature”,而是:- 要么给用户一个可以判断和继续 steering 的结果。为了做到这一点,团队真正投入时间的是一些后台很不起眼的问题:# 7. Sales 为什么成了 Grok Bot 最疯狂的用户之一内部 sales / GTM 团队很快变成非常重度的 Grok Bot 用户。比如某个 Salesforce 页面上的控件,Agent 鼠标控制不够精确,就是点不到。“Agent 缺少哪一种 screen / browser understanding,使这个真实任务无法完成?”因为相比 benchmark 从 73.2 上升到 74.1,它意味着:**昨天还完全无法完成的一整块真实工作,今天突然能做了。**修完以后,sales 团队第二天就开始疯狂感谢他们:“之前连续失败七天的 workflow 终于跑通了。”Roman 认为 Agent 的进步很大程度就是不断:# 8. Recruiting 的案例:AI 不只是筛简历Roman 先解释 SpaceXAI 的招聘哲学:一个人是否正在找工作,不应该成为是否招聘他的前提。如果你采用这种招聘方法,“AI 帮我读 500 份 résumé 然后排序”的价值其实很有限。假设某个领域最新人才出现在学术会议里,而且论文甚至没有 Google Scholar 页面,只存在 conference website。- 如果有联系,就主动发 Slack 请求 introduction。Roman 认为这种持续、重复、大范围的信息搜索其实非常适合 AI。# “Grok Bot now has…” → “Grok Bot can now…”**如果这个东西发布,我们的 launch tweet 是什么?**如果连一条有吸引力的发布内容都写不出来,也许根本不应该做。**Adding things to the product is not the goal.****reliably do impactful work。**因此很多“feature”其实根本不需要 pixels。能变成 bot 自己控制的能力,就应该把对应 UI 删除。# 10. Automation:为什么不应该有 automation builder6. 可能再写 natural-language instruction。结果就是普通用户根本不会建立很多 automation。用户甚至不应该意识到背后创建了一个 automation object。Roman 说当时平台上大约 **99% 的 automations 都是通过自然语言创建的**。# 11. Grok Bot 最关键的两个早期决定理论上 Codex、Cowork 等也能完成很多类似事情。这些都是 implementation detail。## 决定二:每一个 bot 都拥有自己的 computer“你的账号和密码我都可以看到,我的账号和密码你也可以看到。”但今天很多 AI 产品的 computer use 恰好就是这样。Roman 认为未来回头看这一阶段,会觉得非常奇怪。既然你把 AI 当新的 colleague onboarding:很多 primitives 其实市场已经证明过了。Roman 认为 OpenClaw 做对了两个非常重要的事情。很多大家认为“AI 还是很笨”的案例,其实问题不是 intelligence。### 2. 把 AI 当成一个 colleague / helper entityOpenClaw 改变了很多人的 mental model。“我生活里有一个持续存在、能接触各种东西的 helper。”Grok Bot 做的事情更多是 **productize** 这套模式。- 大量 AI power-user 才懂的概念。Roman 认为这种方式不可能服务 millions of mainstream users,更不可能成为普通企业标准工作方式。所以 Grok Bot 的创新重点之一不是发明这些 primitives,而是:普通用户没有义务每天研究 AI frontier 才能把产品用好。# 13. “Colleague-pilled”:产品设计的 North Star当两个产品方案看起来都有道理,大家争不出结果时,他们会换一个问题:因为 SaaS 产品应该如何工作,大家可能意见不同。但“一个优秀同事在这种情况下应该怎么做”,通常大家的答案非常接近。Roman 认为很多 AI 产品问题其实不需要特别天才的 product insight。**human teammate 在这里是什么行为?**然后尽量复制这种 interaction model。# 14. Voice 的例子:为什么 AI 协作还缺一个重要形态Roman 认为真正的 AI colleague 应该把这些状态自然连起来。# 15. Work 与 personal:一个产品还是两个?很多人本身就希望 work / personal 分开。**解决这两个问题的产品 form factor 本质上非常相似。**里面可能是不同 bots、不同权限和 context boundaries,但 interaction model 是同一套。# 16. 下一代“power tool”可能看起来反而很简单Roman 对“专业软件”还有一个很有意思的判断。过去的 power tool 很像 Photoshop。新的 power tool 主要需要用户做两件事:**表达 intent + steering。**所以一个非常强大的专业工作工具,未来看起来可能像:Roman 甚至说他走过同事桌边时,有时候第一眼会觉得对方正在 messaging。其实那个人正在 Grok Bot 里完成主要工作。# 17. Under the hood:不要把 Grok Bot 理解成 VM 产品Roman 没有把重点放在 infrastructure implementation。所以随着 computer-use 能力越来越强,Roman 认为:**computer 最终应该完全从用户的 mental model 中消失。**Roman 认为更正确的 mental model 是:它们不是 disposable chat sessions。- 用户不断复制贴上一次 conversation 内容。也就是既可以走机器接口,也可以在没有机器接口时直接操作 computer。# 18. Grok Bot inside Grok Bot:QA BotLenny 在 meetup 看到一个很疯狂的 demo:**让一个 Grok Bot 的 computer 运行 Grok Bot。**这个例子强化了 Roman 的 mental model:**如果这是一个拥有电脑的人,我可以叫他做什么?**# 19. Roman 自己最重要的用法之一:InfovoreRoman 认为非常有潜力的一类 Agent 是:**information eater / infovore。**也就是让 AI 吞掉巨大数量的信息,把用户从 information overload 中释放出来。**X 上几乎所有关于 Grok Bot 的 mention。**- 如果是 bug,交给 QA bot 尝试 reproduce;它变成 always-on 的 Chief of Staff:**外面的 information firehose 一直冲进来,但 Roman 自己不用一直看。**甚至已经有人让 Grok Bot 拥有 **page 自己的权限**。例如用户出去喝咖啡,如果发生真正紧急的事情,bot 可以 page 他。当然这需要极高 trust,因为 false positive 会非常烦人。**从 reactive 变成 proactive。**# 20. Go-to-market:从个人 early adopter 进入公司Roman 说,他们在 coding AI 上已经经历过一次类似路径。开始用 Cursor 和最新 AI coding tools。Roman 认为 knowledge work 也会发生类似事情。用户可能最先因为很个人、很好玩的事情产生 aha moment,例如:- 帮忙处理 Tesla charger negotiation;最终 Roman 认为 Grok Bot 并不是单纯 consumer toy。**transform businesses / transform teams。**Bot 最终要进入公司并产生真正有经济价值的工作。- organization-level memory 应该是什么?Roman 明确说这里仍有很多 unanswered questions。# 21. SpaceXAI 当时的三个 AI 产品支柱Roman 把 SpaceXAI 当时的方向分成三块。专业 programmer 最终需要一个每个 pixel 都针对 engineering 优化的专业 surface。- engineering-adjacent tasks。但真正 shipping production software,仍然需要 developer-specific product。### General knowledge work目标是不断扩大可委托工作的范围,使它更像真正 teammate。尤其是进入 businesses 和 teams。Roman 把 SpaceXAI 的模型目标描述成相当 practical:他的表述是,他们的重点没有那么偏向抽象地追求某个“superintelligence”概念,而更偏向把模型能力落实为实际可用产品。这和团队里很多人的 applied engineering 背景有关。# 22. “完成 90%”和“完成 100%”不是数量区别**能够完成 100% 工作的 AI,与只能做到 90% 的 AI,是完全不同类别的产品体验。**那么任务虽然理论上完成了 90%,实际上它一直留在你的脑子里。真正 delegation 更像篮球里的 **no-look pass**。这就是 Roman 认为 Grok Bot 第一次在 non-coding work 中让他感受到的东西:工程师过去一年多已经越来越习惯这种体验,因为 coding agent 大幅改变了 programming。但大部分普通 knowledge worker 使用 AI 的方式其实仍跟两年前差不多:Roman 认为真正的 Agent 应该结束这种模式。“我们两天后 launch template marketplace。”他加入 Cursor 时公司大约 **15 人**。后来增长到 **1,000+**,之后又进入更大的 SpaceXAI。他觉得 SpaceXAI/Cursor 至今仍较强地保留这种 impulse。而且 Cursor 本身还大量依赖 foundation-model providers。两年前正确的 AI 产品,不可能仍然完全适合今天。**如果公司不能大约每六个月彻底重新发明一次自己,就会输。**Roman 认为过去很多 AI coding competitors 消失,并不一定因为他们缺资源或者做了某一个明显错误决定。**组织文化无法随着 reality 足够快地改变。**Roman 提到两个自己经常重复的 values。模型能力不断增强以后,很多以前必须靠 product scaffolding 才能实现的东西会变得多余。这也是为什么 Grok Bot 从 prototype 到发布主要做的是 unshipping。**ask-for-permission culture。**# 26. 对 AI startup moat 的看法**obsess over building something useful today。****有没有办法通过 engineering 和 product,把那种未来能力提前到今天?**然后再次看未来三个月,把下一个“不可能”的东西提前。Roman 认为 Cursor 一直重复这个 cycle。它不是创业第一天在 strategy diagram 上画出来的。**找到今天还不可能、但非常有价值的事情。想办法让它今天就可能。****moats are often discovered, not planned。**这是 Lenny 的归纳,不是 Roman 的原话立场,需要区分。# 27. Roman 建议 Grok Bot 新用户怎么开始Roman 很刻意地不愿意分享所谓“高级 prompt hacks”。因为如果产品真的需要几十个 hacks 才好用,在他们看来就是产品没有做好。**“根据你现在能看到的 Slack、email 等信息,找五件你可以从我手上完全接过去做的事情,并告诉我需要怎样做。”**# 28. Power user:给所有 bot 一个统一 output storeRoman 目前越来越关注 bots 之间的 cooperation。如果十几个 bots 一直生产信息,输出会散落得到处都是。让 bots 把 artifacts / digests 写进一个统一、对人很易读的地方。这样用户不需要去十个 bot conversation 里找东西。Roman 给 advanced users 的建议就是:一群 autonomous agents 如果没有统一的信息出口,很快也会制造另一种 information chaos。- Kurt Vonnegut 的 **Cat’s Cradle**- Steven Pressfield 的 **The War of Art**他会每年重看一次 **Casablanca**,其中恰巧有一个角色也叫 Ugarte。他也会看老剧 **Monk**,部分原因是喜欢剧中 1990s~2000s 初 San Francisco 的样子。除 Grok Bot 外,他很喜欢 semantic search 产品。特别提到 **Exa**,以前叫 Metaphor。Roman 很喜欢把 semantic search 用在奇怪的数据集上,比如艺术馆 image collection,而不只是搜索网页。他长期放在门上的一段文字是 **Desiderata**。从十几岁开始,每次搬家都会把它贴到门上,觉得反复读仍能得到新的东西。如果把整期对谈保持原有逻辑串起来,Roman 的思想其实是下面这一条连续链条:**模型已经越来越聪明 → 限制 AI 的越来越多不是 intelligence,而是 harness、tools 和 product form → 所以应该给 Agent 真实工具和自己的电脑 → 一旦它能持续存在并真正完成工作,就不应该再被理解成 chat session → 它应该成为长期存在的 colleague → 既然是 colleague,产品设计就可以大量借鉴人与同事的协作方式 → 用户不需要看它每一步 reasoning,也不需要和它共享鼠标 → 用户真正需要的是 delegation 和 trust → 真正的 delegation 要求 AI 接近端到端完成工作 → 90% 完成并没有消除人的 cognitive load → 当 AI 能完成整块工作,它就从“提高效率的软件”变成了“增加团队 capacity 的成员”。**而 Grok Bot 的很多具体产品决定,其实全部是这条逻辑的后果:- natural-language automation;- proactive notifications;- unified artifact store;- 从 personal early adopters 向企业扩散。这里最值得注意的地方可能是:Roman 并没有把 Grok Bot 的突破归因于某个新模型。**同样越来越强的模型,如果你换掉产品的基本假设,用户感受到的是完全不同的东西。**这也是为什么他们选择从零做一个新产品,而没有继续往 Cursor 里加 tab。