MacTalk

OpenAI 离职员工爆料公司压力巨大发展速度惊人

上午看了一篇前 OpenAI 员工 Calvin 的离职感想,作者回顾了自己在 OpenAI 工作一年多的经历和观察,看完给我自己许多启发。创业维艰,即便是 OpenAI 这种迅速崛起的小巨头,一样压力巨大。

Calvin 提到 OpenAI 发展极快,员工人数一年内从一千多增长到三千多,团队文化多元且变化迅速。公司内部极度依赖 Slack 沟通,强调自下而上的创新氛围,好的想法可以来自任何人,行动力很强,决策和方向调整也非常迅速。OpenAI 的管理层更看重实际能力而非政治手腕,领导层高度参与日常事务。

OpenAI 是一个高度保密且压力巨大的地方,因为公司目标是 AGI,产品是可以影响数亿用户的,未来可能更多。同时,OpenAI 和公司管理层需要面对外界和媒体的密切关注。公司内部不同部门和资历的人目标和视角差异很大,但整体都在努力做正确的事。OpenAI 在 AI 红利分配上做得很开放,尖端模型很快就会对外开放 API,普通用户也能免费体验。

Calvin表示,“这些观点不代表公司立场——仅是我个人的观察”。

在安全方面,OpenAI 更关注实际风险,比如仇恨言论、滥用、政治操控等,理论风险也有人研究但不是重点。公司技术栈以 Python 为主,所有服务运行在 Azure 上,基础设施有很多 Meta 的影子。团队流动性强,协作灵活,产品开发节奏极快。作者参与了 Codex 项目的发布,整个产品从零到上线只用了七周,团队成员各自独立但高度协作。

这段经历让他收获巨大,无论是对大模型训练、代码管理还是与优秀人才共事都有很深的体会。他认为 OpenAI、Anthropic 和 Google 是 AGI 赛道的三大主力,每家公司都有不同的路径和基因。对于创业者来说,现在既是创业的好时机,也是观察未来趋势的绝佳窗口。

内容非常多,我把翻译后的文章贴到下面了,供读者参阅。

关于 OpenAI 的思考

作者:https://calv.info/openai-reflections

我三周前离开了 OpenAI。我最初是在 2024 年 5 月加入这家公司的。

我想分享一些个人思考,因为外界对 OpenAI 的种种举措众说纷纭,却鲜少有人真实描述过在那里工作的文化氛围。

纳比尔·库雷希曾写过一篇精彩的文章《关于 Palantir 的思考》,深入剖析了 Palantir 的独特之处。我也想趁记忆犹新时,为 OpenAI 留下类似的记录。这里不会涉及任何商业机密,更多是对这个处于历史关键节点的非凡组织当前状态的观察。

首先声明:我的离职决定不涉及任何个人恩怨——事实上这个选择让我非常纠结。从自主创业者转变为三千人规模企业的员工,这种身份转换并不容易。此刻的我渴望一个全新的开始。

未来完全有可能因为工作本身的吸引力而回归。毕竟很难想象还有什么比 AGI 更具影响力的项目,而 LLMs 无疑是这十年来最重大的技术创新。能亲眼见证部分突破性进展并参与 Codex 的发布,我深感幸运。

显然这些观点不代表公司立场——仅是我个人的观察。OpenAI 规模庞大,这里只是我窥见的一隅。

关于 OpenAI 首先要了解的是其惊人的扩张速度。我入职时公司刚过千人规模,一年后已突破三千人,而我的司龄竟排在前 30%。几乎所有管理层现在从事的工作与 2-3 年前都截然不同。

如此迅猛的扩张自然导致各种问题:公司沟通机制、汇报体系、产品交付流程、人员管理方式、招聘程序等等。团队文化差异显著:有些团队始终全力冲刺,有些则守着长期项目,还有些保持着稳定节奏。OpenAI 没有统一的工作体验,研究部门、应用部门和市场推广部门遵循着完全不同的时间维度。

OpenAI 有个与众不同的特点:所有工作——我是说所有——都在 Slack 上完成。这里没有电子邮件文化,我在职期间总共可能只收过 10 封邮件。如果你缺乏条理,这种模式会让人分心到崩溃。但只要妥善管理频道和通知设置,这套系统其实相当高效。

OpenAI 奉行彻底的自下而上文化,研究部门尤其如此。我刚入职时曾询问下季度路线图,得到的答复是"这玩意儿不存在"(不过现在有了)。好点子可能来自任何角落,而且往往很难预先判断哪些想法最终最有价值。与其说存在什么宏伟"总蓝图",不如说进展是迭代式的,随着新研究成果涌现而自然呈现。

得益于这种自下而上的文化,OpenAI 也极度崇尚任人唯贤。公司历史上的领导者晋升,主要取决于他们提出优质创意并付诸实践的能力。许多能力超群的领导者根本不擅长全员大会演讲或办公室政治——这在其他公司可能是致命伤,但在 OpenAI 影响相对较小。在这里,最好的创意往往能笑到最后。

这里盛行行动导向的文化(想到就能做)。不同团队不约而同地产生相似创意的情况屡见不鲜。我最初参与的一个与 ChatGPT 连接器类似的并行(但内部)项目就是如此。在决定正式推出前,公司内部至少同时存在 3-4 个不同的 Codex 原型。这类尝试通常由少数人自发推进,无需层层审批。一旦显现潜力,团队就会迅速围绕其组建。

Codex 项目负责人安德烈常对我说,应该把研究员视为"迷你执行官"。这里鼓励自主探索,静观其变。由此衍生出一个现象——多数研究突破都源于研究者被某个难题"狙击"后产生的专注攻关。若某个方向被视为乏味或"已解决",往往无人问津。

优秀的研究主管既能产生巨大影响,又受制于有限权限。顶尖者擅长串联不同研究线索,促成更大规模的模型训练。杰出产品经理亦是如此。

与我共事的 ChatGPT 产品经理们是我见过最酷的客户代表。他们给人的感觉仿佛早已见识过所有风浪。多数时候他们采取相对放权的管理方式,但总能慧眼识人,并确保团队获得成功所需的支持。

OpenAI 调整方向的速度令人咋舌。这让我想起在 Segment 时我们特别推崇的理念——根据新信息及时修正路线,远比固执执行既定计划更有价值。令人惊叹的是,像 OpenAI 这样规模的企业仍保持着这种文化基因,而谷歌显然已失去这种特质。这家公司决策迅捷,一旦确定方向就会全力以赴。

公司承受着巨大的舆论压力。作为来自 B2B 企业背景的人,这种关注度让我颇感震惊。我经常在内部尚未官宣时,就看到媒体报道抢先披露消息。每当告诉别人我在 OpenAI 工作,对方总会带着先入为主的成见。推特上甚至有不少用户运营着自动机器人,专门监测新功能的上线动态。

因此,OpenAI 是个高度保密的地方。我无法向任何人详细透露自己的工作内容。公司设有多个权限各异的 Slack 工作区。营收和资金消耗数据更是严格保密。

OpenAI 比你想象的更为严肃,部分原因在于其肩负的使命至关重要。一方面,团队致力于实现通用人工智能(AGI)的目标——这意味着需要攻克无数技术难关。另一方面,他们正在打造数亿用户依赖的产品,从医疗咨询到心理治疗无所不包。更重要的是,公司正置身于全球最激烈的竞技场中。我们会密切关注 Meta、Google 和 Anthropic 的动态——相信他们同样如此。世界各国政府也正以极大的兴趣密切关注着这个领域。

尽管 OpenAI 在媒体上屡遭诋毁,但我在那里遇到的每个人实际上都在努力做正确的事。鉴于其以消费者为中心的特点,它成为大型实验室中最受瞩目的一个,也因此招致了大量诽谤。

话说回来,你可能不该把 OpenAI 视为铁板一块的整体。我认为 OpenAI 最初就像洛斯阿拉莫斯实验室那样的组织——一群探索科学前沿的科学家和技术狂人。这个群体意外催生了史上最具病毒性的消费级应用,继而发展出向政府和企业销售的雄心。随着时间推移,组织内部不同资历、不同部门的人逐渐形成了迥异的目标与观点。你在其中待得越久,就越可能透过"研究实验室"或"公益非营利"的视角看待事物。

我最欣赏这家公司的一点在于,它在分配人工智能红利方面真正做到了"说到做到"。尖端模型并非专属于需要签订年度协议的企业级客户。世界上任何人都能直接使用 ChatGPT 获取答案,甚至无需登录。他们提供了可注册使用的 API 接口——大多数模型(哪怕是当前最先进或专属技术)往往很快就会被纳入 API 供初创企业使用。你完全可以想象出一个与当今现状截然不同的运作模式。OpenAI 在这方面功不可没,这至今仍是该公司的核心基因。

安全问题实际上比你在 Zvi 或 Lesswrong 上读到的更为重要。有大量人员致力于开发安全系统。鉴于 OpenAI 的性质,我看到更多关注点集中在实际风险(仇恨言论、滥用、操纵政治偏见、制造生物武器、自残行为、提示注入)而非理论风险(智能爆炸、权力追逐)。这并非意味着无人研究后者,确实有团队专注于理论风险。但从我的视角来看,这不是重点。大部分已完成的研究并未公开,OpenAI 确实应该加大力度推动这些成果面世。

与其他公司在招聘会上随意派发周边商品不同,OpenAI 并不常发放宣传品(甚至对新员工也是如此)。取而代之的是定期"限量投放",员工可订购库存商品。首次投放时需求过于火爆,直接导致 Shopify 商店崩溃。当时内部流传过一篇教程,指导如何通过 POST 正确的 json 数据包来绕过购买限制。

与 GPU 成本相比,几乎所有开支都微不足道。举个例子:作为 Codex 产品组成部分开发的一个小众功能,其 GPU 成本消耗就相当于我们整个 Segment 基础设施(虽不及 ChatGPT 的规模,但也承载了相当比例的互联网流量)。

OpenAI 可能是我见过最具野心的组织,其雄心程度令人震撼。你或许会认为拥有全球顶尖的消费者应用程序就足够了,但他们渴望在数十个领域展开竞争:API 产品、深度研究、硬件、编程代理、图像生成,以及若干尚未公开的领域。这里就像一片沃土,能让创意生根发芽并茁壮成长。

这家公司对推特动态异常关注。如果你发布与 OpenAI 相关的内容并引发病毒传播,很可能会有内部人员注意到并予以考虑。我朋友曾开玩笑说:"这家公司是靠推特情绪驱动的"。作为一家面向消费者的企业,这种说法或许不无道理。当然,他们依然非常重视使用数据、用户增长和留存率等分析指标——但网络情绪同样至关重要。

OpenAI 的团队比其他地方更加灵活流动。在推出 Codex 时,我们需要几位经验丰富的 ChatGPT 工程师协助才能如期上线。我们与 ChatGPT 的几位工程经理沟通后,第二天就有两位顶尖人才随时待命支援。这里没有"等待季度规划"或"重新调配人力"的流程,一切推进得极为迅速。

领导层高度可见且深度参与。这在 OpenAI 这样的公司或许显而易见,但每位高管都显得全情投入。你会经常看到 gdb、sama、kw、mark、dane 等人在 Slack 上积极发言。这里不存在挂名领导。

OpenAI 采用了一个巨型单体代码库,主要使用 Python(尽管 Rust 服务正在增多,还零星分布着用于网络代理等功能的 Golang 服务)。这催生了许多看似古怪的代码,因为 Python 的写法实在太多样。你会遇到既有来自十年谷歌老兵设计的大规模库,也有新晋博士随手写的临时 Jupyter 笔记本。几乎所有功能都围绕 FastAPI 构建接口,用 Pydantic 进行验证。但总体上并没有强制执行的代码风格指南。

OpenAI 的所有业务都运行在 Azure 上。有趣的是,我认为真正可靠的服务只有三个:Azure Kubernetes 服务、CosmosDB(Azure 的文档存储系统)和 BlobStore。这里没有能与 Dynamo、Spanner、Bigtable、Bigquery Kinesis 或 Aurora 真正对等的产品。在自动扩展单元方面进行深度思考的情况相对少见。其 IAM 实现方案往往比 AWS 提供的功能局限得多。而且他们明显更倾向于自主研发。

在人员方面(至少工程团队如此),从 Meta 到 OpenAI 的人才输送管道非常显著。OpenAI 在很多方面都像早期的 Meta:拥有现象级消费应用、基础设施尚处萌芽期、且追求极速发展。我接触过从 Meta 和 Instagram 挖来的基础设施人才,绝大多数实力都非常强劲。

将这些元素综合起来,你会发现许多基础设施的核心部件都带着 Meta 的影子。比如内部重写了 TAO 系统,在边缘端统一身份认证的尝试。肯定还有其他我不知道的类似项目。

聊天功能已深度融入系统架构。自 ChatGPT 爆火后,大量代码库都围绕聊天消息和会话概念构建。这些基础组件如今已根深蒂固,忽视它们将自担风险。我们在 Codex 项目中曾稍作偏离(更侧重响应 API 的经验),但仍大量借鉴了既有成果。

代码为王。这里没有中央架构或规划委员会,决策通常由计划执行工作的团队自行做出。结果是整个团队具有强烈的行动导向,代码库中经常会出现大量重复模块。光是队列管理或代理循环这类功能,我就见过至少六个不同的实现库。

在工程团队快速扩张而配套工具跟不上的领域,确实暴露出一些问题。sa-server(后端单体架构)成了代码堆放的"垃圾场"。主干分支的持续集成系统崩溃频率远超预期。即便并行运行测试用例并考虑部分依赖关系,在 GPU 上执行仍需要约 30 分钟。这些问题并非无法解决,但确实提醒我们:这类问题普遍存在,且在超高速扩张时会愈发严重。值得肯定的是,内部团队正在全力改善这一状况。

一个大型消费品牌的模样。直到我们开始研发 Codex 时,我才真正理解这一点。所有指标都以"付费订阅数"来衡量。即便是 Codex 这样的产品,我们最初设想的用户激活路径也主要围绕个人使用而非团队场景。这让我这个长期从事 B2B/企业级业务的人颇感冲击——只需启动开关,第一天就能获得用户流量。

大模型训练的高阶逻辑。整个过程存在从"实验探索"到"工程实现"的连续光谱。多数创意始于小规模实验,当结果显现潜力时,才会被整合进更大规模的训练。实验阶段既要调整核心算法,也要优化数据配方并精细分析结果。而大规模训练则如同巨型分布式系统工程,总会遇到意料之外的边缘案例,调试重任完全落在团队肩上。

如何进行 GPU 运算规划。作为 Codex 项目上线的一部分,我们必须预测算力需求,这是我第一次真正对 GPU 进行基准测试。核心要点在于:应该从实际需要的延迟指标出发(整体延迟、token 数量、首 token 响应时间),而非自下而上分析单个 GPU 的支撑能力。每次模型迭代都可能彻底改变负载模式。

如何管理大型 Python 代码库。Segment 公司采用的是微服务架构,主要使用 Golang 和 Typescript,其代码规模远不及 OpenAI。我深刻领悟到如何根据开发人员数量来扩展代码库——必须建立更多防护机制,比如"默认可用"、"保持主干清洁"、"防误用设计"等原则。

在 OpenAI 度过的最后三个月里,我大部分时间都在推动 Codex 的发布。这无疑是我职业生涯的高光时刻之一。

首先回顾一下背景,2024 年 11 月时,OpenAI 曾设定 2025 年推出编程助手的目标。到 2025 年 2 月,我们内部已流转着几款高效运用模型的工具。当时我们正承受着推出专业编程助手的压力——显然模型能力已发展到对编程极具实用价值的阶段(市场上涌现的智能编程工具热潮就是明证)。

我提前结束陪产假归队,协助 Codex 项目的发布工作。返岗一周后,我们仓促完成了两个团队的合并(过程略显混乱),随即展开了一场疯狂冲刺。从写下第一行代码算起,整个产品仅用七周便宣告完成。

这次冲刺可能是我近十年来最艰苦的工作经历。大多数夜晚都要熬到 11 点甚至午夜,每天清晨 5:30 被新生儿吵醒,7 点又赶回办公室,周末基本都在加班。整个团队全力以赴,因为每周都至关重要——这让我恍然回到了 YC 创业孵化器的日子。

这种开发节奏的惊人程度难以言表。无论是大公司还是小团队,我从未见过谁能如此迅速地将构想转化为正式发布、免费可用的产品。项目规模也毫不含糊:我们构建了容器运行时、优化了代码库下载机制、微调定制模型来处理代码编辑、处理各类 git 操作、开发全新交互界面、实现联网功能,最终打造出用户体验极佳的产品。

无论外界如何评价,OpenAI 至今仍保持着这种产品发布的热血精神。

好消息是,合适的人选能创造奇迹。我们曾是一支由约 8 名工程师、4 名研究员、2 名设计师、2 名市场拓展人员和 1 名产品经理组成的高级团队。若没有这个团队,我想我们早就失败了。虽然没人需要过多指导,但我们确实需要相当程度的协调配合。若你有机会与 Codex 团队的任何人共事,请记住他们个个都出类拔萃。

发布前夜,我们五人熬到凌晨四点才完成主系统的部署(这通常需要数小时)。随后赶回办公室准备上午八点的产品发布直播。当我们启动系统开关,立刻看到流量如潮水般涌入。从未见过哪款产品仅凭出现在左侧边栏就能获得如此迅猛的增长,这就是 ChatGPT 的魔力所在。

在产品形态上,我们最终确定了完全异步的交互模式。不同于 Cursor(当时版本,现已支持类似模式)或 Claude Code 等工具,我们的设计目标是让用户发起任务后,AI 代理能在独立环境中运行。我们押注的终极形态是:用户应像对待同事那样使用编程助手——发送指令后给予其工作时间,最终它会带着代码提交请求返回。

这确实像场赌博:当前模型处于微妙状态——表现尚可但未达卓越。它们能持续工作几分钟,但还撑不了数小时。用户对模型能力的信任度差异悬殊。甚至我们自己也尚未完全摸清这些模型的真实能力边界。

从长远来看,我确实相信大多数编程会变得更像 Codex 的模式。在此期间,观察各类产品如何发展将会非常有趣。

Codex(或许并不令人意外)非常擅长在大型代码库中工作,理解如何导航其中。与其他工具相比,我观察到最大的区别在于它能同时启动多个任务并比较输出结果。

最近我看到有公开数据比较不同 LLM 代理提交的 PR 数量。仅公开数据显示,Codex 已生成 63 万条 PR。自发布以来的 53 天里,相当于每位工程师贡献了 7.8 万条公开 PR(关于私有 PR 的倍数你可以自行估算)。我这辈子可能从未参与过影响力如此巨大的项目。

说实话,最初我对加入 OpenAI 心存顾虑。我不确定牺牲自由、拥有上司、成为庞大机器中微小齿轮会是怎样的体验。我低调处理了自己入职的消息,以防这份工作并不适合我。

我确实想从这段经历中获得三样东西:建立对模型训练方式和能力发展方向的直觉理解,与杰出人才共事并相互学习,推出一款卓越产品。

回顾这一年,我认为这是我做过的最佳决定之一。很难想象在其他地方能获得比这更丰富的成长。

如果你是一位创始人,感觉自己的初创企业确实停滞不前,那么你应该:彻底重新评估如何争取更多发展机会,或者加入大型实验室之一。当下既是创业的黄金时代,也是洞察未来走向的绝佳时机。

在我看来,通往通用人工智能的道路目前呈现三足鼎立之势:OpenAI、Anthropic 和谷歌。基于各自的企业基因(消费级市场导向/商业服务导向/坚如磐石的基础设施+数据优势),这些机构将采取不同的发展路径。在其中任何一家工作都将带来令人大开眼界的体验。

感谢 Leah 的全力支持,在无数个深夜承担了大部分育儿责任;感谢 PW、GDB 和 Rizzo 给予我机会;感谢 SA 团队的伙伴们——Andrew、Anup、Bill、Kwaz、Ming、Simon、Tony 和 Val——引领我入门;特别感激 Codex 核心团队让我体验了毕生难忘的旅程:Albin、AE、Andrey、Bryan、Channing、DavidK、Gabe、Gladstone、Hanson、Joey、Josh、Katy、KevinT、Max、Sabrina、SQ、Tibo、TZ 和 Will。这段冲刺岁月我将永远铭记。

砰然落幕。