AI同事来了,别光下命令,先学会带人
在人工智能深度融入软件开发流程的今天,人与 AI 的协作方式正经历根本性转变。科技媒体 EVERY记录了 OpenAI 工程团队在仅用 28 天开发 Sora 应用 Android 版本的过程中,如何高效利用其自研 AI 编码模型 Codex。尤为引人注目的是,其中一位工程师因意外受伤无法打字,转而通过语音指令“口述”编程任务,这一限制反而催生出一种更自然、更高效的交互模式:把 AI 当作一位需要带教的新同事,而非一个即插即用的工具。这种思维转换,不仅提升了代码产出的质量,也揭示了未来人机协同的核心逻辑——沟通、引导与上下文共建。
OpenAI 团队的经验表明,AI 并不会让编程变得“简单”,但它能显著加速开发节奏——前提是开发者愿意调整工作方式。他们发现,与其试图让 AI 模仿人类操作界面,不如发挥其作为“机器”的优势:快速解析代码库、精准调用接口、严格遵循逻辑。但与此同时,人类仍需以清晰、渐进、富有上下文的语言进行“带教”,才能避免生成看似合理却暗藏错误的代码。这些来自一线实战的洞见,不仅适用于使用 Codex 的团队,也为所有正在探索 AI 辅助编程的开发者提供了可复用的方法论。我们特此编译此文,希望能为中文技术社区带来启发。
以下是文章原文翻译(原文链接:https://every.to/source-code/openai-gave-us-a-glimpse-into-their-ai-coding-playbook)
四位 OpenAI 工程师仅用 28 天就完成了图像生成应用 Sora 的 Android 版本开发。他们全程使用自家的 AI 编码代理 Codex 来完成这项任务。
在冲刺开发进行到一半时,其中一位工程师 RJ Marsan 在一场自行车比赛中摔断了手腕,无法打字。于是他临时搭建了一套语音转文本系统,开始直接“口述”指令给 Codex,而不是亲手敲代码。
这个被迫的限制——必须用语言告诉计算机该做什么,而不是自己动手执行——让他领悟到了一个关键洞见,后来整个团队都采纳了这一做法:把 Codex 当作一位新入职的同事来“带教”,效果远好于把它当成一个需要配置的工具(Codex 不会自动记住之前的对话历史)。“每一次交互,都是在重新带教这位新同事。”
Marsan 与 Codex 产品负责人 Alexander Embiricos 一同参加了 Every 举办的首届 “Codex 训练营”(Codex Camp),分享了他们在用 Codex 构建 Sora 过程中的经验,以及如何更有效地与 AI 协作。以下是我们的核心收获:
核心要点
像带新人一样“带教”你的 AI:从简短、互动式的提示开始,逐步建立信任,让它了解你的偏好,然后再委派更复杂的任务。
别塞爆上下文:如果你不会一次性向新同事灌输 6000 条关于代码库的信息,那就别这么对待 AI。只提供当前任务所需的上下文。
专注胜过全能:一个职责明确、目标聚焦的 AI 代理,表现远优于试图包揽一切的通才型代理。
事情不会变简单——但你会变快:AI 工具转移了瓶颈,而非消除瓶颈。架构设计和代码审查变得更加重要,而非变得无关紧要。
如何思考与 AI 的协作方式?
开发 Codex 的过程,彻底改变了 OpenAI 团队对 AI 代理的认知。去年底项目启动时,他们曾假设:最好的 AI 代理应该模仿人类行为——看着你的屏幕、移动鼠标、点击按钮。毕竟,如果 AI 足够智能,难道不该像人类一样操作电脑吗?
“我当时想,‘明年我们大概就是和 AI 屏幕共享,让它直接干活了,’”Alexander 回忆道,“结果我们大错特错。”
团队最终发现:当让 AI 像计算机一样工作时,它的表现反而更好——而不是强行模仿人类的操作方式。试想一下:你是愿意手动翻遍下载文件夹找某个文件,还是写一行脚本瞬间搞定?后者更快、更可靠、也更容易自动化。但你没法把脚本“喂”给人类同事。
不过,尽管 AI 最擅长以“机器方式”执行任务,你仍需以“人类方式”与它沟通:用自然语言描述你的目标,由它将意图转化为代码。
Embiricos 打了个精妙的比方:“如果你招了个新队友,却永远不能和他打电话,也不能让他坐在你旁边看屏幕,只能每 20 分钟通过邮件交流一次——那带教过程简直糟透了。” 对 AI 也是如此:你需要像和人对话一样去“带教”它,而不是把它当机器人发指令。
先带教,再委派
在训练营中,Marsan 演示了他至今仍在使用的“带教式”方法——这套方法正是源于他受伤期间的实践。他展示了一个 Sora 开发中的真实案例:为用户违规内容实现举报功能。
他知道 iOS 版本已有该功能,且 Android 代码库中也有类似模式。但他没有自己去翻代码,而是给 Codex 布置了一项“新人第一天任务”:去研究 iOS 实现,搞清楚它是怎么工作的。
Codex 花了几分钟进行“调研”——扫描代码库、查找相关实现、识别正确的数据结构。Marsan 强调,这个研究阶段是最关键的一步。Codex 发现了一些他可能会忽略的细节。例如,代码库内部将内容举报功能标记为 “Sora 2”,而 Marsan 很可能猜成 “Sora”,导致代码无法连接到正确的系统。
如果没有让 Codex 先完成这轮调研,它可能会生成看似正确、实则存在隐蔽错误的代码——这类问题对人类工程师来说极难追踪和修复。