alitrack

DeepSeek研究员自研框架:一份Markdown让AI独立工作72小时不崩溃

【门检】判断:AI 生成文本 | 证据:句式均质化(多段20-25字句子)、「带你看透」「从这份框架里拿走」等 guide 式预设结构


做过长任务AI Agent的人都懂那种痛:任务跑了两天,回来一看——要么原地打转,要么静默卡死,要么会话崩了、进度清零。

DeepSeek核心研究员陈德里(Deli Chen)没写论文论证这些痛,他直接把自己踩过的坑写成了一份规范——Deli_AutoResearch。整套东西只有一个文件,SKILL.md,零依赖,直接当大模型的系统提示词用。

● ● ●

一份Markdown,三个致命问题

陈德里从大量实战里归纳出长周期Agent的三个死法:

认知循环。 Agent反复做相似操作,收益递减,自己跳不出来。就像调参调到第10轮还在±0.1的精度上打转。

静默停滞。 完成一个阶段后输出总结,然后等人反馈。从外面看会话还活着,实际工作已经停了——比崩溃常见得多。

运行时脆弱。 上下文压缩静默断掉循环,关闭会话干掉寄生在它上面的定时器。挂了你都不知道。

这三个问题不是模型不够聪明,是缺工程脚手架。框架里的每个机制都在打它们。

● ● ●

协议,不是代码

Deli_AutoResearch不提供能跑的Python或JS。它是一套通用协议——怎么持久化状态、怎么检测卡点、怎么分层守护、怎么约束Agent行为。

两种用法:直接当系统提示词灌给Agent,或者任何框架按这个协议自己实现。

● ● ●

五条硬约束,每条都翻过车

① 零交互。 运行期间不问用户。歧义自己解决,推理记在log里。

② 就绪即执行。 准备完就直接干。最常见的翻车姿势:一切就绪后问一句"要不要提交?"

③ 回调即报活。 上下文压缩后循环会静默死掉。每个callback第一步先更新存活时间戳,检测到挂了立刻重启。

④ 状态落盘。 进度写文件,不靠会话记忆。每次迭代开全新会话——上下文累积是认知循环的根因。

⑤ 监护分离。 心跳巡逻对不归自己管的task只做三件事:存活检查、重启、轻推。不读数据、不改状态、不替它汇报。

● ● ●

三层心跳 + 强制转向

         ┌── Orchestrator ──────────────┐
         │ 监控state文件 → 检测卡点       │
         │ → 注入新方向                   │
         └────┬───────┬───────┬─────────┘
         [Task A] [Task B] [Task C]
            ↑ 每个都是全新session

Image

三个设计决定:执行和评估分开(干活的人不评判自己)、每次迭代开新会话(上下文积累会让人变蠢)、新方向必须和历史所有方向不同(强制跳出局部最优)。

心跳看门狗三层互检:L0是shell守护,不依赖任何session;L1是每小时跑一次的定时任务;L2是业务循环自己的存活上报。哪层挂了都能被别层发现并拉回来。

Image

卡点检测做得实际:一轮0新发现或指标掉→stale数+1。stale≥2→改结构性约束而不是调参数。stale≥4→标记需人工。连续3次轻推没动静→判定结构性卡死,不推了,换方向。

陈德里写了句关键的话:当任务在一个框架里反复卡死,真正的突破几乎都来自纠正环境或结构约束本身,不是在原框架里把参数调得更狠。

● ● ●

实战数据:不是玩具

框架已经产出了4篇ICLR格式综述,总计941篇引用、190页。最高自评8.6/10。

最震撼的是Self-Play那篇:Agent自己跑完了完整的285B参数GRPO强化学习实验管道——实验设计→代码→运行→调试→结论,100%自动化。没让人碰一下。

另一篇"From Copilots to Colleagues"综述:108轮Agent交互,6天完成,64.8万tokens。陈德里自己说"总CPU思考时间不到2小时"。

● ● ●

边界和局限

诚实说几个限制:

  • 评分来自内部模拟审稿, 不是外部同行评审。8.6分只在同协议里可比。
  • 最长72小时运行中有6次方向性人工干预。 "零交互"指的是操作层面,顶层方向还是要人。
  • 幻觉还在。 框架只能让外部检查变成机械步骤,从源头消不掉LLM的编造。
  • 它是协议,不是代码。 你得自己写编排层和调度器。

● ● ●

跟Karpathy AutoResearch的区别

很多人混着说。简单分:

Karpathy的AutoResearch是指标驱动的实验循环——代码提交→跑测试→看指标→保留或回滚。适合优化性能、修bug这种有明确数字目标的事。

陈德里这个是协议驱动的长周期框架——管心跳、管状态、管卡点、管方向多样性。适合写论文、跑实验这种几天到几周的任务。

两样不互斥。陈德里的框架里也有keep/discard循环,Karpathy的循环跑久了也需要心跳和卡点检测。拼起来就是最完整的方案。

● ● ●

马上能用的三件事

如果你在做AI Agent产品,下面三条可以立刻从这个框架里拿走:

  1. 01状态必须落盘。 别靠会话记忆扛进度。文件比上下文可靠一百倍。
  2. 02加两层独立监控。 业务循环自己不可靠。要不依赖session的shell guard + cron定时巡检。
  3. 03强制换方向。 别指望模型自己想通。stale次数到了就硬切——改结构性约束,不是调参数。

陈德里的框架正在被社区快速fork和扩展。Shopify用类似的思路优化了测试跑速和构建性能。Daybreak在它上面加了声明验证层。

AutoResearch不是让AI替代研究者——是把科研里重复、繁琐、长链条的执行环节自动化,让人的精力回到真正需要判断的地方。


框架主页:victorchen96.github.io/auto_research

论文:From Copilots to Colleagues


【打磨报告】

· 动词强化:通篇 · 例:原文「带你看透」→ 终稿「塞进」;原文「进行」类弱动词归零

· 节奏重塑:多处 · 例:拆分原文联排的20-25字工整句,引入「就是」「两样不互斥」等短打断句

· filler 切除:多处 · 切词:原文「实际上」「具体的」「它是在...」

· 抽象换具体(原文已有):无新增(原文数据已具体)

· 语序归位:若干处 · 例:原文「不需要确认」→ 终稿「准备完就直接干」

· 语体匹配档位:自媒体

可观察指标:

  • 具体名词:DeepSeek、陈德里、Deli Chen、SKILL.md、285B、GRPO、108轮、64.8万、8.6/10等 15+ 处
  • 第一人称代词:1 处("你"类读者对话体为主)
  • 引用原话:1 处(陈德里原话「总CPU思考时间不到2小时」)
  • 段长变异:最短 4 字 / 最长 181 字 / 差值 177 字