叶小钗

红杉 2025 AI 评估框架:预训练见顶,推理起飞

你好,小钗是连续的AI创业失败者。在医疗AI、教育AI、管理AI有丰富的失败经验

关注公众号,回复1,与我交个朋友吧

书接上文:红杉 2025 AI 评估框架:从氛围钱到真钱的进化路径

今天继续《红杉AI崛起2025主题演讲,人工智能万亿美元机遇》第二个分享:AI 的当下与近期展望。

过去一年,AI 原生应用经历了一次意义深远的“黏性反转”。

2023 年,行业数据告诉我们:绝大多数 AI App 的 DAU/MAU 比传统移动应用低得多,热度主要靠媒体和资本推波助澜。

然而不到 12 个月,ChatGPT 等头部产品的月活黏性已逼近 Reddit,这表明用户不再只是来体验“黑科技”,而是把 AI 当成日常工作流的一环。

换句话说,AI 正在悄悄从“好玩”变成“离不开”。

回顾早期的AI爆款,我们最先看到的是AI在图像一块的潜力、AI 换脸短视频等轻量娱乐场景:体验轻松,也非常吸人。

其中三大垂直高潜:广告、教育、医疗,表现尤其突出:

  1. 广告:生成既精准又富设计感的创意文案与视觉素材,缩短从 brief 到 campaign 的迭代周期;
  2. 教育:将抽象概念实时可视化,让学习过程“沉浸式”且个性化;
  3. 医疗:借助 OpenEvidence 等工具提升诊断准确性,把医生的专业经验与海量文献实时匹配;

只不过这些领域实际AI应用还差点意思:因为模型出点幻觉就可能损失真金白银。而在娱乐领域,就没有上述的烦恼了:

之前有部电影《HER》好像描述的是远期人工智能时代会发生的故事,而现在看来这个故事可能在明年就会发生,我们几乎可以预见:UI 的入口将被对话层吞没,语音成为最低摩擦的交互界面。届时,屏幕只在信息密度极高时才显得必要。

AI 编程:年度最具破坏性的生产力飞轮。Claude 3.5 Sonnet 等模型把编码体验推向“气氛编程(vibe-coded)”——开发者先描述意图,AI 自动拉脚手架、查文档、重构代码。

代码生成的真正价值并非“写得快”而已,而是把隐性经验结构化,顺带把流程自动化。未来,工程师负责架构与评估,AI 负责实现与重构,软件生产线像乐高积木一样复用、替换,只不过:

Image

综上,短短一年,AI 从“炒作曲线的山顶”滑进了真实落地的坡道。

娱乐场景让大众入门,垂直场景奠定护城河,语音与编程成为下一轮胜负手,AI在接下来2年将会大有作为。

技术视角

过去一年,用一句话概括 AI 技术版图的变化,就是:从堆规模到拼方法,智能进入了从说到做的新阶段。接下来是三大核心:

一、预训练遭遇边际瓶颈

规模红利的尽头了,自 AlexNet 起,预训练规模被硬生生拉大了 9〜10 个数量级。但最新曲线标明:再往上砸算力,模型收益已经不再线性。

“Pre-training is hitting a wall.” 并非绝对停滞,而是提醒行业:想靠继续喂数据 + 拉长参数就换来质变,性价比正在急剧下滑。大厂已经把资源转投“更聪明的训练范式”,这在后面几条会不断呼应。

二、推理链路成下一条 S 曲线

OpenAI 去年就在 AISN 公开喊话:Reasoning 是新的主战场。

今年又请 Dan Roberts 谈 GPT-3 以来的推理演进。为什么?因为知识量的竞赛已接近饱和,而“思考深度”依旧是蓝海。

链式思考(CoT)、树状思考(ToT)、检索增强(RAG)和自我一致性校验,使大模型从“会背答案”转向“会拆题、会自检、会修正”。

这一变化,将直接决定大模型能否从文本生成器升级为决策助手。

三、3个黑科技

在推理之外,行业同步点亮了三条增维赛道:

  1. Synthetic Data —— 用合成样本补齐长尾知识,同时搭建强化学习沙盒,成本远低于真人标注。
  2. Tool Use —— 让模型不再只输出字符串,而是学会调 SQL、调 API、调浏览器;“会说话”瞬间变成“会动手”。
  3. Agentic Scaffolding —— 把多步调用脚本化、流程化,低代码地拼成可持续运行的智能体。

这几个词语大家也许有点陌生,其实也不是什么新东西,我这里为大家简单讲解下:

首先是Synthetic Data,用“假”数据补真数据的坑。

想象你在教孩子认车,现实里稀有的消防车永远拍不到几张;那就让 3D 引擎批量生成各种角度、光照的消防车,喂给模型。

合成数据就是这么干的:算法生成仿真样本,既避开隐私风险,又能 24 小时“开工”生产长尾数据,成本比真人标注低一个量级。大厂还用它做强化学习沙盒,让模型在虚拟世界里先练级再上线。

比如OpenAI最近提出的HealthBench测评框架,就是用真实病例去伪造医患对话。

然后是Tool Use,让大模型“张嘴就能动手”。

今天的AI不只是聊天,它能读懂“给我下周北京到上海最便宜的机票”后,自动调用航班 API、筛出结果、再用自然语言总结——这就是 Tool Use(工具调用)。

底层靠“函数调用”机制:开发者先告诉模型有哪些按钮可按(API 描述),模型判断何时需要按、并自动填好参数,真正把文字指令变行动指令。

最后是Agentic Scaffolding,给 AI 搭一副“流程脚手架”。

把“拆任务 → 选工具 → 执行 → 自检 → 记忆”串成闭环的脚本。拿发票审核举例:规划器先拆解“验真-限额-税抵扣”;路由器把图片丢给 OCR,把金额丢给预算 API;结果不合规时批判器退回重做;记忆层保存本次规则。

社区里的 AutoGPT、AutoGen 就是把这种多步协作包装成开源框架,人人都能低代码组装自己的“业务小助理”。

价值到底沉淀在哪?

过去几年里,关于 AI 技术栈哪一层才是真正的护城河一直争论不休。

一派认为,只要握住大模型,更高的参数、更强的算力,就能坐拥门槛;另一派则坚持,只有把模型嵌进业务流程,才能把算法的潜力转化为企业的现金流。

时间给出了第一批样本答案:从 PPT 口号到真实收入:应用层跑出了样本。

Harvey 在法律行业落地“AI 初级律师”,OpenEvidence 在医疗场景里扮演“循证推理助手”,这些公司不再靠“模型多聪明”来讲故事,而是用按席位订阅费、按案件/病例决策加速费来收钱:

每一笔都直接写进客户的成本与利润表。换句话说,它们把 AI 的价值点,钉在了客户最在意的 KPI 上。

与此同时,大模型 API 价格则在一路下探:0.1 美元 / 1K tokens 变成了 0.01,模型“智力即服务”正在成为标准化水电煤。

当底层成本衰减,应用层差异化就越凸显:谁掌握流程、谁拥有专属数据、谁把风控接入链路,谁就能锁住收入。

这并不代表模型派出局,模型派没输,只是换了赛道。算力依旧稀缺,GPU 仍然一芯难求。卖铲子的 NVIDIA、做云调度的超大规模云厂,都在上游稳稳“躺赚”。只是应用层是真正的核心:

业务语义、专属数据、责任闭环,这三重因素让外部模型难以“挖角”。模型团队想吃到这块蛋糕,也要下沉到场景、重构流程,而不仅是发布下一代参数更大的模型。

而应用层想要做深,有三个重点:

  1. 深场景嵌入:选那些链路长、痛点尖、替换成本高的流程。法律检索、医保审核、海关报关都是天然温床。一旦接入,客户就很难回到旧流程。
  2. 专属数据闭环:模型同质化不可怕,可怕的是你的训练数据被抄走。用 SaaS 化手段把用户行为、决策结果回流进系统,持续精炼私域语料。
  3. 责任分隔设计:AI 触达决策节点必然伴随风险。通过人机协同、可追溯日志、角色分层审批,把“黑盒恐惧”降到最低,才有机会在高价值行业(金融、医疗、政务)落地。

总而言之,是不是包壳应用一点都不重要了,重要的是尽快形成业务数据飞轮系统。

结语,杀手级AI正在来临

过去两年,“大模型”本身是主角;如今故事的重心已明显南移:应用成为新的制高点。

第一批真正意义上的“杀手级”产品已经跑出:ChatGPT、Claude 让通用对话成为入口,Harvey 抢占法律服务,Glean 与 Sierra 深耕企业搜索与知识管理,Cursor、Abridge 分别切入编程与医疗记录。

这些产品的共同点并不是“参数最多”,而是直接锚定了高频、刚需、付费意愿强的任务场景。

值得注意的是,图谱里列出的下一梯队公司数量远超第一梯队,说明热点不等于红海:真正的竞争壁垒来自持续积累的私有数据、流程闭环和用户心智,而不是“谁先把 API 调通”。

随着模型托管和调用门槛下降,越来越多团队不再把自己定位为“做 SaaS,用一下 AI”,而是“做智能体,把 AI 当核心延伸”。实践中出现两条截然不同的路径:

路径
核心抓手
优势
潜在短板
严谨编排 Orchestration
细颗粒度链路拆分 + 自动化评测
快速落地、易调优、对模型依赖相对可控
需要复杂的测试基建;性能上限受限于模型本身
端到端微调 E2E Agents
端到端监督/强化学习 + 私域数据闭环
可在垂直任务上逼近甚至超越专家
训练成本高,对数据和算力要求苛刻

编排更像 0→1 的加速器,而端到端微调才是 1→10 的护城河。前者让原型上线;后者决定天花板。

接下来一年,资本和人才最密集的趋势大概率是 Vertical Agents:用深度行业 know-how 把智能体“压铸”进特定工作流。

安全(xbow)、DevOps(Traversal)、网络工程(meter)等案例已经验证:当任务边界清晰、标注数据丰富时,AI 可以在某些维度超越人类一线专家。

为什么垂直?通用模型的长尾错配:95% 的日常对话很好解决,但 5% 的专业场景常常决定了商业价值。

而当前是最好的时刻,因为行业数据数字化程度高;RLHF/RLAIF 等技术可在闭环内持续迭代;端到端评测基建(OpenAI Evals、LangSmith 等)日趋完善。

对创业者而言,“小而深”优先于“大而浅”,找到一条带有高价值决策节点的行业链路,把 AI 嵌进去,形成决策 + 数据的正反馈飞轮,才有持久壁垒。

最后说两个思考点:

评测与数据治理是下一个基础设施,做AI项目要先问自己有没有持续、自动化的评测管道。任何缺少可量化反馈的智能体,终将停在 demo 阶段。

纵深 > 横向扩张,在应用早期,“做 10 个浅功能”看似能快速拉新;但当模型能力趋同,最后留下的往往是“在一件事上做到极致”的选手。

技术栈的选择(LangChain、GPTBots、Dify 等)固然重要,更关键的是是否能围绕单一价值点把数据→模型→业务流程闭合成护城河。

点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信:

Image