小红书技术REDtech

QECon深圳2026|小红书技术专场:Agent驱动的研发效率工程探索与实践

Image

大模型技术正从对话式交互走向任务型自主执行,Agentic AI 已成为重塑软件工程形态的关键力量。AI Agent 深度融入研发流程后,自主规划、自主执行、自主验证的能力正在系统性拓展工程团队的生产力边界。

小红书质效研发团队以 AI Native 为理念,重塑架构风险分析、变更自动化、智能测试、代码知识化、性能体验评测等领域的工作流程,让工程团队从重复性摩擦中解放,将过去依赖大量人工协同、高度碎片化的复杂工程问题,逐一转化为可持续演进的智能化工程范式。

5 月 22–23 日,QECon 全球软件质量效能大会·2026 深圳站即将举行。作为 AI 工程化的积极实践者,小红书质效研发团队将带来五场主题分享,围绕真实业务场景中的具体问题展开交流。诚挚邀请您共聚深圳,一起探讨 AI 驱动下的工程效能新范式。

以下为本次小红书技术团队带来的五场分享简介:

一、《亿级 Token 知识库的 Agentic 生成:企业级 Wiki 工程实践》

演讲嘉宾:郝栩彬

AI 工程架构师(智能体长程任务 / 多智能体),目前主要从事智能体受控长程任务研究工作,在 上下文编辑(context editing)、多智能体 场景有较多经验。

演讲介绍:

AI Coding 的热点正在发生根本性转变——行业不再只关心模型会不会写代码,而是关心 AI 能否像工程师一样,在真实开发环境里持续完成复杂任务。“长程智能体”成为焦点,而真正决定效果的,是模型外面的整套执行机制:任务怎么拆、上下文怎么管理、工具怎么调用、什么时候回退。

对于真实大型仓库,难点从来不是“让模型解释一小段代码”,而是仓库太大读不完、问题跨模块跨服务、向量检索只看局部看不到全局。CodeWiki 不是简单的 RAG,它解决的是更底层的问题:在上下文窗口有限的前提下,让 AI 分阶段、分层次读懂大型代码仓库,把“让 AI 一次读完整个仓库”变为“让一组可协作的智能体各自读懂该读的部分,拼成完整认知结果”。

演讲大纲:

  • 为什么“读懂仓库”成为长程智能体的基础能力,以及传统 RAG、单 Agent、多 Agent 方案各自的瓶颈所在

  • CodeWiki 的两阶段核心思路:路径压缩、代码骨架压缩、Glob Pattern 切分如何解决 token 黑洞与任务边界问题

  • 四维度共享记忆、智能退避、应读尽读——让多智能体从“能跑 Demo”到“能进生产”的关键工程机制

  • 工程踩坑与收益:AST 引用注入、语义相似度退避等解法,以及在真实大仓上的规模化验证结果

二、《基于 Multi-Agent 的 B/C 数据链路变更自动化保障》

演讲嘉宾:李伟 

AI 工程架构师(数据血缘 & Agent 自动化),长期深耕数据传输跨端数据一致性保障,主导构建广告 BC 链路字段血缘采集能力。近期专注于将 AI Agent 技术应用于广告数据链路变更自动化,主导设计并落地了 ArkAI Prism 系统。

演讲介绍:

广告数据链路(投放端→ADBus→在线索引)的字段变更是日常高频且高风险的工程动作,涉及跨团队协作、多平台操作、影响面评估、审批流转等多个环节,每次变更都需要多人多天串行推进,极易出现遗漏、错序或影响面评估盲区。传统方式依赖“人传人、手动改、靠经验”,缺乏系统化的变更追溯和影响面分析能力。

本次分享将完整呈现 ArkAI Prism 系统如何通过 Supervisor + Specialist Agent 分层协作,将复杂的跨团队链路变更变得可自动化、可追溯、可审计,实现变更遗漏/错序问题归零。

演讲大纲:

  • 广告 BC 链路字段变更的现状与量化痛点:多团队、多平台串行推进,人工协作的上限在哪里

  • ArkAI Prism 的架构设计:Supervisor 持有全局上下文动态调度,Specialist Agent 专注各端,模块化 SKILL 热插拔

  • 核心技术突破:字段血缘自动分析、影响面自动评估与变更拦截预检、全程留痕与可追溯审计

  • 落地效果与经验:将 Agent 应用于强规则域的设计取舍,以及群聊驱动 AI 协同的工程实践

三、《大模型压测数据构造:质量跃迁之路——从能跑到真管用》

演讲嘉宾:陈圣

AI 工程架构师(压测与稳定性保障),主要负责大型活动压测与稳定性保障,支撑社区、交易、AGI 等核心业务线在大促场景下的容量评估与风险识别。

演讲介绍:

随着大模型在问答、搜索、Agent、内容生成等场景快速落地,压测工作的难点正从“如何发起压力”转向“如何构造有效数据”。大模型系统的性能对输入内容高度敏感,过于模板化、均质化的数据只能覆盖理想场景,难以暴露长尾负载和复杂输入下的真实压力特征,最终导致压测结果“看起来稳定”,但对容量评估和风险识别的支撑有限。

演讲大纲:

  • 传统压测数据构造方法在大模型场景下为何失效,以及“可用”与“好用”的本质差距

  • 大模型压测数据构造的三重难题:业务真实性难还原、覆盖性难保障、复杂度难分层

  • 从“请求样本”转向“负载特征”的解题思路:三层数据框架与数据来源的技术选型

  • 过程踩坑与可复制经验:如何避免只关注平均分布而忽略长尾,让压测数据真正支撑决策

四、《LLM 驱动端到端测试体系》

演讲嘉宾:肖俊 

AI 工程架构师(质量可测性与智能化测试),主要负责服务端质量可测性建设及智能化测试探索,致力于将 AI 能力系统性融入测试研发效能体系,在研发效能提升、资损防控、测试智能化等领域积累了丰富实践经验。

演讲介绍:

端到端测试天然具有跨域、长链路、组合爆炸三大特点——以买手分账订单为例,需横跨商品域、交易域、支付域等多个业务域,每引入一个新维度用例矩阵就成倍膨胀,手工造数时间从分钟级飙升至天级。传统工程化方案的根本矛盾难以回避:人工预制的编排逻辑是静态的,真实业务的组合空间是动态的。

小红书选择让 Agent 直接感知业务接口、自主规划执行链路,以动态规划(逆向链式推导)+ 自适应执行(Debug-first + 流量回放自验证)彻底绕开静态编排的天花板。落地成果:跨域造数从小时级降至分钟级,22 种审核处置场景实现端到端用例全覆盖。

演讲大纲:

  • 端到端测试的根本矛盾:静态编排与动态业务组合空间之间的结构性冲突

  • Agent 直接理解意图的破局路线:逆向链式推导如何实时生成执行计划,Plan-and-Execute × ReAct 的混合思考模式

  • 关键工程实现:子域知识库的渐进式加载、Debug-first 脚本生成范式、工具级 + 链路级双层经验沉淀

  • 两条核心认知:Prompt 是业务题不是语文题;双层记忆(知识库 + 经验库)是 Agent 泛化与稳定性的核心变量

五、《AI 驱动的客户端性能体验全链路保障:从代码风险预判到用户感知度量》

演讲嘉宾:张雨 

AI 工程架构师(性能体验),主要负责性能体验质量领域建设,聚焦端侧性能度量、体验优化与质量保障体系构建,推动 UI 测试从传统脚本驱动迈向大模型认知驱动。

演讲介绍:

客户端性能体验是社交/内容平台类 App 的核心竞争力,直接影响用户留存与使用时长。然而性能体验测试长期面临四大困境:体验问题发现滞后、度量口径与用户感知脱节、代码分析与测试执行断层、缺乏统一的综合评价标准。

本次分享将呈现小红书构建的 AI 驱动全链路性能测试体系:AI 贯穿从代码变更到风险预判、用例生成、自动化验证、感知度量、体验评分的完整闭环,辅以众测反馈持续反哺。

演讲大纲:

  • 性能体验测试的四大困境:埋点度量与用户感知的 gap、代码分析与测试执行的断层如何系统性解决

  • 六层全链路架构设计:从代码白盒扫描、智能用例生成、自动化执行,到专项分析、AI 度量、体验评分的完整闭环

  • AI 视觉度量的三层融合策略:传统图像处理→CV 模型→MLLM 精筛,如何在精度与推理成本之间取得平衡

  • 体验评分体系的设计取舍:从零散指标走向统一评分的指标选取、场景加权与劣化判定机制

📩加入我们 

小红书质效研发部,肩负着以 AI 重构公司级下一代研发体系的使命。我们希望基于 AI 技术,打造全新版本的研发工具,结合 LLM 辅助、LLM 原生能力,串联从需求理解到发布部署的全流程,为小红书的技术团队提供业界顶尖的“武器装备”;同时希望通过这些“武器装备”,让每一位小红书的研发人,都有机会成为 AI Native 时代下的“超级个体”。 AI Coding 团队,专注于 AI Coding 与 GUI 智能化方向的技术攻坚与规模化落地。 

核心方向有: 

1️⃣ GUI Agent 执行引擎与 Coding Agent 架构

2️⃣ AI Testing

3️⃣ AI Coding harness 与解决方案

4️⃣ 分层知识库与路径引导系统 

我们正在寻找对 AI Agent、智能化测试、GUI 自动化方向有热情的同学。如果你做过 Agent 工程化、LLM 基础设施,或者想把 LLM 真正落地到具体业务,来聊聊。 

📮 内推简历投递:[email protected]

Image
Image