小红书技术REDtech

小红书 AllSpark 发布 Iris:同量级最强开源 Search Agent

Image

导读

Search Agent 要在真实网络里边搜、边读、边推理,还要自己决定何时收敛作答。训练它、以及为它准备“够难又确实可解”的数据,都不是容易的事。近日,小红书 AllSpark 团队发布Iris,权重和评测代码已开源,并将陆续公布数据与训练的完整配方。在 BrowseComp、DeepSearchQA、HLE 等 4 个 Search 相关的 Benchmarks 上,Iris 取得同量级最强开源成绩——35B 版本已逼近万亿参数级模型,397B 版本更在部分基准上实现反超;更令人惊喜的是,搜索能力还“外溢”到了 General Tool Use 与 Cowork 等任务场景中。

Image

图 1:Iris 在 BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE 四个 Agentic Search Benchmarks 上与其他系统的对比。

   .

写在前面

普通语言模型的评测里,任务、上下文和算力预算大多在开始前就固定好了。Search Agent 不一样:它要自己决定搜什么、怎么读检索回来的内容、什么时候继续找、什么时候证据够了可以回答。这让它更强,也让它更难训练、更难被公平评测。

团队把难点归纳为三个,Iris 的配方也正是围绕它们展开:

  • 数据难:真正好的训练题,必须“闭卷答不出、给了资料才能答对”,而且不能靠关键词匹配蒙对。自然产生的网页问题很少同时满足,人工出题又贵又难扩展。

  • 训练难:长链路搜索里,少数超长轨迹会拖慢整个同步训练;而判分、摘要如果依赖外部 API,训练就会被卡在网络波动上。

  • 评测难:搜索智能体的分数很容易被推理时的各种外部技巧抬高。只看最终成绩,会把“模型本身有多强”和“框架有多会取巧”混为一谈,难以对齐比较。

这三道坎——数据、训练、评测——共同决定了一个 Search Agent 的上限,Iris 的做法是把它们当成一个整体来解。

01

数据

Iris 的训练题不是收集来的,而是从网页的超链接结构里反向“造”出来的。

流程分三步:先以某个种子页面作为答案,顺着它的出链把相关页面聚成一张小型实体图谱;再在这张图上编写一道必须跨多个页面、多步推理才能得到唯一答案的问题;最后是最关键的一步——把题面里除答案之外的每一个实体,都改写成一句描述性的指代。

这一步“抹掉线索”的改写,让题目没法再靠字符串匹配走捷径:模型不能把题干里的名字直接丢进搜索框,而必须真正理解、逐步锁定。

造完题还要双重筛选:用一个参考模型验证两件事——闭卷(不给资料)时它答不出,说明题够难;把证据作为上下文喂给它时它能答对且答案唯一,说明题确实可解。只有同时满足“够难”和“可解”的题才会被保留。这样得到的题,逼着模型靠推理而非匹配去消歧——这正是真实搜索场景最需要的能力。整个流程全自动、不依赖人工出题,因此能随网页语料规模持续扩展。

Image

图 2:数据构造 pipeline。

02

训练

有了题,Iris 用监督微调(SFT)与强化学习(RL)交替进行的方式训练,团队把这个过程叫做 SFT–RL Climbing。

SFT 阶段先让一个强教师模型在真实搜索工具上把题做一遍、得到完整轨迹,再经过两层过滤才用于训练:轨迹层看结果对不对、有没有陷入重复或乱码、搜索深度够不够;再由一个“判官”在单轮粒度上剔除那些看起来在瞎搜的步骤——而判官的评判标准不是人手写的,是从数据里归纳出来的。

RL 阶段让模型在真实网络上边搜边学。这里有两个关键工程决定:

  • 判分和摘要都放进训练集群内部:用一个自建模型同时充当“奖励判官”和“检索内容摘要器”,训练全程不依赖任何外部 API,把网络波动挡在训练循环之外。

  • 超长轨迹“断点续跑”:少数拖后腿的超长会话不再被整段丢弃,而是在请求级别中断、下一步从已提交的前缀继续,让 GPU 在同步调度下也能保持忙碌。

把判分与摘要收进集群内部还有一个额外好处:训练时用来压缩检索内容的那套摘要器,正是模型在评测和线上会用到的同一套,训练与使用不再错位。

每一轮 RL 之后,团队会把其中最难被做对的、以及最高效解出的轨迹回灌给下一轮 SFT。随着模型变强,筛选出来的题会自动变难,形成一条自适应的课程,也天然给出了停止的信号。

换句话说,模型每一轮都在“先自己探索、再把成功经验固化下来”。

03

评测

团队在 BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE 四个 Benchmarks 上评测 Iris。这四个基准各有侧重:前两个考察中英文的复杂网页检索,DeepSearchQA 看答案对证据的覆盖是否完整,HLE 则是需要专家级推理的高难题。

为了让分数尽量反映模型本身、而非推理框架的取巧,所有系统都在相同的 Tool、Context 和 Judge Model 下比较、默认采用同一种上下文管理策略,并且只用单个 ReAct 智能体,不叠加多智能体、也不做测试时自我验证。

  • Iris-mini(35B):四项成绩 82.2 / 84.8 / 86.9 / 52.3,在 BrowseComp、BrowseComp-ZH、HLE 三项上登顶同量级开源。更难得的是,它在 BrowseComp 上的 82.2 分已逼近 Kimi-K2.6 等万亿参数级模型——用 35B 的体量,摸到了数十倍参数模型的水平。

  • Iris-pro(397B):四项成绩 88.6 / 85.1 / 92.9 / 56.4,在 BrowseComp、DeepSearchQA、HLE 上均为同量级最强开源,BrowseComp-ZH 上并列第一。

四个基准从中英文网页检索到专家级难题各不相同,能在其中同时领先,说明 Iris 的 Search 能力并非针对某类题的过拟合,而是较为通用的底层能力。团队也坦承,面对最顶尖的前沿系统,Iris 仍有差距,缩小这一差距是后续的重点之一。

Image

图 3:Iris-mini 与 Iris-pro 在四大基准上的主结果。

上下文管理(CM)是 Search Agent 常见的加分项——长链路搜索常在答完前就把上下文用光,截断、压缩或清空重来都能续上更多搜索,但是鲜有工作讨论过这一点。团队把它单独拉出来做了对照:即便完全不开 CM,Iris 也已领先同量级其他系统;开启后成绩进一步提升,且小模型的获益明显大于大模型——因为小模型解同样的题需要更多步骤、更容易触到上下文上限,可回收的空间也更大。

Image

图 4:上下文管理(CM)的影响。每个系统的 w/o 为不开 CM 的基线,其余行是不同 CM 策略下的成绩,括号内为相对基线的变化。

04

Search,但不止于 Search

团队在实验中发现了一个超出预期的现象:为 Search 合成的数据、以及专门训练出的专家模型,在没有专门训练过的任务上同样有效——包括 General Tool Use(BFCL、τ-bench)和 Cowork(OfficeQA、APEX)场景等。

背后的解释是:一方面,如今很多任务多少都会用到一些在线搜索或本地检索的工具;另一方面,Search 数据教会模型的,是在信息不完整时如何行动——而这种能力并不只属于网页浏览,任何需要“边做边找、边找边判断”的 Agent 任务都用得上。这也解释了为什么一个 Search 模型,会在从没专门训练过其他任务上有如此好的泛化性。

如果这个规律成立,那么 Search 或许更应该被看作一种可复用的原子能力,而不是一个孤立的垂直方向。Search 数据与模型的价值,也就不该只用“浏览网页做得多好”来衡量——过去被当作“垂类”投入的训练,很可能是一项能被反复使用的通用底座。

///

写在最后

Iris 给出的是一套端到端、可复现的 Search Agent 配方,团队计划开源模型权重,以及数据构造、训练、评测各环节的关键组件。比起单个基准上的分数,团队更看重两点:一是让相对小巧的模型在垂域上也能具备逼近超大模型的能力;二是 Search 能力“外溢”到更广的 Agent 任务——这意味着这套数据与模型有机会复用到更多智能体产品中,而不必为每个方向从零训练。这也是接下来要继续探索的方向。

技术报告、模型权重与配方开源:

  • Paper:

    https://arxiv.org/abs/2609.04304

  • GitHub:

    https://github.com/AllSpark-Research/Iris

  • HuggingFace:

    https://huggingface.co/collections/AllSpark-Research/iris

///

作者简介

  • 刘子源,AllSpark Pevek 组算法实习生,清华大学电子系本科、直博在读。以第一作者身份发表 SCI / CCF-A 论文 7 篇,主要研究方向为 Agentic后训练与 DeepResearch/Cowork Agents。

  • 沐川,AllSpark Pevek 组负责人。

Image