Search Agent 是最难训练、也最难评测的一类模型。它要在真实网络里边搜边读边推理,还得自己判断什么时候证据够了、可以停下来作答。小红书 AllSpark 团队刚刚开源的 Iris,把这件事往前推了一步:35B 的体量,在 BrowseComp 上拿到 82.2 分,逼近 Kimi-K2.6 这类万亿参数模型。

团队把难点归纳成三道坎,Iris 的配方就围绕它们展开。
数据:从超链接结构里"造"题
Iris 的训练题不是收集来的,而是从网页的超链接关系里反向生成的。
流程分三步:先以某个种子页面为答案,顺着出链把相关页面聚成一张小型实体图谱;再在这张图上写一道必须跨多个页面、多步推理才能得到唯一答案的问题;最后一步最关键——把题面里除答案之外的每一个实体,都改写成一句描述性的指代。
这一步"抹掉线索"的改写,让题目没法靠字符串匹配走捷径。模型不能把题干里的名字直接丢进搜索框,必须真正理解、逐步锁定。
造完题还要双重筛选:用一个参考模型验证两件事——闭卷(不给资料)时它答不出,说明题够难;把证据作为上下文喂它时能答对且答案唯一,说明题确实可解。只有同时满足"够难"和"可解"的题才会留下。整个流程全自动、不依赖人工出题,所以能随网页语料规模持续扩展。
训练:SFT–RL Climbing
Iris 用监督微调(SFT)和强化学习(RL)交替训练,团队管这个过程叫 SFT–RL Climbing。
SFT 阶段先让一个强教师模型在真实搜索工具上把题做一遍、得到完整轨迹,再经过两层过滤:轨迹层看结果对不对、有没有陷入重复或乱码、搜索深度够不够;再由一个"判官"在单轮粒度上剔除瞎搜的步骤——判官的评判标准不是人手写的,是从数据里归纳出来的。
RL 阶段有两个关键工程决定。一是把判分和摘要都收进训练集群内部,用一个自建模型同时充当奖励判官和检索内容摘要器,训练全程不依赖任何外部 API,把网络波动挡在训练循环之外。二是超长轨迹"断点续跑"——少数拖后腿的超长会话不再整段丢弃,而是在请求级别中断、下一步从已提交的前缀继续,让 GPU 在同步调度下也保持忙碌。
每轮 RL 之后,团队把最难做对的、以及最高效解出的轨迹回灌给下一轮 SFT。模型变强,筛选出的题自动变难,形成一条自适应的课程。
评测:把取巧的水分挤掉
Iris 在 BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE 四个基准上做了评测。为了让分数反映模型本身而非推理框架的取巧,所有系统都在相同的 Tool、Context、Judge Model 下比较,只用单个 ReAct 智能体,不叠多智能体、也不做测试时自我验证。
成绩如下:
- Iris-mini(35B):82.2 / 84.8 / 86.9 / 52.3,在 BrowseComp、BrowseComp-ZH、HLE 三项上登顶同量级开源。BrowseComp 的 82.2 分已逼近万亿参数级模型。
- Iris-pro(397B):88.6 / 85.1 / 92.9 / 56.4,BrowseComp、DeepSearchQA、HLE 均同量级最强开源。
团队还单独把上下文管理(CM)拉出来做了对照——长链路搜索常在答完前就用光上下文,截断、压缩、清空重来都能续上更多搜索,但鲜有工作讨论这一点。结论是:即使完全不开 CM,Iris 已领先同量级系统;开启后成绩进一步提升,且小模型获益明显大于大模型,因为小模型解同样的题需要更多步骤、更容易触到上下文上限。
真正有意思的是"外溢"
实验里出现了一个超出预期的现象:为 Search 合成的数据、专门训练的专家模型,在没有专门训练过的任务上同样有效——包括 General Tool Use 和 Cowork 场景。
团队的解释是:Search 数据教会模型的,是在信息不完整时如何行动——而这种能力不只属于网页浏览,任何需要"边做边找、边找边判断"的 Agent 任务都用得上。
如果这个规律成立,Search 或许更应该被看作一种可复用的原子能力,而不是一个孤立的垂直方向。过去被当作"垂类"投入的训练,很可能是一项能被反复使用的通用底座。这也是 Iris 的价值所在:不只刷了一个 benchmark 的分,而是证明了"搜索"这件事的底层能力可以迁移。
技术报告、权重和配方都已开源。团队坦承,面对最顶尖的前沿系统 Iris 仍有差距,缩小这个差距是后续重点。
来源: