深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

35B 的搜索智能体登顶多个基准:Iris 还把训练数据和评测方法一起开源了

2026-09-08·arXiv·模型推理搜索智能体强化学习MoE论文
▮ SIGNAL SUMMARY · 摘要快读

一篇 arXiv 论文发布 Iris-mini/Iris-pro 两个搜索智能体(35B-A3B / 397B-A17B),多项开放搜索基准登顶。比数字更硬核的,是它把训练数据、评测与 RL 串成一条「爬坡流水线」。

35B 的搜索智能体登顶多个基准:Iris 还把训练数据和评测方法一起开源了

搜索是 Agent 最古老也最吃香的技能,但「搜索智能体怎么做训练数据」长期是个黑箱:各家都在说效果,很少讲数据从哪来、怎么保证模型是真会搜而不是背答案。Iris 这篇论文罕见地把整条流水线摊开了——数据怎么造、训练怎么交替、评测怎么避免作弊,全都写在纸面上。

综述

Iris 是论文里两个搜索智能体的名字:Iris-mini(35B-A3B)与 Iris-pro(397B-A17B),都是 MoE 稀疏架构,由 9 位作者提交于 2026 年 9 月 3 日。官方计划开源权重与完整配方(数据构建、训练、评测)。

效果口径:开启上下文管理后,BrowseComp 82.2/88.6、BrowseComp-ZH 84.8/85.1、DeepSearchQA 86.9/92.9、HLE 52.3/56.4(分别对应 mini/pro),论文称是各自参数范围内开源搜索智能体的最强结果。所有数字来自单一 ReAct agent——没有子 agent,没有测试时验证。

真正的亮点在方法论。任务不是人工写的,而是从网页语料的超链接结构「反推」出来的:先从一个种子页和它的外链蒸馏出实体图,再据此创作多跳问题链,并把每个非答案实体改写成描述性指代,确保线索无法靠字符串匹配蒙对;最后只保留「参考模型闭卷答不出、给足证据就能解」的问题。这批问题再转成轨迹,经轨迹级与轮次级双重过滤后做 SFT,随后对着实时搜索做 RL。

专业分析

这篇论文最狠的一刀,切在「数据从哪里来」:用超链接结构当老师,让题目难度自动长在模型够不着的地方。

过去的搜索 agent 训练数据要么靠人工标注(贵、慢、有偏),要么靠大模型生成(容易与评测分布重叠)。Iris 的做法是让网络结构自己出题——链接即相关性,出链即线索,多跳出链即多跳推理。再叠加「参考模型闭卷失败、开卷成功」的准入测试,保证题目恰好落在模型能力边缘。这一招把数据生产变成了可扩展的流水线,而不是一次性工程。

训练环节的「SFT-RL 交替爬坡」同样值得记笔记:每轮 RL 把「最难解决且最高效的 rollout」送回下一轮 SFT。这相当于给数据流装了一个自动升级阀——模型变强,回炉的数据也变强,难度梯度永远贴着当前能力走。配合 RL 期间对超长 rollout 的请求级中断与已提交前缀续跑,工程细节相当扎实。

还要注意论文反复强调的一句话:在这些基准上,推理期的上下文管理比大多数系统差异更值钱。 所以他们把所有评测都做成「带/不带上下文管理」对照,工具集、上下文上限、裁判全部固定。这种严谨,比跑分数字本身更能说明分数可信。

关联信息与影响

搜索智能体是这一波 Agent 落地里最接近「人手一个」的品类。Iris 与 FreeToken、Kiro Crew、OpenWAM 等同期情报放在一起,能看出开源社区今年的重心:不再只卷单模型榜单,而是把「数据工厂 + 训练流水线 + 评测基建」打包开源,降低后来者的入场门槛。

对评测生态是直接冲击:BrowseComp 这类反作弊设计的高难基准,正因为 Iris「闭卷/开卷准入」式数据过滤而变得更难被污染——想刷榜,先得让自己的模型真的会搜。反过来,HLE 上 52.3/56.4 的成绩也提示:搜索能力再强,遇到人类专家级难题仍有大段空白。

影响是双向的:对闭源厂商,开源搜索 agent 逼近其 API 能力,会压缩「搜索即服务」的溢价;对工具链,推理期上下文管理被证明是收益高地,未来会有更多系统专门优化这一层。

未来展望

短期,等权重放出后的社区复现是试金石:论文里的数字是否站得住、mini 档在消费级硬件上能不能真跑、上下文管理的实现成本有多高。

中期,这套「链接结构造题 + 交替爬坡」的方法论大概率外溢到其他 agent 技能——代码、工具调用、多模态检索都可能复制同一套数据反推逻辑。届时「Agent 的训练数据工程」会从手艺变成标准件。

长期,搜索 agent 的分工会被重写:当 35B 级的开源模型能在 BrowseComp 上逼近 90 分,通用大模型与专用搜索模型的边界会重新划定——「搜索」可能重新变成模型家族的独立子系,而不是聊天模型的附加技能。

信号强度

大模型厂商:搜索能力可以外置成专用模型,旗舰模型不必为「会搜」背负全部参数成本;但开源逼近的压力会让搜索 API 的定价策略更谨慎。

研究者:获得一份可复现的搜索 agent 全流程范本——数据准入过滤、SFT-RL 交替、上下文管理对照评测,都是可以直接移植的方法论。

开发者:可在消费级(mini)与云端(pro)之间按预算选档;权重开源后,私有搜索 agent、企业知识库检索都有低成本改造空间。

内容创作者:多跳、跨源、要验证的检索任务交给搜索 agent 更可靠,事实核查类工作的自动化程度会继续提升。

关联产业链:推理上下文管理的优化会催生新的中间件机会;高质量「造题」数据服务也可能成为独立生意——毕竟数据流水线现在是开源项目最稀缺的资产。

这篇论文的标题叫「Climbing to the Search Frontier」,翻译过来是「往搜索的前沿爬」。它真正示范的,不是某一次登顶,而是把梯子本身做成了可以反复使用、还能自己升高的东西。

SIGNAL FILE · 情报档案

llm/Iris-mini / Iris-pro(AI 情报库 2026-09-08 收录)

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://arxiv.org/abs/2609.04304(arXiv)

RELATED SIGNALS · 关联信号