
如果只看参数表,AllSpark Research 发布的 Iris-mini 与 Iris-pro 很容易被归入又一组基于 Qwen 后训练的模型:前者以 Qwen3.6-35B-A3B 为底座,总参数 35B、每次推理激活约 3B;后者基于 Qwen3.5-397B-A17B,总参数 397B、激活约 17B;两者都给出 256K 上下文长度和 Apache 2.0 许可。
但 Iris 项目值得细看的地方并不在参数规模,而在它把搜索 Agent 拆成了一套可检查的工程系统。模型要连续决定:当前缺哪块事实,下一条查询怎样写,搜索结果是否真的支持某个中间结论,现有证据是否足够结束任务;同时,运行框架还要处理上下文耗尽、无效输出、重试与评分。换句话说,Iris 的对象不是“带搜索框的聊天模型”,而是一个可能持续几十轮、不断改变调查方向的长程检索过程。
截至 2026 年 9 月 14 日,模型权重、模型卡、GitHub 代码以及 Iris-Harness 已公开;论文摘要称计划公开完整的数据构造、训练与评测方法。需要先划清信息边界:本文提到的训练细节和性能数字,主要来自 AllSpark 团队论文及模型卡,是项目方自报结果;The Decoder 的报道提供了外部梳理,但并不是一次独立复测。当前更准确的结论是:Iris 给出了一个透明度较高、可复现入口较完整的开放搜索 Agent 方案,而不是其“同档最强”已经得到第三方最终确认。
一、长程搜索的难点,不是多搜几次,而是维护一条可收敛的调查链
普通检索问答可以在一次查询后摘取答案。BrowseComp 一类任务却故意只提供间接线索,答案常藏在多个实体、网页与关系的末端。Agent 可能先识别一个没有明说的人物,再定位其作品或任职机构,然后追到另一篇材料中的日期、地点或关联对象。任何一步实体消歧出错,后续搜索都可能沿着错误分支继续扩张。
因此,长程搜索至少包含四种不同决策。
第一是缺口识别。Agent 不能只是复述题目,而要把问题拆成尚未证明的命题。例如,当前已经确认了某奖项的获奖者,却仍未确认题目所指的是其哪一部作品,那么下一轮应围绕作品关系搜索,而不是继续收集人物简介。
第二是查询改写。网页使用的名称、别名、年代和语言可能与题目完全不同。有效查询往往要把一个描述性线索还原为实体,再把实体与下一个目标关系组合起来。Iris 的训练任务刻意强化了这一点:项目论文称,其数据管线从种子网页及外链构造局部实体图,再反向生成多跳问题;除最终答案外,问题中的实体会被改写为描述性指代,以削弱直接字符串匹配的捷径。
第三是分支控制。一次没有结果,可能意味着查询写坏了、搜索引擎召回不足,也可能意味着假设本身错误。Agent 要选择同义改写、换语言、搜索上游实体,还是放弃当前路径。长程任务失败常常不是因为模型不会推理,而是它对同一猜测反复搜索,形成成本很高的循环。
第四是停止判断。找到一个看似匹配的页面并不等于完成任务。Agent 必须判断答案是否唯一、关键关系是否被来源直接支持、冲突信息是否已经解释。过早停止会留下证据缺口;过晚停止则会把上下文塞满重复材料,甚至被后出现的低质量网页带偏。
AllSpark 将训练过程称为“SFT-RL climbing”。按照项目论文的描述,先由较强教师模型生成交错包含推理、搜索、抓取和观察结果的 ReAct 轨迹,再从整条轨迹与单个步骤两个层面过滤:整条轨迹要答对、不能陷入重复循环,并达到一定工具调用深度;步骤级评审则屏蔽冗余或低质量动作。随后模型进入连接实时搜索环境的强化学习阶段。每轮强化学习中较难但成功解决的样本,以及更短、更有效率的成功轨迹,又回流到下一轮监督微调。
“climbing”的实质不是简单轮流做 SFT 和 RL,而是让课程难度随模型能力上移:先教会基本搜索语法,再让模型在真实反馈中暴露薄弱环节,最后把高价值成功路径固化为下一轮示范。论文还称,长轨迹训练使用了 partial rollout 与 prefix reuse:过长请求可以在边界处中断,保存已经提交的前缀,下一训练步再从该状态续跑,以避免每次从头计算。这个设计针对的正是搜索训练的成本长尾——难题的昂贵部分往往集中在轨迹后半段。
二、证据来源管理:答案后面必须能还原“这句话从哪里来”
搜索 Agent 最危险的错误不是完全找不到资料,而是把“搜到过相关内容”误当成“已经证明结论”。一个结论可能来自搜索摘要、网页正文、二手转述或模型自己的补全,它们的证据强度完全不同。如果运行系统只保存最终答案,不保存检索轨迹,就无法区分模型是沿着可靠来源推导,还是碰巧猜中。
Iris 公开材料中一个关键做法,是把网页观察转换为与当前查询相关的摘要,而不是把原始 HTML 全量塞回模型。这样能降低导航栏、广告和无关段落的噪声,也让后续推理更集中。不过,摘要本身又引入一层中介:原网页的限定词、时间范围、否定表达可能在压缩时丢失。因此,生产级证据链不应只有“摘要文本”,还应至少保存 URL、页面标题、抓取时间、命中片段、查询词、摘要器版本,以及中间结论与来源片段之间的映射。
可以把一次调查表示为证据图,而不是一段越来越长的聊天记录。节点包括问题、候选实体、中间命题、页面和原文片段;边则表示“页面支持命题”“命题否定候选”“查询由缺口触发”。这样,当 Agent 最终回答时,系统能够反向遍历:最终答案依赖哪些中间命题,每个命题由哪个页面的哪段文字支撑,是否存在只有单一二手来源的薄弱边。
Iris 的训练数据构造也体现了“可证明性”约束。据项目方描述,合成问题只有同时满足两个条件才会被接纳:参考模型闭卷无法回答,而在提供支持证据后能够回答。前者减少模型凭参数记忆蒙对的样本,后者排除实体图不足以证明答案的坏题。这个双条件比单纯生成复杂问题更重要,因为强化学习若使用不可解或答案含混的任务,最终奖励会把搜索策略推向猜测。
但这仍不等于证据溯源已经完全解决。模型卡展示的评测重点是最终答案准确率或 F1,并未把引用覆盖率、来源质量、原文蕴含关系单独列为核心指标。论文还报告 BrowseComp-ZH 中存在参考答案与网页事实冲突的案例:Agent 给出有来源支持的答案,却被固定 ground truth 判错。该案例由项目方提出,具体比例仍需独立审计,但它揭示了检索评测的根本问题——评测不能永远假设答案表比证据更可靠。
更稳妥的评测应并行记录两类结果:一类是答案与标准答案是否一致,另一类是答案是否被可访问、时间匹配的来源充分支持。两者不一致时进入人工复核,而不是直接把 Agent 判为失败或成功。

三、256K 上下文仍会耗尽,管理策略甚至能制造二十多分差距
搜索轨迹的 token 消耗与普通对话不同。每一轮都新增思考、工具参数、结果摘要和下一步计划;一旦走错分支,历史中还会积累大量已经失效的假设。256K 看似很长,但对于几十次网页交互并不宽裕。更麻烦的是,接近窗口上限时,问题不只表现为“装不下”:模型还可能在冗长历史中重复查询、忘记最初约束,或把早期猜测当成已证实事实。
Iris 模型卡把上下文管理单独列成实验变量。其 discard-all 策略在提示长度超过阈值后,把会话重置为最初问题;retry 则用于一次运行没有产出可解析答案时重新启动,并携带一份简短摘要,记录已经检查和排除的方向。公开的快速启动示例把 256K 模型的丢弃阈值设为 131072 token,这说明“最大上下文”并不等于系统应该一直填到最大值。
项目方报告,Iris-mini 在 BrowseComp 上不使用上下文管理时为 64.7,采用 discard-all 后为 82.2;若再叠加 retry,则为 85.9。Iris-pro 相应从 72.6 提高到 88.6,discard-all + retry 为 90.3。HLE 上增益较小:mini 从 43.2 到 52.3,pro 从 50.8 到 56.4。按团队解释,BrowseComp 更依赖长程探索,而 HLE 更依赖专业知识与推理,所以管理策略的影响不同。
这些数字最重要的含义不是“清空历史竟然更聪明”,而是排行榜上的 Agent 分数属于模型与运行框架的组合。Iris-mini 在同一模型、同一工具条件下,仅改变上下文处理,BrowseComp 就出现 17.5 分的标题成绩差;如果取 discard-all + retry 与无管理对比,差距达到 21.2 分。这个幅度足以超过许多模型之间的公开差距。
不过,discard-all 也有明显代价:如果所有调查状态只存在会话文本里,清空就会遗失已经确认的事实,模型可能重新走旧路。它之所以仍有效,说明冗余历史造成的干扰有时大于遗忘成本。更成熟的实现不应在“保留全部”和“全部清空”之间二选一,而应把状态分层:原始网页与工具日志进入外部存储;已验证事实进入结构化证据账本;被否定候选进入短期排除表;当前推理窗口只保留任务约束、最新缺口和少量高相关证据。上下文管理的目标不是压缩得越短越好,而是在任何一次模型调用中保持足够的决策信息。
四、Iris-Harness 为什么比一张模型榜更重要
Iris-Harness 公开了 Agent 循环、工具、上下文策略和四项评测的运行入口,并可连接 OpenAI 兼容端点。模型卡明确写道,项目结果来自单个 ReAct Agent,没有子 Agent,也没有测试时最终验证。这种披露很关键,因为多 Agent 并发、额外答案核验、不同搜索 API、不同抓取器和不同裁判模型,都可能显著改变成绩与成本。
一个可信的搜索 Agent 评测 Harness 至少需要固定以下变量:工具集合与调用格式、搜索后端及地区语言设置、网页抓取和摘要方式、上下文上限、丢弃阈值、最大轮数、重试规则、答案解析方式、裁判模型版本以及随机性。还应记录每题的搜索次数、抓取次数、token、延迟和失败类型。否则,82 分与80 分可能只是前者多给了一次重试,或用了召回更强的搜索源。
Iris 模型卡称,其四项基准均在统一工具、上下文限制与裁判下分别测试“有管理”和“无管理”两种制度,这是比只公布最佳配置更有价值的做法。但横向表格中的其他系统成绩来自各自公开报告,并各用自己的上下文管理,因此不能视为完全受控的同场复测。The Decoder 所称“各参数档最强”也应理解为对项目方对比表的转述。
下一步独立复现应重点检查三件事。其一,固定搜索快照与实时网页两种环境分别测试:前者保证可重复,后者检验现实适应性。其二,将最终准确率拆成检索召回、证据充分性、引用正确性、停止质量和成本效率。其三,做系统消融:同一底模分别关闭搜索后训练、观察摘要、discard-all 和 retry,确认收益究竟来自模型策略还是脚手架。
Iris-mini 与 Iris-pro 的真正价值,未必是把开放搜索 Agent 的榜单再推高几分,而是迫使使用者承认:长程搜索不是一个模型 API,而是一套有状态、有证据、有恢复机制、也必须被严格测量的系统。模型负责在不完整信息下选择动作;Harness 决定它能看到什么、记住什么、失败后怎样继续;证据账本则决定最终回答是否值得相信。把三者混成一个分数很方便,却不足以支撑研究、尽调或企业决策。Iris 已经把这层问题公开摆上桌面,接下来真正有分量的工作,是第三方能否用同一套 Harness 复现数字,并把“答对”进一步推进到“可证明地答对”。
参考资料
- AllSpark Research,Iris-mini 模型卡(项目方资料):https://huggingface.co/AllSpark-Research/Iris-mini
- AllSpark Research,Iris-pro 模型卡(项目方资料):https://huggingface.co/AllSpark-Research/Iris-pro
- AllSpark Research,Iris GitHub 与 Iris-Harness(项目方代码):https://github.com/AllSpark-Research/Iris
- AllSpark Research,《Iris: Climbing to the Search Frontier》(项目方论文,2026-09-03):https://www.alphaxiv.org/abs/2609.04304
- The Decoder,《Iris-mini and Iris-pro are the strongest open-weight search agents in their class》(媒体报道,2026-09-13):https://the-decoder.com/iris-mini-and-iris-pro-are-the-strongest-open-weight-search-agents-in-their-class/