小红书 AllSpark 开源 Search Agent 模型 Iris,35B 与 397B 版本同量级成绩领先
事件全貌
AI 综述中国团队AllSpark(小红书)发布两个开源搜索智能体Iris-mini和Iris-pro及完整训练配方。Iris-mini为35B参数,基于Qwen3.6-35B-A3B;Iris-pro为397B参数,基于Qwen3.5-397B-A17B,均支持256,000 token上下文窗口。团队在论文中宣称,两者在各自参数级别中为最强开源权重搜索智能体。
据论文,开启上下文管理后,Iris-mini四个基准得分为82.2、84.8、86.9、52.3,Iris-pro为88.6、85.1、92.9、56.4。Iris-mini在四项基准中的三项居小级别首位,在BrowseComp上超出次优模型XYZ-Aquila-mini 3.4分,但在DeepSearchQA上落后;Iris-pro在更大级别中领先或持平,作者称其有时接近需要更多算力的系统。上下文管理对较小模型影响更大,BrowseComp提升最高21.2分,论文归因于Iris-mini消耗上下文更快而非token预算更小。
训练方法方面,论文介绍从网页链接结构反向构造可验证训练数据:从种子页及其出链构建术语关系图生成多步问题,除最终答案外所有术语均被改写以防简单文本搜索解决,仅保留参考模型无工具时无法解决但有正确来源可解的问题。教师模型生成含推理、搜索查询和结果的解题路径,经两轮过滤(全路径正确性/重复循环/搜索深度检查,以及评审模型逐步审核,其标准由数据本身导出),再通过在真实网络搜索上的强化学习改进,监督微调与强化学习交替进行,作者称之为“SFT-RL climbing”。作者还报告训练数据和模型在未训练过的任务(如通用工具使用和办公工作)上也有提升,团队推测搜索更接近一种基础能力。
模型权重已在Hugging Face开放,代码在GitHub开放。目前发布内容包括Iris Harness(含智能体循环、工具、上下文管理策略及全部四项基准的评测),可对接任何OpenAI兼容端点;数据构建与训练管线团队计划后续发布。小红书AllSpark官方公众号亦发布Iris,宣称其为同量级最强开源Search Agent,以上性能领先均为团队在论文中的宣称。
AI 汇总报道生成 · 8天前更新。单篇报道保留其发布时的原貌。
历史报道归档。当前热点以新版榜单为准。
报道时间线
沿着报道,了解事件的不同侧面。
- 小红书 AllSpark 开源 Search Agent 模型 Iris,35B 与 397B 版本同量级成绩领先
小红书 AllSpark 团队发布并开源 Search Agent 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布。
- AllSpark 发布 Iris-mini 和 Iris-pro 开源搜索智能体
AllSpark 团队发布 Iris-mini(35B,基于 Qwen3.6-35B-A3B)和 Iris-pro(397B,基于 Qwen3.5-397B-A17B)两个开源搜索智能体,并公开训练配方。