📖标题:Cross-Domain Hybrid OPD for Generalizable Search Agents
🌐来源:arXiv, 2608.02101v1
🛎️文章简介
🔸研究问题:如何在提升大模型自主搜索能力的同时,避免因强化学习导致的通用能力下降(即对齐税)?
🔸主要贡献:论文提出跨域混合在线策略蒸馏框架,联合优化搜索专用强化学习与多领域专家蒸馏,在保持搜索性能的同时恢复并增强通用智能。
📝重点思路
🔸构建两阶段混合训练框架:第一阶段仅针对代理搜索任务进行强化学习,赋予模型自主规划、迭代检索和证据推理能力;第二阶段引入多领域专家在线策略蒸馏,联合优化搜索RL与通用能力。
🔸训练多领域专家教师模型:分别针对数学、代码、逻辑推理和科学四个领域,利用包含公开基准和内部合成数据的语料库,采用基于信号密度的课程学习策略训练专家教师,确保其具备鲁棒的领域专用推理能力。
🔸实施混合目标优化:在第二阶段,将搜索轨迹与通用领域样本混合成小批量数据。搜索样本继续使用GRPO算法优化,通用样本则通过最小化学生模型与对应领域专家教师分布之间的反向KL散度进行蒸馏,实现token级别的监督信号传递。
🔸设计结构化搜索环境:代理通过XML风格协议调用网页、图像和视频搜索工具,形成检索-执行-生成的闭环,支持多跳信息获取和查询细化,并通过规则验证器、执行沙箱和奖励模型提供准确的奖励信号。
🔎分析总结
🔸单一搜索强化学习存在对齐税:实验显示,仅在第一阶段优化搜索任务能显著提升多跳检索和长程交互等搜索基准的性能,但导致数学、逻辑推理和代码等通用能力基准出现明显下降。
🔸混合训练有效缓解能力退化:引入多领域专家在线策略蒸馏后,模型在逻辑推理、代码生成和数学解题等通用基准上的性能大幅回升,部分指标甚至超过基座模型,成功抵消了搜索专用化带来的负面影响。
🔸搜索性能得以保留并增强:在恢复通用能力的同时,第二阶段的混合训练并未牺牲搜索性能,多数搜索基准得分相比第一阶段仍有提升或保持高位,证明蒸馏知识补充而非覆盖了已习得的搜索策略。
🔸组件消融证实关键作用:移除在线策略蒸馏改用纯强化学习,或合并多专家为单一大通才教师,均会导致通用能力显著下降,表明跨域多专家蒸馏和课程学习对高质量能力迁移至关重要。
💡个人观点
论文打破了搜索专业化与通用智能之间的零和博弈思维,通过结合面向行为的强化学习与面向分布的知识蒸馏,解决了垂直领域微调常见的灾难性遗忘问题。