大模型强化学习最早被广泛讨论时,典型场景是单轮问题:给一个 prompt,模型生成一个 response,系统根据答案是否正确给 reward,然后更新 policy。
数学题、代码题、选择题和短答案问答,都很适合这个框架。
但 Agent 任务不是这样。
一个真正的 Agent 往往不是一次性给出答案,而是在环境里多轮行动:它要观察状态、调用工具、读取返回结果,并继续决定下一步。有些任务需要查网页,有些任务需要操作系统,有些任务需要访问数据库或知识图谱。此时,强化学习优化的对象就不再是一段 response,而是一整条 trajectory。
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework 就是在这个背景下出现的。它的目标不是再改一个单轮 RL 算法,而是构建一个能支撑多轮、多任务、异步训练、环境统一部署的 Agentic RL 框架。
一、为什么 Agentic RL 不是单轮 RL 的简单加长版
在单轮 reasoning RL 中,模型面对的是一个相对简单的闭环:
prompt → response → verifier → reward → policy update这条闭环已经能解释很多 RLVR 工作。比如数学题可以用最终答案打分,代码题可以用测试用例打分。轨迹虽然是逐 token 生成,但环境状态通常不演化,reward 多半来自最终输出。
Agentic RL 的闭环不同:
observation → action/tool call → environment feedback → next observation → ... → final reward这里的 action 不只是 token,往往还包含工具调用;observation 不是静态 prompt,而是环境返回的新状态;reward 不一定只来自最终答案,也可能来自任务是否完成、工具是否成功、状态是否正确更新
图 1 说明了这个变化。左侧的单轮 RLVR 更像 bandit:模型只做一次回答,verifier 给出反馈。右侧的 Agentic RL 更像多步 MDP:模型的每一步 action 都可能改变后续状态。
这会带来三个直接后果。
第一,轨迹长度更不稳定。有的任务几轮就结束,有的任务要经历很长的工具调用链。同步等待整个 batch 完成,会产生大量空等。
第二,状态空间更大。单轮答案的探索空间主要是文本分布;Agent 任务还包含环境状态、工具返回、网页结构、数据库内容、文件系统状态等。模型更容易过早收缩到少数路径。
第三,多任务干扰更强。WebShop、OS、DB、KG、ALFWorld 这些任务的奖励尺度、动作空间、平均长度和采样效率都不同。把它们放在同一个 RL 训练里,某些任务可能学得很快,某些任务几乎不动,甚至互相干扰。
所以 AgentRL 不是“把 response 变长”这么简单,而是在系统和算法上同时重构 LLM RL。
二、系统层:异步 rollout-training 才能支撑多轮交互
AgentRL 的第一个核心贡献是系统架构。
在普通单轮 RL 中,常见流程是同步的:先生成一批 rollout,再统一计算 reward,最后做训练更新。对于长度接近的数学题,这个方式还能接受。但对于多轮 Agent 任务,trajectory 长度差异很大。短任务已经完成,长任务还在运行,GPU 就会被尾部延迟拖住。
AgentRL 采用 fully-asynchronous generation-training pipeline,把 rollout engine 和 training engine 分成不同资源组,并让二者并行运行。训练端不必等待完整 batch 全部结束,而是持续从 rollout 端拉取可用数据。
图 2 上半部分对比了同步与异步训练。同步式的问题是“最慢 trajectory 决定整体节奏”;异步式则把生成和训练拆开,尽量填满硬件空洞。
图 2 下半部分是 AgentRL 的两层系统:
第一层是Training Framework,负责 policy rollout、actor update、reference / KL 等训练组件。
第二层是Environment Deployment Framework,负责部署多种任务环境。论文中特别强调统一 function-call based API、containerized environments 和 centralized controller。这几个工程设计非常重要,因为 Agent 任务的环境接口高度异构:WebShop 更像网页购物搜索,DB 像数据库查询,OS 像系统操作,KG 像图遍历。
如果每个环境都用一套动作格式和生命周期管理,训练框架很难规模化。AgentRL 的做法是把它们抽象成统一的 function-call 接口,由 controller 管理任务启动、动作执行、观测返回和奖励反馈。
这一步的意义可以概括为:
不同环境的复杂性 → 被 controller 和统一 API 吸收 RL trainer 看到的是相对统一的 trajectory stream没有这层系统抽象,多任务 Agentic RL 很容易停留在 demo,而很难成为可复用训练框架。
三、算法层:探索和多任务稳定性是两个核心难点
AgentRL 的算法部分主要有两个部件:cross-policy sampling和task advantage normalization。
第一个问题是探索。
多轮 Agent 任务的状态空间很大。随着 RL 训练进行,模型可能越来越确定,探索多样性下降。对于单轮题,这可能只是答案多样性减少;对于 Agent 任务,这会让模型总是在相似环境路径中打转,访问不到某些关键状态。
AgentRL 的 cross-policy sampling 让一条 trajectory 中的不同动作可以来自策略池中的不同模型。实际实现中,论文使用当前模型的早期版本作为 stale engines,使部分 rollout engines 每隔多步才更新参数。这样可以在不引入完全不同架构模型的情况下,保留一定策略多样性。
第二个问题是多任务稳定性。
不同任务的 reward 分布和 advantage 尺度可能差异很大。如果直接把所有任务混在一起更新,某些任务的优势信号会主导梯度,导致其它任务学不到,或者多任务训练发生负迁移。
AgentRL 的 task advantage normalization 在每个任务内部对 token-level advantage 做归一化,使每个任务 batch 内的优势分布接近零均值、单位方差。
图 3 左侧展示 cross-policy sampling 的直觉。它不是随意拼接动作,而是让同一条多轮轨迹在多个策略版本之间采样,以扩大可达状态空间。论文中的分析认为,这种方法能探索单一模型不容易访问的路径,同时仍保持语言动作有效。
图 3 右侧展示 task advantage normalization。归一化前,不同任务的 advantage 分布可能尺度不同、均值不同;归一化后,每个任务内部被拉到可比较尺度。它解决的不是 reward 本身,而是优化时梯度信号的可比性。
这两个部件对应 Agentic RL 的两个基本矛盾:
cross-policy sampling:不要太早停止探索 task advantage normalization:不要让任务之间互相压制前者面向状态覆盖,后者面向多任务稳定。
四、实验结果:一个模型能否覆盖多种 Agent 任务
AgentRL 的实验覆盖五类 AgentBench-FC 任务:ALFWorld、DB、KG、OS 和 WebShop。它们分别考验长程规划、数据库查询、知识图谱导航、操作系统任务和网页购物搜索。
论文比较了 API 模型、通用开源模型、已有 Agent training 方法,以及经过 AgentRL 训练的 Qwen2.5 和 GLM 系列模型。
图 4 的左侧重绘了论文表 3 中的平均成功率:Qwen2.5-32B-Instruct 基座平均为 37.2,DeepSeek-R1 为 49.3,GPT-5 为 52.2,Claude-Sonnet-4 Thinking 为 58.2,而 AgentRL with Qwen2.5-32B-Instruct 达到 70.4。
这些数字需要谨慎理解。不同模型、接口与环境设置都会影响结果,不应该简单推出“某模型全面强于另一个模型”。但在论文给定评测设置下,AgentRL 的确展示了 RL 对多轮 Agent 任务的显著增益。
更有意思的是图 4 右上角:论文比较了单任务专家模型和一个多任务模型。五个单任务专家各自只擅长自己的环境,把它们取 best-of-five,平均为 67.8;一个多任务 AgentRL 模型平均为 67.7,几乎持平。
这个结果很关键。因为 Agent 的长期目标不是为每个环境训练一个模型,而是训练一个能跨环境泛化的 generalist agent。多任务模型接近专家组合,说明统一训练并不一定意味着牺牲峰值性能。
图 4 右下角是 ablation。AgentRL-14B 完整设置平均为 65.0;去掉 cross-policy sampling 降到 60.7;去掉 task advantage normalization 降到 59.4。这说明这两个部件并不是装饰性设计,而是会实际影响训练效果。
从这些结果中可以得到一个更抽象的结论:
Agentic RL 的收益不是单一算法带来的,而是系统吞吐、环境统一、探索机制、多任务归一化共同作用的结果。
五、AgentRL 对大模型强化学习意味着什么
AgentRL 把大模型强化学习从“答案级优化”推向“交互级优化”。这件事的意义很大。
在答案级优化里,模型的主要目标是生成一个高质量 response。即使 response 很长,它仍然属于一次生成。训练时最重要的是 reward 设计、policy update、KL 控制、长度与算力。
在交互级优化里,模型必须在环境中行动。它需要观察、选择工具、解析反馈、修正计划。一次失败可能不是因为最终答案错了,而是因为中间某个工具调用错了、某个环境状态理解错了,或者某一步探索路线过早收缩了。
这让 RL 问题发生三层变化。
第一,训练对象从 response 变成 trajectory。reward 不再只是对文本答案打分,而是对行动序列和任务完成度打分。
第二,系统瓶颈从生成吞吐扩展到环境吞吐。训练框架不仅要推理快,还要能管理大量环境实例、工具调用、容器状态和异步反馈。
第三,泛化目标从题型泛化变成环境泛化。一个会做 WebShop 的模型,不一定会做 OS;一个会查数据库的模型,也不一定会导航知识图谱。多任务训练的核心,是让不同环境共享可迁移的 agentic skills。
这也是为什么 AgentRL 特别强调 infrastructure。没有统一 API、controller、containerized environments 和异步 pipeline,多任务 Agentic RL 很难稳定扩展。
六、局限:Agentic RL 仍然比 reasoning RL 更难标准化
AgentRL 很重要,但它也暴露了 Agentic RL 的几个开放问题。
第一,环境本身会成为训练的一部分。数学题的 verifier 相对清晰,Agent 环境却复杂得多。工具接口、状态转移、容器隔离、网络延迟、环境重置,都会影响训练稳定性。
第二,reward 更容易稀疏和延迟。一个任务可能要到多轮交互之后,才知道是否完成。中间每一步 action 的 credit assignment 很难,二值轨迹奖励可能不足以告诉模型哪里错了。
第三,安全性和可控性更重要。Agent 会调用工具、操作系统、浏览网页或查询数据库。强化学习如果只优化任务成功率,可能鼓励一些不符合预期的行为模式。
第四,评测更难复现。多轮环境会引入更多随机性,外部状态变化也会影响结果。因此 Agentic RL 需要更强的 benchmark、沙箱和环境版本控制。
这些问题说明,AgentRL 更像一个起点:它给出了可扩展的训练框架和两个关键算法部件,但 Agentic RL 仍然需要更丰富的 reward、环境标准和安全约束。
七、三篇前沿番外形成的闭环
到这里,GSPO 之后的三篇前沿线索可以串起来了。
ScaleRL 回答的是:RL compute 怎么 scale。它把训练算力、曲线拟合、recipe 和可预测收益连接起来。
Webscale-RL 回答的是:RL data 怎么 scale。它把预训练语料转换成可验证 QA,让 RL 数据不再局限于小题库。
AgentRL 回答的是:RL task 怎么 scale。它把单轮回答推进到多轮环境交互,让强化学习开始优化 Agent trajectory。
这三者共同指向一个趋势:大模型强化学习正在从“后训练技巧”演变为一套系统工程。
优化算法:GRPO / DAPO / CISPO / GSPO 算力扩展:ScaleRL 数据扩展:Webscale-RL 任务扩展:AgentRL如果说早期大模型 RL 的核心问题是“能不能训起来”,那么现在的问题已经变成:能不能用足够大的数据、足够稳定的系统、足够真实的环境,把 RL 训练变成可规模化、可复现、可泛化的能力生成机制。
这也许才是大模型强化学习后续最值得持续关注的方向。
学习资源推荐
如果你想更深入地学习大模型,以下是一些非常有价值的学习资源,这些资源将帮助你从不同角度学习大模型,提升你的实践能力。
一、全套AGI大模型学习路线
AI大模型时代的学习之旅:从基础到前沿,掌握人工智能的核心技能!
因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取
二、640套AI大模型报告合集
这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示
因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取
三、AI大模型经典PDF籍
随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。
因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取
四、AI大模型商业化落地方案
作为普通人,入局大模型时代需要持续学习和实践,不断提高自己的技能和认知水平,同时也需要有责任感和伦理意识,为人工智能的健康发展贡献力量。