AI-Workshop 文献分享 2026-06-06 22:00

AI-Workshop 文献分享 #2 — Skill1:基于强化学习的技能增强型智能体统一进化

qyr 在首次 AI-Workshop 中分享 Skill1 框架——通过强化学习实现 Agent 技能选择、技能使用、技能蒸馏的统一进化。核心贡献:多尺度分数分配解决多时间尺度奖励归因问题。

AI-Workshop 文献分享 LLM Agent 强化学习 Skill1

AI-Workshop 文献分享 #2 — Skill1:基于强化学习的技能增强型智能体统一进化

分享人:qyr | 日期:2026-06-06

论文:Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning


一、摘要

本文提出 Skill1 框架,通过强化学习实现 Agent 技能的统一进化

所谓统一进化,是将 skill 能力拆成三个维度,放进同一个强化学习框架中联合优化:

  • 技能选择:处理问题时应该选用什么技能
  • 技能使用:如何利用该技能完成当前任务
  • 技能蒸馏:如何将成功轨迹沉淀为新的技能

Skill1 的关键价值在于:它把这三个原本分散的问题,纳入了同一个 RL 框架中统一优化。


二、领域背景与发展沿革

本文属于 LLM Agent 方向下的技能增强型自进化智能体子方向:

LLM → Agent → 技能增强型 Agent

目标:让 LLM 智能体像人类一样,从过去的成功和失败中学习,把有用经验沉淀为"通用技能",下次遇到类似任务时不必从零开始思考。

1. 无技能 Agent(初期)

代表方法:ReAct(2022)——首次提出 "Think - Act - Observe" 循环框架。

问题: - 每次遇到相似任务都要重新思考,效率低 - 同一任务换一个场景就可能失败,泛化差 - 容易遗忘上下文,甚至陷入死循环

2. 静态 / 半静态技能库

引入技能库概念:把成功策略保存下来,后续任务直接调用。

代表方法: - Voyager(2023):首次提出自动生成并复用技能 - ExpeL(2024):从成功轨迹中提取"经验教训",通过提示工程复用

典型流程:相似度匹配技能 → 技能内容加入 prompt 增强。

问题: - 技能库往往需人工增删改,难以自我进化 - 基于相似度的技能匹配不够准确 - 蒸馏通常是 training-free 的,不更新模型参数,稳定性不足

3. 动态技能库

开始使用 RL(强化学习) 实现技能的自动积累与优化。

代表方法: - SkillRL(2026):用 RL 优化技能利用,但冻结了技能选择 - RetroAgent(2026):用 RL 优化技能利用和蒸馏,但未给技能选择提供梯度信号

RL 的基本逻辑:设计奖励函数 → 模型朝"最大化奖励"方向更新参数。

奖励设计通常覆盖:

环节 常见设计 问题
技能使用 任务成功 +1 / 失败 -1;步数惩罚;子任务进度奖励;探索奖励 太稀疏,或依赖人工拆解
技能选择 UCB 探索算法;事后奖励(成功则给选择加分) 启发式有偏,或噪声大
技能蒸馏 成功即蒸馏;新颖性奖励 易重复生成,或鼓励"新颖但无用"

三、Skill1 核心贡献

1. 统一进化

在以往方法中,RL 往往只能分别优化三环节中的某一个或两个。同时更新多个环节时常见问题:

  • 一个阶段参数更新削弱另一个阶段的能力
  • 不同奖励信号之间产生冲突

Skill1 的突破:让 Agent 在技能选择、技能使用、技能蒸馏三个环节中均产生梯度,进入同一个强化学习过程。

2. 多尺度分数分配:解决多目标奖励冲突

Skill1 提出了 multi-scale credit assignment

最终奖励非常简单:任务完成 +1,失败 0。

真正困难的地方在于:这个结果到底应该归功于哪个动作?而且这些动作的影响范围还不一样。

论文用一个餐馆类比来解释:

你开了一家餐馆,今天赚了 1000 块钱。 - 一个月前请了好厨师 → 影响未来几个月 - 昨天选了新鲜食材 → 影响今天一天 - 厨师现在做了一道菜 → 影响这一桌客人

这 1000 块应该怎么给这三个动作分配功劳?

映射到 Skill1 的环节:

环节 时间尺度 类比
技能蒸馏 影响未来所有任务 研发新菜,以后都能卖
技能选择 影响当前任务 今天选哪家供应商
技能利用 影响当前一步 厨师炒这一盘菜

Skill1 将奖励拆成低频趋势高频波动两部分:

\[r(\tau) = U(s) + [r(\tau) - \hat{U}_i]\]

低频部分:\(U(s)\)

\(U(s)\) 用指数移动平均更新,衡量某个技能在历史任务中的长期表现,越近的任务权重越大。它是对技能选择阶段的长期质量估计。

高频部分:蒸馏奖励

\(R_{distill} = r(\tau) - \hat{U}_i\),其中 \(\hat{U}_i\) 是技能库中当前最好技能在第 \(i\) 个任务上的表现。

这个值衡量新技能相对已有技能的增量价值——越大越值得蒸馏入库。

通过一个统一的奖励分解,Skill1 把: - 长期价值 → 分配给技能选择 - 增量创新 → 分配给技能蒸馏 - 执行质量 → 也纳入同一框架

从而实现三者的统一优化

3. 重排序学习

仅靠相似度做技能匹配可能长期选错。方案:

  1. 先用相似度召回 Top-K 个技能
  2. 再基于 NDCG 奖励函数对这 K 个技能做重排序

核心区别: - \(U(s)\) 衡量技能在历史任务上的平均表现 - NDCG 奖励衡量该技能在当前任务排序中的相对优劣

这解决的是:一个"全局表现不错"的技能,在当前任务里是否也应该排在更前面。


四、实验结论

  • 主实验:验证了 Skill1 整体框架的优越性
  • 消融实验:缺少技能选择、技能使用或技能蒸馏中的任一模块,性能均显著下降

五、总结

Skill1 最重要的贡献,不是单独把某一个技能环节做强,而是第一次把技能选择、技能使用、技能蒸馏三件事统一放进一个强化学习框架里共同优化,并通过多尺度分数分配解决了不同时间尺度下的奖励归因问题。

三个要点:

  1. 统一进化 — 三个技能环节在同一 RL 框架中联合优化
  2. 多尺度分数分配 — 按时间尺度区分长期价值与增量创新
  3. 重排序学习 — 解决相似度匹配的长期偏差