AI-Workshop 文献分享 #2 — Skill1:基于强化学习的技能增强型智能体统一进化
分享人:qyr | 日期:2026-06-06
论文:Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
一、摘要
本文提出 Skill1 框架,通过强化学习实现 Agent 技能的统一进化。
所谓统一进化,是将 skill 能力拆成三个维度,放进同一个强化学习框架中联合优化:
- 技能选择:处理问题时应该选用什么技能
- 技能使用:如何利用该技能完成当前任务
- 技能蒸馏:如何将成功轨迹沉淀为新的技能
Skill1 的关键价值在于:它把这三个原本分散的问题,纳入了同一个 RL 框架中统一优化。
二、领域背景与发展沿革
本文属于 LLM Agent 方向下的技能增强型自进化智能体子方向:
LLM → Agent → 技能增强型 Agent
目标:让 LLM 智能体像人类一样,从过去的成功和失败中学习,把有用经验沉淀为"通用技能",下次遇到类似任务时不必从零开始思考。
1. 无技能 Agent(初期)
代表方法:ReAct(2022)——首次提出 "Think - Act - Observe" 循环框架。
问题: - 每次遇到相似任务都要重新思考,效率低 - 同一任务换一个场景就可能失败,泛化差 - 容易遗忘上下文,甚至陷入死循环
2. 静态 / 半静态技能库
引入技能库概念:把成功策略保存下来,后续任务直接调用。
代表方法: - Voyager(2023):首次提出自动生成并复用技能 - ExpeL(2024):从成功轨迹中提取"经验教训",通过提示工程复用
典型流程:相似度匹配技能 → 技能内容加入 prompt 增强。
问题: - 技能库往往需人工增删改,难以自我进化 - 基于相似度的技能匹配不够准确 - 蒸馏通常是 training-free 的,不更新模型参数,稳定性不足
3. 动态技能库
开始使用 RL(强化学习) 实现技能的自动积累与优化。
代表方法: - SkillRL(2026):用 RL 优化技能利用,但冻结了技能选择 - RetroAgent(2026):用 RL 优化技能利用和蒸馏,但未给技能选择提供梯度信号
RL 的基本逻辑:设计奖励函数 → 模型朝"最大化奖励"方向更新参数。
奖励设计通常覆盖:
| 环节 | 常见设计 | 问题 |
|---|---|---|
| 技能使用 | 任务成功 +1 / 失败 -1;步数惩罚;子任务进度奖励;探索奖励 | 太稀疏,或依赖人工拆解 |
| 技能选择 | UCB 探索算法;事后奖励(成功则给选择加分) | 启发式有偏,或噪声大 |
| 技能蒸馏 | 成功即蒸馏;新颖性奖励 | 易重复生成,或鼓励"新颖但无用" |
三、Skill1 核心贡献
1. 统一进化
在以往方法中,RL 往往只能分别优化三环节中的某一个或两个。同时更新多个环节时常见问题:
- 一个阶段参数更新削弱另一个阶段的能力
- 不同奖励信号之间产生冲突
Skill1 的突破:让 Agent 在技能选择、技能使用、技能蒸馏三个环节中均产生梯度,进入同一个强化学习过程。
2. 多尺度分数分配:解决多目标奖励冲突
Skill1 提出了 multi-scale credit assignment。
最终奖励非常简单:任务完成 +1,失败 0。
真正困难的地方在于:这个结果到底应该归功于哪个动作?而且这些动作的影响范围还不一样。
论文用一个餐馆类比来解释:
你开了一家餐馆,今天赚了 1000 块钱。 - 一个月前请了好厨师 → 影响未来几个月 - 昨天选了新鲜食材 → 影响今天一天 - 厨师现在做了一道菜 → 影响这一桌客人
这 1000 块应该怎么给这三个动作分配功劳?
映射到 Skill1 的环节:
| 环节 | 时间尺度 | 类比 |
|---|---|---|
| 技能蒸馏 | 影响未来所有任务 | 研发新菜,以后都能卖 |
| 技能选择 | 影响当前任务 | 今天选哪家供应商 |
| 技能利用 | 影响当前一步 | 厨师炒这一盘菜 |
Skill1 将奖励拆成低频趋势和高频波动两部分:
低频部分:\(U(s)\)
\(U(s)\) 用指数移动平均更新,衡量某个技能在历史任务中的长期表现,越近的任务权重越大。它是对技能选择阶段的长期质量估计。
高频部分:蒸馏奖励
\(R_{distill} = r(\tau) - \hat{U}_i\),其中 \(\hat{U}_i\) 是技能库中当前最好技能在第 \(i\) 个任务上的表现。
这个值衡量新技能相对已有技能的增量价值——越大越值得蒸馏入库。
通过一个统一的奖励分解,Skill1 把: - 长期价值 → 分配给技能选择 - 增量创新 → 分配给技能蒸馏 - 执行质量 → 也纳入同一框架
从而实现三者的统一优化。
3. 重排序学习
仅靠相似度做技能匹配可能长期选错。方案:
- 先用相似度召回 Top-K 个技能
- 再基于 NDCG 奖励函数对这 K 个技能做重排序
核心区别: - \(U(s)\) 衡量技能在历史任务上的平均表现 - NDCG 奖励衡量该技能在当前任务排序中的相对优劣
这解决的是:一个"全局表现不错"的技能,在当前任务里是否也应该排在更前面。
四、实验结论
- 主实验:验证了 Skill1 整体框架的优越性
- 消融实验:缺少技能选择、技能使用或技能蒸馏中的任一模块,性能均显著下降
五、总结
Skill1 最重要的贡献,不是单独把某一个技能环节做强,而是第一次把技能选择、技能使用、技能蒸馏三件事统一放进一个强化学习框架里共同优化,并通过多尺度分数分配解决了不同时间尺度下的奖励归因问题。
三个要点:
- 统一进化 — 三个技能环节在同一 RL 框架中联合优化
- 多尺度分数分配 — 按时间尺度区分长期价值与增量创新
- 重排序学习 — 解决相似度匹配的长期偏差