AI-Workshop 文献分享 #18 — SkillOpt 作者分享:核心问答与观点速览
分享人:zzw | 日期:2026-08-15
主题:SkillOpt(面向自进化 Agent Skills 的策略优化)—— 作者本人分享后的 Q&A 摘要
8 月 15 日,AI-Workshop 有幸邀请到 SkillOpt 论文作者 zzw 进行分享。由于论文主体内容与 #17 记录的框架一致,本场分享的技术细节在一问一答中展开,这里整理分享后的问答环节摘要与会议核心观点速览。
一、核心问答环节整理(Q&A)
本环节主要涉及技术细节的实现逻辑和实验设置的探讨,整理为表格以便查阅:
| 提问人 | 关注领域 | 核心问题 | 关键回答摘要 |
|---|---|---|---|
| 陈昊东 | 机制原理 | Slow Update 中“反转样本”如何度量?是否会像金融对冲一样合并处理正反信号? | 视为关键学习信号。将“先对后错”或“先错后对”的样本分别聚合到不同 Mini-batch 中,利用 LM 进行语义去重,目的是让模型学习如何稳定地做对题目。 |
| 梁*威 | 实现细节 | Mini-batch 的聚合逻辑是什么?如何判断两条 Edit 是重复的? | 1. 聚合逻辑:分批处理提建议 → 合并重复 → 限制采纳数量(防上下文溢出)。2. 去重方式:利用 LM 判断语义相似度(而非简单的字符串匹配),识别表述不同但含义相同的规则。 |
| 彭康 | 模型选型 | Optimizer Model 选用了哪个模型?执行任务的 Agent 和 Optimizer 是同一个模型吗? | 1. 选型:主实验统一用 GPT-4o(更强模型效果更好)。2. 角色分离:Target Model(执行者)和 Optimizer Model(优化者)是分开的。 |
| qyr | 选题价值 | 如何判断该选题具备顶会(Oral)潜力? | 本质是 Prompt Optimization 的延伸,但创新点在于聚焦优化单个 Markdown 文件(Skill)的框架设计,最终被顶会接收为 Oral。 |
二、会议核心观点速览
除了问答环节,本次分享关于 Skill Optimization 框架的几个核心机制也值得注意:
1. 核心逻辑:文本空间优化
- 痛点解决:针对 GPT-4o 等闭源模型无法调参的问题,提出在文本空间进行优化。
- 类比深度学习:
- 数据划分:采用 Train / Validation / Test(2:1:7)划分,严防数据泄露。
- Mini-batch:将数据聚合(如 4 条一组)输入优化器,防止上下文窗口溢出。
- 学习率类比:限制每个 Step 应用的 Edit 数量(如上限 4 个),防止过度优化。
2. 关键机制:跨步长反思(Slow Update)
- 样本翻转识别:对比当前与历史 Step 的验证集表现,识别“对错翻转”的样本。
- 利用历史:利用这些翻转样本进行 Slow Update,让模型从优化历史中学习 Skill 改动带来的具体影响。
3. 实验结论:技能迁移性
- 模型无关性:在 GPT-4o 上训练出的 Skill,可以无缝迁移到 Claude Code 等其他模型上使用。
- 任务强特异性:Skill 对任务非常挑剔。即使是相近的 Benchmark(如不同数学领域),跨任务迁移通常会导致性能下降或副作用。