AI-Workshop 文献分享 2026-08-15 21:30

AI-Workshop 文献分享 #18 — SkillOpt 作者分享:核心问答与观点速览

8月15日,SkillOpt 论文作者 zzw 受邀分享。论文主体与 #17 一致,本文整理分享后的问答摘要:覆盖 Slow Update 反转样本的度量与 Mini-batch 聚合去重、优化器模型选型与角色分离、顶会 Oral 选题价值;并速览文本空间优化、跨步长反思、技能迁移性三大核心观点。

AI-Workshop 文献分享 SkillOpt Agent Q&A 作者分享

AI-Workshop 文献分享 #18 — SkillOpt 作者分享:核心问答与观点速览

分享人:zzw | 日期:2026-08-15

主题:SkillOpt(面向自进化 Agent Skills 的策略优化)—— 作者本人分享后的 Q&A 摘要


8 月 15 日,AI-Workshop 有幸邀请到 SkillOpt 论文作者 zzw 进行分享。由于论文主体内容与 #17 记录的框架一致,本场分享的技术细节在一问一答中展开,这里整理分享后的问答环节摘要与会议核心观点速览。

一、核心问答环节整理(Q&A)

本环节主要涉及技术细节的实现逻辑和实验设置的探讨,整理为表格以便查阅:

提问人 关注领域 核心问题 关键回答摘要
陈昊东 机制原理 Slow Update 中“反转样本”如何度量?是否会像金融对冲一样合并处理正反信号? 视为关键学习信号。将“先对后错”或“先错后对”的样本分别聚合到不同 Mini-batch 中,利用 LM 进行语义去重,目的是让模型学习如何稳定地做对题目。
梁*威 实现细节 Mini-batch 的聚合逻辑是什么?如何判断两条 Edit 是重复的? 1. 聚合逻辑:分批处理提建议 → 合并重复 → 限制采纳数量(防上下文溢出)。2. 去重方式:利用 LM 判断语义相似度(而非简单的字符串匹配),识别表述不同但含义相同的规则。
彭康 模型选型 Optimizer Model 选用了哪个模型?执行任务的 Agent 和 Optimizer 是同一个模型吗? 1. 选型:主实验统一用 GPT-4o(更强模型效果更好)。2. 角色分离:Target Model(执行者)和 Optimizer Model(优化者)是分开的。
qyr 选题价值 如何判断该选题具备顶会(Oral)潜力? 本质是 Prompt Optimization 的延伸,但创新点在于聚焦优化单个 Markdown 文件(Skill)的框架设计,最终被顶会接收为 Oral。

二、会议核心观点速览

除了问答环节,本次分享关于 Skill Optimization 框架的几个核心机制也值得注意:

1. 核心逻辑:文本空间优化

  • 痛点解决:针对 GPT-4o 等闭源模型无法调参的问题,提出在文本空间进行优化。
  • 类比深度学习
  • 数据划分:采用 Train / Validation / Test(2:1:7)划分,严防数据泄露。
  • Mini-batch:将数据聚合(如 4 条一组)输入优化器,防止上下文窗口溢出。
  • 学习率类比:限制每个 Step 应用的 Edit 数量(如上限 4 个),防止过度优化。

2. 关键机制:跨步长反思(Slow Update)

  • 样本翻转识别:对比当前与历史 Step 的验证集表现,识别“对错翻转”的样本。
  • 利用历史:利用这些翻转样本进行 Slow Update,让模型从优化历史中学习 Skill 改动带来的具体影响。

3. 实验结论:技能迁移性

  • 模型无关性:在 GPT-4o 上训练出的 Skill,可以无缝迁移到 Claude Code 等其他模型上使用。
  • 任务强特异性:Skill 对任务非常挑剔。即使是相近的 Benchmark(如不同数学领域),跨任务迁移通常会导致性能下降或副作用。