arxiv 资讯 热度 19

On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents

AI 导读

多轮代理策略蒸馏课程式指导小模型优化性能提升

文章提出Guided-OPD方法,通过课程式指导减少教师干预,解决多轮代理小模型训练中误差累积问题,显著提升性能。

Guided-OPD reduces teacher intervention via curriculum guidance, addressing error accumulation in multi-turn agent distillation, achieving 21.1% Score and 25.5% Success Rate improvements.

重点速览

  • 传统OPD在多轮代理训练中易因小错误累积导致教师监督失效 Traditional OPD suffers from error accumulation in multi-turn distillation
  • Guided-OPD通过课程式指导动态调整教师干预概率 Guided-OPD dynamically adjusts teacher intervention via curriculum
  • 方法在ALFWorld等基准测试中实现显著性能提升 Achieves 21.1% Score and 25.5% Success Rate gains in benchmarks
  • 逐步撤除教师监督以恢复纯策略蒸馏模式 Gradually removes teacher supervision to recover pure on-policy mode

一句话:Guided-OPD为小模型训练提供有效策略,平衡教师指导与自主学习。 / Guided-OPD offers effective strategy for small model training balancing supervision and autonomy.

推荐理由 为小模型训练提供新范式,可提升复杂任务处理效率。

查看原文 ↗ 返回热榜

二次创作声明:本页为 AI 热榜聚合导读,内容与热度数据来自公开来源 (arxiv),版权归原始作者所有;本站仅做转载指引与摘要评述,不复制原文。