FrogNano:通过在线任务合成训练4B编码代理

AI·研究

微软研究院的Minseon Kim、Zhengyan Shi等作者提出FrogNano,一个4B参数的编码代理,专为在资源受限环境下高效处理软件工程任务而设计。它仅通过强化学习在约1500个SWE环境上后训练,使用合成任务,完全没有从更大模型蒸馏。提升性能的关键是在线任务合成流水线,生成的任务校准到当前检查点的可学习性前沿,即当前模型刚好能解决的水平。报告认为这种校准而非任务数量才是训练奏效的原因。FrogNano证明有竞争力的小型编码代理可以仅靠合成任务训练,摆脱对更强教师模型的依赖。报告提供训练方法细节、跨多样环境的评估和深入分析,定位为持续探索轻量级编码代理的基础,而非完成品。

来源:原文链接 (新窗口)

← 返回搜罗吧首页


本页由搜罗吧(Solo8.cn)信息精选服务自动生成,内容仅供参考,不构成任何建议。