AI编码代理的约束工程剖析

AI·技术

当开发者首次为代理式编码系统进行约束工程时,常常落入同一个陷阱:他们运行Terminal-Bench和DeepSWE等常见的端到端基准测试,看着综合分数变动几个百分点,却不知道为何变化。端到端基准测试是评估模型性能、判断哪些方面需要深入调查的事实标准,但挑战在于这些调查成本高昂。行为评估往往能更好地衡量信心,判断你期望的行为是否真的发生,以及在新模型变更或回归时你是朝正确方向前进还是在倒退。行为评估可以充当迭代伙伴,帮助揭示某些改动为何推动指标变化。行为评估像集成测试一样,用于改进代理约束的运行。当行为评估集足够丰富时,你就有了代理目标行为的基线,并能迭代改进提示词以达到目标。行为评估断言的是中间执行步骤,如特定工具调用或文件修改,而非最终字符串相等。

来源:原文链接 (新窗口)

← 返回搜罗吧首页


本页由搜罗吧(Solo8.cn)信息精选服务自动生成,内容仅供参考,不构成任何建议。