AI·研究
Sierra在2024年构建了𝜏-bench,回答当时看似新颖的问题:模型能否充当可靠的客服代理?如今这已是基本要求。更难的问题是,究竟是谁在构建代理?越来越多情况下是模型自己。Sierra与一些世界领先公司密切合作推出其代理,实践中这项工作不太像实现规格,更像做研究:需求散落在手册、支持文档、电子表格和最佳一线代表头脑中,因此需要形成假设、挖掘证据、构建和测试以确定哪些杠杆真正提升性能。今天Sierra开源hyper-𝜏-bench(发表为𝜏^𝜏-bench),一种新的长时程代理评估,衡量模型不仅能充当代理、还能构建代理的能力。设置是:一个开发者代理从业务记录中恢复需求,在沙盒工作区中构建客服代理,并根据该代理处理留出任务的表现评分。开发者代理端到端完成工作,从证据中恢复规格、设计架构、将业务动作转化为工具,直到拥有可用的客服代理。客户的REST API可能有细微缺陷,因此部分工作是判断bug在规格还是代码中。完成的代理必须在固定模型菜单中服务,并遵守每次对话的成本预算。交付后,用开发者构建时从未见过的完全可验证的𝜏-bench式测试,针对模拟生产流量部署。单独工作时,最佳配置Claude Opus 5(最大推理)在Claude Code中仅通过23.9%的留出评估任务;与具有深度上下文的工程师配对,同类模型在同一任务上达到82.2%。
来源:原文链接 (新窗口)
本页由搜罗吧(Solo8.cn)信息精选服务自动生成,内容仅供参考,不构成任何建议。