τ^τ-bench 评测:最强编码智能体设置在真实客户模拟中仅通过 23.9%
中文摘要
Sierra发布τ^τ-bench模拟真实任务,最强编码智能体仅通过23.9%。
English Summary
Sierra's τ^τ-bench simulates real customer tasks; the strongest coding agent scored only 23.9%.
Original Excerpt
Sierra 与普林斯顿大学推出 τ^τ-bench 基准,把智能体构建模拟成真实客户交付任务,智能体需基于公司记录、客户需求、生产 API、现有代码和预算交付可部署的客服智能体。