AI 编程进入下半场!新基准不测补丁,拷问真正的工程能力
中文摘要
Scale AI 发布 SWE Atlas 新基准,系统评估 AI 编程工程能力。揭示模型在代码健康、测试和跨文件协调方面不足,拷问真实工程水平。
English Summary
Scale AI launched SWE Atlas, a new benchmark assessing AI programming's engineering capabilities. It reveals current models' deficiencies in code health, testing, and cross-file coordination.
Original Excerpt
📌 一句话摘要 Scale AI 发布的 SWE Atlas 基准测试,通过代码理解、测试编写和重构三大维度系统评估 AI 编程智能体的工程能力,揭示当前模型在代码健康、边界覆盖和跨文件协调上仍有明显不足。 📝 详细摘要 本文报道了 Scale AI 团队发布的新一代 AI 编程基准测试 SWE Atlas。与现有主流基准(如 SWE-Bench)仅关注修 bug 和加功能不同,SWE Atlas 聚焦于真实软件工程中...