刷榜 AI 全挂了!Meta 斯坦福地狱级测试,GPT/Claude/Gemini 交出 0 分
中文摘要
Meta、斯坦福与哈佛推出的ProgramBench要求AI从零复现软件,GPT/Claude等9款模型通过率为0%,揭示了AI软件工程能力的缺陷。
English Summary
Meta, Stanford, and Harvard’s ProgramBench requires AI to recreate software from scratch. Nine top models, including GPT and Claude, scored 0%, revealing fundamental software engineering flaws.
Original Excerpt
📌 一句话摘要 Meta、斯坦福和哈佛联合发布 ProgramBench 基准测试,要求 AI 从零复现完整软件,9 款顶级模型通过率全部为 0%,揭示当前 AI 在系统设计与软件工程能力上的根本性缺陷。 📝 详细摘要 文章报道了由 SWE-Bench 原班人马(Meta、斯坦福、哈佛)联合推出的全新 AI 编程基准测试 ProgramBench。与 SWE-Bench 的「修 bug」模式不同,ProgramBenc...