Kimi K3、Qwen3.8-Max 官方评测都在用!伯克利硬核测试揭穿 AI 自进化假象
中文摘要
伯克利评测揭示,AI Agent擅长优化现有组件而非发现新方法,戳破了“自进化”AI的假象。
English Summary
Berkeley's MLS-Bench reveals AI agents excel at optimizing existing components rather than discovering new methods, debunking the "self-evolving AI" illusion.
Original Excerpt
📌 一句话摘要 本文深度解读伯克利 MLS-Bench 评测,指出当前 AI Agent 更擅长优化组合已有组件而非发现新方法,揭示了 Auto-Research 在方法发现层面的真实瓶颈。 📝 详细摘要 文章围绕伯克利大学提出的 MLS-Bench 评测展开,系统拆解了当前「自进化 AI」叙事中的三种能力层次:执行能力、系统外围更新与研究方法发现。作者指出,Auto-Research 的关键问题不在于 AI 是否参与...