Claude 4.6 只有 66%?Claw-Eval-Live 说:会修终端≠能跨系统干活
中文摘要
Claw-Eval-Live评测显示最强模型通过率仅66%,短板为跨系统工作流。
English Summary
Claw-Eval-Live real-time agent evaluation shows even top models struggle with cross-system tasks, achieving only 66% success.
原文节选
📌 一句话摘要 Claw-Eval-Live 是一个面向 Agent 的实时评测框架,通过审计执行轨迹和环境快照来替代仅看结果的评估方式,并动态更新任务集以反映真实工作流需求,其评测结果显示当前最强模型通过率也仅 66%,且短板在于跨系统工作流而非终端操作。 📝 详细摘要 本文介绍了 Claw-Eval-Live,一个面向 AI Agent 的实时评测框架。该框架的核心创新在于两点:一是通过审计执行轨迹、服务端日志和环...