返回首页
OpenAI··官方实验室

Separating signal from noise in coding evaluations

中文摘要

OpenAI分析指出编程基准测试SWE-Bench Pro存在问题,引发对其评估AI模型可靠性和准确性的担忧。

English Summary

OpenAI's analysis of the SWE-Bench Pro coding benchmark reveals issues, raising concerns about the reliability and accuracy of AI model evaluations.

原文节选

A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.