AI 程式設計能力,該從試題重新審視?OpenAI 的決斷
OpenAI 已停止推薦使用過去作為 AI 程式設計能力評估標準的『SWE-Bench Pro』。隨著試題本身發現缺陷,AI 效能評估的可靠性亮起了紅燈。
OpenAI 已停止推薦使用過去作為 AI 程式設計能力評估標準的『SWE-Bench Pro』。隨著試題本身發現缺陷,AI 效能評估的可靠性亮起了紅燈。
OpenAI 停止推荐作为 AI 编程能力评估标准的“SWE-Bench Pro”。由于在题目本身发现了错误,AI 性能评估的可靠性敲响了警钟。
OpenAI가 AI 코딩 능력 평가의 표준으로 쓰이던 'SWE-Bench Pro'의 사용 권장을 중단했습니다. 문제 자체의 오류가 발견되면서 AI 성능 평가의 신뢰성에 빨간불이 켜졌습니다.
OpenAIがAIコーディング能力評価の標準として使われていた「SWE-Bench Pro」の推奨を中止しました。問題自体にエラーが発見され、AI性能評価の信頼性に赤信号が灯りました。
OpenAI has ceased recommending 'SWE-Bench Pro,' previously a standard for evaluating AI coding capabilities. The discovery of errors within the tasks themselves has raised red flags regarding the reliability of AI performance metrics.