OpenAI公布数学解法未达普林斯顿评估标准
OpenAI公布数百个数学解法,未达普林斯顿评估标准。其719份手稿仅10份含思维链,42%证明未经形式化验证,且存在自然语言与代码不一致风险,引发透明度质疑。
共 2 篇相关文章
OpenAI公布数百个数学解法,未达普林斯顿评估标准。其719份手稿仅10份含思维链,42%证明未经形式化验证,且存在自然语言与代码不一致风险,引发透明度质疑。
25位菲尔兹奖得主联名警告AI基准测试伤害数学研究。OpenAI发现前沿模型存在“基准污染”,因SWE-bench Verified近六成题目有纰漏,已停止报告该成绩。