大模型的进步,为什么越来越难衡量了? 25位菲尔兹奖得主联名警告AI基准测试伤害数学研究。OpenAI发现前沿模型存在“基准污染”,因SWE-bench Verified近六成题目有纰漏,已停止报告该成绩。 人工智能 2026-09-18 02:07 52 阅读