GPT-6 Astra 解 5 道 Erdős 难题,其余 4 个 AI 模型得零分
上周六
Epoch AI 和曼彻斯特大学发布 FrontierMath Erdős(FME)基准测试论文,针对陶哲轩对 AI 数学成果的批评设计该测试:用 68 道人类未解的 Erdős 数学难题消除数据污染,要求 AI 用 Lean 证明助手提交形式化证明,所有模型在相同条件下作答。5 个顶级 AI 模型同场测试,仅 GPT-6 Astra 非零分,得分率 3%,其余 4 个模型均零分。在标准测试中 GPT-6 Astra 解出 2 道,放宽预算的追加测试中又解出 3 道,共解开 5 道,包括 Erdős1931 年提出的首个认真问题和 Erdős-Sós 猜想等。论文也指出测试存在形式化成本可能低估 AI 能力、未衡量提问题能力等局限,68 道题仍有 63 道未解。
体验专业版特色功能,拓展更丰富、更全面的相关内容。