分析机构指谷歌 Meta 模型刷榜,双方各执一词
1 小时前
分析机构 SemiAnalysis 发文指出谷歌 Gemini 3.8 Flash 和 Meta Muse Spark 1.3 刷榜痕迹明显。在 Terminal-Bench 2.1 榜单上二者成绩优异,Gemini 3.8 Flash 排第 2,Muse Spark 1.3 排第 4,但在新增防作弊机制、更新题目的 Terminal-Bench 4.0 榜单上,前者暴跌至 19.1 分排第 12,后者为 33.3 分,成绩大幅下滑。Meta 首席 AI 官对此反驳,称 GPT-5.6 Sol 落差更大却未被指刷榜,且 Muse Spark 1.3 主打性价比。SemiAnalysis 还揭露行业刷榜高阶玩法:大厂不再直接用原题训练,而是购买贴近公开榜单题型的训练数据,相关产业链已成熟,单季合同均价达 30 万到 50 万美元,供给侧有众多公司参与。此外,Datacurve 公司既运营 DeepSWE 榜单,又出售相关训练数据,被指既当卖题机构又当监考老师。SemiAnalysis 认为公开基准终将被「刷穿」,建议做高质量私有基准,但这会使公开榜单沦为营销工具,开发者将失去公平丈量模型的公共标尺。
体验专业版特色功能,拓展更丰富、更全面的相关内容。