专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  新智元

AI圈惊天丑闻,Meta作弊刷分实锤?顶级榜单曝黑幕,斯坦福MIT痛斥

新智元  · 公众号  · AI  · 2025-05-01 13:33
    

主要观点总结

新智元报道,关于LMArena的争议引发关注。来自不同机构的研究者发表新论文,指控AI公司利用LMArena作弊刷分。论文详细分析了LMArena的280万场战斗,涉及43家提供商的238个模型。研究显示,少数公司通过特定策略在排行榜上名列前茅,存在过度拟合现象。同时发现闭源商业模型在LMArena中的参与度更高,开源模型的对战次数较少且容易被移除,导致数据访问不平等现象。LMArena的官方回应称论文存在大量错误和误导性陈述。此外,论文还提出了LMArena需要改进的地方。同时,也有其他声音认为科技公司对LLM的投入使得LMArena成为了一个重要的评测平台,但如今其公正性受到质疑。

关键观点总结

关键观点1: 论文指控LMArena存在作弊行为

研究者发现一些AI公司通过特定策略在LMArena上获得高分,包括私下测试多个模型变体、选择性撤回低分模型等方式。

关键观点2: 研究者分析LMArena的数据

论文分析了LMArena中的280万场战斗数据,揭示了不同模型的表现和参与者之间的差异。

关键观点3: 数据访问不平等现象

研究发现闭源商业模型在LMArena中的参与度更高,开源模型的对战次数较少且容易被移除,导致数据访问不平等。

关键观点4: LMArena的官方回应和争议

LMArena官方回应称论文中存在事实错误和误导性陈述,并指出论文中的一些数字与实际情况不符。

关键观点5: 其他观点和建议

有观点认为科技公司对LLM的投入使得LMArena成为一个重要的评测平台,但现在其公正性受到质疑。论文还提出了LMArena需要改进的地方,包括提高透明度、确保移除模型的公平性等。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照