最近,模型得分现象引起了业界的广泛关注。9月8日,分析机构SemiAnalysis发布多条推文,直接指责谷歌和Meta两家公司,认为它们的模型Gemini 3.8 Flash和Muse Spark 1.3存在明显的刷榜迹象。根据数据显示,Gemini 3.8 Flash在终端工作能力测试Terminal-Bench 2.1中获得89.4分,位列第二名,超越了GPT-6 Astra。然而,当同一模型在新版本Terminal-Bench 4.0中评测时,仅获得19.1分,瞬间跌至第12位,分数缩水至原来的20%。

与此同时,GPT-6 Astra也经历了大幅下滑,从88.4分降低至57.7分。就在此时,Meta的AI主管Alexandr Wang在评论区反击,称这一指责非常愚蠢。他指出,虽然GPT-5.6 Sol在2.1和4.0之间的降幅更大,却没有人怀疑其刷榜。并且,他重申Muse Spark 1.3并未声称能与Astra或Fable 5.1平起平坐,仅强调性价比更高。

Terminal-Bench系列测评是评估模型实际工作能力的标准,要求模型自主完成一系列复杂任务。在老版本2.1中,Gemini和Muse Spark的表现相对出色,但新版本4.0推出后,局势发生变化。新测试中,Claude Mythos 5.1以60.9分领先,Gemini的得分却仅为19.1分,连同Meta的Muse Spark 1.3也跌至33.3分,显现出明显的实力不足。 龙8头号玩家

分析指出,虽然Gemini在旧版本中表现良好,但在新版榜单中却显得无能为力,甚至被过去的版本所超越。而Meta与谷歌并未通过不当手段来获取优秀成绩,而是可能通过购买类似题目的训练数据以获得较好表现,这在行业内被视为一种新型的“作弊”。

业内调查显示,目前存在一个蓬勃发展的训练数据市场,提供的模拟题目售价从数百到数万美元不等。大企业也纷纷加入这一市场,寻求更好的模型训练方式。如今的局面显示,尽管榜单题目完全公开,但相应的产业链已经成熟,企业只需花钱便可获得更高的排名分数,而不必辛苦进行作弊。