返回首页

24小时热榜

65作者: erikschoster大约 3 小时前原帖
42作者: Davisb135大约 3 小时前原帖
我是我和我的朋友们撰写的一篇论文的作者。我们出于好奇,想知道1970年代起源的MUD文本游戏是否可以用来评估大型语言模型(LLMs)。在过去几个月的晚上和周末,我们在个人电脑上进行实验并撰写论文,使用的API信用额度大约为99美元。 我们的实验确实有一个有趣的排行榜,但更令人惊讶的是每个LLM的测量结果。我们在四个行为维度上对每个模型进行了评分,其中两个维度严重依赖于LLM分类器。当我们去掉这两个维度时,其中一个前沿模型的排名下降了六位。随后,我们将分类器与第二位评审进行比较,结果显示两者之间的模型一致性范围从85%到22%。总体的kappa值(探测检测为0.04)表明该工具存在噪声,但并未说明哪些模型受到噪声的影响。受影响最严重的模型与分类器属于同一家族。这并不能证明存在偏见,只是我们记录到的一个观察结果。 我们意识到LLM评审可能不可靠,虽然这并不是我们最初的测试意图,但最终成为了最有趣的发现。两位评审之间的差异是我们认为可以推广到其他基于评审的基准测试的发现。 我们强调这只是一个概念验证,而不是经过验证的基准。我们在论文中准备了详细的局限性部分,包括每个模型仅进行了50次运行、顶级模型之间存在重叠的置信区间、没有人类评审员、环境非常小等。 我们所做的一切都是公开的,论文和数据采用CC BY 4.0许可,而代码则是MIT许可。论文、记录、代码和完整的API账单导出可以在以下链接找到:<a href="https://doi.org/10.5281/zenodo.21386663" rel="nofollow">https://doi.org/10.5281/zenodo.21386663</a> 如果您发现问题,请告诉我们,这正是我们分享这些内容的原因。我们目前正在设计第二阶段,希望它尽可能稳健。我们正在考虑人类基准、多位评审、更多目标、更大的环境等。