这篇研究论文分析了大型语言模型(LLMs)产生貌似合理但错误的陈述(即幻觉)的统计根源和持续性。作者们认为,幻觉源于预训练阶段的自然统计错误,并证明了生成错误率与一个名为“是否有效”(Is-It-Valid, IIV)的二元分类任务的错误率存在数学关联。此外,幻觉在模型后训练阶段持续存在,是因为主流的评估基准大多采用二元评分系统。这种评分机制实质上是惩罚不确定的表达,激励模型在不确定时进行自信的猜测,以优化其测试表现,而非承认知识不足。为了应对这一问题,论文建议进行社会技术性改进,修改现有基准的评分方式,例如在指示中明确设定信心阈值,从而鼓励模型恰当地表达不确定性。
前往小宇宙评论区与主播互动