2026年9月24日

大型语言模型(LLM)常面临一种矛盾现象:它们可能以极高的自信度输出错误答案,或在给出正确回答时表现出过度的犹豫。加利福尼亚大学河滨分校(UC Riverside)计算机科学家团队的一项最新研究揭示了这一现象背后的机制——模型的“信心”与“准确性”并非由同一组内部特征决定。
该研究成果已发布在 arXiv 预印本服务器上。随着 LLM 被广泛应用于决策支持和任务执行,开发人员亟需更可靠的方法来评估其输出的可信度。这项研究指出,通过识别并调整与信心和正确性分别相关的内部特征,可以在不重新训练整个模型的情况下,优化 AI 系统的行为,使其在正确时更具信心,在潜在错误时更加谨慎。
UCR 计算机科学博士生、该研究主要作者 Het Patel 表示:“业界普遍假设模型的高信心意味着高准确率,低不确定性意味着高可靠性。然而,我们观察到大量反例:模型可能在确信的同时犯错,或在正确的同时表现出不确定。”
信心与准确性的解耦分析
现代 AI 模型通过在海量数据上训练庞大的神经网络构建而成,过程中会调整数十亿个数值参数以预测文本序列。Patel 及其同事旨在探究当信心与准确性发生偏离时,模型内部究竟发生了什么。
研究人员选取了两个可访问内部结构的开源大型语言模型进行实验:Meta 的 Llama-3.1-8B 和 Google 的 Gemma-2-9B。他们根据答案的正确性以及模型的自信程度,将测试结果分为四组,并利用“稀疏自动编码器”(Sparse Autoencoders)技术深入检查模型的内部活动,从而定位驱动特定行为的特征。
分析结果显示,存在三类关键特征:主要与不确定性相关的特征、主要与错误答案相关的特征,以及同时关联两者的“混合”特征。研究团队通过抑制这些选定的特征,观察模型行为的变化,Patel 将此过程比喻为在模型内部“转动旋钮”。
干预内部特征提升可靠性
实验数据显示,不同特征的抑制效果差异显著。关闭与不确定性相关的特征会导致模型准确率大幅下降;相比之下,仅抑制与错误答案直接相关的特征对整体性能影响较小。
值得注意的是,针对“混合”特征的干预产生了积极效果。抑制那些同时与不确定性和不正确性相关的特征,使模型准确率提升了高达 1.1%,同时将模型的不确定性降低了最高 75%。这种效应在多个问答基准测试中均得到验证。
这意味着开发者可以在模型推理阶段进行干预,即事后调整激活值或特征权重,而无需承担昂贵的全量重训成本。
利用内部信号标记可疑答案
另一项实验表明,内部信号可用于辅助 AI 系统判断何时应当拒绝回答。研究人员利用 Llama 模型中间层的三个“混合”特征,成功预测了模型即将产生错误答案的情况。当模型拒绝回答被标记为高风险的问题时,其在剩余问题上的准确率从 62% 提升至 81%,尽管这导致其仅能回答约 53% 的问题。
相比之下,若仅提供“我不知道”选项让模型自行弃权,效果并不理想。研究证实,基于内部信号的干预不仅是理论观察,更为开发者提供了提升 AI 系统可靠性的实用路径。
此外,研究发现这些内部特征具有泛化能力。在一个基准测试中标识的特征,应用于其他基准测试时也能产生类似效果,表明它们反映的是模型的通用特性,而非特定数据集的过拟合结果。
方法的可扩展性
Patel 指出,这种方法论可延伸至信心与准确性之外的领域。研究人员可以搜索与其他期望或不期望的 AI 行为相关的内部特征,并通过操纵这些特征来调控模型性能。“你可以定义想要避免的行为,找到对应的内部特征,然后针对性地进行干预以减少这种行为,”Patel 总结道。
论文信息:
Het Patel et al, Do LLMs encode uncertainty and correctness in the same features? Functional dissociation via sparse autoencoders, arXiv (2026). DOI: 10.48550/arxiv.2604.19974





