当大语言模型答错事实性问题时,究竟是因为从未学过这个知识,还是学过但无法提取?一套名为"知识画像"的分析框架给出了答案:前沿大语言模型几乎编码了所有事实,真正的瓶颈在于知识召回。
事实准确性是大语言模型可靠性的基础。当模型回答事实性问题出错时,原因可能有两种:要么这个事实从未被编码进模型参数,要么已经编码但无法被提取。标准的准确率指标将这两种情况混为一谈,但它们背后的问题截然不同,对应的解决思路也大相径庭。编码失败意味着需要扩大模型规模或拓展训练数据覆盖范围,而召回失败则指向另一类方向——通过训练后优化和推理阶段的方法,帮助大语言模型更好地利用已编码的知识。
在《空架子还是丢失的钥匙?召回率才是参数化事实性的瓶颈》这篇论文中,研究团队提出了"知识画像"这一行为分析框架,用于同时衡量编码和召回能力,并以此诊断前沿大语言模型(如Gemini 3和GPT-5)在事实性上的核心瓶颈。研究发现,前沿大语言模型中的大量事实错误,更像是"钥匙丢了"(召回失败),而非"架子是空的"(编码失败)。
用一个比喻来说明:编码对应事实的参数化存储,召回对应无需外部提示独立提取已编码事实,识别则是指在给定备选项时辨认出正确答案。为支撑这一分析,研究团队构建了WikiProfile基准数据集,包含2150个源自维基百科的事实,每个事实配有10道题,分别探测编码、召回与识别能力。
知识画像将分析单元从单个问题转移到事实本身。它不再问"模型有没有答对这道题",而是问一个更宏观的问题:这个事实目前处于什么状态?研究将每个事实归入五类知识画像:(1)编码失败;(2)召回失败;(3)直接召回;(4)经思考后召回;(5)无编码推理。这五类画像比单题准确率提供了更有价值的诊断信息。
分类依据是该事实是否被编码,以及其可及性如何:是无法召回、可以直接召回,还是只能借助"思考"过程(即在输出答案前激活中间计算步骤,包括思维链提示和针对思考优化的大语言模型)才能召回。
为落地知识画像方法,研究团队构建了WikiProfile基准数据集,旨在针对真实存在的自然事实衡量模型的事实性表现。该数据集通过全自动流水线生成,底层使用带思考模式的Gemini-2.5-Pro,提示词经过在小型留出集上的人工优化。研究从维基百科页面中提取候选事实——即涉及一对有序实体(主体与客体)的命题,且主体在文档中先于客体出现。每个事实配套10项任务:2项用于编码测试、4项用于知识评估、4项用于识别(多选题形式)。
问题生成采用三步流程:生成、精炼、过滤,确保每道题无歧义、指向明确、表述精简且答案唯一。所有问题经搜索引擎辅助过滤,凡返回多个答案或需要进一步澄清的情况均予以剔除。经过自动过滤和人工最终验证,数据集最终包含2150个事实。
研究共评估了13个大语言模型,每个模型分别在有/无思考模式下进行测试。针对每个模型、每个事实和每项任务,各采样8次回复,由大语言模型自动评分,共产生约450万条响应。
在前沿大语言模型(Gemini-2.5-Pro、Gemini-3-Pro、Gemini-3 Flash、GPT-5)中,事实编码接近饱和,但召回远未达到同等水平。对于Gemini-3-Pro和GPT-5,95%至98%的事实已被编码,但这些模型仍有26%至34%的事实无法被直接召回。即便开启思考模式,仍有11%至12%的事实无法召回。这意味着在前沿模型中,事实性错误越来越多地来自于"知识已存储但无法可靠提取",而非"知识根本不存在"。换句话说,瓶颈正从知识获取转向知识利用。
规模扩展也印证了这一规律。在Gemma 3系列模型中,更大的模型编码失败率大幅降低,但召回失败依然显著,且在剩余错误中占比更高。扩大规模更多地提升了模型的存储能力,而非提取能力。
研究结果表明,召回与事实被学习时的具体条件密切相关。当查询与训练时遇到该事实的上下文、表述方式或顺序存在偏差时,召回就会变得更加困难。以下两种情形尤为突出。
此前研究表明,大语言模型在处理长尾(低频)事实时表现较差,通常将其归因于模型容量不足。本研究给出了一个互补的视角:对比低热度与高热度事实,两者的编码率相差不大,差距较小;但召回率的差距则要大得多。这重新界定了长尾问题的本质:许多低频事实并非不存在于模型参数中,而是存在了却难以被提取。瓶颈已从知识获取转移到了知识利用。
研究还重新审视了"反转诅咒"现象——即大语言模型知道"A是B",却无法回答"B是什么"。乍看之下,这似乎说明大语言模型缺乏双向知识。但本研究的结果对此提出了修正。在开放式生成(即召回)任务中,反向问题始终比正向问题更难;而在多选题验证(即识别)任务中,反向问题并不比正向问题更难,甚至往往更容易。这种分离现象意义重大:如果模型在面对干扰项时能认出正确答案,却无法在反向查询中生成该答案,那么问题并不在于双向知识缺失,而在于该事实虽已编码、甚至可以被识别,却难以在查询方向与训练时相反的情况下被召回。"反转诅咒"本质上是一个召回问题。
接下来,研究聚焦于"思考"是否能够帮助恢复那些原本无法提取的知识。结果表明,思考在直接召回最薄弱的地方提升效果最为显著,对低频事实和反向问题的改善尤为突出,有效缩小了热度差距和方向性差距。
具体而言,在针对思考优化的模型中,思考过程能够恢复约40%至65%已编码但未能直接召回的事实;相比之下,对于未编码的事实,思考的帮助则小得多。这一规律表明,思考主要作为一种召回辅助机制发挥作用——它帮助模型提取已编码的知识,而非主要通过复杂的多步推理推导答案。当然,思考并非没有代价,它带来了额外的计算开销,且何时应该触发思考机制目前仍不明确。
知识画像框架使我们能够精准诊断大语言模型的事实性行为。将这一方法应用于维基百科事实后,研究结果提示我们应当转变对前沿大语言模型事实错误的认知方式。如果编码已接近饱和,那么进一步提升事实性表现,可能不再主要依赖扩大规模(无论是模型大小还是数据量)。研究证明,思考能够恢复相当比例的"已编码但未直接召回"事实,这表明事实性的下一轮进步,或许不会来自更好的知识获取,而将来自对模型已有知识的更好利用。
Q&A
Q1:知识画像框架是什么?它是怎么分析大语言模型的?
A:知识画像是一种行为分析框架,将每个事实的状态分为五类:编码失败、召回失败、直接召回、经思考后召回、无编码推理。它不再只看模型答没答对某道题,而是追问这个事实在模型中处于什么状态。借助WikiProfile基准数据集(2150个维基百科事实,每个配10道题),研究可以同时衡量模型的编码与召回能力,从而更精准地定位事实错误的根源。
Q2:前沿大语言模型事实出错主要是因为没学过,还是学了但想不起来?
A:主要是"学了但想不起来"。研究发现,Gemini-3-Pro和GPT-5已编码了95%至98%的事实,但仍有26%至34%的事实无法被直接召回。即使开启思考模式,仍有11%至12%无法召回。这说明前沿模型的主要瓶颈不是知识缺失,而是知识无法被可靠提取,即召回失败。
Q3:"反转诅咒"到底是知识缺失的问题还是召回的问题?
A:是召回问题。研究发现,在多选题验证任务中,反向问题(如"B是什么?")并不比正向问题更难,说明模型其实"认识"这个答案;但在开放式生成任务中,反向问题的召回率明显更低。这种分离说明,双向知识已经编码进模型,只是当查询方向与训练时相反时,知识难以被提取,而非根本不存在。
