推理模型更懂如何表达自信:大型语言模型如何通过慢思考实现更准确的自我评估
这项研究证明推理模型(使用链式思考的大语言模型)不仅在解决问题上表现优异,还能更准确地表达其确信度。研究人员在六个数据集上评估了六种推理模型,发现它们在33/36种测试设置中比非推理模型表现更好。深入分析揭示这一优势来源...
这项研究证明推理模型(使用链式思考的大语言模型)不仅在解决问题上表现优异,还能更准确地表达其确信度。研究人员在六个数据集上评估了六种推理模型,发现它们在33/36种测试设置中比非推理模型表现更好。深入分析揭示这一优势来源...
这项研究突破了大语言模型推理能力主要局限于数学和编程领域的限制,提出了"General-Reasoner"训练方法,使模型能够在物理、化学、金融等多领域展现高水平推理能力。研究团队构建了包含23万个跨学科问题的高质量数据...
这篇研究来自新加坡南洋理工大学,首次建立了覆盖英语-汉语、英语-泰米尔语和英语-马来语的代码切换对话摘要基准测试CS-Sum。研究评估了10个大型语言模型,发现即使最先进的模型在处理混合语言时也存在严重局限,主要表现为忽...
这项研究揭示了现有长视频理解评估基准的严重缺陷:过度依赖多选题导致结果膨胀,且许多问题存在先验偏好使模型无需真正理解视频就能作答。针对这些问题,多伦多大学团队开发了VIDEOEVAL-PRO基准,采用开放式短答案形式,真...
这项由香港大学等机构合作开发的FedPrLLM框架,首次将联邦学习与大语言模型修剪技术结合,解决了隐私敏感领域无法共享数据进行模型压缩的难题。研究表明,采用层比较的一次性修剪策略且不进行权重缩放,可以在保护数据隐私的同时...
SSR是西湖大学研究团队开发的创新框架,通过引入深度感知增强视觉语言模型的空间理解能力。该方法将原始深度数据转换为结构化的推理语言,作为中间表示,显著提升空间推理能力。研究团队还创建了包含超过百万级的SSR-COT数据集...
微软研究院与北京大学的团队开发出全新的大型混合推理模型(LHRMs),解决了大型推理模型的过度思考问题。这种创新模型能够像人类一样,根据问题复杂度自动决定是否需要深入思考。研究团队设计了两阶段训练方法,包括混合微调和混合...
这篇研究探讨了大语言模型知识蒸馏过程中教师模型选择的重要性。北科a-m-team团队从三个顶级模型(AM-Thinking-v1、Qwen3-235B-A22B和DeepSeek-R1)收集了189万个问题的推理答案,分...
AWS AI Labs团队开发了MigrationBench,这是首个针对Java代码从版本8迁移到17/21的大型基准测试平台。研究包含5,102个完整项目和300个精选挑战性项目,解决了代码迁移评估的难题。实验表明,...
微软研究院新提出的"奖励推理模型"(RRM)为大型语言模型开创了全新评估方式。传统奖励模型对所有问题使用统一计算资源,而RRM能像人类一样先进行推理思考再做判断,对复杂问题投入更多思考资源。研究团队通过强化学习框架训练模...
这项研究提出了CompeteSMoE,一种创新的稀疏混合专家(SMoE)训练方法,通过引入竞争机制来优化大型语言模型。传统SMoE依赖独立路由器分配任务,而CompeteSMoE让所有专家直接处理输入并选择反应最强的进行...
这篇论文介绍了香港中文大学研究团队开发的创新框架"Solve-Detect-Verify"和灵活验证器"FlexiVe"。该系统模拟人类"快思考"和"慢思考"的双重认知模式,能根据问题复杂度智能调配计算资源。验证器首先采...
这项由不列颠哥伦比亚大学张翔和曹俊泰领衔的研究,揭示了大语言模型中一个被忽视的关键限制:分词系统对符号和算术推理能力的影响。研究团队发现,即使使用思维链提示技术,模型的推理能力仍受制于分词格式。通过将原子符号(如字母)明...
首尔国立大学和成均馆大学的研究者提出了"推理路径压缩"(RPC)技术,一种无需训练的方法,能够对大语言模型在推理过程中生成的冗余内容进行压缩。研究发现推理路径存在"语义稀疏性"——大量重复或多余的内容。RPC通过定期评估...
NExT-Search是一项创新研究,旨在解决生成式AI搜索中的用户反馈断层问题。传统网络搜索通过丰富的用户点击和停留时间等信息不断优化,而生成式AI搜索虽提高了便利性,但用户只能对最终答案提供粗粒度反馈,无法指出具体环...
MediaTek Research团队提出的Latent Flow Transformer(LFT)是一种创新架构,通过流匹配技术将多个Transformer层压缩为单层,大幅提升效率。研究引入"重耦合比率"指标精确预测...
史蒂文斯理工学院研究团队发现大语言模型内部存在"真相神经元",这些特殊神经元能够识别信息真实性,不受主题限制。研究通过积分梯度方法定位这些神经元,证明抑制它们会显著降低模型在真实性测试中的表现。实验表明,这些神经元主要分...
前一阵红杉资本的AI创业逻辑刷屏,核心观点是AI正在从工具变为劳动力,并最终要用产出去衡量价值。而在AI创业领域同样有重要与影响力的Y Combinator(YC)也频频释放新的创业方法论。
这项研究介绍了WikiDYK基准测试,利用维基百科"你知道吗"板块的实时更新内容评估大语言模型的知识注入能力。研究发现,双向语言模型(BiLMs)在记忆知识方面显著优于因果语言模型(CLMs),准确率高出约23%。基于此...
这篇研究探讨了Alpha世代(2010-2024年出生)独特的数字通信模式如何挑战现有AI内容审核系统。研究者评估了四大AI系统(GPT-4、Claude、Gemini和Llama 3)以及人类审核员理解这一代专属语言的...