LIVE INDEX / 最新文章
解锁长文推理效率:首尔国立大学和成均馆大学开发的"推理路径压缩"技术让LLM思考更快更省资源

解锁长文推理效率:首尔国立大学和成均馆大学开发的"推理路径压缩"技术让LLM思考更快更省资源

首尔国立大学和成均馆大学的研究者提出了"推理路径压缩"(RPC)技术,一种无需训练的方法,能够对大语言模型在推理过程中生成的冗余内容进行压缩。研究发现推理路径存在"语义稀疏性"——大量重复或多余的内容。RPC通过定期评估...

"真相神经元":探索大语言模型中的"诚实机制"——史蒂文斯理工学院揭秘AI如何区分真假

"真相神经元":探索大语言模型中的"诚实机制"——史蒂文斯理工学院揭秘AI如何区分真假

史蒂文斯理工学院研究团队发现大语言模型内部存在"真相神经元",这些特殊神经元能够识别信息真实性,不受主题限制。研究通过积分梯度方法定位这些神经元,证明抑制它们会显著降低模型在真实性测试中的表现。实验表明,这些神经元主要分...

一个字就能节省千个字:低秩克隆技术实现高效知识蒸馏,哈尔滨工业大学研究提升小型语言模型效率

一个字就能节省千个字:低秩克隆技术实现高效知识蒸馏,哈尔滨工业大学研究提升小型语言模型效率

这篇论文介绍了一种名为"低秩克隆"(LRC)的新型知识蒸馏方法,能极大提升小型语言模型的训练效率。哈尔滨工业大学深圳校区和百度公司的研究团队通过训练可学习的低秩投影矩阵,同时实现了软剪枝和激活克隆,避免了传统方法中的信息...

模型合并:一项提升大型语言模型预训练效果的强大武器——字节跳动Seed团队最新研究成果解析

模型合并:一项提升大型语言模型预训练效果的强大武器——字节跳动Seed团队最新研究成果解析

这篇研究探讨了模型合并技术在大型语言模型预训练中的应用。字节跳动Seed团队通过从百万到千亿参数级别的系统实验证明,在稳定训练阶段合并检查点不仅显著提升模型性能,还能准确预测学习率衰减效果,大大节省计算资源。研究提出的P...