LIVE INDEX / 最新文章
"知识诞生"的奥秘:MIT研究揭示大语言模型如何跨越时间、空间和规模形成语义特征

"知识诞生"的奥秘:MIT研究揭示大语言模型如何跨越时间、空间和规模形成语义特征

这项研究探索了大语言模型内部可解释特征的形成过程,分析了它们在训练过程中(时间)、模型层级间(空间)和不同规模模型(尺度)的行为变化。研究团队使用稀疏自编码器技术,成功识别出特定语义概念在神经激活中出现的时间点和位置。研...

自适应思维模式切换:南京大学研究团队提出进程级思维模式动态调整方法,让AI更"聪明"也更"高效"

自适应思维模式切换:南京大学研究团队提出进程级思维模式动态调整方法,让AI更"聪明"也更"高效"

南京大学研究团队提出了一种新型推理范式:进程级自适应思维模式切换(PATS),能让大型语言模型根据每步推理的难度动态调整思维策略。与传统固定策略不同,PATS在波束搜索框架中通过控制候选步骤数量(2/4/8个)模拟不同复...

大揭秘:当数据隐私侦探挑战庞大数据集和大语言模型,会发生什么?谷歌深度思维研究团队的发现

大揭秘:当数据隐私侦探挑战庞大数据集和大语言模型,会发生什么?谷歌深度思维研究团队的发现

这项由谷歌深度思维团队领导的研究首次在大规模数据集和语言模型上测试了强力成员推理攻击,通过训练超过4000个不同规模的GPT-2模型,发现了三个关键结论:强成员推理攻击确实能在大型语言模型上成功,但在实际条件下效果有限(...

AI发展新方向:从模型压缩到数据压缩——上海交通大学EPIC实验室研究团队揭示大语言模型效率优化的重要转变

AI发展新方向:从模型压缩到数据压缩——上海交通大学EPIC实验室研究团队揭示大语言模型效率优化的重要转变

这篇研究论文揭示了人工智能效率研究的重要转变:从以模型参数为中心的压缩技术转向以数据为中心的Token压缩方法。随着模型参数增长放缓而上下文长度呈指数级增长,自注意力机制的二次方计算复杂度已成为主要瓶颈。上海交通大学EP...