CLaSp:让大语言模型生成文本更快的自我推测解码技术
CLaSp是一项创新的自我推测解码技术,能让大语言模型生成文本的速度提高1.3到1.7倍,同时保持输出质量不变。由中国科学院等机构联合开发的这一技术,通过动态决定模型内部哪些计算层可以被跳过,避免了传统方法需要额外训练或...
CLaSp是一项创新的自我推测解码技术,能让大语言模型生成文本的速度提高1.3到1.7倍,同时保持输出质量不变。由中国科学院等机构联合开发的这一技术,通过动态决定模型内部哪些计算层可以被跳过,避免了传统方法需要额外训练或...
这项研究展示了多模态AI推理的突破性进展。耶鲁大学团队开发的v1系统使AI能够像人类一样在推理过程中有选择地"再看一眼"图像。通过简单的"指向并复制"机制,AI可以动态检索关键视觉区域,而非仅依赖初始输入的记忆。实验证明...
这项研究首次系统研究了大语言模型在表达不确定性时的"忠实度"问题,发现它们往往在不确定时仍使用肯定语言,导致用户过度信任。研究团队提出了MetaFaith方法,通过激发模型的"元认知"能力,使其能更诚实地表达不确定性。在...
这项研究提出了强化蒸馏(REDI)框架,创新性地利用大型语言模型生成的正确和错误推理过程进行训练。传统方法仅使用正确样本,浪费了包含宝贵信息的错误样本。REDI采用两阶段方法:先用正确样本建立基础,再通过非对称加权的目标...
UniGeo是一项开创性研究,它利用视频扩散模型来一致性地估计视频中的几何信息(如表面法线和坐标)。与传统方法不同,UniGeo在全局参考坐标系中进行预测,而非每帧的局部相机坐标系,从而有效利用视频模型中的帧间对应关系。...
EasyText是一项由新加坡国立大学、香港中文大学与Tiamat AI、Liblib AI合作开发的多语言文本渲染框架。基于扩散变换器(DiT)技术,它能将多语言字符编码为字符标记,并通过创新的字符位置编码技术实现精确...
波森AI研究团队开发的EmergentTTS-Eval是一个针对文本转语音(TTS)系统的全面评估框架,专注于测试六大挑战场景:情感表达、非语言线索、外语词汇、语法复杂性、复杂发音和问题表达。研究创新地采用大型音频语言模...
这项研究由东北大学、北京大学、哈佛大学和谷歌合作完成,提出了一种名为Fusion-X的创新框架,用于解决大语言模型知识聚合中的挑战。研究团队通过引入自适应选择网络、动态加权融合策略和反馈驱动损失函数,实现了多个异构LLM...
这项研究揭示了大语言模型在处理特定输入时可被精确表示为线性系统的惊人特性。研究者通过在梯度计算中战略性分离非线性部分,使Llama 3、Gemma 3等多种模型展现出局部线性特性,无需改变模型权重或输出结果。通过奇异值分...
这篇论文介绍了GSO(Global Software Optimization),一个用于评估大语言模型在软件性能优化任务中能力的基准测试。研究团队从真实代码库中提取了102个优化任务,涵盖10个代码库和多种编程语言。实...
这篇研究介绍了一种名为YAQA(Yet Another Quantization Algorithm)的训练后量化技术,由康奈尔大学研究团队开发。与传统方法不同,YAQA不仅关注局部激活误差,而是考虑整个模型的KL散度,...
弗吉尼亚大学研究团队开发了TruthHypo基准和KnowHD框架,用于评估大语言模型生成生物医学假设的真实性及检测幻觉。研究发现大多数模型在生成真实假设方面存在困难,只有GPT-4o达到60%以上的准确率。通过分析推理...
亚马逊Nova责任AI团队与亚利桑那州立大学共同开发了AIDSAFE,这是一种创新的多代理协作框架,用于生成高质量的安全策略推理数据。不同于传统方法,AIDSAFE通过让多个AI代理进行迭代讨论和精炼,产生全面且准确的安...
ByteDance智能创作团队推出的ATI系统彻底改变了视频生成技术的控制方式。这个统一框架通过简单的点轨迹同时实现相机移动、物体平移和局部变形控制,不再需要分散的工具。用户只需在初始图像上标记关键点并绘制运动路径,系统...
这项来自蒙特利尔大学研究团队的突破性工作提出了System-1.5推理框架,通过在潜在空间中创建动态捷径,使大语言模型能够灵活调整思考路径。研究者设计了模型深度捷径和推理步骤捷径,让AI系统能像人类一样区分关键与非关键推...
这项研究揭示了视觉语言模型在解决视觉文字谜题方面的重大局限性。研究团队通过432个手工注释的谜题数据集,评估了从OpenAI到Google等多家公司的AI模型表现。结果显示,即使最先进的模型在抽象推理、横向思维和理解视觉...
上海人工智能实验室研究团队开发了MMSI-Bench,这是首个专注于多图像空间智能评估的全面基准。研究人员花费300多小时,从12万张图像中精心构建了1000道问题,涵盖了位置关系、属性和运动等多种空间推理任务。评测结果...
这项研究提出了ZPressor,一种轻量级模块,可帮助前馈式3D高斯渲染(3DGS)模型更有效地处理大量输入视图。研究团队通过信息瓶颈理论,将输入视图分为锚点视图和支持视图,然后使用交叉注意力将支持视图信息压缩到锚点视图...
卡内基梅隆大学研究团队开发了ViGoRL系统,通过视觉定位强化学习显著提升AI的视觉推理能力。该方法让模型将每个推理步骤明确锚定到图像的特定坐标,模拟人类注视点转移的认知过程。与传统方法相比,ViGoRL在SAT-2、B...
华盛顿大学和UC伯克利的研究团队开发了一种创新框架,让动物在音乐节奏下翩翩起舞。该研究《当你不在时,动物们是如何跳舞的》从少量生成的关键帧开始,通过图优化问题找出满足特定编舞模式的最佳路径,并应用视频扩散模型生成中间帧。...