视觉品质-R1:通过排序强化学习打造具有推理能力的图像质量评估模型
香港城市大学、OPPO研究院与香港理工大学研究团队提出了VisualQuality-R1,一种通过排序强化学习训练的推理增强型图像质量评估模型。该模型将Thurstone排序模型无缝集成到组相对策略优化中,使用连续保真度...
香港城市大学、OPPO研究院与香港理工大学研究团队提出了VisualQuality-R1,一种通过排序强化学习训练的推理增强型图像质量评估模型。该模型将Thurstone排序模型无缝集成到组相对策略优化中,使用连续保真度...
这项研究提出了AnytimeReasoner框架,通过从先验分布采样思考预算,优化大语言模型在任意计算资源下的推理能力。研究团队开发的预算相对策略优化(BRPO)技术引入可验证的密集奖励,提升强化学习效率。实验表明,该方...
这篇研究通过创新的"先描述后推理"方法,解决了视觉语言模型在学习推理过程中容易走捷径的问题。研究团队开发的Visionary-R1模型不依赖任何推理链标注数据,仅使用问题-答案对和强化学习,就实现了超越GPT-4o等商业...
香港浸会大学周開陽教授率领的研究团队提出了IndexMark,这是首个针对自回归图像生成模型的免训练水印框架。该方法利用码本中索引的冗余性,通过匹配-替换策略在生成过程中嵌入不可见水印。具体而言,IndexMark将码本...
这项研究提出了量化零阶优化(QZO)方法,解决大型语言模型微调时的内存瓶颈问题。研究团队通过创新性地结合模型量化(将权重从16位压缩到4位)和零阶优化(通过前向传递扰动估计梯度),同时消除了对梯度和优化器状态的存储需求,...
纽约大学阿布扎比分校研究团队提出了一种创新的两阶段训练方法,解决了AI领域的数据稀缺问题。他们首先让AI模型在简单的"骑士与恶棍"逻辑游戏中"热身",学习通用推理技能,然后再用少量特定领域数据进行强化学习。实验表明,这种...
这项由EPFL和Google联合完成的研究提出了WilliamT,一种创新的低成本自动化程序修复工具。与传统的寻找漏洞根本原因的方法不同,WilliamT专注于"崩溃点修复",直接在程序崩溃位置添加防护代码,有效阻止漏洞...
这项研究介绍了一种新型的新闻偏见检测工具"bias-detector",由慕尼黑工业大学和罗马大学的研究团队开发。他们通过在BABE数据集上微调RoBERTa模型,显著提升了偏见检测准确率,其宏观F1得分达0.9257,...
2025年5月23日,正值Claude 4系列模型发布当天,Redpoint的AI播客《Unsupervised Learning》邀请到了Anthropic的技术团队成员Sholto Douglas进行了一次深度对话。
ByteDance Seed团队发布的BAGEL是一个突破性开源基础模型,采用混合变换器专家架构,能同时执行多模态理解和生成任务。研究显示,随着训练数据和模型规模增加,BAGEL展现"涌现能力"—从基础理解和生成,到复杂...
这项研究证明推理模型(使用链式思考的大语言模型)不仅在解决问题上表现优异,还能更准确地表达其确信度。研究人员在六个数据集上评估了六种推理模型,发现它们在33/36种测试设置中比非推理模型表现更好。深入分析揭示这一优势来源...
这项研究突破了大语言模型推理能力主要局限于数学和编程领域的限制,提出了"General-Reasoner"训练方法,使模型能够在物理、化学、金融等多领域展现高水平推理能力。研究团队构建了包含23万个跨学科问题的高质量数据...
这篇研究来自新加坡南洋理工大学,首次建立了覆盖英语-汉语、英语-泰米尔语和英语-马来语的代码切换对话摘要基准测试CS-Sum。研究评估了10个大型语言模型,发现即使最先进的模型在处理混合语言时也存在严重局限,主要表现为忽...
这项研究揭示了现有长视频理解评估基准的严重缺陷:过度依赖多选题导致结果膨胀,且许多问题存在先验偏好使模型无需真正理解视频就能作答。针对这些问题,多伦多大学团队开发了VIDEOEVAL-PRO基准,采用开放式短答案形式,真...
这项由香港大学等机构合作开发的FedPrLLM框架,首次将联邦学习与大语言模型修剪技术结合,解决了隐私敏感领域无法共享数据进行模型压缩的难题。研究表明,采用层比较的一次性修剪策略且不进行权重缩放,可以在保护数据隐私的同时...
SSR是西湖大学研究团队开发的创新框架,通过引入深度感知增强视觉语言模型的空间理解能力。该方法将原始深度数据转换为结构化的推理语言,作为中间表示,显著提升空间推理能力。研究团队还创建了包含超过百万级的SSR-COT数据集...
微软研究院与北京大学的团队开发出全新的大型混合推理模型(LHRMs),解决了大型推理模型的过度思考问题。这种创新模型能够像人类一样,根据问题复杂度自动决定是否需要深入思考。研究团队设计了两阶段训练方法,包括混合微调和混合...
这篇研究探讨了大语言模型知识蒸馏过程中教师模型选择的重要性。北科a-m-team团队从三个顶级模型(AM-Thinking-v1、Qwen3-235B-A22B和DeepSeek-R1)收集了189万个问题的推理答案,分...
AWS AI Labs团队开发了MigrationBench,这是首个针对Java代码从版本8迁移到17/21的大型基准测试平台。研究包含5,102个完整项目和300个精选挑战性项目,解决了代码迁移评估的难题。实验表明,...
微软研究院新提出的"奖励推理模型"(RRM)为大型语言模型开创了全新评估方式。传统奖励模型对所有问题使用统一计算资源,而RRM能像人类一样先进行推理思考再做判断,对复杂问题投入更多思考资源。研究团队通过强化学习框架训练模...