LIVE INDEX / 最新文章
VisuLogic:一个评估多模态大语言模型视觉推理能力的基准测试
2025-04-25

VisuLogic:一个评估多模态大语言模型视觉推理能力的基准测试

想象一下,你正在参加一场智力测试。主考官给你看了一张图片,并要求你找出图案的规律,预测下一个图形会是什么样子。对我们人类来说,这种视觉推理任务虽然有难度,但通常还算可行——我们能够观察图案变化、识别规律,然后做出合理推测...

教旧电脑学新语言:沙特研究团队开创性地为AI注入阿拉伯语能力
2025-04-24

教旧电脑学新语言:沙特研究团队开创性地为AI注入阿拉伯语能力

想象一下,你有一台已经运行多年的老电脑,它已经存储了大量英文文档和程序,运行得很好。现在,你突然想让它处理阿拉伯文,会发生什么?通常情况下,你有两个选择:要么购买一台全新的、更强大的双语电脑(成本高昂),要么尝试在老电脑...

NVIDIA Eagle 2.5:让AI"看得更久、看得更细"的视觉语言模型
2025-04-23

NVIDIA Eagle 2.5:让AI"看得更久、看得更细"的视觉语言模型

你是否曾想过,如果AI能像人类一样看完整部电影,或者理解超高清图像中的细微细节会怎样?普通的AI模型在这方面往往力不从心,它们就像只能看几秒视频或者只能看低分辨率图片的"近视眼"。NVIDIA联合多所高校的研究团队近日推...

FlowReasoner:强化型查询级元智能体的突破性研究
2025-04-23

FlowReasoner:强化型查询级元智能体的突破性研究

想象一下,你正在使用一个餐厅点餐系统。传统的系统可能只有一套固定的点餐流程,无论你是来喝咖啡、吃简餐还是举办宴会,都要经过同样的步骤。这就像当前的任务级多智能体系统——它们为特定类型的任务(比如代码生成)设计一套固定的工...

奖励设计:让AI学会智能使用工具的关键
2025-04-23

奖励设计:让AI学会智能使用工具的关键

想象一下,你有一个非常聪明的朋友,他知道很多知识,但每当需要使用计算器、搜索引擎或查询最新天气时,却变得像个笨手笨脚的孩子。这正是当前大语言模型(简称LLMs,如ChatGPT这类AI系统)面临的尴尬处境。

ToolRL:奖励设计是工具学习所需的全部
2025-04-23

ToolRL:奖励设计是工具学习所需的全部

想象一下,你拥有一个聪明的助手,它知道很多知识,但在面对需要使用计算器、搜索引擎或查询最新信息时却显得笨手笨脚。这正是当前大语言模型(LLMs)面临的困境。虽然这些模型已经通过监督微调(SFT)学会了使用工具的基本能力,...

X-Teaming:使用自适应多智能体进行多轮越狱攻击和防御
2025-04-23

X-Teaming:使用自适应多智能体进行多轮越狱攻击和防御

想象你正在和一个智能助手聊天。如果你直接要求它提供有害信息,它很可能会礼貌拒绝。但如果你通过一系列看似无害的对话,逐步引导它走向你的真实目标呢?这就是当前AI安全领域面临的一个严峻挑战——多轮对话中的安全漏洞。

"思考操纵":用外部思考让大型推理模型更高效
2025-04-22

"思考操纵":用外部思考让大型推理模型更高效

想象你在使用一个非常聪明的AI助手完成一项复杂任务,比如解决一道数学难题。你可能注意到这个助手会花很长时间"思考",一步一步写下大量推理过程,最后才给出答案。虽然这种详细的思考过程确实帮助AI做出了更准确的判断,但同时也...

进击的降噪术:解密Filter2Noise如何让低剂量CT图像更清晰
2025-04-22

进击的降噪术:解密Filter2Noise如何让低剂量CT图像更清晰

想象一下,你正在进行一次CT扫描。医生告诉你,为了减少辐射对你身体的伤害,他们会使用低剂量的X射线。这听起来很棒,对吗?然而,就像在昏暗光线下拍照会产生大量噪点一样,低剂量CT扫描也会产生大量的图像噪声,这些噪声就像薄雾...