LIVE INDEX / 强化学习
教会AI模型说"我不确定"

教会AI模型说"我不确定"

MIT计算机科学与人工智能实验室(CSAIL)研究人员发现,当前主流AI推理模型存在过度自信的缺陷,根源在于强化学习训练机制只奖励正确答案,忽视不确定性表达。为此,研究团队提出RLCR方法,通过在奖励函数中引入Brier...

构建可靠AI智能体的幕后工作

构建可靠AI智能体的幕后工作

亚马逊AGI实验室正在构建高保真强化学习"训练场",让AI智能体掌握基础交互技能。在智能体能够执行复杂任务如预订度假之前,必须先学会滚动、点击等基本操作。研究团队开发了"常规核心智能体"系统,通过反复练习最简单的交互行为...