当AI助手学会在"黑箱"里训练自己
这篇论文提出了一套统一的黑箱强化学习框架,让大语言模型能够直接通过Claude Code、OpenClaw等复杂不透明的智能体外壳系统进行稳定训练,借助沙盒隔离、前缀树重建轨迹、训练推理一致性保障等技术,在多个基准测试上...
这篇论文提出了一套统一的黑箱强化学习框架,让大语言模型能够直接通过Claude Code、OpenClaw等复杂不透明的智能体外壳系统进行稳定训练,借助沙盒隔离、前缀树重建轨迹、训练推理一致性保障等技术,在多个基准测试上...
这篇论文由牛津大学 Simonyan 和 Zisserman 于 2014 年提出双流卷积网络,首次让深度学习在视频动作识别任务上超越传统手工特征方法。核心思路是用两条独立网络分别处理静态画面和光流运动信息再融合,准确率...
Nanbeige4.2-3B是一款采用循环transformer架构的30亿参数代理模型,本文详细记录了作者在苹果电脑上部署该模型时发现的五个独立bug、循环架构导致的内存翻倍问题及分块预填充解决方案,以及系统提示词和M...
旅行者保险公司推出自研大语言模型TravelersLLM,该模型基于数百万份内部文档训练,并经过数万道保险领域问题评测。相比通用前沿模型,TravelersLLM在保险相关问题上表现更优且运营成本更低。公司采用"按需路由...
2026年8月21-22日,2026科学智能大会在北京中关村国际创新中心举行。大会以“人工智能变革科研范式”为主题,由“学术科协”科学智能专家委员会指导,中国科技发展基金会和北京科学智能研究院主办,设有2场全体会议和14...
今天讲的出海案例是横店东磁,这家磁性材料与器件制造商已让越南永磁基地和泰国软磁基地进入量产,海外制造从单一产品扩展为两条产品线。
Take-Two Interactive就《GTA 6》游戏内容遭泄露一事向美国纽约南区联邦法院提交申请,要求对微软(GitHub)和Discord发出传票,以获取涉嫌泄露者的身份信息。泄露内容包括游戏视频片段、过场动画...
CNET历经四年测试,对多款FDM 3D打印机进行精度评测。结果显示,Prusa Core One以仅0.18%的尺寸误差率夺冠,Prusa MK4S紧随其后(0.19%)。测试采用专有基准模型,涵盖垂直高度、圆形直径等...
尽管机器人吸尘器已日趋成熟,但人形家用机器人仍面临巨大挑战。当前市面上的Neo、Isaac 1等人形机器人产品,本质上仍是早期原型和精心包装的"演示剧场"。专家指出,其核心障碍在于:物理AI能力不足、训练数据匮乏、硬件耐...
随着笔记本电脑市场竞争加剧,越来越多厂商主推8GB内存配置,引发用户质疑。文章深度剖析背后原因:一方面,内存成本上涨压缩了厂商利润空间,迫使其降低基础配置;另一方面,部分厂商借助营销话术掩盖内存不足的短板。对于主流用户而...
硅谷长期押注万能人形机器人,但消费市场的规律是专业化而非通用化。投资人Amber Atherton认为,2036年的家庭不会有一台全能机器人,而是拥有一系列各司其职的智能产品——衣橱机器人、美妆机器人、园艺机器人等。真正...
人形机器人开发商Neura Robotics旗下的Neura Mobile Robots宣布全资收购自主清洁机器人公司Adlatus Robotics。此次收购旨在将Adlatus的自主清洁系统接入Neura的物理AI平...
麻省理工学院与波士顿大学联合研究发现,老年人大脑中的语言处理网络活跃程度与年轻人几乎一致,而负责决策、工作记忆等执行功能的"多需求网络"则随年龄明显衰退。研究显示,专门化的语言网络具有更强的抗衰老韧性,且不会与其他网络发...
全球净零排放目标制定时未将AI纳入考量,COP31安塔利亚峰会是弥补这一缺口的关键时机。当前两大趋势相互竞争:AI单任务能耗每年下降约一个数量级,但数据中心总用电量2025年增长17%,AI专属数据中心更增长50%。IE...
这篇论文提出了一套针对视觉语言模型的移动端量化压缩方案,通过模型自生成数据的QAT训练流程和全新设计的2.7比特S3D8数字格式,把Llama 3.2 11B Vision Instruct模型压缩到3.7GB,并在Ar...
本文提出InfinityEdit,一种面向"无限视频编辑"新任务的轻量适配器,它在冻结的流式视频生成模型Helios上加装三段式注意力模块,仅在编辑指令到来时短暂激活,让编辑效果自然延续到未来生成的画面中,实验证明其在编...
GOAG提出一种全新的机械手抓取规划思路,通过仅在机械手自身几何和运动学上训练生成模型,摆脱了传统方法对物体专属抓取数据集的依赖,在MultiDex数据集上取得86.93%的成功率,同时大幅提升生成效率,并在真实机器人实...
这篇论文发现,多模态大模型在"深度思考"和"快速直答"两种模式下,回答质量存在巨大落差,即便答案正确,快速模式也常暴露思维泄漏、重复、矛盾等毛病。研究者构建了PatternEval测试集揭示这一现象,并提出Pattern...
这篇论文提出了RA-Bench,一个专门评估AI生成视频检测能力的基准测试集,聚焦真实世界危机事件场景。研究测试了七种传统检测器、十种多模态大模型和两种专门微调的检测系统,发现没有一种方法能稳定识别逼真的AI生成危机视频...