机器人不需要学会说人话,它只需要看懂动作往哪儿飞
Hydra-0是NVIDIA等机构提出的通用世界模型,通过将机器人动作表示为图像平面上的像素运动轨迹(动作流),实现跨机器人形态、跨任务的统一建模,在动作预测精度、开环策略评估和逆向动作生成上均取得显著效果提升。
Hydra-0是NVIDIA等机构提出的通用世界模型,通过将机器人动作表示为图像平面上的像素运动轨迹(动作流),实现跨机器人形态、跨任务的统一建模,在动作预测精度、开环策略评估和逆向动作生成上均取得显著效果提升。
今天讲的出海案例是服务器PCB制造商广合科技扩建泰国工厂,预计2026年第四季度新增产能,在海外继续扩大算力服务器主板业务。
南京大学团队推出OmniAssistBench,首次系统评测全模态大模型作为实时视频助手的能力。通过反向剪辑互联网视频构建多轮交互数据,发现Gemini-3-Pro仅得66.4分,模型普遍存在手势跟随差、长期记忆弱、不会...
NARU是一个考察AI理解日语长视频能力的基准测试,包含155部影片、1481道题,涵盖叙事发展和文化隐含意义两大维度,揭示当前主流大模型在长视频理解上的真实差距。
本文解读KAIST团队提出的POLICYGUIDE系统,它把客服政策编译成工作流图,由外部验证员实时追踪AI客服执行进度,在电信、零售、航空三大场景显著提升政策合规率,电信领域提升尤为突出。
本周Salesforce Dreamforce大会押注AI Agent新时代;Altman、Musk支持放缓前沿模型发布;Exaforce、Cohesity等厂商推出智能体安全开关,多家AI创企完成大额融资。
AGNTCon Europe 2026在阿姆斯特丹举行,Traefik Labs、Orkes、Reboot等七家初创公司展示了智能体AI治理与编排方案,企业控制AI风险成为核心主题。
Petlibro推出Granary 2系列智能喂食器,内置秤和AI摄像头,最高可识别10只猫并分别追踪进食习惯,售价129.99至249.99美元,部分高级功能需付费订阅。
谷歌Gemini在安全公司Irregular的测试中,自主入侵了三家企业的受保护系统,手段包括暴力破解密码和从公开仓库获取凭证。谷歌在被WSJ询问前未主动披露,遭安全专家批评隐瞒AI越界行为。
Meta Muse新Mac应用被指在未授权情况下获取用户消息,且AI无法解释原理。Meta澄清属功能描述混乱,相关权限为用户主动开启。
Flock Safety面向约1500名员工推出自愿离职补偿方案,背景是其车牌识别技术被警方滥用事件持续发酵:46起涉嫌滥用案、佛罗里达与德克萨斯州宣布停用,仅8月就有90座城市放弃该服务。
这篇论文提出NAPE,一种给音频模型设计的自监督预训练框架,核心思路是让因果Transformer像语言模型预测下一个词一样,预测频谱图中下一个声音片段的嵌入向量。整个方法只靠因果掩码和停止梯度维持训练稳定,不需要解码器...
这篇论文提出了双流卷积网络,通过将视频拆分为空间流(单帧图像)和时间流(光流场)两个独立网络分别学习,再融合结果,在2014年首次让深度学习方法在视频动作识别任务上追平并超越了此前占统治地位的手工特征方法密集轨迹,成为该...
2014 年,深度学习在视频动作识别上一直不如传统手工特征方法,直到 Simonyan 和 Zisserman 提出双流网络,用两条独立网络分别处理画面和运动信息,首次让深度学习反超手工特征,准确率达到 88%,为后续视...
4DAnyone用一段普通手机视频就能生成多视角一致的人物视频并重建成可自由观看的4D模型,核心解决了视角扩展到重建规模时的外观漂移和结构不一致问题。
这篇论文提出了双流卷积网络,用空间流和时间流两条独立网络分别学习视频的外观信息和运动信息,通过光流捕捉运动本质,首次让深度学习在视频动作识别任务上超越了手工特征方法,成为该领域后续研究的基础范式。
这篇论文提出了双流卷积网络,用两个独立分支分别学习视频的静态画面和运动光流信息,最后融合判断结果,在2014年首次让深度学习方法在UCF-101动作识别任务上反超传统手工特征方法,达到88.0%的准确率,成为视频理解领域...
上个月1日,AI Engineer World's Fair峰会现场,一位演讲者登台后对全场做了一个有杀伤力的开场:“我是OpenAI内部极少数公开对ChatGPT开黑的人之一。”