两万字记录微软Build2025主题演讲谈了什么:萨提亚展现好人缘,奥特曼、马斯克、黄仁勋轮番出镜,软件工程的本质在于好工具
不知道科技公司举办大会是不是也要看黄历,但这个星期应该是大家一起算好的:台北的Computex、谷歌的I/O、Dell World,以及在在西雅图举行的微软Build 2025开发者大会,接连上演。
不知道科技公司举办大会是不是也要看黄历,但这个星期应该是大家一起算好的:台北的Computex、谷歌的I/O、Dell World,以及在在西雅图举行的微软Build 2025开发者大会,接连上演。
这项由KAIST和DeepAuto.ai研究团队开发的MetaSPO(元级系统提示词优化器)框架,通过元学习方法优化大语言模型的系统提示词,而不仅仅关注用户提示词。研究发现,一个经过优化的系统提示词可以在各种未见过的任务...
ENERVERSE-AC(EVAC)是一种创新的动作条件世界模型,它能根据机器人预测的动作生成未来视觉观察结果,实现真实且可控的机器人仿真。该研究由AgiBot、上海交通大学和香港中文大学的研究团队开发,通过多层动作条件...
这篇博文深入解析了KAIST与卡内基梅隆大学研究团队开发的COT ENCYCLOPEDIA框架,该框架能够自下而上地分析、预测和控制大语言模型的推理策略。研究显示,不同的推理策略对模型表现有显著影响,且这些策略主要由训练...
EWMBENCH是一个专为评估具身世界模型而设计的基准框架,由AgBot等多家机构联合开发。与普通视频生成不同,具身模型需要生成物理合理、动作一致的行为,尤其适用于机器人操作场景。该基准从视觉场景一致性、运动正确性和语义...
这项研究介绍了TokenAdapt,一种通过混合启发式初始化策略帮助大型语言模型实现分词器灵活性的创新框架。研究团队同时探索了学习多词"超级词元"技术,以增强压缩效率并减少标记碎片化。实验证明TokenAdapt显著优于...
这项研究介绍了一种创新的两阶段SVG风格定制方法,使AI能够生成具有特定风格的矢量图形。香港城市大学和Adobe研究院的团队首先训练一个路径级T2V扩散模型掌握SVG结构,然后通过从定制的图像扩散模型中提取风格知识来实现...
黄仁勋上午在在台北流行音乐中心做了Computex 2025的首场主题演讲,关注度自然也是极高的。两个小时的演讲,不仅回顾了英伟达公司30年的发展历程,还详细阐述了英伟达在AI、加速计算、机器人和企业级AI基础设施等领域...
雷·库兹韦尔在谷歌的官方头衔是“Principal Researcher and AI Visionary”(首席研究员兼人工智能愿景专家),但是他被外界所熟知,是因为他在2005年出版过一本叫《奇点临近》的书。
昨天我们发布了谷歌CEO皮查伊的访谈,今天就来一期另一家互联网巨头#亚马逊 CEO Andy Jassy的博客。其实我想发Andy Jassy的内容很久了,但是苦于一直没有很好的素材。十天前,《哈佛商业评论》放出了一期对...
这篇研究介绍了Meta公司开发的J1系统,这是一种通过强化学习训练大语言模型进行评判的创新方法。J1将可验证和不可验证的提示转换为具有可验证奖励的判断任务,从而鼓励模型在做出决策前先进行思考。研究表明,J1在8B和70B...
北京人工智能研究院等机构研究团队提出的"端到端视觉令牌化调优"(ETT)方法解决了视觉令牌化器在多模态任务中的表示瓶颈问题。与传统方法不同,ETT利用令牌化器码本嵌入代替离散索引,并通过重建和描述目标端到端优化视觉令牌化...
浙江大学和香港大学的研究团队提出了Prior Depth Anything,一个创新框架,融合了深度测量中精确但不完整的度量信息与深度预测中相对但完整的几何结构。该方法通过粗到细的流程,先用像素级度量对齐将深度预测与先验...
一项由苏州大学、微软等机构合作的研究OPENTHINKIMG首次提出了完整的视觉工具强化学习框架,解决了当前大型视觉语言模型缺乏视觉思维的问题。该研究基于Qwen2-VL-2B基础模型,开发了V-TOOLRL方法,通过分...
这项研究探索了将大型语言模型(LLM)与扩散变换器(DiT)深度融合用于文本到图像生成的新方法。纽约大学和Hugging Face的研究团队没有提出全新技术,而是系统分析了现有方法的设计空间和关键参数选择。研究发现深度融...
ReSurgSAM2是新加坡国立大学团队开发的两阶段手术视频分割系统,允许外科医生通过文本指令精准识别和追踪手术器械与组织。这项创新利用SAM2模型为基础,添加了跨模态空间-时间Mamba、可靠初始帧选择和多样性驱动长期...
在#谷歌 I/O大会前期,放出一期谷歌CEO的深度访谈,应该是再合适不过了。
想象一下,你拥有一个智能助理,它可以为你安排日程、搜索信息、甚至编写代码。这些助理越来越像是我们生活和工作的小伙伴,而不仅仅是简单的问答工具。它们可以操作各种工具,在不确定的环境中自主导航,有时甚至几乎不需要人类监督。这...