2026-06-01
Cosmos 3如何帮助物理AI在行动前进行思考
现实世界始终处于运动状态。为实现自主运行,包括机器人、自动驾驶汽车和智能空间在内的物理AI系统不仅需要理解它们所看到的内容及其成因,还需要预测接下来可能发生的情况。英伟达在台北GTC大会上发布的Cosmos 3世界基础模...
现实世界始终处于运动状态。为实现自主运行,包括机器人、自动驾驶汽车和智能空间在内的物理AI系统不仅需要理解它们所看到的内容及其成因,还需要预测接下来可能发生的情况。英伟达在台北GTC大会上发布的Cosmos 3世界基础模...
谷歌推出全新模型Gemini Omni,支持图像、音频、视频和文本的多模态输入,并可生成高质量视频。用户可通过自然语言对话编辑视频,保持角色一致性与场景连贯性。Omni结合物理直觉与Gemini的知识库,实现更真实的视觉...
谷歌在I/O 2026开发者大会上宣布了Gemini应用的重要更新。新版本引入更快速的Gemini 3.5 Flash模型,带来"神经表达"设计风格,提升动画与交互体验。全新Gemini Omni Flash支持多模态视...
微软AI研究实验室发布三款新的基础AI模型,可生成文本、语音和图像。MAI-Transcribe-1支持25种语言语音转文本,速度比Azure Fast快2.5倍;MAI-Voice-1可在一秒内生成60秒音频并支持自定...
AI视频生成初创公司Luma发布Luma Agents,可处理文本、图像、视频和音频的端到端创意工作。该智能体基于公司的统一智能模型家族,采用单一多模态推理系统架构。Luma Agents面向广告代理、营销团队、设计工作...
谷歌最新的开源 AI 模型 Gemma 3 并不是今天 Alphabet 子公司唯一的重要新闻。实际上,谷歌的 Gemini 2.0 Flash 以原生图像生成技术吸引了更多的关注,这是一个可供 Google AI St...