2026-05-21
Gemini Omni正式发布:多模态输入生成高质量视频
谷歌推出全新模型Gemini Omni,支持图像、音频、视频和文本的多模态输入,并可生成高质量视频。用户可通过自然语言对话编辑视频,保持角色一致性与场景连贯性。Omni结合物理直觉与Gemini的知识库,实现更真实的视觉...
谷歌推出全新模型Gemini Omni,支持图像、音频、视频和文本的多模态输入,并可生成高质量视频。用户可通过自然语言对话编辑视频,保持角色一致性与场景连贯性。Omni结合物理直觉与Gemini的知识库,实现更真实的视觉...
北大和Rabbitpre AI发起的Open-Sora Plan项目致力于复现OpenAI的视频生成模型Sora。项目包括Video VQ-VAE压缩视频至潜在维度,Denoising Diffusion Transfo...