在科技领袖们持续争论开源权重AI模型利弊之际,开发者们并未停下脚步。LTX于本周二发布了其开源世界模型的最新版本——LTX-2.5。

LTX-2.5是一款开源世界模型,与大多数人熟知的AI有所不同。大语言模型擅长生成文本,而世界模型则是将物理世界转化为生成式AI可理解语言的复杂网络体系。其核心理念在于:模型对现实世界具有扎实的理解,从而减少"幻觉"现象的发生。想象一下能够在房间内自如穿行而不碰撞任何物体的机器人,或是AI生成的视频片段中人物会绕开障碍物行走,而非像幽灵一样穿墙而过。世界模型可用于模拟数字环境、生成内容,以及辅助机器人编程。

新版本在多个方面实现了显著提升:通过优化减少了AI生成的视觉瑕疵(即错误),并借助全新的像素扩散流程提升了生成内容的一致性。由于采用开源模式,企业可以下载并根据自身需求定制模型,从而有效保护其知识产权。例如,某电影制片公司可利用LTX-2.5创作和剪辑包含旗下角色的视频片段。LTX-2.5针对英伟达RTX GPU的本地推理进行了优化,这意味着开发者可在自有硬件上运行,无需依赖云端AI服务。

LTX-2.5现已在HuggingFace和ComfyUI等平台上线,可供下载使用。

LTX是开源权重AI模型领域最受欢迎的开发商之一,其模型已被HuggingFace用户下载超过3300万次,其中不乏基于LTX框架开发自有版本的用户。OpenAI和谷歌分别推出了各自的开源权重模型系列——GPT-OSS和Gemma 4,但两家公司的闭源模型数量仍远超开源版本。Anthropic目前尚未发布任何开源Claude模型。

长期以来,开源倡导者坚持认为,科技公司公开披露工具运作方式才是最佳发展路径。这一争论在AI时代愈演愈烈。目前,多款热门中国模型正以开源格式发布,例如Moonshot推出的新版Kimi 3,为开发者、研究人员和网络安全专家提供了深入了解其运作机制的窗口。据报道,特朗普政府曾于7月考虑以网络安全为由,禁止中国及其他外国AI模型,但此举遭到众多行业领袖的反对,他们认为这反而可能对网络安全构成威胁。

尽管大多数AI领袖表示不应禁止开源权重模型,但各大巨头并未急于大量发布此类模型。Meta首席执行官马克·扎克伯格积极倡导更开放的AI生态,他于周一发表了一篇长文,阐述了开源权重模型将使更多人受益于AI的立场。Meta还发布了名为Muse Glimmer的新开源权重模型,并承诺将开放另一款近期模型Spark 1.2的权重。

LTX持有相似的理念。其首席执行官兼联合创始人泽夫·法布曼在近期发文中指出,无论是政府还是私营企业,都不适合作为私有AI模型的守护者——前者主要受不断变化的政治目标驱动,后者则以纯粹的商业利益为导向。

"这不应该由少数决策者来掌控,无论他们是政府官员还是少数几家强势企业,"法布曼写道,"决策权应归属于终端用户,通过他们能够自主掌控和审查的模型来实现。"

Q&A

Q1:LTX-2.5世界模型和普通大语言模型有什么区别?

A:大语言模型主要擅长生成文本,而LTX-2.5这类世界模型则将物理世界转化为生成式AI可理解的语言,对现实世界有更扎实的理解,能减少"幻觉"现象。它可用于生成符合物理规律的视频内容、模拟数字环境,以及辅助机器人导航编程,应用场景与大语言模型有明显差异。

Q2:LTX-2.5开源对企业有什么好处?

A:企业可以免费下载LTX-2.5并根据自身需求进行定制,同时将数据和成果保留在本地,无需上传至云端AI服务,有效保护知识产权。例如电影公司可用它创作包含自有角色的视频片段。此外,模型针对英伟达RTX GPU进行了本地推理优化,方便开发者在自有硬件上直接运行。

Q3:目前开源AI模型的争议焦点是什么?

A:争议主要集中在开放程度与安全风险之间的平衡。开源倡导者认为公开模型运作方式有助于透明度和安全研究;但各大科技巨头发布的开源模型数量仍远少于闭源模型。此外,围绕是否应限制外国开源模型的政策讨论也持续升温,多位行业领袖认为过度限制反而可能损害网络安全。

cnet