Meta重返开源生态,发布了Muse Glimmer——一款拥有300亿参数的开放权重稠密模型,支持超过12万Token的上下文窗口,专为本地AI智能体工作场景而构建。

Muse Glimmer针对英伟达多种边缘、桌面及工作站AI平台进行了优化,在单张GPU上可实现每秒2万Token的处理速度,使常驻智能体能够在本地处理数据,并执行复杂的多步骤工作流。

为何智能体工作流需要专属模型

大多数大语言模型针对对话场景进行优化,注重单轮交互和首Token响应速度。然而,智能体工作流对模型的要求截然不同。一个负责构建软件项目、修订文档或管理知识库的智能体,在单次会话中可能需要连续执行多个工具调用,同时还要求极高的可靠性、一致性、长上下文连贯性以及持续的吞吐能力——这些都是对话优先模型难以满足的需求。

Muse Glimmer采用稠密架构,对每一个Token的处理都会激活全部参数,无需路由、专家选择或Token路径上的任何差异化处理。因此,它在需要可靠指令遵循、长上下文连贯性、可预测延迟以及更少故障模式的智能体工作负载中表现出色。

本地优先,数据安全有保障

涉及个人文件、通讯内容、访问凭证及专有文档的智能体工作流,要求推理计算全程在本地完成,数据不离开设备。Muse Glimmer在这一点上实现了最优平衡:模型规模足够大,能够应对复杂的多步推理;同时又足够精简,可完整装入单张英伟达GPU的显存,无需模型分片、CPU卸载或调用外部接口。

英伟达Tensor Core架构恰好加速了这一计算模式,支持在设备端以完整上下文长度进行实时智能体推理。

英伟达GeForce RTX 5090配备32GB显存与第五代Tensor Core,让开发者在本地设备上即可运行Muse Glimmer,专有代码无需离开设备,同时彻底消除了按Token计费的推理成本。

英伟达DGX Spark将工作站级性能与企业级智能体流水线集成于紧凑机身。英伟达NVLink提供高速内存访问,英伟达NIM容器则让Muse Glimmer的本地部署只需一条命令即可完成。

英伟达DGX Station将机架级Blackwell Ultra计算能力引入本地企业环境,专为在气隙隔离要求或合规框架下无法使用云端推理的团队所设计。

英伟达Jetson将Muse Glimmer的本地推理能力延伸至边缘场景,赋能机器人、工业自动化及嵌入式系统——在这些场景中,网络隔离是硬性要求,每一次推理决策都必须在操作现场即时完成。

硬件性能表现

在英伟达Blackwell Ultra平台上,Muse Glimmer以BF16/NVF4精度可实现每GPU每秒超过20个Token的推理速度。吞吐量与交互性曲线表明,300亿参数的稠密架构能够维持高并发处理,且不存在混合专家模型固有的路由开销。

单张Blackwell Ultra可在显存中完整承载该模型,并为大型KV缓存缓冲区预留充足空间,非常适合开发者在本地基础设施上运行常驻智能体所需的高吞吐、低延迟场景。

开发者工具支持

开发者可在安全的OpenShell环境中运行英伟达NemoClaw,打造持久运行的个人助手,支持代码生成、个人助理、自主客服等多种任务。

开发者还可借助英伟达NeMo AutoModel对模型进行后训练微调。该高效微调库原生支持Hugging Face检查点,无需模型转换。它开箱即支持完整的SFT和LoRA微调,针对英伟达GPU(包括DGX Spark)进行了快速实验优化。开发者也可通过NeMo RL进行强化学习,并获取示例配方与参考精度验证曲线。

推理栈选择

英伟达提供多种推理栈以满足不同开发者需求。

SGLang和vLLM为需要深度性能控制的开发者提供开源推理方案,可在英伟达加速平台上运行。此外,Muse Glimmer还提供可下载的英伟达NIM——这是一个预构建的优化推理容器,可自动选择运行时配置与服务设置,让团队专注于智能体的构建与扩展。

快速上手

开发者可从HuggingFace下载Muse Glimmer模型权重,通过上述推理方案部署到英伟达GPU加速平台,也可使用可下载的NIM容器,或直接在build.nvidia.com上在线体验。

Q&A

Q1:Muse Glimmer是什么模型?有什么特点?

A:Muse Glimmer是Meta发布的一款300亿参数开放权重稠密模型,支持超过12万Token的超长上下文窗口,专为本地AI智能体工作流设计。它采用稠密架构,处理每个Token时激活全部参数,无需路由或专家选择,在需要可靠指令遵循、长上下文连贯性和低延迟的智能体任务中表现突出,并在英伟达单张GPU上即可完整运行。

Q2:Muse Glimmer在英伟达硬件上的推理性能如何?

A:在英伟达Blackwell Ultra平台上,Muse Glimmer以BF16/NVF4精度可达到每GPU每秒超过20个Token的推理速度,支持高并发处理且无混合专家模型的路由开销。单张Blackwell Ultra即可在显存中完整承载模型,并为KV缓存预留充足空间。英伟达GeForce RTX 5090凭借32GB显存也可在消费级设备上本地运行该模型。

Q3:如何开始使用和部署Muse Glimmer?

A:开发者可从HuggingFace下载Muse Glimmer模型权重,通过SGLang或vLLM等开源推理框架部署到英伟达GPU平台,也可使用英伟达NIM预构建推理容器实现一键部署。如需微调,可使用英伟达NeMo AutoModel进行SFT或LoRA微调,支持强化学习训练。此外,也可直接在build.nvidia.com上在线试用该模型。

NVIDIA