2026-09-09
llm-d如何最大化利用现有硬件资源
llm-d在544块H100 GPU上部署7530亿参数的GLM-5.2模型,通过前缀感知路由、KV缓存分层等技术,支持3000个并发编码智能体零抢占运行,成本较商业API低5-10倍。
llm-d在544块H100 GPU上部署7530亿参数的GLM-5.2模型,通过前缀感知路由、KV缓存分层等技术,支持3000个并发编码智能体零抢占运行,成本较商业API低5-10倍。
Baseten工程师Philip Kiely与Ali Taha拆解了现代AI推理层的核心机制:从200,000 token请求的缓存感知路由、分离式预填充解码,到投机解码与结构化输出,推理优化仍有20%至200%的提升空...
当Anthropic等顶尖AI公司争夺前沿模型话语权时,开源模型正悄然崛起。今年春季,中国开源模型在Hugging Face上的下载量占比达41%,超越美国模型;OpenRouter上最受欢迎的六款模型均来自中国企业。H...