llm-d如何让混合GPU集群上的AI推理速度提升3至5倍
随着企业将大模型从实验阶段推向实际服务,越来越多的企业选择本地部署以掌控全栈。IBM Research、Red Hat与NxtGen合作,在混合GPU集群上测试开源框架llm-d的性能。实验结果显示,llm-d通过缓存感...
随着企业将大模型从实验阶段推向实际服务,越来越多的企业选择本地部署以掌控全栈。IBM Research、Red Hat与NxtGen合作,在混合GPU集群上测试开源框架llm-d的性能。实验结果显示,llm-d通过缓存感...
AI基础设施初创公司Tensormesh完成2000万美元融资,投资方包括英伟达、AMD和CoreWeave及多家风投机构,累计融资额达2450万美元。该公司通过KV缓存技术,将大语言模型处理提示词时产生的中间数据存储复...
博通与韩国AI基础设施初创公司FuriosaAI合作构建机架级推理平台,旨在突破当前GPU主导的AI架构。该平台结合FuriosaAI第三代张量收缩处理器与博通的网络、封装和互连技术,针对超大规模AI部署打造多芯片推理系...
谷歌发布TurboQuant技术,通过压缩大模型推理中的键值缓存来提升AI模型运行效率。在Gemma和Mistral模型测试中,该技术在英伟达H100硬件上实现6倍内存节省和8倍注意力计算加速,且无精度损失。该技术针对现...
Google发布TurboQuant方法,通过压缩大语言模型推理中的键值缓存来提升AI模型运行效率。在Gemma和Mistral模型测试中,该技术在不影响准确性的前提下实现了显著的内存节省和运行加速,在英伟达H100硬件...
韩国AI硬件初创公司Rebellions在IPO前融资轮中筹集4亿美元,由未来资产金融集团领投。该公司专注于AI推理芯片,认为推理将定义AI采用的下一阶段。其核心产品包括Rebel-Quad和Atom AI加速器,采用软...
英伟达在GTC 2026开发者大会上发布了全新Groq 3语言处理单元,这是一款专为多智能体工作负载设计的推理芯片。该芯片基于英伟达200亿美元收购Groq公司的技术授权开发,专注于AI推理而非训练。Groq 3 LPX...
英伟达在GPU技术大会上发布开源平台Dynamo 1.0,专为大规模AI部署优化。该平台旨在解决企业AI面临的复杂生成式和智能体工作负载高效运行难题。英伟达表示推理经济性与模型性能同等重要,Dynamo可实现10倍功耗吞...
AI数据中心如同工厂,电力输入,令牌输出。推理经济学看似简单却暗藏复杂性:每瓦特生成更多令牌意味着更高收益。然而并非所有令牌都相等,需要在吞吐量、用户交互性和成本之间找到平衡。软件优化、分解计算架构和专家混合模型正推动机...
多家领先AI推理服务商通过NVIDIA Blackwell平台大幅降低token成本。Baseten、DeepInfra、Fireworks AI和Together AI等公司将开源前沿模型与Blackwell硬件结合,...
AI平台公司Clarifai发布新推理引擎,声称能让AI模型运行速度提升一倍,成本降低40%。该系统采用多种优化技术,从CUDA内核到高级推测解码,能在相同硬件上获得更强推理性能。第三方测试显示其在吞吐量和延迟方面创下行...
OpenAI发布两款开源推理模型gpt-oss-120b和gpt-oss-20b,分别具有1170亿和210亿参数,可运行代码并与外部系统交互。其中20b版本仅需16GB显存,适合设备端部署。同时Anthropic推出C...
旧金山AI研究初创公司Deep Cogito发布四款新的大语言模型,参数规模从700亿到6710亿不等。这些模型采用混合推理系统设计,能够学习更有效的推理方式并自我改进。通过迭代蒸馏放大技术,模型将推理过程内化到训练中,...
AlphaOne 框架使开发者能在模型推理过程中灵活调节“慢思考”与“快思考”,从而提高复杂任务的准确性与效率,同时降低计算成本。
Google 发布新一代 AI 模型 Gemini 2.5,在 LMArena 评测中位居榜首。该模型采用递归分析方法提供输出,在推理、科学、数学和代码生成等方面表现出色。目前已向付费高级用户开放使用,并将在 2025 ...
xAI 推出新一代人工智能模型 Grok-3,计算能力大幅提升,新增高级推理功能。该模型在初步测试中表现优于同类产品,并推出"思考"和"大脑"两种推理模式。xAI 还将推出名为"深度搜索"的 AI 代理产品。Grok-3...
微软宣布将OpenAI的GPT-o1推理模型免费集成到Copilot中,增强其推理能力。这一决定紧随Microsoft 365涨价和竞争对手DeepSeek发布免费开源AI模型之后。GPT-o1作为链式思考模型,可通过产...