企业人工智能软件公司Iterate Studio Inc.今日推出Lifeboat,这是一款为大语言模型设计的推理引擎,内置了机密计算功能。
Iterate.ai表示,该软件能让每个图形处理器承载的并发AI智能体会话数量提升2到6倍。
Lifeboat旨在解决智能体在大规模部署时产生的内存问题。一个聊天机器人的提问通常只触发一次模型调用,而一个智能体完成单一任务可能需要进行数十次调用,且其上下文窗口会随每次调用而扩大,因此在共享硬件上运行数百个智能体会迅速占满键值缓存。Iterate.ai表示,标准推理引擎在同时处理四到五个长上下文请求时就可能出现卡顿。
遇到这一瓶颈的团队往往会选择购买更多GPU,或将工作迁移到按Token计费的云服务,但这意味着要将数据交给第三方处理。Iterate.ai联合创始人兼首席技术官布莱恩·萨蒂亚纳坦表示,银行、保险公司和医疗系统希望能在"自己的围墙内"用自有数据运行智能体,而不必让GPU支出翻倍。
Lifeboat的方案从公平调度和准入控制入手,为每个会话分配相应的GPU份额,确保繁重的文档处理智能体不会挤占交互式智能体的资源。该公司称,通过对键值缓存的优化,其有效容量实现了翻倍,同时模型权重仍保持全精度运算。
在混合专家模型方面,系统只加载特定智能体所需的专家模块。每个会话还运行在独立的安全舱内,具备过滤机制、Token预算控制和沙箱执行环境。
Iterate.ai自行开展的测试使用了单块英伟达公司的RTX PRO 6000 Blackwell GPU,运行Qwen 30B-A3B模型,Lifeboat在该硬件上支撑了2048个并发会话且所有请求均顺利完成。关闭Lifeboat优化功能后,同一引擎的并发会话上限仅为该数字的一半,每秒处理4965个Token,而开启优化后则达到每秒8714个。差距最明显的测试出现在128个会话同时发送18000个Token请求的内存压力测试中,Lifeboat将首个Token响应时间的第99百分位数控制在1.5秒,而基准版本则需要189秒。
Iterate.ai联合创始人兼首席执行官乔恩·诺德马克表示:"企业在为智能体购置更多GPU之前,应该先弄清楚现有设备的真实潜力。数据中心或新型云服务商如果能让每块卡的并发会话数翻倍,就能在不增加机架和电力的情况下重新获得这部分算力。"
Lifeboat的旗舰版机密计算版本在硬件验证通过之前不会处理任何请求。该验证涵盖超威半导体公司和英特尔公司处理器中的可信执行功能,以及英伟达在H100、B200、GB300等支持型号GPU上的机密计算模式。模型权重被封装在可信执行环境内,无论引擎部署在云端机密虚拟机还是客户自有硬件上,都能在使用过程中保持加密状态。
该公司表示,Lifeboat的早期访问在短短几天内吸引了数千次下载,目前该引擎已正式全面开放。免费开发者许可证支持在单节点最多两台推理服务器上进行非商业用途和评估使用。希望获得专业支持的客户可升级至标准许可证,月费为49.99美元。具备硬件验证功能的机密计算版月费为499.99美元,与标准版一样,均可免信用卡试用七天。
诺德马克和萨蒂亚纳坦此前曾在SiliconANGLE Media的直播节目theCUBE上,就公司的Generate平台及其与NetApp公司的合作展开讨论,相关内容在上周NetApp举办的Insight大会上播出。
Q&A
Q1:Lifeboat是什么?它能做什么?
A:Lifeboat是Iterate.ai开发的大语言模型推理引擎,内置机密计算功能,核心能力是让单块GPU承载的并发AI智能体会话数提升2到6倍,同时保证数据在使用过程中保持加密状态。
Q2:Lifeboat如何解决智能体占用过多内存的问题?
A:Lifeboat通过公平调度和准入控制为每个会话分配GPU份额,并优化键值缓存使其有效容量翻倍,同时在混合专家模型中只加载特定智能体所需的模块,从而大幅提升并发处理能力。
Q3:Lifeboat的价格和使用方式是怎样的?
A:Lifeboat提供免费开发者许可证,支持单节点两台服务器的非商业用途;标准许可证月费49.99美元;具备硬件验证的机密计算版月费499.99美元,两者均可免信用卡试用七天。
