谷歌今年6月曾承诺推出Gemini 3.5 Pro,但整个夏天却只是陆续发布了几款较小规模的Flash模型。现在,谷歌准备再次向前沿领域发起挑战,推出Gemini 4 Argon。该公司声称这款新AI在编程、知识工作和网络安全方面提供业界领先的性能,但目前用户还无法使用它。

虽然大多数人需要等待才能测试Gemini 4,但谷歌表示公司内部的工程师已经在大量使用这款新模型。据报道,Argon利用“全舰队遥测数据”帮助谷歌在其数据中心节省了300 TiB的内存。同时,Argon智能体一直在协助谷歌将C/C++代码库迁移到Rust语言,涉及核心的re2和libgav1库中的数千行代码,以及Fuchsia操作系统Zircon内核中超过80万行代码。

谷歌还拿出了一系列基准测试结果来支撑其说法。在软件工程DeepSWE v1.1基准测试中,Gemini 4 Argon的得分为77.9%,高于GPT-6 Astra、Fable 5.1和Opus 5.5。谷歌承诺该模型在一系列长周期任务中同样表现出色,并指出Argon在经济分析Vals Index测试中取得了业界领先的分数。

由于该模型仍处于有限测试阶段,谷歌尚未公布API定价。不过该公司已确认,Gemini 4 Argon将支持高达100万Token的输出上限,相比此前Gemini模型的6.4万Token有大幅提升。谷歌表示,这使用户能够在单一步骤中完成更具挑战性的任务。

目前Gemini 4的主要应用重点是网络防御。谷歌表示,此类规模的模型需要分阶段发布,因此将先从一小部分受信任的测试者开始。该公司Fairwind计划的合作伙伴可以获得访问权限,利用该模型的网络安全防御能力。据悉,Wiz公司已经在使用Argon,并借助该模型发现了一个严重漏洞,该漏洞可能导致全球多家医院使用的系统泄露个人信息。谷歌声称其他前沿模型都未能发现这一缺陷,但没有提供具体细节。

今年夏天发生了几起备受关注的黑客事件后,业界对模型失控问题颇为担忧。谷歌声称其在设计Argon时加入了监控模型思维链的系统,一旦模型行为越界即可及时制止。谷歌表示,这正是推理透明性在前沿模型开发中至关重要的原因。

Gemini 4 Argon最终将向企业和消费者客户开放,但谷歌尚未给出具体时间表。目前已知的是,在完成网络安全测试后,该模型将首先向付费API用户和谷歌AI Ultra订阅用户全面开放。

Q&A

Q1:Gemini 4 Argon现在可以使用吗?

A:目前还不能广泛使用。该模型仍处于有限测试阶段,谷歌先向Fairwind计划的受信任合作伙伴开放,后续将按步骤向付费API用户和谷歌AI Ultra订阅用户开放,暂无具体公开时间表。

Q2:Gemini 4 Argon相比之前的Gemini模型有什么提升?

A:Gemini 4 Argon支持高达100万Token的输出上限,远超此前模型的6.4万Token,能让用户在单一步骤中完成更复杂的任务。在编程、知识工作和网络安全等多项基准测试中表现领先,例如DeepSWE v1.1基准测试得分77.9%,超过多款同类前沿模型。

Q3:Gemini 4 Argon在网络安全方面有哪些实际应用?

A:谷歌合作伙伴Wiz已经使用Argon发现了一个严重漏洞,该漏洞可能导致全球多家医院使用的系统泄露个人信息,且谷歌称其他前沿模型未能发现此问题。谷歌还为Argon设计了监控思维链的系统,可在模型行为异常时及时制止。

ArsTechnica - AI