谷歌已经有一段时间没有发布Gemini Pro模型了,但周三,该公司又推出了一批新的Gemini Flash和Flash Cyber模型。
尽管Gemini 3.7 Flash才发布三周(这是谷歌六周内第三次发布Flash模型),但新的Flash模型在很多方面都大幅超越了前代,尤其是在智能体编码任务和智能体计算机操作方面表现突出。
和以往一样,Flash 3.8的定价为每百万输入/输出Token 0.75美元/3.75美元。不过这是introductory(初期优惠)价格,该价格将于2026年12月31日到期,之后调整为每百万Token 1.50美元/7.50美元。
Fairwind计划限制Flash 3.8 Cyber访问权限
Flash 3.8看起来是一款相当出色的模型,谷歌将其称为"主力模型"确实名副其实,但Flash 3.8 Cyber同样值得一提。通过这款模型,谷歌基本上是在效仿Anthropic的做法。
谷歌将Cyber模型描述为其"在漏洞检测和自动化补丁修复方面具有前沿级性能的最强网络安全模型"。正因如此,该模型仅向少数"可信防御者"开放,谷歌为此推出了一项名为Fairwind的新计划。
这些可信合作伙伴约有650家,包括埃森哲、CrowdStrike、互联网安全中心、Datadog、帕洛阿尔托网络、Snowflake和Wiz等。
"防御方的优势在于缩短发现漏洞到修复漏洞之间的时间,"谷歌安全与隐私副总裁弗劳尔·弗林在公告中写道。"通过谷歌的Fairwind计划,政府和企业合作伙伴获得了能够更快、更大规模修复系统的自主工具,使他们能够在智能体速度的威胁面前始终领先一步。"
此前谷歌曾针对Flash 3.5 Cyber推出过一项有限访问计划,但当时该计划没有正式名称,看起来也比较临时。
Gemini 3.8 Flash:长周期编码与智能体能力
至于Flash 3.8,谷歌指出,在处理复杂工程任务时,新模型的表现通常优于OpenAI的GPT-5.6 Sol以及Anthropic的Claude Sonnet 5和Opus 5。例如在DeepSWE等基准测试中,该模型与Opus 5持平,且超越了GPT-5.6 Sol和Sonnet 5。
不过这里有一个需要说明的地方,谷歌同时强调"3.8 Flash更努力"。但更努力也意味着会消耗更多Token,值得肯定的是,谷歌对此保持坦诚,并指出:"在处理复杂任务时,该模型表现出更强的严谨性——执行额外的推理步骤,并反复调用工具。有时,为了将性能最大化,尤其是在更高努力程度下,该模型可能会使用更多Token。"
为了应对这一问题,开发者可以像使用以前的模型一样,在不同的推理模式之间进行选择。
谷歌的基准测试并未包括Anthropic仅早一天发布的Fable 5.1。这是一款性能强得多的模型,但价格也高出不少。
没有人会将Fable 5.1称为主力模型,但值得指出的是,在Terminal-Bench 4.0等通用智能体基准测试中,Flash 3.8的得分为19.1%,而Fable 5.1达到55.8%,Opus 5达到51.8%。与此同时,在专注于编码的Terminal-Bench 2.1测试中,Flash 3.8的表现优于竞争对手。
不过Terminal-Bench在此处属于特例,因为在其他智能体任务上,即便与其他旗舰模型相比,Gemini模型的表现实际上相当不错。
尽管取得了不小的进步,谷歌模型在计算机操作方面仍显吃力(在OSWorld-2.0基准上为59%,而Opus 5达到75.4%),在测试模型知识工作任务能力的GDPVal基准上,谷歌以1545分远落后于Opus 5的1824分,但终于开始追上Sonnet 5的1584分。
谷歌指出,之所以能在如此短的时间内改进模型,部分原因在于现在也使用了智能体循环来改进模型。团队写道:"今天发布的两款模型均由相同的基础智能驱动,并通过长时间运行的智能体循环得到进一步加速,这些循环旨在递归地评估和优化底层模型。"
中国模型正在缩小差距
值得注意的一点是,谷歌的对比主要聚焦于OpenAI和Anthropic,但不难发现,在DeepSWE 1.1等一些基准测试中,部分中国模型如GLM-5.3和GLM-5.3 Flash,以及DeepSeek v4 Pro和Kimi K3,其表现也处于同一水平——而且它们往往提供更好的性价比。
网络安全基准测试
至于Flash 3.8 Cyber,谷歌表示,该模型在CyberGym测试中展现出"自主漏洞发现方面的前沿级性能",超越了今年7月发布的3.5 Flash Cyber,以及"规模明显更大的前沿模型"。
CyberGym仅涵盖C和C++代码,因此谷歌还在一个涵盖20种编程语言的内部基准上测试了该模型,报告成功率超过70%。
在Collinear的CWE-Bench测试中,该模型的pass@1得分为47.2%,仅次于谷歌未透露名称的"一款领先前沿模型的47.8%"。
不过基准测试终究有其局限性。Chrome安全团队表示,该模型生成的正确补丁数量是"规模大得多的最佳商业模型"的2.6倍,而Wiz报告称,在其内部渗透测试基准上,该模型的召回率高出7.5%至9.7%,成本却降低了2.3至5.2倍。
安全性
在安全方面,谷歌表示,3.8 Flash发布时"针对化学、生物、放射性和核(CBRN)以及网络攻击领域的滥用风险配备了防护措施,同时根据我们的前沿安全框架,支持有益用途的使用场景。"
Gemini Flash 3.8 Cyber的防护措施相对宽松一些,但这也正是它仅向少数用户群体开放的原因。
谷歌还指出,新模型在应对提示词注入攻击方面也更加稳健,例如在Gray Swan IPI基准测试中取得了(几乎)业内领先的成绩。
Gemini Pro呢?
下一代Gemini Pro模型的发布将会很有看点。这些Flash模型正在快速改进,尽管谷歌在Pro模型的发布节奏上有些失误,但该模型或许值得等待。与此同时,谷歌押注Flash模型的策略也意味着,该公司得以推动一种性价比叙事,而这对其他美国前沿实验室来说是很难做到的。
按照这个速度,我们或许会在Gemini 4 Pro到来之前,先看到Gemini 3.9 Flash。
可用性
Gemini 3.8 Flash现已在谷歌的常规产品中上线,包括Antigravity、Google AI Studio、Android Studio和Stitch,以及Gemini Enterprise。
拥有AI Pro和Ultra订阅的消费者也可以在Gemini App、谷歌搜索的AI模式以及Gemini in Google Sheets中使用该模型。
Q&A
Q1:Gemini 3.8 Flash的价格是多少?
A:每百万输入/输出Token的价格分别为0.75美元和3.75美元,这是初期优惠价,将于2026年12月31日到期,之后调整为1.50美元/7.50美元。
Q2:Gemini Flash 3.8 Cyber谁可以使用?
A:该模型仅通过谷歌新推出的Fairwind计划向约650家可信合作伙伴开放,包括埃森哲、CrowdStrike、Datadog、帕洛阿尔托网络、Snowflake和Wiz等。
Q3:Gemini 3.8 Flash在哪些产品中可以使用?
A:该模型已上线Antigravity、Google AI Studio、Android Studio、Stitch和Gemini Enterprise,AI Pro和Ultra订阅用户还可在Gemini App、谷歌搜索AI模式及Gemini in Google Sheets中使用。
