在距上一次大语言模型发布仅三周后,谷歌于今日正式推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型。
这两款大语言模型建立在相同的技术底座之上。主要区别在于:Gemini 3.8 Flash 是面向通用场景的模型,而 Gemini 3.8 Flash Cyber 则专为网络安全研究人员设计。后者通过一项名为"Fairwind 计划"的全新早期访问项目开放使用,该计划也于今日同步上线。
谷歌让 Gemini 3.8 Flash 完成了 16 项人工智能基准测试,结果显示该模型在其中 9 项测试中超越了 Claude Opus 5 和 GPT 5.6 Sol。
在表现突出的评测项目中,Terminal-Bench 1.1 尤为值得关注,该基准专门衡量大语言模型处理多步骤编程任务的能力。其他测试涵盖金融数据分析和图表理解等多种应用场景。
在竞争对手表现更优的基准测试上,Gemini 3.8 Flash 同样展现出较强的竞争力。在 DeepSWE-1.1 测试中,该模型得分为 73.7%,这一基准评估的是 AI 模型自动化处理长周期编程任务的能力。该成绩比 GPT-5.6 Sol 高出约 1 个百分点,与 Opus 5 的差距仅为零点几个百分点。
谷歌高管 Tulsee Doshi 和 Raluca Ada Popa 在一篇博文中写道:"这些性能提升源于一个核心设计理念:3.8 Flash 更加努力。面对复杂任务时,它表现出更强的专注度——执行额外的推理步骤,并以迭代方式调用工具。在某些情况下,模型可能会使用更多 Token 以最大化性能,尤其是在较高的努力级别下。"
另一款同日发布的大语言模型 Gemini 3.8 Flash Cyber 同样表现优异。在 CyberGym 基准测试中,该模型得分为 86.2%,这一测试专门评估大语言模型在 C 和 C++ 代码中发现漏洞的能力。相比之下,Claude Mythos 5 得分为 83.8%,GPT-5.6 Sol 得分为 83.6%。
Gemini 3.8 Flash Cyber 通过名为"Fairwind 计划"的早期访问项目开放使用,参与资格面向政府机构、关键基础设施运营商,以及负责"保障广泛软件基础安全"的科技企业。
谷歌表示,该计划在发布当日已吸引逾 650 个参与方,其中包括 Snowflake、CrowdStrike、Datadog 等主要软件企业。
Fairwind 计划参与者可将 Gemini 3.8 Flash Cyber 与一项名为 CodeMender 的技术配合使用。CodeMender 是一套由谷歌 DeepMind 开发的工具集,包含提示词、代码文件及其他技术资产,旨在提升大语言模型发现漏洞、评估漏洞严重程度以及生成修复补丁的能力。
谷歌工程师也在内部使用 Gemini 3.8 Flash Cyber 来加速工作。据谷歌介绍,Chrome 浏览器开发团队发现,该大语言模型对浏览器漏洞生成的"正确补丁数量是竞争对手的 2.6 倍"。另一支谷歌团队则借助 Gemini 3.8 Flash Cyber 发现了一个"关键底层漏洞",若依靠人工排查,可能需要数月时间才能找到。
Q&A
Q1:Gemini 3.8 Flash 在 AI 基准测试中的表现如何?
A:谷歌让 Gemini 3.8 Flash 参与了 16 项 AI 基准测试,结果显示该模型在其中 9 项测试中超越了 Claude Opus 5 和 GPT 5.6 Sol。在 DeepSWE-1.1 编程任务自动化测试中得分 73.7%,比 GPT-5.6 Sol 高约 1 个百分点,与 Opus 5 差距极小。谷歌表示,性能提升的关键在于模型会执行更多推理步骤并迭代调用工具,在复杂任务上表现出更强的专注度。
Q2:Gemini 3.8 Flash Cyber 和普通版有什么区别?
A:两款模型共用相同的技术底座,主要区别在于应用场景。Gemini 3.8 Flash 是通用型模型,而 Gemini 3.8 Flash Cyber 专为网络安全研究人员设计,在 CyberGym 基准测试中得分 86.2%,高于 Claude Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。该模型目前仅通过 Fairwind 计划向政府机构、关键基础设施运营商及科技企业开放访问。
Q3:Fairwind 计划是什么?哪些机构可以加入?
A:Fairwind 计划是谷歌为 Gemini 3.8 Flash Cyber 设立的早期访问项目,于今日与模型同步发布。参与资格面向政府机构、关键基础设施运营商及负责保障广泛软件基础安全的科技企业。目前已有逾 650 个参与方加入,包括 Snowflake、CrowdStrike、Datadog 等主要软件公司。参与者还可使用谷歌 DeepMind 开发的 CodeMender 工具集,以增强漏洞发现与修复能力。
