谷歌今日发布了三款全新Gemini Flash模型,并将代码安全智能体CodeMender推进至预览阶段。此次更新旨在以更低成本运行AI智能体,并自动化完成软件漏洞的发现与修复工作。
三款新模型分别是:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向安全领域的Gemini 3.5 Flash Cyber。
Gemini 3.6 Flash是本次发布的核心产品。谷歌表示,与上一代3.5 Flash相比,该模型在Artificial Analysis Index上的输出Token数量减少了17%,完成多步骤任务所需的推理步骤和工具调用次数也更少。定价为每百万输入Token 1.5美元、每百万输出Token 7.5美元,低于3.5 Flash的售价。
在基准测试方面,Gemini 3.6 Flash在DeepSWE测试中得分49%,高于3.5 Flash的37%;在衡量机器学习研究能力的MLE Bench测试中得分63.9%,高于3.5 Flash的49.7%;在OSWorld-Verified计算机操作测试中得分83%,高于3.5 Flash的78.4%。目前,计算机操作功能已作为内置工具集成至Gemini API和Gemini企业版。在知识工作基准GDPval-AA v2上,该模型得分1421分,高于3.5 Flash的1349分。
早期客户包括法律AI公司Harvey AI和金融研究平台Hebbia,两家公司均将该模型应用于文档解析、数据分析和报告撰写等场景。Harvey应用研究负责人尼科·格鲁彭表示:"Gemini 3.6 Flash在资本市场和企业并购等实务领域的文件起草与审查上表现出色,与上一代相比,性能显著提升,平均任务完成速度提高了12%。"
谷歌还表示,Gemini 3.6 Flash配备了涵盖化学、生物、放射性和核风险及网络攻击的前沿安全防护机制,并经过专项训练以抵御越狱攻击,同时减少对正常请求的误拒。
Gemini 3.5 Flash-Lite是三款模型中价格最低、速度最快的。其定价为每百万输入Token 0.3美元、每百万输出Token 2.5美元,可提供3.5系列中最高的吞吐量。谷歌表示,该模型在Terminal-Bench 2.1等测试中大幅超越早期的3.1 Flash-Lite,并在SWE-Bench Pro和OSWorld-Verified等部分代码与智能体评测中超越更大规模的3.0 Flash。谷歌将其定位为现有2.5和3.0 Flash工作负载的迁移路径,并已将其集成到谷歌搜索中。
第三款模型Gemini 3.5 Flash Cyber则专为安全场景打造,经过专项微调,用于发现、验证和修复软件漏洞,并运行于CodeMender智能体之内。谷歌表示,当CodeMender调用该模型最多5次以生成单份报告时,其在CyberGym基准上的表现可与规模大得多的模型相媲美。
在谷歌DeepMind的Big Sleep团队针对Chrome、Safari等复杂代码库的测试中,Flash Cyber的表现优于谷歌自家的3.5 Flash、3.6 Flash,以及Anthropic的Claude Opus 4.6。在V8 JavaScript引擎测试中,该模型发现了55个已确认的独特问题,而3.5 Flash发现47个,Claude Opus 4.6发现36个,其中10个问题是其他模型均未发现的。谷歌解释称,之所以以Claude Opus 4.6而非更新竞品模型作为对照,是因为更新的模型在漏洞发现方面表现更差,谷歌将此归因于其安全护栏机制的影响。
此外,谷歌云漏洞研究团队还在一次独立测试中,使用该模型在两小时内发现了公共API中的远程代码执行漏洞及一个生产服务中的内存损坏漏洞,并生成了可绕过标准内存保护机制的可用漏洞利用代码。
鉴于漏洞研究的双重属性,谷歌表示将在有限访问试点项目下,仅向政府机构和受信合作伙伴通过CodeMender提供Flash Cyber。
CodeMender智能体于今日正式进入预览阶段。该智能体基于谷歌DeepMind的研究成果构建,工作流程分为扫描、验证和修复三个步骤:首先扫描代码仓库,查找内存损坏、注入和加密弱点等漏洞;随后尝试验证每个漏洞的真实性,构建漏洞利用程序并在客户自控沙箱中运行,以剔除误报;若漏洞利用成功,智能体将生成补丁并以代码差异的形式返回给开发者审批。CodeMender支持C/C++、Go、Java、Python、Ruby、Rust和TypeScript等编程语言。
谷歌并未将客户绑定于单一模型,用户可根据成本、速度和扫描深度的需求自由选择,公司还表示今年晚些时候将增加对第三方前沿模型的支持。CodeMender可通过Gemini企业智能体平台获取,也可作为谷歌AI威胁防御的组成部分使用——谷歌旗下Wiz云安全平台将在Wiz安全图谱中丰富CodeMender的发现结果,并触发自动化渗透测试。谷歌还表示,Wiz将支持调用CodeMender扫描代码,该功能即将上线。
CodeMender在工作流程中保留了人工审核环节:开发者须在补丁提交前进行审批,但该智能体也可接入持续集成管道实现自主运行。谷歌表示,源代码数据将被加密、隔离处理,且不会被留存。
早期企业测试用户包括Salesforce、Robinhood和Palo Alto Networks。Salesforce首席信息安全官伊恩·穆尔霍兰表示,CodeMender"通过加快从漏洞验证到修复测试的流程,将AI引入了安全生命周期的关键环节"。Robinhood安全运营负责人斯科特·庞特则表示,该智能体"持续发现了其他AI工具完全遗漏的关键漏洞"。
Gemini 3.6 Flash和3.5 Flash-Lite即日起可通过谷歌AI Studio和Android Studio中的Gemini API使用,其中3.6 Flash还将集成至谷歌Antigravity代码工具和Gemini企业版应用,两款模型均可通过Gemini应用面向普通用户提供服务。谷歌还表示,Gemini 3.5 Pro正在与合作伙伴进行测试,即将更广泛发布,而Gemini 4的预训练工作也已全面展开。
Q&A
Q1:Gemini 3.6 Flash和3.5 Flash相比有哪些提升?
A:Gemini 3.6 Flash在Artificial Analysis Index上的输出Token数量比3.5 Flash减少了17%,完成多步骤任务所需的推理步骤和工具调用次数更少,价格也更低。基准测试方面,DeepSWE得分从37%提升至49%,MLE Bench从49.7%提升至63.9%,OSWorld-Verified从78.4%提升至83%,整体性能和效率均有显著改善。
Q2:CodeMender是如何发现和修复代码漏洞的?
A:CodeMender的工作流程分为三步:首先扫描代码仓库,查找内存损坏、注入漏洞、加密弱点等问题;接着在客户自控的沙箱中构建并运行漏洞利用程序,验证漏洞是否真实存在,以排除误报;最后生成修复补丁,以代码差异形式提交给开发者审批。整个过程保留了人工审核环节,开发者可决定是否提交补丁。
Q3:Gemini 3.5 Flash Cyber为什么只对政府和特定合作伙伴开放?
A:因为漏洞研究本身具有"双重属性"——发现漏洞的能力既可用于防御,也可能被滥用于攻击。谷歌在测试中证实,该模型能够快速发现真实漏洞并生成可绕过内存保护的利用代码,因此为防止技术被滥用,谷歌决定通过有限访问试点项目,仅向政府机构和受信合作伙伴开放该模型。
