AI模型与智能体

开发者和企业客户在构建生产级AI智能体时,需要更高的Token使用效率、更低的延迟以及更可靠的性能表现。谷歌Flash系列模型正是为此而生,旨在实现效率与质量的最佳平衡,以支持智能体工作流的规模化扩展。在Gemini 3.5 Flash的基础上,谷歌正式推出以下新模型:

3.6 Flash:定位为主力工作模型,在编程、知识工作和多模态任务上均有显著提升。根据Artificial Analysis指数,与3.5 Flash相比,该模型输出Token使用量减少了17%;在Datacurve的DeepSWE等部分基准测试中,降幅甚至高达65%,且每输出Token的成本更低。

3.5 Flash-Lite:3.5系列中速度最快、性价比最高的模型,根据Artificial Analysis指数,其输出速度达到每秒350个Token,在智能体工作流方面也大幅超越此前的Flash-Lite版本。

CodeMender中的3.5 Flash Cyber:成功的网络安全应用需要将模型与智能体基础架构进行精密协同。谷歌推出了一款高效、专注于网络安全领域的专用模型,并将其与CodeMender代码安全智能体配合使用,以具有竞争力的前沿性能应对安全挑战。

除上述发布外,Gemini 3.5 Pro目前已与合作伙伴展开测试,谷歌计划在准备就绪后尽快向更多用户开放。与此同时,团队已着手构建下一代模型——Gemini 4的预训练工作已经启动,这也是谷歌迄今为止最具雄心的预训练任务,目前进展令人振奋。

3.6 Flash:比3.5 Flash更高效、质量更优

Gemini 3.6 Flash直接吸纳了开发者和客户对3.5 Flash的反馈意见。3.6 Flash不仅在编程和知识工作方面有所跃升,更在大幅提升Token使用效率的同时实现了这一进步。在Artificial Analysis指数上,3.6 Flash的输出Token消耗比3.5 Flash减少了17%,完成多步骤工作流所需的推理步骤和工具调用次数也有所减少。

在效率提升的同时,3.6 Flash的定价也低于3.5 Flash——输入Token每百万定价1.5美元,输出Token每百万定价7.5美元。更低的每次智能体任务总成本,使构建和运行智能体更具经济性。

与3.5 Flash相比,3.6 Flash在多项应用场景中均实现了性能提升:

在编程任务方面,3.6 Flash在DeepSWE基准测试中得分为49%(3.5 Flash为37%),精度更高,不必要的代码修改和执行循环更少;在MLE Bench机器学习研究评估中得分达63.9%(3.5 Flash为49.7%),提升显著。

计算机使用能力方面,在OSWorld-Verified测试中得分为83.0%(3.5 Flash为78.4%)。计算机使用功能现已作为内置客户端工具,可通过Gemini API和Gemini Enterprise调用。

在知识工作方面,GDPval-AA v2基准测试得分为1421(3.5 Flash为1349)。Hebbia和Harvey等客户表示,该模型在多模态任务(如文档解析、图表与数据分析、报告起草)方面尤为出色。

安全构建

3.6 Flash在化学、生物、放射性和核(CBRN)领域以及网络攻击滥用方面内置了增强版前沿安全防护机制,使模型对越狱攻击的抵御能力大幅提升。与此同时,该模型在训练中也尽量减少了对正当用途的拒绝响应。

更多信息请参阅3.6 Flash模型卡片。

3.5 Flash-Lite:为智能体工作流规模化扩展而生

除Flash系列外,谷歌同步发布了Gemini 3.5 Flash-Lite,专为低延迟任务及对高吞吐量有关键需求的开发者工作流(如智能体搜索和文档处理)而设计。

3.5 Flash-Lite是3.5系列中速度最快的模型。经Artificial Analysis测量,其运行速度达到每秒350个输出Token。以每百万输入Token 0.3美元、每百万输出Token 2.5美元的价格,加上相比3.1 Flash-Lite大幅提升的质量,3.5 Flash-Lite为运行高吞吐量生产流量的开发者和客户提供了极具竞争力的性价比。

3.5 Flash-Lite支持智能体系统的高效扩展。在各思考层级上,该模型均大幅超越3.1 Flash-Lite。开发者可根据工作负载灵活配置:对于大批量任务,可选择最低或低思考层级,优先保证低延迟、低成本执行;若处理多步骤子智能体工作负载,则可启用更高思考层级。该模型现已将计算机使用功能作为内置工具,以可靠地跨平台支持智能体任务。

在编程与智能体任务方面,Terminal-Bench 2.1得分从31%提升至54%;长上下文处理方面,GDM-MRCR v2得分从60.1%提升至72.2%;真实任务执行方面,GDPval-AA v2得分从642提升至1140。

值得一提的是,3.5 Flash-Lite在多项智能体和编程评测中甚至超越了3 Flash,包括SWE-Bench Pro(54.2% vs. 49.6%)和OSWorld-Verified(74.0% vs. 65.1%),成为同时适用于2.5和3 Flash工作负载的更快、更强选择。

更多模型信息请参阅3.5 Flash-Lite模型卡片。

CodeMender中的3.5 Flash Cyber:高效发现并修复漏洞

AI模型发现安全漏洞的速度已超过现有系统的修复速度。应对这一日益严峻的威胁,需要一种兼具高能力和高效率的软件安全方案。

Flash系列出色的性能与效率,使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber基于3.5 Flash构建,并针对网络安全漏洞的发现与修复进行了专项微调,每Token价格低于大型模型。

在CodeMender中,多个3.5 Flash Cyber智能体协同工作,生成统一的综合报告。在此框架下,3.5 Flash Cyber在CyberGym热门基准测试中达到了极具竞争力的前沿水平。

鉴于这项技术的双重用途属性,谷歌采取了审慎的部署策略。该模型将作为有限访问试点计划的一部分,近期通过CodeMender向政府及可信合作伙伴专项开放。这将使一线防御者能够抢先发现并修复关键漏洞,在漏洞被利用之前将其消除,同时降低更广泛滥用的风险。

3.6 Flash与3.5 Flash-Lite:立即上手体验

3.6 Flash和3.5 Flash-Lite今日起正式开放:

面向开发者:可通过Google AI Studio和Android Studio中的Gemini API使用;3.6 Flash同步在Google Antigravity上线。请参阅开发者指南开始使用。

面向企业用户:可通过Gemini Enterprise智能体平台使用;3.6 Flash同步在Gemini Enterprise应用中提供。

面向所有用户:可通过Gemini应用使用;3.5 Flash-Lite也正逐步在Google搜索中推广。

在使用3.6 Flash和3.5 Flash-Lite的过程中,谷歌欢迎用户反馈,以持续改进未来的Gemini模型,并期待尽快发布3.5 Pro。

Q&A

Q1:Gemini 3.6 Flash与3.5 Flash相比有哪些改进?

A:Gemini 3.6 Flash在多个维度上超越了3.5 Flash。Token使用效率提升17%,在DeepSWE部分场景下最高可降低65%;定价更低,输入每百万Token 1.5美元,输出每百万Token 7.5美元;编程能力方面,DeepSWE得分从37%提升至49%;计算机使用能力(OSWorld-Verified)从78.4%提升至83.0%;知识工作(GDPval-AA v2)得分从1349提升至1421。

Q2:Gemini 3.5 Flash-Lite适合哪些使用场景?

A:3.5 Flash-Lite适合需要低延迟或高吞吐量的场景,例如智能体搜索、文档处理、大批量数据提取等。它是3.5系列中速度最快的模型,每秒可输出350个Token,同时价格较低(输入每百万0.3美元,输出每百万2.5美元)。开发者可根据工作负载调整思考层级,灵活平衡速度与质量。

Q3:Gemini 3.5 Flash Cyber是什么?普通用户能用吗?

A:Gemini 3.5 Flash Cyber是基于3.5 Flash专项微调的网络安全模型,专注于代码漏洞的发现与修复,并与CodeMender代码安全智能体配合使用。由于技术具有双重用途风险,该模型目前不面向公众开放,仅作为有限访问试点,向政府机构及可信合作伙伴提供,普通用户暂时无法使用。

Google DeepMind