谷歌Gemini走过了一段漫长的进化之路。从早期的Bard时代因频繁出现幻觉错误导致谷歌股价下跌,到更名为Gemini后依然因同样问题引发股市震荡,历经两年打磨,谷歌终于在聊天机器人领域找到了正确方向。
免费版Gemini基于2.5 Flash模型运行,是一款表现出色的产品。它能快速回答问题,事实准确性较高。与免费版ChatGPT相比,Gemini的使用频次限制更为宽松,用户可以更频繁地使用,等待时间也更少。在测试中,笔者可以在Gemini上连续生成多张图片,而在ChatGPT免费版上,生成一张图片就会触及使用上限。此外,Gemini的图片生成速度也远快于ChatGPT免费版。不过,偶尔也会出现刚问完第一个问题就触发Token限制的情况。
对于日常AI用户而言,Gemini 2.5 Flash已完全够用。它为用户提供了充足的使用空间,不会让人时刻担心触及使用上限。当然,这款模型并非无懈可击,尤其在图像生成方面仍存在一些不足。尽管如此,对于日常使用场景,免费版Gemini完全可以替代谷歌搜索来完成大多数任务。
CNET的AI模型测评方法
今年,笔者采用了一种不同的方式来评测AI聊天机器人。随着AI模型的持续进步,简单的查询已经不再能够考验这些模型的能力。同时,这些模型大多已接入互联网,有助于提升回答的准确性。因此,笔者转而采用更注重实际体验的评测方式。AI聊天机器人是多面手型工具,不同职业背景的用户使用习惯差异显著——作为一名记者和作家的用法,与程序员、律师或艺术家截然不同。幸运的是,记者本身就是各领域的通才,这种使用方式能够覆盖相当广泛的用户群体。这也意味着,测评过程中不会向所有AI模型提出完全相同的问题再进行横向比较。
免费版Gemini的准确性如何?
与历代Gemini相比,基于最新更新的2.5 Flash模型运行的免费版Gemini,准确性已大幅提升。这不仅得益于Gemini可以直连互联网进行信息交叉验证,也因为2.5 Flash是一款"思考型"模型。所谓思考型模型,并非简单地进行"增强版自动补全",而是在给出答案之前,遵循一套规则和推理逻辑进行分析。
当然,关于"思考"或"推理"模型究竟是否真正在进行逻辑推理,抑或只是通过更大规模的数学计算提升文本生成准确性,学界尚存争议。不过,在Gemini 2.5 Flash中,用户可以直接看到模型的"思考过程",这一功能参考了去年底引发广泛关注的DeepSeek R1所采用的方案。
作为一名新入手任天堂Switch的用户,笔者很想了解哪些游戏会登陆这款主机。市场上有传言称《Stellar Blade》——此前的PS5独占游戏(近期已推出PC版)——可能会登陆Switch 2。考虑到这是一款对硬件要求较高的游戏,笔者对其在任天堂新掌机上的运行表现颇感好奇。
Gemini 2.5 Flash对此给出了相当专业的分析。它梳理了虚幻引擎4游戏在初代Switch上的运行情况,并以此推断在性能更强的Switch 2上的可能表现。结论认为:在底座模式下,《Stellar Blade》的移植版理论上可以借助DLSS AI超分辨率技术,以1080p分辨率稳定运行在30帧每秒。即便笔者并非硬件专家,这一结论与《赛博朋克2077》等其他Switch 2移植游戏的表现也较为吻合。
笔者还研究了在纽约市经营Turo租车服务是否划算。Turo是一种允许个人将自己的车辆出租以获取收益的租车平台,类似于汽车版Airbnb。纽约市场较为特殊,停车限制、街道法规以及高昂的拥车成本都是不得不考虑的因素。Gemini 2.5 Flash出色地分析了将一辆手动挡丰田GR86在Turo上出租的利弊——这辆车对驾驶爱好者而言颇具吸引力,但手动挡的小众属性也可能导致受众有限。
Gemini还特别指出了2022款车型存在的特定发动机问题,尽管概率较低,但仍值得关注。随后,它进行了详细的收益测算,分别给出了低、中、高三档预期收入和利润估算,最终帮助笔者得出结论:将这辆手动挡丰田GR86用于Turo出租,可能得不偿失。据推测,Gemini是从专业论坛和Reddit等平台的数据中获取了相关信息。(谷歌去年已与Reddit签署了一项价值6000万美元的数据授权协议。)
Gemini还可以调用YouTube、谷歌地图以及其他谷歌旗下产品的数据,这赋予了它相比其他AI聊天机器人的独特优势。例如,若想查询某家餐厅玉米卷的食材配方,Gemini可以直接交叉检索谷歌地图上的评价来寻找答案,而ChatGPT则需要搜索Yelp等第三方平台。
使用限制:既少见又捉摸不定
谷歌表示,最新更新的Gemini 2.5 Flash模型拥有100万Token的上下文窗口,远超ChatGPT付费版GPT-4o的12.8万Token上限。当然,ChatGPT旗舰级的GPT-4.1模型同样具备100万Token的上下文窗口。
在使用Gemini 2.5 Flash的过程中,笔者极少遭遇使用限制,可以连续提问并生成多张图片,而不会触发限制。
但偶尔会出现一种令人困惑的情况:即便是当天的第一个问题,也会突然触发限制,此后需要等待数小时才能重置。目前尚不清楚谷歌的具体计量方式——究竟是以小时为单位统计用量,还是在多日内累计计算?后者显然不太合理。
此外,尽管谷歌宣称Gemini支持100万Token的上下文窗口,笔者却发现无法将一场两小时会议的完整文字记录直接粘贴进去进行摘要处理,实际上只能粘贴约四分之一的内容。询问Gemini原因时,它坚持认为自己完全可以处理,对自己的大上下文窗口充满信心。再次尝试,结果相同。直到笔者改用上传.txt文件的方式,Gemini才成功读取并完成了整场会议的摘要。对此,Gemini解释称,谷歌可能对直接文本输入设置了字符上限,以防止浏览器卡顿。这一问题在Gemini付费版中并未出现。
虽然笔者未对代码能力进行专项测试,但据谷歌介绍,Gemini Code Assist每月为免费用户提供18万次代码补全,按谷歌的说法,用户需要每天编程14小时才能触及上限。
谷歌在购物功能上落后于ChatGPT
谷歌的主要收入来源是在线广告,2024年该业务占其总营收的78%。如今,谷歌搜索结果页面不仅布满广告,还充斥着商品轮播和赞助商品推广,有时令人感到干扰。因此,外界自然期待谷歌的AI聊天机器人在购物方面同样表现强劲——但现实情况并非如此。
在购物功能上,Gemini 2.5 Flash与ChatGPT存在明显差距。今年早些时候,OpenAI为所有ChatGPT用户推送了更新,将购物功能直接集成到聊天界面中,支持带图片的产品链接展示,整体体验流畅直观。笔者认为,尽管偶有链接跳转问题,ChatGPT免费版的购物体验整体相当不错,且OpenAI声称目前不对购物推荐进行商业变现。
相比之下,Gemini的购物体验则略显平淡。在产品调研方面,Gemini 2.5 Flash可以提取关键信息并进行产品横向对比,但除非主动要求,否则不会主动提供产品链接,也不会像谷歌搜索那样展示商品图片。
在为任天堂Switch 2搜寻可用于《马力欧赛车世界》联机的摄像头时,Gemini的推荐表现尚可,甚至能够交叉参考笔者分享的一篇Reddit帖子。但在同一查询过程中,也随机遭遇了一次"出了点问题"的错误提示,且没有任何说明,最终不得不新开一个对话才得以继续使用。
免费版Gemini的图像生成:一分价钱一分货
Gemini 2.5 Flash在图像生成方面相当慷慨,但要让它生成符合预期的图像,却是一个令人抓狂的过程。
笔者希望生成一张充满怀旧感的图片:一个男孩在父母的车里,于夜晚行驶途中玩着Game Boy。尽管Gemini确实生成了图片,但画面逻辑完全失真。
第一次生成的图片,男孩表情十分悲伤,与预期的温馨氛围相去甚远。
提出修改意见后,Gemini重新生成的版本有所改进,但仍不够理想——色调不对,更奇怪的是,男孩坐在了前排副驾驶位置,安全性堪忧。在另一个版本中,背景中的汽车正在驶离,这与画面逻辑完全不符。
经过反复调整,Gemini生成的图片依然问题不断,甚至出现男孩坐在前排父母旁边却朝向车辆后方的荒诞画面。笔者最终选择放弃。
Gemini 2.5 Flash的图像生成速度快、次数慷慨,但质量仍有较大提升空间。谷歌DeepMind的德米斯·哈萨比斯在今年的Google I/O大会上谈及"世界模型"概念,表示这类模型能够更好地理解和模拟真实物理规律。希望这项技术能够尽快下沉到免费版Gemini中。
免费版Gemini比免费版ChatGPT给得更多
谷歌在过去一年对Gemini的大幅改进值得充分肯定。这款AI聊天机器人的准确性显著提升,功能也更加丰富完善,而且大部分能力都是免费开放的,实属难得。这无疑给其他AI聊天机器人带来了不小的压力,也充分展示了谷歌在资源与生态上的竞争优势——尤其是在谷歌大力推动Gemini成为用户首选AI工具的背景下。
ChatGPT、Claude和Perplexity可以凭借更高质量和更精准的信息参与竞争,但这需要持续的研发投入、技术创新和服务器成本支出,对于那些不如谷歌财力雄厚的公司而言,压力不小。以Claude为例,其免费版基于Sonnet 4模型运行,这是一种"混合推理模型",采用多层次方法以充分发挥AI的潜力。
尽管如此,谷歌能够免费向所有用户开放"思考型"模型,依然令人印象深刻。考虑到DeepSeek R1今年早些时候已率先采取同样策略,这或许在一定程度上倒逼了谷歌加快行动。无论如何,全新升级的Gemini迈出了正确的一步。
Q&A
Q1:Gemini 2.5 Flash的免费版Token上限是多少,实际使用中会频繁触发吗?
A:谷歌官方表示Gemini 2.5 Flash拥有100万Token的上下文窗口。在实际测试中,大多数情况下不会频繁触发限制,可以连续提问并多次生成图片。但偶尔会出现随机触发限制的情况,有时甚至是当天第一个问题就被限流,触发后需等待数小时才能重置。此外,直接粘贴长文本时存在字符上限,上传文件则可绕过这一限制。
Q2:Gemini 2.5 Flash的图像生成效果怎么样?
A:Gemini 2.5 Flash在图像生成方面速度快、次数限制宽松,对普通用户较为友好。但在生成画面逻辑复杂的图像时表现较差,容易出现人物位置错误、场景逻辑混乱等问题。经过多次反复修改,仍难以达到预期效果,整体图像质量有待提升,与其他专业图像生成工具相比仍有明显差距。
Q3:免费版Gemini和免费版ChatGPT相比,哪个更好用?
A:两者各有优劣。Gemini免费版基于2.5 Flash思考模型,使用频次限制更宽松,可调用谷歌地图、YouTube等谷歌生态数据,准确性较高。ChatGPT免费版在购物功能上更强,支持带图片的产品链接展示。图像生成方面,Gemini速度更快且次数更多,但画面逻辑准确性不如预期。总体而言,对于日常使用,免费版Gemini提供的功能更为丰富。
