头条推荐
A |

B | 这是最近网友对 Gemini 的一句调侃。 按理说,一家公司发新模型,通常是来打脸这种调侃的。可就在刚刚,Google 一口气发了三个新模型之后,网友非但没收回这句话,反而笑得更大声了。比分看着不差,但放在"连续 4 场平局"的背景下,谁都笑不出来。

C | 多少有种他们都不看好你,可偏偏你最不争气的即视感。回想赛季上半程,蓉城那是攻无不克、战无不胜,踢谁谁怕;如今却是一波四连平,活生生把"冠军相"踢成了"保平相"。积分榜上,蓉城 44 分继续领跑,第二名重庆铜梁龙 29 分——领先多达 15 分,纸面上看相当稳。 三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专搞网络安全的 3.5 Flash Cyber。但足球最怕"纸面",四连平背后藏着的,是比分数更刺眼的信号:这支球队,真的开始掉速了。为什么会突然下滑?第一口锅,得甩给密集赛程。官方博客的措辞也相当眼熟,「更高效」「更聪明」「为大规模 AI agent 而生」,一句不落。多线作战的消耗是隐形的,上半程靠一口气顶着,到了赛季中段,体能债集中爆发,球员跑不动、对抗跟不上了,过去那种高位逼抢和快速转换自然打不出来。你以为对手变强了,其实是自己先累了。

D | 第二,是被研究透了。

E | 上半程蓉城战术新鲜、打法超前,对手来不及应对;现在全中超都在琢磨怎么"兑子"蓉城——收缩防线、切断中场连线、掐死箭头人物。 只不过,实际体感却冰火两重天。

F | 主角登场,3.6 Flash 到底强在哪 先说头牌,3.6 Flash。你越是被针对,越容易陷入阵地战泥潭,而阵地战恰恰是蓉城最不擅长的。当年的"新鲜感红利",吃完了。官方给的定位就俩字——「主力」(workhorse),干活模型。 3.5 Flash 是今年 5 月 I/O 大会上发的,这次算是小版本迭代。第三,心态变了。 最大的卖点是省 token。

G | 从"追赶者"变成"被追赶的领跑者",球员和教练组潜意识里会更保守,领先时想守、胶着时不敢冒进。 按 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE(Datacurve 出的基准)这类场景上甚至能省到 65%。四连平里好几场都是先赢后缩,最后被追平,这不全是能力问题,是心态问题——怕输,反而更容易平,甚至输。

H | 官方还说它跑多步任务时,推理步数和工具调用都更少。第四,锋线效率下滑。创造机会的能力没丢太多,但临门一脚准星掉了,加上核心球员轮休、伤病增多,能一锤定音的人变少了,平局自然就多了。也就是说,干同样的活,废话更少,绕路更少,账单更薄。

I | 过去赢 1-0 的比赛,现在变成 1-1、2-2,差的不是场面,是那一下终结。那么冠军还稳吗?我的判断很明确:主动权还在蓉城自己手里,但"稳"字要打个大问号。 价格也确实降了。输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——注意,上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。15 分的身位是底气,可四连平说明,追兵只要在后面咬住,赛季后半段任何一次失误都可能被放大。更何况蓉城自己若继续抱着"平局思维",积分优势会被一场场磨平——领先 15 分不等于安全,领先 15 分却连续不掉链子,才是真安全。又快又省,单个 agent 任务的成本就压下来了。

J | 基准测试上,官方摆出了一整排数据。真正的考验在后半程:能不能在转会窗补强短板、能不能把战术套路翻新、能不能把心态从"守冠军"调回"抢冠军"。

K | 冠军从来不是算分算出来的,是一场场踢出来的。 代码能力是重点。DeepSWE 从 37% 提升到 49%,官方的说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境的要求。蓉城现在最需要的,不是恐慌,而是一记清醒的耳光——四连平,就是那记耳光。

L | 机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。

M | 计算机操作(computer use)能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。

N | 并且,「计算机操作」(computer use)也成了Gemini API 和企业版的内置工具,主打一个开箱即用。

o | 知识工作方面,GDPval-AA v2 从 1349 涨到 1421。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。

p | 接得住,冠军还是你的;接不住,15 分也经不起挥霍。

q | Figma、JetBrains 也都出面背书了一番。 哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。

r | 老黄历总算翻篇了。 安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。看中超上咪咕视频!(罗掌柜)

s | 电脑操作这次也做成了内置工具。 跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。 最有意思的是,这个「小弟」在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。 比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。

t | 官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它「速度、智能、成本三合一」。

u | 最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。 Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。 这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。 在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。 不过这模型我们暂时也用不上。

v | 考虑到「找漏洞」这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。把它锁得死死的——只对「可信合作伙伴」限量开放,走内测。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。 说好的 3.5 Pro 呢?如来 看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了? 官方口径是「正在和合作伙伴测试,准备好就上」。但这套说辞背后的故事,可能没那么体面。 据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。 而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。 听着虽然挺提振人心,但把它放在「旗舰跳票」的背景下看,多少有点转移视线、画饼续命的味道了。 除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。 第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。 价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。 X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了(阴阳怪气 doge)。 吐槽的还不止一个。 网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是「性价比」,结果被人当场指出性价比不如对手,等于自砸招牌。 作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。 这对比,这落差,还有人记得大明湖畔的 Google Gemini 3? 实测派也来补刀。网友 Balder 更是直接开团: 这三个模型性能全比之前的 3.5 Flash 差。他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。 而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的「Cloud First」。

w | 此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。 简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。 这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子? 反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。
Current article:http://www.mengruanpianchengji.cyou/news/20260826_628722.htm
Published on:03:23:37