2026 年 8 月 13 日,谷歌发布 Gemini 3.7 Flash,距离上一代 3.6 Flash 只有三周。放在一年前,大模型厂商以季度甚至半年为周期发版还是行业常态;而如今,Flash 产品线已经跑出了接近“月更”的节奏。这一次发布的意义远不止数字上的进步——它是谷歌在中端模型战场上的一次明确表态:与其等旗舰 Pro 慢工出细活,不如让 Flash 快速迭代,用速度和价格抢占开发者心智。
一、三周迭代,不是挤牙膏,是换引擎
先看谷歌自己公布的基准数据。FrontierCode 1.1 Main 从 34.4% 升至 43.6%,提升 9.2 个百分点;DeepSWE v1.1 从 49.0% 升至 65.3%,大涨 16.3 个百分点。更值得注意的是另外两组数字:测试多步业务工作流的 AutomationBench 从 17.0% 翻到 30.4%,几乎翻倍;复杂文档理解的 GDP.pdf 从 22.0% 升至 34.0%。这些基准的共同点是它们都指向“真实世界的脏活”:跨多文件的软件工程任务、需要长链路工具调用的业务流程、包含表格和版式的复杂文档。这与 3.6 Flash 主打“更便宜地做同样的事”形成鲜明对比——3.7 Flash 的核心叙事变成了“做更多的事,做得更好,同时还更便宜”。
模型卡里还有几项公告中没有的高亮数字:GDM-MRCR v2(长上下文)达到 97.0%,Terminal-bench 2.1 达到 85.8%,OSWorld-2.0(计算机操作)47.9%。但同一张卡上,难度更高的 Terminal-bench 3.0 只有 14.9%。同一家模型、同一类任务,不同版本的榜单分数可以相差五倍以上——这提醒我们,引用基准数字时必须连“哪个榜单版本”一起引用,否则很容易被单一数字误导。
二、5 折定价:不是促销,是成本结构宣言
3.7 Flash 的输入定价为 0.75 美元/百万 token,输出 3.75 美元/百万 token,到 2026 年 12 月 31 日截止;2027 年 1 月 1 日起恢复 1.50/7.50 美元。表面看这是一次限时促销,但把它放进 Agent 工作流的成本模型里,意义完全不同。
Agent 类应用的特点是“循环调用”:一个编码助手在完成一个仓库级任务时,往往要连续执行数十乃至上百次工具调用。每一次调用都包含输入上下文、输出结果和思考 token。在这样的结构里,决定总成本的不是单次输出的峰值质量,而是“每完成任务所需的 token 总量”乘以“每 token 单价”。谷歌强调 3.7 Flash 在遇到障碍时会更频繁地检查已完成的工作、更善于澄清意图而非盲目执行、按指令的忠实度更高——这些特性翻译成成本语言,就是“更少无效重试、更少整轮重启”。假设一次多步任务在 3.6 上平均需要 15 轮调用才能完成,在 3.7 上只需要 10 轮,那么即便单价不变,单任务的 token 消耗也下降了三分之一;再加上 5 折的价格,实际单任务成本可能只有上一代的四成左右。这正是谷歌在公告中暗示的“按任务成本取胜”策略——不再跟你比谁的榜单分高,而是比谁的 Agent 跑一遍活更省钱。
独立机构 Artificial Analysis 的数据提供了另一个参照:3.7 Flash 在智能指数上得 56 分(比 3.6 高 4 分),但输出速度约 340 token/秒,在 186 个模型中排名第一。速度本身不是能力,但对于高频调用的 Agent 循环,吞吐量直接决定延迟与并发上限。
三、中端战场的牌桌:Flash 面对谁?
把 3.7 Flash 放进当前中端模型的价格—性能坐标系里,竞争格局非常清晰。Claude Sonnet 5 在 FrontierCode 上得 42.7%、DeepSWE 53.8%,输入定价 2.00 美元;GPT-5.6 Terra 在 DeepSWE 上以 69.6% 领先,输入同为 2.00 美元。也就是说,3.7 Flash 以不到对手四成的输入价格,在 FrontierCode 上反超两者,在 DeepSWE 上超过 Sonnet 5、但仍落后 Terra 约 4 个百分点。而 DeepSeek V4-Flash 以 0.14 美元的输入价格继续占据性价比底端。
这组对比透露了两个趋势。第一,中端模型的能力差距正在被压缩到“个位数百分点”的区间,单纯靠跑分已经很难建立壁垒,价格和迭代速度成为新的区分维度。第二,OpenAI 的“Ultrafast”模式(GPT-5.6 Sol 最高提速 14 倍)与谷歌的 Flash 快速迭代,本质上都在回答同一个问题:在延迟敏感和成本敏感的 Agent 场景里,旗舰大模型太重了,真正的生产主力应该是又快又便宜的中端模型。值得玩味的是,3.7 Flash 发布时,Gemini 3.5 Pro 仍在延期——谷歌押注 Flash 作为“真正生产线”的姿态已经非常明显。
四、对开发者与企业的实际影响
对已经跑在 3.6 Flash 上的团队,升级路径表面顺畅:同一套 API 面、更好的数字、年底前更低的价格。但真正的迁移成本在于验证——原有提示词、工具 schema 和评测集是否能适配一个“更擅长多步指令”的新模型。为 3.6 的薄弱规划能力做的各种“硬编码补丁”,可能在 3.7 上不但多余,反而碍事。更根本的问题是工程策略:当模型以月度为单位更新,团队应该锁定版本按季度复审,还是持续跟随最新版?答案没有标准解,但至少可以确定,任何依赖单一基准快照做的技术选型,保质期都只有几周。
五、冷静面:工作机不是万能机
最后必须给这轮热度降温。65.3% 的 DeepSWE 意味着大约每三个真实软件工程任务就有一个失败;30.4% 的 AutomationBench 意味着七成多步自动化任务仍无法完成。它是一台出色的“工作马”,但不是“奇迹机器”。对于后果严重的业务场景,权限控制、人工监督和回滚机制依然不可或缺——这一点,随着 Agent 自主性越来越强,反而变得更加重要。
三周迭代让“上周的榜单冠军”随时可能被替换。对开发者而言,这既是红利也是挑战:模型层正在变成快消品,而真正的护城河,将越来越多地转移到评测体系、工作流封装与成本工程上。
本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理