**谷歌(Google)**在 Gemini 3.6 发布仅三周后,就迅速推出 Gemini 3.7 Flash,新模型在 DeepSWE 测试中取得 65.3% 的成绩,首发定价仅为上一代发布价的一半。
要点速览:
- Gemini 3.7 Flash 在 DeepSWE v1.1 的得分提升至 65.3%,Web 开发场景的 Elo 评分升至 1588。
- 直至 2026 年,首发优惠价为:每 100 万输入 token 收费 0.75 美元,每 100 万输出 token 收费 3.75 美元。
- 模型正向 Spark 推出,并已整合进谷歌多款面向开发者与企业的 AI 产品矩阵。
Gemini 3.7 发布节奏创纪录
谷歌于 8 月 13 日正式宣布上线 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 发布仅三周。公司称,此次迭代主要由开发者反馈与算法更新驱动,重点瞄准软件工程、Web 开发和知识型工作等场景,发布节奏明显快于以往。
本轮升级在代码能力上的提升最为显著:DeepSWE v1.1 得分从 3.6 Flash 约 49% 拉升至 65.3%;FrontierCode 1.1 Main 从 34.4% 提升至 43.6%。Web 开发侧同样进步明显,WebDev Arena 的 Elo 分数从 1538 提升到 1588。
谷歌表示,新模型“能够用更少的提示词生成更可用的页面布局和功能完整的应用”。在知识工作相关基准上也有改善:GDP.pdf 得分从 22.0% 提升到 34.0%;AutomationBench 从 17.0% 升至 30.4%。同时,谷歌补充了针对 CBRN(化学、生物、放射与核)滥用以及网络攻防场景的更新安全防护。
延伸阅读:Anthropic Pursues A $6B Decart Deal While Preparing To Go Public
AI 性能与成本结构
外部测试也验证了类似的性能跃升。法律科技公司 Harvey 应用研究负责人 Niko Grupen 称,在 Legal Agent Bench 测试中,3.7 Flash 相比 3.6 Flash 的“全通过”(all-pass)表现提升了 2.6 个百分点。初创公司 Nunu.ai 联合创始人 Kyrill Hux 则表示,其内部评测显示,3.7 Flash 的整体表现已逼近中型前沿模型,但成本约为其一半。
对于需要高频调用模型的智能体(agents)和自动化应用而言,价格下探尤为关键:复杂任务往往需要多轮规划、频繁工具调用和重试,费用容易快速累积。谷歌称,3.7 Flash 在遵循指令和处理“卡壳”场景方面更为稳健,有望减少工程与业务流程中的人工干预。该模型目前已普遍开放使用。
作为对比,Gemini 3.6 Flash 于 7 月 21 日发布时,定价为每 100 万输入 token 1.50 美元、每 100 万输出 token 7.50 美元。
三周后亮相的 Gemini 3.7 Flash,将价格分别下调至 0.75 美元和 3.75 美元(优惠期至 12 月 31 日),同时在多项基准上刷新成绩,并登陆 Spark,为 AI Pro 和 Ultra 订阅用户开放。快速迭代进一步强化了谷歌在 Flash 系列上的加速更新节奏。
下篇推荐:Virtuals Protocol Trading Volume Explodes 180%, Bulls Eye $0.68





