**谷歌(Google)**在 Gemini 3.6 发布仅三周后就推出 Gemini 3.7 Flash,这一版本在 DeepSWE 测试中取得 65.3% 成绩,首发定价则较上一代上线价格直接腰斩。
要点概览
- Gemini 3.7 Flash 在 DeepSWE v1.1 上升至 65.3%,WebDev Arena Elo 提升至 1588。
- 2026 年底前首发价为:输入每 100 万 token 收费 0.75 美元,输出每 100 万 token 收费 3.75 美元。
- 新模型正向 Spark 推出,并已覆盖谷歌面向开发者与企业的多款 AI 产品。
Gemini 3.7 发布节奏再加速
谷歌于 8 月 13 日宣布推出 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 上线仅三周。公司表示,本次快速迭代主要源自开发者反馈与算法更新,重点场景锁定在软件工程、Web 开发以及知识工作,这一更新频率在业界相当罕见。
提升最明显的仍是编码能力:DeepSWE v1.1 分数攀升至 65.3%,相比 3.6 Flash 约 49% 的水平有大幅跃进;FrontierCode 1.1 Main 从 34.4% 提升到 43.6%。Web 开发方面也有进展,WebDev Arena Elo 从 1538 升至 1588。
谷歌称,新模型“能在更少提示下生成更可用的页面布局和功能完整的应用”。在知识工作相关基准上同样有改观:GDP.pdf 从 22.0% 提升到 34.0%,AutomationBench 从 17.0% 升至 30.4%。与此同时,谷歌更新了安全防护策略,加强对 CBRN(化学、生物、放射性与核)滥用及网络攻防场景的限制。
延伸阅读:Anthropic 追求 60 亿美元 Decart 融资交易,酝酿赴美上市
性能与成本:逼近中型前沿模型、价格约腰斩
外部测试也证实了类似的性能提升。法律科技公司 Harvey 应用研究负责人 Niko Grupen 表示,在 Legal Agent Bench 测试中,3.7 Flash 相比 3.6 Flash 的“全通过(all-pass)”表现提升 2.6 个百分点。Nunu.ai 联合创始人 Kyrill Hux 称,其内部基准显示 3.7 Flash 的整体表现已经逼近中型前沿模型,但成本约为后者的一半。
对于依赖大量自动化流程的 AI 代理,高频规划、工具调用与重试会迅速推高账单,因此价格下调尤为关键。谷歌表示,Gemini 3.7 Flash 在指令跟随、一致性和解题“脱坑”能力上更强,可在工程和业务流程中减少人工干预。模型现已全面开放使用。
定价方面,Gemini 3.6 Flash 于 7 月 21 日上线时,输入端按每 100 万 token 收费 1.50 美元,输出端则为 7.50 美元。
仅三周后,3.7 Flash 登场,同时将价格下调至输入 0.75 美元、输出 3.75 美元(每 100 万 token),优惠将持续至 12 月 31 日。伴随更好的基准表现,新版本也同步扩展至 Spark,为 AI Pro 和 Ultra 订阅用户提供支持,延续谷歌对 Flash 系列的“加速更新”节奏。





