Google 在 Gemini 3.6 推出短短三星期後,隨即推出新一代 Gemini 3.7 Flash,DeepSWE 分數升至 65.3%,而開售價則較上一代發佈價削減一半,性價比明顯提升。3.6 相關報道
重點摘要
- Gemini 3.7 Flash 的 DeepSWE v1.1 分數升至 65.3%,Web 開發相關的 WebDev Arena Elo 亦提升至 1588。
- 優惠期內至 2026 年,收費為每 100 萬個輸入 token 0.75 美元、每 100 萬個輸出 token 3.75 美元。
- 模型正陸續登陸 Spark,並可於 Google 多個開發者及企業級 AI 產品中使用。
Gemini 3.7 快速登場
Google 於 8 月 13 日公布推出 Gemini 3.7 Flash,距離 Gemini 3.6 Flash 上線僅三星期。公司指,是次升級主要受開發者回饋及演算法調整推動,重點應用場景包括軟件工程、網頁開發及知識型工作,更新節奏明顯加快。
今次最大進帳在於編碼能力。DeepSWE v1.1 由 3.6 Flash 約 49% 一口氣升至 65.3%;FrontierCode 1.1 Main 亦由 34.4% 升至 43.6%。Web 開發方面,WebDev Arena 的 Elo 分數則由 1538 提升至 1588。
Google 表示,新模型「可以用更少提示,產出更可用的版面設計及功能完整的應用程式」。知識工作相關測試同樣有改善:GDP.pdf 由 22.0% 升至 34.0%,AutomationBench 由 17.0% 升至 30.4%。同時,Google 亦更新了安全防護,針對 CBRN(化學、生物、放射及核)濫用及網絡攻擊用途作出額外限制。
延伸閱讀:Anthropic 爭取 60 億美元 Decart 融資 備戰上市
AI 效能與成本表現
第三方測試結果與官方數據大致一致。法律科技公司 Harvey 應用研究主管 Niko Grupen 指出,在 Legal Agent Bench 測試中,Gemini 3.7 Flash 較 3.6 Flash 的「全通過」表現多出 2.6 個百分點。Nunu.ai 聯合創辦人 Kyrill Hux 則表示,其內部基準顯示,3.7 Flash 的表現已逼近中型 frontier 模型,但成本約為對方一半。
對需大量呼叫模型的代理(agents)而言,價格降低尤其關鍵,因為多輪規劃、工具調用及重試會快速推高開支。Google 指出,3.7 Flash 在跟隨指令方面更精準,亦更善於處理任務受阻情況,有望減少工程和業務流程中需要「人手收尾」的環節。該模型現已全面向客戶開放。
Gemini 3.6 Flash 於 7 月 21 日推出時,定價為每 100 萬個輸入 token 1.50 美元、每 100 萬個輸出 token 7.50 美元。
三星期後登場的 3.7 Flash,於今年 12 月 31 日前,價格分別下調至 0.75 及 3.75 美元,同時在多個基準測試上再進一步,並擴展至 Spark,供 AI Pro 及 Ultra 訂閱用戶使用。這次接連更新,進一步鞏固了 Google 在 Flash 系列上「快節奏小步快跑」的迭代策略。





