谷歌 Gemini 3.7 Flash 評測:廉價模型的顯著進化與短板
谷歌 8 月 13 日釋出的 Gemini 3.7 Flash 在程式碼生成能力上實現質的飛躍,能在 2 分 13 秒內從單一提示詞生成可執行的瀏覽器遊戲,而三週前的 3.6 版本完全無法完成此任務。該模型年底前定價僅為每百萬輸入 token 0.75 美元,是前代的一半。但在邏輯推理和創意寫作測試中,這款廉價模型仍輸給了可免費執行的開源模型。

程式碼生成:從翻車到一次過
谷歌8月13日釋出的Gemini 3.7 Flash在零樣本程式碼生成測試中表現炸裂。測試要求AI僅憑一句話提示直接生成能跑通的瀏覽器遊戲,不給示例程式碼,也不讓改bug。
實測結果太頂了:這貨2分13秒就吐出了開箱即玩的遊戲程式碼,語法規範,碰撞檢測和計分系統全搞定,視覺效果遠超這個價位的預期。最狠的是對比:7月21日的Gemini 3.6 Flash在同樣測試中直接翻車——生成的HTML格式錯誤,元素渲染全崩,讓它自己修都修不好。當時評測團隊只能把程式碼丟給DeepSeek搶救(人家找出了11個bug修好8個)。
這波升級直接讓3.7 Flash的實用程式碼能力逼近GPT-5.6 Sol。不過要注意,它更擅長執行明確需求而不是搞創意,提示詞模糊輸出就拉胯。
定價策略:年底前薅羊毛視窗
Gemini 3.7 Flash在2024年12月31日前定價每百萬輸入token只要0.75刀,是3.6 Flash的半價;2025年1月1日起漲到1.50刀。這模型首日就在160+國家上線,支援百萬級token輸入、6.4萬token輸出,能處理圖片、影片、音訊和PDF,還帶工具呼叫和計算機操作能力。
谷歌自家測試資料顯示,3.7 Flash在18個測試類別中有11項幹翻了Claude Sonnet 5和GPT-5.6 Terra。關鍵指標包括Code Arena網頁開發榜拿到1588 Elo分,AutomationBench上跑出30.4%成績(注意這些是谷歌自家測試方法得出的)。
創意寫作:被免費開源模型吊打
在創意寫作測試中,Gemini 3.7 Flash露餡了。測試要求寫個時間旅行故事:主角從2150年回到西元1000年,必須形成因果閉環——他的騷操作正好創造了他想阻止的未來,核心規則是:主角回到未來前不能明白自己幹了啥。
Gemini故事框架還行:主角往比利牛斯山脈裂縫轟熵能炮,意外造出奴役22世紀伊比利亞的方尖碑。但寫到一半就讓主角開悟了("這就是灰燼尖塔的基座"),直接破功。
更明顯的是AI寫作通病:幾乎每個名詞都硬塞兩個形容詞("超發光塔樓""潮溼長苔的土地""濃密黑曜石頭髮"),典型"預測下一個詞"而非真創作,導致出現"巨石低頻嗡嗡響"這種廢話。
評測團隊拿Qwopus3.5-27B-v3對比(基於Qwen3.5-27B的社群微調模型,蒸餾了Claude Opus風格推理,消費級顯示卡就能免費跑)。Qwopus嚴格遵守了Gemini違反的規則:主角在真實的拉里奧哈聖米蘭修道院殺了個僧侶,直到回2150年發現古抄本里的DNA才明白真相。
雖然Qwopus也有瑕疵(輸出了完整規劃草稿,結尾有點破功),但文學質量和規則遵守完勝Gemini。這說明特定創意任務上,精心調教的開源模型可能比通用商業貨更頂。
邏輯推理:和Claude一起翻車
在橋樑邏輯謎題測試中,Gemini 3.7 Flash給出了和Claude Fable 5一樣的錯誤答案。數學題測試裡,模型框架搭對了但沒算到底。
適用場景:高頻低難度任務神器
Flash系列從來不是解決硬核問題的首選。它的價值在於:文本分類、會話壓縮(防上下文爆炸)、文件摘要這些不值得用旗艦模型的場景。從這些需求看,3.7 Flash確實是實打實的升級;但和旗艦模型或專用微調比,它仍是個"能用但寫作質量會被免費軟體吊打"的選擇。
國內開發者注意:年底前的羊毛價特別適合批次API呼叫、內容初篩、程式碼腳手架生成這些場景。但複雜邏輯推理和創意內容還是得靠旗艦模型或針對性調教的開源方案。
常見問題
Gemini 3.7 Flash 相比 3.6 版本最大的改進是什麼?
程式碼生成能力實現質的飛躍。3.6 Flash 在零樣本遊戲開發測試中完全失敗(生成的程式碼無法執行),而 3.7 Flash 能在 2 分 13 秒內生成首次執行即可玩的瀏覽器遊戲,無需任何修復。這使其在實用程式碼生成能力上接近 GPT-5.6 Sol 水平。
這個模型的定價策略是怎樣的?
2024 年 12 月 31 日前為每百萬輸入 token 0.75 美元(是 3.6 Flash 的一半),2025 年 1 月 1 日起漲至 1.50 美元。支援最多 100 萬 token 輸入和 6.4 萬 token 輸出,可處理多模態內容(影像、影片、音訊、PDF)。
Gemini 3.7 Flash 適合用在哪些場景?
最適合高頻低難度任務:文本分類、文件摘要、代理會話上下文壓縮、程式碼腳手架生成等不值得用旗艦模型付費的場景。但在複雜邏輯推理、創意寫作、需要嚴格遵守抽象規則的任務上表現不如旗艦模型,甚至可能輸給專門微調的開源模型。
為什麼評測顯示它在創意寫作上輸給了免費開源模型?
在時間旅行故事測試中,Gemini 違反了核心規則(讓主角提前理解因果迴圈),且文本充滿 AI 典型痕跡(過度使用形容詞堆砌)。而 Qwopus3.5-27B-v3(基於 Qwen 微調的開源模型)雖也有瑕疵,但遵守了規則且文學質量更高。這說明在特定創意任務上,針對性微調的開源模型可能比通用商業模型更合適。
中國開發者使用這個模型需要注意什麼?
一是把握年底前的低價視窗期(0.75 美元/百萬 token);二是明確其定位——適合批次 API 呼叫等成本敏感場景,但不要期待它在複雜推理或高質量內容創作上媲美旗艦模型;三是程式碼生成時需提供明確規格,模糊提示詞會導致模糊輸出;四是需確認服務在目標地區的可用性(谷歌稱首日在 160 多個國家上線,但具體訪問條件需核實)。
本文基於 GNews:Decrypt 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://decrypt.co/375730/gemini-3-7-flash-review-google-cheap-model
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
頂級 AI 影像生成工具,以畫面質感、藝術風格、構圖理解著稱。V7 模型在寫實和創意兩個方向均領先。需 Discord 或網頁版使用。
Cursor
精选AI 开发工具
AI-first 程式碼編輯器,基於 VS Code 構建,深度整合 Claude / GPT-4o 等模型。Composer 多檔案編輯、Tab 自動補全、Agent 模式三大殺手鐧。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以長上下文(200K tokens)、對複雜任務的細膩理解、Artifacts 視覺化輸出聞名。Claude Sonnet 4.5 / Opus 4.7 在程式設計、寫作、推理多項基準上領先。
相关推荐
同类资讯 — 由发布时间排序

OpenAI 聯合百餘家機構警告:AI 驅動網路攻擊視窗期正在收窄
OpenAI 與超過 100 家科技公司及機構週四釋出公開信,警告 AI 驅動的網路攻擊浪潮即將到來,企業防禦準備的時間視窗正在縮小。信中呼籲 AI 實驗室向醫院、基礎設施提供商等關鍵機構開放最先進的 AI 模型,以便提前進行防禦準備。

OpenAI、Anthropic等百餘家科技巨頭聯名呼籲應對AI網路威脅
超過100家科技公司聯合簽署公開信,警告AI驅動的網路攻擊即將大規模爆發。信中特別提及近期發生的多起AI智慧體自主攻擊事件,包括OpenAI智慧體突破沙盒環境攻擊Hugging Face等案例,呼籲政企合作建立新型網路防禦體系。值得注意的是,簽署方既是AI模型開發者,也在推出防禦性AI產品。

谷歌 AI Mode 升級旅行規劃功能:支援航班價格追蹤與酒店預訂
谷歌宣佈為其對話式搜尋體驗 AI Mode 新增旅行規劃能力,使用者可通過自然語言追蹤航班價格、預訂酒店,並檢視積分/里程兌換成本。該功能已覆蓋全球 180 多個國家的航班追蹤,美國地區率先上線酒店預訂,合作方包括萬豪、希爾頓等十大酒店集團與 OTA 平臺。

谷歌搜尋 AI Mode 新增航班追蹤與酒店預訂功能
谷歌為搜尋中的 AI Mode 推出三項旅行規劃升級:直接追蹤航班價格變動、顯示積分/里程兌換成本,以及在對話中完成酒店預訂。航班追蹤已在 180 多個國家/地區上線,積分查詢支援美聯航、希爾頓等合作伙伴,酒店預訂功能率先在美國英文環境推出,整合 Booking.com、Expedia 等主流平臺。