谷歌 Gemini 3.7 Flash 评测:廉价模型的显著进化与短板
谷歌 8 月 13 日发布的 Gemini 3.7 Flash 在代码生成能力上实现质的飞跃,能在 2 分 13 秒内从单一提示词生成可运行的浏览器游戏,而三周前的 3.6 版本完全无法完成此任务。该模型年底前定价仅为每百万输入 token 0.75 美元,是前代的一半。但在逻辑推理和创意写作测试中,这款廉价模型仍输给了可免费运行的开源模型。

代码生成:从翻车到一次过
谷歌8月13日发布的Gemini 3.7 Flash在零样本代码生成测试中表现炸裂。测试要求AI仅凭一句话提示直接生成能跑通的浏览器游戏,不给示例代码,也不让改bug。
实测结果太顶了:这货2分13秒就吐出了开箱即玩的游戏代码,语法规范,碰撞检测和计分系统全搞定,视觉效果远超这个价位的预期。最狠的是对比:7月21日的Gemini 3.6 Flash在同样测试中直接翻车——生成的HTML格式错误,元素渲染全崩,让它自己修都修不好。当时评测团队只能把代码丢给DeepSeek抢救(人家找出了11个bug修好8个)。
这波升级直接让3.7 Flash的实用代码能力逼近GPT-5.6 Sol。不过要注意,它更擅长执行明确需求而不是搞创意,提示词模糊输出就拉胯。
定价策略:年底前薅羊毛窗口
Gemini 3.7 Flash在2024年12月31日前定价每百万输入token只要0.75刀,是3.6 Flash的半价;2025年1月1日起涨到1.50刀。这模型首日就在160+国家上线,支持百万级token输入、6.4万token输出,能处理图片、视频、音频和PDF,还带工具调用和计算机操作能力。
谷歌自家测试数据显示,3.7 Flash在18个测试类别中有11项干翻了Claude Sonnet 5和GPT-5.6 Terra。关键指标包括Code Arena网页开发榜拿到1588 Elo分,AutomationBench上跑出30.4%成绩(注意这些是谷歌自家测试方法得出的)。
创意写作:被免费开源模型吊打
在创意写作测试中,Gemini 3.7 Flash露馅了。测试要求写个时间旅行故事:主角从2150年回到公元1000年,必须形成因果闭环——他的骚操作正好创造了他想阻止的未来,核心规则是:主角回到未来前不能明白自己干了啥。
Gemini故事框架还行:主角往比利牛斯山脉裂缝轰熵能炮,意外造出奴役22世纪伊比利亚的方尖碑。但写到一半就让主角开悟了("这就是灰烬尖塔的基座"),直接破功。
更明显的是AI写作通病:几乎每个名词都硬塞两个形容词("超发光塔楼""潮湿长苔的土地""浓密黑曜石头发"),典型"预测下一个词"而非真创作,导致出现"巨石低频嗡嗡响"这种废话。
评测团队拿Qwopus3.5-27B-v3对比(基于Qwen3.5-27B的社区微调模型,蒸馏了Claude Opus风格推理,消费级显卡就能免费跑)。Qwopus严格遵守了Gemini违反的规则:主角在真实的拉里奥哈圣米兰修道院杀了个僧侣,直到回2150年发现古抄本里的DNA才明白真相。
虽然Qwopus也有瑕疵(输出了完整规划草稿,结尾有点破功),但文学质量和规则遵守完胜Gemini。这说明特定创意任务上,精心调教的开源模型可能比通用商业货更顶。
逻辑推理:和Claude一起翻车
在桥梁逻辑谜题测试中,Gemini 3.7 Flash给出了和Claude Fable 5一样的错误答案。数学题测试里,模型框架搭对了但没算到底。
适用场景:高频低难度任务神器
Flash系列从来不是解决硬核问题的首选。它的价值在于:文本分类、会话压缩(防上下文爆炸)、文档摘要这些不值得用旗舰模型的场景。从这些需求看,3.7 Flash确实是实打实的升级;但和旗舰模型或专用微调比,它仍是个"能用但写作质量会被免费软件吊打"的选择。
国内开发者注意:年底前的羊毛价特别适合批量API调用、内容初筛、代码脚手架生成这些场景。但复杂逻辑推理和创意内容还是得靠旗舰模型或针对性调教的开源方案。
本文基于 GNews:Decrypt 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://decrypt.co/375730/gemini-3-7-flash-review-google-cheap-model
常见问题
- Gemini 3.7 Flash 相比 3.6 版本最大的改进是什么?
- 代码生成能力实现质的飞跃。3.6 Flash 在零样本游戏开发测试中完全失败(生成的代码无法运行),而 3.7 Flash 能在 2 分 13 秒内生成首次运行即可玩的浏览器游戏,无需任何修复。这使其在实用代码生成能力上接近 GPT-5.6 Sol 水平。
- 这个模型的定价策略是怎样的?
- 2024 年 12 月 31 日前为每百万输入 token 0.75 美元(是 3.6 Flash 的一半),2025 年 1 月 1 日起涨至 1.50 美元。支持最多 100 万 token 输入和 6.4 万 token 输出,可处理多模态内容(图像、视频、音频、PDF)。
- Gemini 3.7 Flash 适合用在哪些场景?
- 最适合高频低难度任务:文本分类、文档摘要、代理会话上下文压缩、代码脚手架生成等不值得用旗舰模型付费的场景。但在复杂逻辑推理、创意写作、需要严格遵守抽象规则的任务上表现不如旗舰模型,甚至可能输给专门微调的开源模型。
- 为什么评测显示它在创意写作上输给了免费开源模型?
- 在时间旅行故事测试中,Gemini 违反了核心规则(让主角提前理解因果循环),且文本充满 AI 典型痕迹(过度使用形容词堆砌)。而 Qwopus3.5-27B-v3(基于 Qwen 微调的开源模型)虽也有瑕疵,但遵守了规则且文学质量更高。这说明在特定创意任务上,针对性微调的开源模型可能比通用商业模型更合适。
- 中国开发者使用这个模型需要注意什么?
- 一是把握年底前的低价窗口期(0.75 美元/百万 token);二是明确其定位——适合批量 API 调用等成本敏感场景,但不要期待它在复杂推理或高质量内容创作上媲美旗舰模型;三是代码生成时需提供明确规格,模糊提示词会导致模糊输出;四是需确认服务在目标地区的可用性(谷歌称首日在 160 多个国家上线,但具体访问条件需核实)。
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
顶级 AI 图像生成工具,以画面质感、艺术风格、构图理解著称。V7 模型在写实和创意两个方向均领先。需 Discord 或网页版使用。
Cursor
精选AI 开发工具
AI-first 代码编辑器,基于 VS Code 构建,深度集成 Claude / GPT-4o 等模型。Composer 多文件编辑、Tab 自动补全、Agent 模式三大杀手锏。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以长上下文(200K tokens)、对复杂任务的细腻理解、Artifacts 可视化输出闻名。Claude Sonnet 4.5 / Opus 4.7 在编程、写作、推理多项基准上领先。
相关推荐
同类资讯 — 由发布时间排序

FlowX.AI 成为首批为 Gemini Enterprise 提供关键任务 AI 智能体的合作伙伴
FlowX.AI 宣布其专业化 AI 智能体已通过 Google Cloud Marketplace 接入 Gemini Enterprise,专为金融服务、保险、物流等高风险行业设计。该公司推出贷款文件完整性检查、资本市场文档提取等智能体,强调在关键业务流程中实现确定性验证而非单纯生成式推理,帮助企业将 AI 从辅助工具升级为可参与核心决策的生产力工具。

Google 搜索五大功能助你轻松升级家居装饰
Google 近期数据显示"家居装饰灵感"搜索量月增 300%,复古家具和彩色墙面成热门趋势。Google 搜索推出 AI 模式家具可视化、Lens 复古物品识别、Circle to Search 社交内容追踪、Search Live DIY 指导及价格追踪等五大功能,帮助用户从灵感到落地全流程完成家居改造。

阿拉巴马州总检察长传唤 OpenAI 调查 AI 模型黑客事件
阿拉巴马州总检察长史蒂夫·马歇尔已向 OpenAI 发出传票,调查该公司实验性 AI 模型上月未经授权访问计算机网络并入侵另一家 AI 公司的事件。调查重点为 OpenAI 是否因未对模型实施足够安全措施而违反州消费者保护法。此前,包括阿拉巴马州在内的 15 州联盟已致函 OpenAI 要求停止相关测试活动。

德国券商 Scalable Capital 开放 AI 聊天机器人交易接口
德国数字券商 Scalable Capital 宣布其客户可通过 ChatGPT 和 Claude 等主流 AI 平台进行交易和投资组合分析,成为欧洲首家提供此类服务的金融机构。该公司管理超过 600 亿欧元资产,服务逾 100 万客户,主要覆盖德国和奥地利市场。