📖 文章导读:
三周两更,谷歌把 Gemini 3.7 Flash 端了上来。不仅 API 价格腰斩,更以“主力工作模型”自居,轻量级模型能否承担旗舰职能?本期实测表明,3.7 Flash 在速度与成本上极具竞争力,是高频生产任务的实用派首选,但工程深度与精度仍有明显上限。
8 月 13 日,Gemini 3.7 Flash 正式发布。距离 Gemini 3.6 Flash 上线不过三周,谷歌这次不仅将编程、网页开发、复杂文档处理和企业工作流的能力做了升级,还直接把年底前的 API 价格砍到了原价的一半:输入每百万 Token 0.75 美元、输出 3.75 美元。

提到 Gemini Flash,大家第一反应往往是轻量和低价。然而到了 3.7,谷歌已经开始把它往主力工作模型方向靠拢,尤其是编码、网页开发和 Agent。官方甚至直接把它称为“迄今最智能的 workhorse model”。这也让 Gemini 3.7 Flash 更具讨论度:它到底还是一个主打性价比的 Flash,还是已经开始接管原本属于 Pro 的任务了?
一表速览谷歌 Flash 模型定位
| 模型 | 定位 | 适配场景 |
|---|---|---|
| Gemini 3.5 Flash | 轻量、快速、性价比 | 日常问答、批量调用、轻量任务 |
| Gemini 3.6 Flash | 平衡性能与成本 | 编程、Agent、多步骤任务 |
| Gemini 3.7 Flash | Workhorse 主力模型 | 编程、Web开发、复杂知识工作、Agent |
3.7 Flash 核心升级点
- 编码与 Agent 能力飞升 FrontierCode(生产级代码)跃升至 43.6%,DeepSWE v1.1(长时程软件工程)从 49% 飙至 65.3%,涨幅超 34%;在模拟企业自动化场景的 AutomationBench-AA 中得分 30.4%,领先于 Kimi K3 和 GPT-5.6 Sol。
- 网页开发与 UI 还原度领先 WebDev Arena Elo 分达到 1588,超越 Claude Sonnet 5 和 GPT-5.6 Terra,能以更少提示生成布局完善、功能完整的交互页面。
- 速度与成本的帕累托最优 高推理模式下,Artificial Analysis 智能指数 56 分,同时输出速度约 340 token/秒,是 GPT-5.6 Terra 的近 3 倍;平均每任务耗时 1.7 分钟,且单任务成本仅 $0.40(高推理),比 3.6 低 30%,并支持三档推理强度灵活切换,在“智能-时间”和“智能-成本”双前沿上站稳脚跟。


Pro 缺席,争议随之而来
在 Flash 三周两更的极速迭代背后,是 Gemini 3.5 Pro 的杳无音讯。
这也是 Gemini 3.7 Flash 发布后最值得讨论的问题:如果 Flash 已经开始承担越来越多的编程、复杂推理和 Agent 工作,那么 Pro 还剩下多少存在感?
尤其是在 OpenAI、Anthropic 等竞争对手持续强化旗舰模型的同时,谷歌的 Pro 系列却仍停留在 3.1 版本。一边是旗舰模型迟迟交不出答卷,一边是 Flash 以闪电般速度的迭代,这很难不让人怀疑谷歌是不是在用 Flash 填补 Pro 留下的空档。评论界也存在普遍担忧:当轻量级产品开始吞噬 Pro 的职能,谷歌是否在牺牲长期上限换取短期声量?以及,当 Flash 已经足够强、足够快,还足够便宜,谷歌究竟还需要一个什么样的 Pro,才能重新拉开两者之间的差距?
榜单排名

目前在 Artificial Analysis 排名第 16.
用户评价

说到底,3.7 Flash 到底是个稳步前进的实用派,还是一次原地踏步的凑数发布?本期文章,302.AI 将综合多维度实测揭晓其真正实力。
1. Gemini 3.7 Flash 模型基础信息
(1)实测模型在 302.AI 的价格:
| 模型名称 | 上下文 | 302.AI内的价格 |
|---|---|---|
| gemini-3.7-flash | 1000000 | 输入 $0.75 / 1M tokens输出 $3.75 / 1M tokens |
| grok-4.6 | 500000 | 输入 $2 / 1M tokens输出 $6 / 1M tokens |
(2)测评目的:
本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。
(3)测评方法:
本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。
题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0
💡记分规则:
按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。
(4)测评工具:
- 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
- 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒
编程案例分数评级:
⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。
⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。
⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。
⭐⭐及以下 C级(不合格): 不可用,存在明显问题。
2. Gemini 3.7 Flash 测试结果总览
302.AI 多模态模型测评分数榜单:

3. Gemini 3.7 Flash 案例展示
案例 1:多模态逻辑推理
提示词:观察规律,推测以下序列中的下一个符号是什么?
答案:数字 6
解析:这是一个序列 1、2、3、4、5……,所有数字都与其镜像相连。

Gemini 3.7 Flash:识别推理正确

Grok 4.6:识别推理错误

案例 2:程序化 SVG 图形生成
绘制一幅松鼠在树枝之间跳跃的svg动态图
Gemini 3.7 Flash 输出效果:

Grok 4.6 输出效果:

绘制一幅渔夫抛出鱼竿垂钓的svg动态图
Gemini 3.7 Flash 输出效果:

Grok 4.6 输出效果:

简评:
Grok 4.6 的输出效果在图形复杂度和动态表现质量上都略优于 Gemini 3.7 Flash.
| 测评点 | Gemini 3.7 Flash | Grok 4.6 |
| 语义表达准确度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 图形构造复杂度 | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 动态实现质量 | ⭐⭐ | ⭐⭐⭐ |
案例 3:Three.js 3D 微型工厂模拟
Create a polished single-page 3D animation using Three.js.
Build a miniature automated factory on a clean tabletop, with a conveyor belt, robotic arm, rotating gears, processing machine, input/output trays, and small colorful products.
The factory should run automatically in a continuous production cycle: products enter the conveyor → move to the processing machine → the robotic arm picks and places them → the machine processes them with moving mechanical parts → finished products return to the conveyor → move to the output tray.
Focus on detailed procedural 3D modeling, realistic mechanical movement, spatial relationships, and visual polish. Use beveled geometry, metallic/plastic/rubber/glass materials, soft studio lighting, shadows, and a clean light-colored background. Avoid making the scene look like simple primitive shapes.
Use only Three.js-generated geometry; no external 3D models. Add Play/Pause/Replay controls, mouse-drag camera rotation, and scroll zoom. Keep the animation smooth, responsive, and continuously looping.
Gemini 3.7 Flash 输出效果:
完整网页:https://71ce19c3.302ai.app
录屏展示:
简评:
✅ 核心优势:
- UI 设计更精致,包含实时状态面板,以及相机角度调节、倍速调节等功能;
- 动画表现更具”表演性”,产品有从毛坯到成品的视觉变化。
❌ 不足之处:
- 使用 CDN script 标签引入,缺少对现代 Three.js 特性,几何体精度相对粗糙,边缘生硬;
- 代码结构较为平铺,模块化程度低,可维护性弱。
Grok 4.6 输出效果:
完整网页:https://s6zdglc6kz.302ai.app
录屏展示:
简评:
✅ 核心优势:
- 使用 ES Module 方式引入Three.js,符合现代前端开发规范,代码结构清晰,模块化程度高;
- 材质系统更精致,材质库涵盖金属、橡胶、玻璃、橡胶等。
❌ 不足之处:
- 场景复杂度相对较低,视觉风格偏实用主义,缺乏冲击力;
- 缺少实时状态反馈,控制面板功能相对薄弱。
| 测评点 | Gemini 3.7 Flash | Grok 4.6 |
| 视觉与交互 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 技术实现 | ⭐⭐ | ⭐⭐⭐ |
| 功能与内容完整性 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
案例 4:小球倾倒动画模拟
Create a single-page HTML 3D animation using Three.js.
Build a clean product-style scene with a transparent rectangular box containing about 30 colorful balls.
Animation:
1. The box slowly tilts to one side, causing the balls to fall out naturally.
2. The balls roll, bounce, and collide with each other and the ground.
3. After a short pause, the balls gradually roll back toward the box.
4. The balls enter the box and settle back inside.
5. The animation then loops.
Requirements:
- Use Three.js and JavaScript.
- Simulate basic gravity, velocity, collision, bouncing, and friction.
- Avoid balls passing through each other, the box, or the ground.
- The balls should have natural physical movement rather than simply following predefined paths.
- Add soft lighting, shadows, and a clean light-colored background.
- Add Play / Replay controls.
- Allow mouse drag to rotate the camera and scroll to zoom.
- Make the layout responsive.
Focus on realistic physics and smooth transitions. Avoid clipping, floating, teleportation, or obviously scripted-looking movement.
Gemini 3.7 Flash 输出效果:
完整网页:https://2ec16f62.302ai.app
录屏展示:
简评:
✅ 核心优势:
- 纯 JavaScript 实现物理模拟,不依赖任何外部物理库,加载速度快;
- 物理阶段划分明确,阶段信息实时反馈到 UI。
❌ 不足之处:
- 物理模拟精度有限,碰撞检测不精确,可能导致小球出现穿透或粘滞;
- 回流机制略显脚本化,缺少物理引擎中约束的概念,小球回流轨迹可能不够自然。
Grok 4.6 输出效果:
完整网页:https://kzc759xgn2.302ai.app
录屏展示:
简评:
✅ 核心优势:
- 产品级 UI 呈现,3D 表现相当出色,玻璃材质逼真,整体光照模拟十分自然;
- 物理真实感极强,使用 Cannon-es 物理引擎,碰撞、摩擦、堆叠效果真实可靠;
- 代码结构模块化,逻辑分离且有调试工具,适合长期项目。
❌ 不足之处:
- 使用完整的 Cannon-es 物理引擎和多材质球体,性能开销较大。
| 测评点 | Gemini 3.7 Flash | Grok 4.6 |
| 视觉与交互 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 技术实现 | ⭐⭐ | ⭐⭐⭐⭐⭐ |
| 功能与内容完整性 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
4. Gemini 3.7 Flash 模型实测结论

结合实测体验来看,Gemini 3.7 Flash 虽还未呈现出碾压竞品的惊艳感,但在轻量级模型的赛道中,它的确也具备领先的响应速度、低价的调用成本以及稳定的发挥。
1. 优势:综合能力稳定,速度与性价比突出
综合多方面实测可以明显感知到,Gemini 3.7 Flash 具备较为均衡的整体能力。逻辑推理、多模态理解、编程、网页开发、Agent 等任务,它基本都能覆盖,而且面对复杂任务的稳定性较上一代有所提升。从官方提供的跑分数据也能看出,DeepSWE v1.1 从 49% 提升到 65.3%,WebDev Arena 也来到 1588,这些提升与实测体感基本一致。
而极速响应也极大提升了使用体验。约 340 token/秒的输出速度,在实际使用时有很强的存在感。无论是普通问答、代码生成,还是需要不断修改和重新生成的 Vibe Coding 场景,更短的等待时间都会直接改善交互体验。对于 Agent 任务来说,更快的输出速度还会进一步压缩整个任务链的执行时间。再加上目前 0.75 美元/百万输入 Token、3.75 美元/百万输出 Token的价格,3.7 Flash 在能力—速度—成本这组三角关系里确实找到了一个不错的平衡点。
简单来说,3.7 Flash 的优势并非某一项能力特别出挑,而是在几个关键指标上都没有明显参差。
2. 劣势:完成度仍有短板,能力上限明显
3.7 Flash 的能力上限也同样清晰。将测试从能否完成推进到细节打磨的高度,模型与高阶竞品之间的差距就会逐渐显现。例如在 Three.js 的实测案例中,模型能将场景、交互和功能基本能够搭起来,但在代码工程性、物理模拟精度以及部分视觉细节上,仍有较大提升空间。
这也侧面说明了 3.7 Flash 目前更擅长快速拆解一个复杂任务并交付结果,但在一些需要长期工程经验、复杂约束或者极高视觉完成度的任务里,仍然容易出现基本成型,精度不足的情况。
因此,对于特别依赖代码质量、物理真实性或者视觉表现的任务,3.7 Flash 与那些具备一定性价比的高阶模型之间依然存在选择空间。
3. 适用场景:高频生产任务更能发挥优势
综合来看,3.7 Flash 更适合作为一个务实的选择。
对于 Vibe Coding、网页开发、脚本编写、复杂信息整理、Agent 工作流以及各种高频 API 调用这类任务,模型不需要每一次都触及绝对能力上限,而是需要响应快、执行稳、价格合理,同时覆盖足够广的任务类型。3.7 Flash 恰好具备这些条件。
然而对于复杂工程问题,或是特别强调视觉创作、动画细节和代码架构的高精度任务,旗舰级模型依然更具优势。
常见问题 FAQ
Q1:Gemini 3.7 Flash 是什么?和 Gemini 3.6 Flash 有什么区别?
Gemini 3.7 Flash 是 Google 推出的新一代 Flash 系列模型,定位从轻量快速模型进一步升级为主力工作模型。与 Gemini 3.6 Flash 相比,3.7 Flash 重点提升了编码、网页开发、复杂文档处理和 Agent 能力,同时将 API 价格降至原价的一半。根据 302.AI 实测,它在 FrontierCode、DeepSWE v1.1 和 AutomationBench-AA 等任务上进步明显,适合高频生产任务、代码生成和企业自动化场景。
Q2:Gemini 3.7 Flash 的速度有多快?
Gemini 3.7 Flash 的输出速度约为 340 Token/s,在高推理模式下仍保持很快的响应速度,约为 GPT-5.6 Terra 的 3 倍。文章实测显示,其平均每个任务耗时约 1.7 分钟。对于代码生成、批量摘要、网页迭代和自动化处理等高频任务,速度优势可以显著减少等待时间。
Q3:Gemini 3.7 Flash 的 Agent 和编程能力如何?
Gemini 3.7 Flash 的 Agent 与编程能力是本次升级的重点。FrontierCode 生产级代码得分提升至 43.6%,DeepSWE v1.1 长时程软件工程得分从 49% 提升至 65.3%,AutomationBench-AA 得分达到 30.4%。它适合代码生成、网页开发、复杂文档处理、企业自动化和多步骤任务,但在极复杂工程任务的细节打磨上仍不如顶级 Pro 或旗舰模型。
Q4:Gemini 3.7 Flash 的价格是多少?
在 302.AI 平台,Gemini 3.7 Flash 的价格为输入 $0.75/百万 Token、输出 $3.75/百万 Token。相比上一代及同档模型,价格明显下降。高推理模式下单任务成本约为 $0.40,适合需要频繁调用模型的代码审查、批量处理、Agent 自动化和内容生产场景。具体价格以 302.AI API 超市当前页面为准。
Q5:Gemini 3.7 Flash 支持哪些推理强度?
Gemini 3.7 Flash 支持三档推理强度,用户可以在智能水平、响应速度和成本之间进行权衡。简单任务可以使用较低推理强度以获得更快响应;复杂代码、长文档和 Agent 任务则可以提高推理强度,以换取更完整的分析和更高的任务成功率。这种灵活配置是它适合作为日常主力模型的重要原因。
Q6:Gemini 3.7 Flash 擅长哪些场景?
根据 302.AI 实测,Gemini 3.7 Flash 主要适合四类场景:1)多模态逻辑推理;2)程序化 SVG 图形生成;3)Three.js 3D 微型工厂模拟;4)小球倾倒等物理动态模拟。此外,它还适合高频代码生成、网页开发、复杂文档处理、企业自动化和长程 Agent 任务。
Q7:Gemini 3.7 Flash 有哪些局限性?
根据 302.AI 实测,Gemini 3.7 Flash 的主要局限包括:1)工程深度和精度仍有上限;2)复杂任务的最终完成度不一定达到 Pro 级别;3)在视觉、3D 交互和细节打磨方面存在波动;4)Pro 版本缺席使其与旗舰模型的定位边界仍不清晰。因此,它更适合作为高频生产主力,而不是所有极限任务的旗舰替代品。
Q8:如何在 302.AI 上调用 Gemini 3.7 Flash API?
在 302.AI 调用 Gemini 3.7 Flash 的步骤是:1)注册 302.AI 账号并充值;2)进入 API 超市,搜索 Gemini 3.7 Flash;3)获取 API Key;4)使用在线调试功能测试,或通过兼容 OpenAI 格式的接口接入 Python、Node.js 等应用。也可以通过 302.AI 客户端或相关应用直接体验,无需自行配置复杂环境。
5. 如何在 302.AI 上使用
1. 使用302.AI客户端
步骤指引:对话框内选择模型菜单

输入gemini即可获取相应版本调用

2. 聊天机器人中使用
步骤指引 :应用超市→聊天机器人→立即体验

选择模型:Google模型→gemini-3.7-flash→确认

3. 使用模型 API
步骤指引:API超市→语言大模型→Gemini→gemini-3.7-flash


点击【Playground】在线调用 API
想即刻体验 Gemini 3.7 Flash 模型?
👉立即注册免费试用302.AI,开启你的AI之旅!👈
为什么选择302.AI?
● 灵活付费:无需月费,按需付费,成本可控
● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求
● 开源生态:支持开发者深度定制,打造专属AI应用
● 易用性:界面友好,操作简单,快速上手
