三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

📖 文章导读:
三周两更,谷歌把 Gemini 3.7 Flash 端了上来。不仅 API 价格腰斩,更以“主力工作模型”自居,轻量级模型能否承担旗舰职能?本期实测表明,3.7 Flash 在速度与成本上极具竞争力,是高频生产任务的实用派首选,但工程深度与精度仍有明显上限。

8 月 13 日,Gemini 3.7 Flash 正式发布。距离 Gemini 3.6 Flash 上线不过三周,谷歌这次不仅将编程、网页开发、复杂文档处理和企业工作流的能力做了升级,还直接把年底前的 API 价格砍到了原价的一半:输入每百万 Token 0.75 美元、输出 3.75 美元。

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

提到 Gemini Flash,大家第一反应往往是轻量和低价。然而到了 3.7,谷歌已经开始把它往主力工作模型方向靠拢,尤其是编码、网页开发和 Agent。官方甚至直接把它称为“迄今最智能的 workhorse model”。这也让 Gemini 3.7 Flash 更具讨论度:它到底还是一个主打性价比的 Flash,还是已经开始接管原本属于 Pro 的任务了?

一表速览谷歌 Flash 模型定位

模型定位适配场景
Gemini 3.5 Flash轻量、快速、性价比日常问答、批量调用、轻量任务
Gemini 3.6 Flash平衡性能与成本编程、Agent、多步骤任务
Gemini 3.7 FlashWorkhorse 主力模型编程、Web开发、复杂知识工作、Agent

3.7 Flash 核心升级点

  1. 编码与 Agent 能力飞升 FrontierCode(生产级代码)跃升至 43.6%,DeepSWE v1.1(长时程软件工程)从 49% 飙至 65.3%,涨幅超 34%;在模拟企业自动化场景的 AutomationBench-AA 中得分 30.4%,领先于 Kimi K3 和 GPT-5.6 Sol。
  2. 网页开发与 UI 还原度领先 WebDev Arena Elo 分达到 1588,超越 Claude Sonnet 5 和 GPT-5.6 Terra,能以更少提示生成布局完善、功能完整的交互页面。
  3. 速度与成本的帕累托最优 高推理模式下,Artificial Analysis 智能指数 56 分,同时输出速度约 340 token/秒,是 GPT-5.6 Terra 的近 3 倍;平均每任务耗时 1.7 分钟,且单任务成本仅 $0.40(高推理),比 3.6 低 30%,并支持三档推理强度灵活切换,在“智能-时间”和“智能-成本”双前沿上站稳脚跟。
三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI
三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

Pro 缺席,争议随之而来

在 Flash 三周两更的极速迭代背后,是 Gemini 3.5 Pro 的杳无音讯。

这也是 Gemini 3.7 Flash 发布后最值得讨论的问题:如果 Flash 已经开始承担越来越多的编程、复杂推理和 Agent 工作,那么 Pro 还剩下多少存在感?

尤其是在 OpenAI、Anthropic 等竞争对手持续强化旗舰模型的同时,谷歌的 Pro 系列却仍停留在 3.1 版本。一边是旗舰模型迟迟交不出答卷,一边是 Flash 以闪电般速度的迭代,这很难不让人怀疑谷歌是不是在用 Flash 填补 Pro 留下的空档。评论界也存在普遍担忧:当轻量级产品开始吞噬 Pro 的职能,谷歌是否在牺牲长期上限换取短期声量?以及,当 Flash 已经足够强、足够快,还足够便宜,谷歌究竟还需要一个什么样的 Pro,才能重新拉开两者之间的差距?

榜单排名

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

目前在 Artificial Analysis 排名第 16.

用户评价

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

说到底,3.7 Flash 到底是个稳步前进的实用派,还是一次原地踏步的凑数发布?本期文章,302.AI 将综合多维度实测揭晓其真正实力。


1. Gemini 3.7 Flash 模型基础信息

(1)实测模型在 302.AI 的价格:

模型名称上下文302.AI内的价格
gemini-3.7-flash1000000输入 $0.75 / 1M tokens输出 $3.75 / 1M tokens
grok-4.6500000输入 $2 / 1M tokens输出 $6 / 1M tokens

(2)测评目的:

本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。

(3)测评方法:

本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。

题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0

💡记分规则:

按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。

(4)测评工具:

  • 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
  • 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒

编程案例分数评级:

⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。

⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。

⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。

⭐⭐及以下 C级(不合格): 不可用,存在明显问题。


2. Gemini 3.7 Flash 测试结果总览

302.AI 多模态模型测评分数榜单:

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

3. Gemini 3.7 Flash 案例展示

案例 1:多模态逻辑推理

提示词:观察规律,推测以下序列中的下一个符号是什么?

答案:数字 6

解析:这是一个序列 1、2、3、4、5……,所有数字都与其镜像相连。

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

Gemini 3.7 Flash:识别推理正确

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

Grok 4.6识别推理错误

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

案例 2:程序化 SVG 图形生成

绘制一幅松鼠在树枝之间跳跃的svg动态图

Gemini 3.7 Flash 输出效果:

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

Grok 4.6 输出效果:

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI
绘制一幅渔夫抛出鱼竿垂钓的svg动态图

Gemini 3.7 Flash 输出效果:

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

Grok 4.6 输出效果:

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

简评:

Grok 4.6 的输出效果在图形复杂度和动态表现质量上都略优于 Gemini 3.7 Flash.

测评点Gemini 3.7 FlashGrok 4.6
语义表达准确度⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
图形构造复杂度⭐⭐⭐⭐⭐⭐⭐
动态实现质量⭐⭐⭐⭐⭐

案例 3:Three.js 3D 微型工厂模拟

Create a polished single-page 3D animation using Three.js.
Build a miniature automated factory on a clean tabletop, with a conveyor belt, robotic arm, rotating gears, processing machine, input/output trays, and small colorful products.
The factory should run automatically in a continuous production cycle: products enter the conveyor → move to the processing machine → the robotic arm picks and places them → the machine processes them with moving mechanical parts → finished products return to the conveyor → move to the output tray.
Focus on detailed procedural 3D modeling, realistic mechanical movement, spatial relationships, and visual polish. Use beveled geometry, metallic/plastic/rubber/glass materials, soft studio lighting, shadows, and a clean light-colored background. Avoid making the scene look like simple primitive shapes.
Use only Three.js-generated geometry; no external 3D models. Add Play/Pause/Replay controls, mouse-drag camera rotation, and scroll zoom. Keep the animation smooth, responsive, and continuously looping.

Gemini 3.7 Flash 输出效果:

完整网页:https://71ce19c3.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. UI 设计更精致,包含实时状态面板,以及相机角度调节、倍速调节等功能;
  2. 动画表现更具”表演性”,产品有从毛坯到成品的视觉变化。

❌ 不足之处:

  1. 使用 CDN script 标签引入,缺少对现代 Three.js 特性,几何体精度相对粗糙,边缘生硬;
  2. 代码结构较为平铺,模块化程度低,可维护性弱。

Grok 4.6 输出效果:

完整网页:https://s6zdglc6kz.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. 使用 ES Module 方式引入Three.js,符合现代前端开发规范,代码结构清晰,模块化程度高;
  2. 材质系统更精致,材质库涵盖金属、橡胶、玻璃、橡胶等。

❌ 不足之处:

  1. 场景复杂度相对较低,视觉风格偏实用主义,缺乏冲击力;
  2. 缺少实时状态反馈,控制面板功能相对薄弱。
测评点Gemini 3.7 FlashGrok 4.6
视觉与交互⭐⭐⭐⭐⭐⭐⭐
技术实现⭐⭐⭐⭐⭐
功能与内容完整性⭐⭐⭐⭐⭐⭐⭐

案例 4:小球倾倒动画模拟

Create a single-page HTML 3D animation using Three.js.

Build a clean product-style scene with a transparent rectangular box containing about 30 colorful balls.

Animation:
1. The box slowly tilts to one side, causing the balls to fall out naturally.
2. The balls roll, bounce, and collide with each other and the ground.
3. After a short pause, the balls gradually roll back toward the box.
4. The balls enter the box and settle back inside.
5. The animation then loops.

Requirements:
- Use Three.js and JavaScript.
- Simulate basic gravity, velocity, collision, bouncing, and friction.
- Avoid balls passing through each other, the box, or the ground.
- The balls should have natural physical movement rather than simply following predefined paths.
- Add soft lighting, shadows, and a clean light-colored background.
- Add Play / Replay controls.
- Allow mouse drag to rotate the camera and scroll to zoom.
- Make the layout responsive.

Focus on realistic physics and smooth transitions. Avoid clipping, floating, teleportation, or obviously scripted-looking movement.

Gemini 3.7 Flash 输出效果:

完整网页:https://2ec16f62.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. 纯 JavaScript 实现物理模拟,不依赖任何外部物理库,加载速度快;
  2. 物理阶段划分明确,阶段信息实时反馈到 UI。

❌ 不足之处:

  1. 物理模拟精度有限,碰撞检测不精确,可能导致小球出现穿透或粘滞;
  2. 回流机制略显脚本化,缺少物理引擎中约束的概念,小球回流轨迹可能不够自然。

Grok 4.6 输出效果:

完整网页:https://kzc759xgn2.302ai.app

录屏展示:

简评:

✅ 核心优势:

  1. 产品级 UI 呈现,3D 表现相当出色,玻璃材质逼真,整体光照模拟十分自然;
  2. 物理真实感极强,使用 Cannon-es 物理引擎,碰撞、摩擦、堆叠效果真实可靠;
  3. 代码结构模块化,逻辑分离且有调试工具,适合长期项目。

❌ 不足之处:

  1. 使用完整的 Cannon-es 物理引擎和多材质球体,性能开销较大。
测评点Gemini 3.7 FlashGrok 4.6
视觉与交互⭐⭐⭐⭐⭐⭐⭐⭐
技术实现⭐⭐⭐⭐⭐⭐⭐
功能与内容完整性⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐

4. Gemini 3.7 Flash 模型实测结论

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

结合实测体验来看,Gemini 3.7 Flash 虽还未呈现出碾压竞品的惊艳感,但在轻量级模型的赛道中,它的确也具备领先的响应速度、低价的调用成本以及稳定的发挥。

1. 优势:综合能力稳定,速度与性价比突出

综合多方面实测可以明显感知到,Gemini 3.7 Flash 具备较为均衡的整体能力。逻辑推理、多模态理解、编程、网页开发、Agent 等任务,它基本都能覆盖,而且面对复杂任务的稳定性较上一代有所提升。从官方提供的跑分数据也能看出,DeepSWE v1.1 从 49% 提升到 65.3%,WebDev Arena 也来到 1588,这些提升与实测体感基本一致。

而极速响应也极大提升了使用体验。约 340 token/秒的输出速度,在实际使用时有很强的存在感。无论是普通问答、代码生成,还是需要不断修改和重新生成的 Vibe Coding 场景,更短的等待时间都会直接改善交互体验。对于 Agent 任务来说,更快的输出速度还会进一步压缩整个任务链的执行时间。再加上目前 0.75 美元/百万输入 Token、3.75 美元/百万输出 Token的价格,3.7 Flash 在能力—速度—成本这组三角关系里确实找到了一个不错的平衡点。

简单来说,3.7 Flash 的优势并非某一项能力特别出挑,而是在几个关键指标上都没有明显参差。

2. 劣势:完成度仍有短板,能力上限明显

3.7 Flash 的能力上限也同样清晰。将测试从能否完成推进到细节打磨的高度,模型与高阶竞品之间的差距就会逐渐显现。例如在 Three.js 的实测案例中,模型能将场景、交互和功能基本能够搭起来,但在代码工程性、物理模拟精度以及部分视觉细节上,仍有较大提升空间。

这也侧面说明了 3.7 Flash 目前更擅长快速拆解一个复杂任务并交付结果,但在一些需要长期工程经验、复杂约束或者极高视觉完成度的任务里,仍然容易出现基本成型,精度不足的情况。

因此,对于特别依赖代码质量、物理真实性或者视觉表现的任务,3.7 Flash 与那些具备一定性价比的高阶模型之间依然存在选择空间。

3. 适用场景:高频生产任务更能发挥优势

综合来看,3.7 Flash 更适合作为一个务实的选择。

对于 Vibe Coding、网页开发、脚本编写、复杂信息整理、Agent 工作流以及各种高频 API 调用这类任务,模型不需要每一次都触及绝对能力上限,而是需要响应快、执行稳、价格合理,同时覆盖足够广的任务类型。3.7 Flash 恰好具备这些条件。

然而对于复杂工程问题,或是特别强调视觉创作、动画细节和代码架构的高精度任务,旗舰级模型依然更具优势。


常见问题 FAQ

Q1:Gemini 3.7 Flash 是什么?和 Gemini 3.6 Flash 有什么区别?

Gemini 3.7 Flash 是 Google 推出的新一代 Flash 系列模型,定位从轻量快速模型进一步升级为主力工作模型。与 Gemini 3.6 Flash 相比,3.7 Flash 重点提升了编码、网页开发、复杂文档处理和 Agent 能力,同时将 API 价格降至原价的一半。根据 302.AI 实测,它在 FrontierCode、DeepSWE v1.1 和 AutomationBench-AA 等任务上进步明显,适合高频生产任务、代码生成和企业自动化场景。

Q2:Gemini 3.7 Flash 的速度有多快?

Gemini 3.7 Flash 的输出速度约为 340 Token/s,在高推理模式下仍保持很快的响应速度,约为 GPT-5.6 Terra 的 3 倍。文章实测显示,其平均每个任务耗时约 1.7 分钟。对于代码生成、批量摘要、网页迭代和自动化处理等高频任务,速度优势可以显著减少等待时间。

Q3:Gemini 3.7 Flash 的 Agent 和编程能力如何?

Gemini 3.7 Flash 的 Agent 与编程能力是本次升级的重点。FrontierCode 生产级代码得分提升至 43.6%,DeepSWE v1.1 长时程软件工程得分从 49% 提升至 65.3%,AutomationBench-AA 得分达到 30.4%。它适合代码生成、网页开发、复杂文档处理、企业自动化和多步骤任务,但在极复杂工程任务的细节打磨上仍不如顶级 Pro 或旗舰模型。

Q4:Gemini 3.7 Flash 的价格是多少?

在 302.AI 平台,Gemini 3.7 Flash 的价格为输入 $0.75/百万 Token、输出 $3.75/百万 Token。相比上一代及同档模型,价格明显下降。高推理模式下单任务成本约为 $0.40,适合需要频繁调用模型的代码审查、批量处理、Agent 自动化和内容生产场景。具体价格以 302.AI API 超市当前页面为准。

Q5:Gemini 3.7 Flash 支持哪些推理强度?

Gemini 3.7 Flash 支持三档推理强度,用户可以在智能水平、响应速度和成本之间进行权衡。简单任务可以使用较低推理强度以获得更快响应;复杂代码、长文档和 Agent 任务则可以提高推理强度,以换取更完整的分析和更高的任务成功率。这种灵活配置是它适合作为日常主力模型的重要原因。

Q6:Gemini 3.7 Flash 擅长哪些场景?

根据 302.AI 实测,Gemini 3.7 Flash 主要适合四类场景:1)多模态逻辑推理;2)程序化 SVG 图形生成;3)Three.js 3D 微型工厂模拟;4)小球倾倒等物理动态模拟。此外,它还适合高频代码生成、网页开发、复杂文档处理、企业自动化和长程 Agent 任务。

Q7:Gemini 3.7 Flash 有哪些局限性?

根据 302.AI 实测,Gemini 3.7 Flash 的主要局限包括:1)工程深度和精度仍有上限;2)复杂任务的最终完成度不一定达到 Pro 级别;3)在视觉、3D 交互和细节打磨方面存在波动;4)Pro 版本缺席使其与旗舰模型的定位边界仍不清晰。因此,它更适合作为高频生产主力,而不是所有极限任务的旗舰替代品。

Q8:如何在 302.AI 上调用 Gemini 3.7 Flash API?

在 302.AI 调用 Gemini 3.7 Flash 的步骤是:1)注册 302.AI 账号并充值;2)进入 API 超市,搜索 Gemini 3.7 Flash;3)获取 API Key;4)使用在线调试功能测试,或通过兼容 OpenAI 格式的接口接入 Python、Node.js 等应用。也可以通过 302.AI 客户端或相关应用直接体验,无需自行配置复杂环境。

5. 如何在 302.AI 上使用

1. 使用302.AI客户端

步骤指引:对话框内选择模型菜单

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

输入gemini即可获取相应版本调用

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

2. 聊天机器人中使用

步骤指引 :应用超市→聊天机器人→立即体验

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

选择模型:Google模型→gemini-3.7-flash→确认

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

3. 使用模型 API

步骤指引:API超市→语言大模型→Gemini→gemini-3.7-flash

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI
三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

点击【Playground】在线调用 API


想即刻体验 Gemini 3.7 Flash 模型?

👉立即注册免费试用302.AI,开启你的AI之旅!👈

为什么选择302.AI?

● 灵活付费:无需月费,按需付费,成本可控

● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求

● 开源生态:支持开发者深度定制,打造专属AI应用

● 易用性:界面友好,操作简单,快速上手

三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

All Rights Reserved by 302.AI
(0)
302.AI
上一篇 3天前
下一篇 2026 年 2 月 26 日 下午5:21

相关推荐

  • Grok 4.6 实测:1.5万亿参数,成本仅Opus 1/4,3大场景硬刚 Claude Opus 5 | 302.AI

    📖 文章导读:距上代发布仅一月,SpaceXAI “光速”推出旗舰模型 Grok 4.6。此次摒弃参数堆砌,转而深耕数据质量与长程Agent能力,剑指编程与复杂工作流。本文基于实测,将其正面硬刚 Claude Opus 5,实测发现,Grok 4.6 视觉上限极高、长流程代码抗打,且使用成本仅为竞品四分之一,但细节与稳定性仍存短板。一文看懂这款高性价比模型的…

    3天前 基准实验室
    3710
  • DeepSeek-V4-Pro 实测:1.6T参数,价格仅Opus 1/10,编程能力稳步变强 | 302.AI

    📖 文章导读:DeepSeek-V4-Pro 0813正式版上线,伴随峰谷涨价引发关注。其真实战力能否比肩全球顶级旗舰?本期内容我们将其与 Claude Opus 5 进行对比评测。结果显示 V4-Pro 基础能力稳健、性价比优势突出,但在细节打磨与极限表现上仍存差距。一文看懂低调发布背后的真实水准与选型建议。 2026年8月13日,DeepSeek 再次以…

    4天前 基准实验室
    5100
  • Qwen3.8-Max 实测:2.4万亿参数,100万上下文,4大场景叫板 Claude | 302.AI

    文章导读:2.4 万亿参数、100 万 Tokens 上下文、即将开源,Qwen3.8-Max 堪称千问目前最重磅的一次升级。但参数之外,它的真实体验如何?本文从代码生成、视觉理解、复杂任务执行等多个维度,带你看看这款国产旗舰到底成色几何。 8 月 3 日,阿里通义千问团队正式把 Qwen3.8-Max 端了出来。作为通义千问迄今规模最大的旗舰模型,Qwen…

    2026 年 8 月 7 日 基准实验室
    7600
  • DeepSeek-V4-Flash 实测:打破“轻量版”标签, Agent 逼近 Opus 4.8 | 302.AI

    📖 文章导读:DeepSeek-V4-Flash 正式版上线!后训练让 Agent 与编程能力飙升,综合能力超过 V4 Pro。百万Token输入仅 1 元的“地板价”彻底刷新 Agent 门槛。本文通过多场景实测,揭示其真实水平与短板。极致性价比能否重塑轻量模型认知?一文看懂。 7 月 31 日,DeepSeek-V4-Flash 正式版 API 终于开放…

    2026 年 8 月 5 日 基准实验室
    1.6K0

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注