Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

📖 文章导读:

SpaceXAI 发布 Grok 4.7,主打性价比前沿。不是最强,但同价能力大幅升级。结合跑分与实测,其长程复杂任务表现有所提升,竞争力集中于单价与定位,然而通用能力仍有短板,且复杂任务 Token 消耗大易生隐性成本。它是“定价封顶”打法下的专项性价比之选,选型需权衡隐性消耗。

9月22日,SpaceXAI 正式推出最新旗舰模型——Grok 4.7.

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

先提取官方稿中最朴素的一句话:

与 Grok 4.6 同价同速($2/$6),能力大幅升级。

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

官方的竞品对比表格传达的最核心信息是:

单看分数,Grok 4.7 并不是冠军。但把价格拉进来,结果就是最具性价比的模型。

Fable 5.1 的 CursorBench 分数高 5.5%,成本高五倍以上;Harvey法律基准,Grok 19.6% vs Fable 6.7%,用低价拿到近三倍的分。

所以官方的措辞很准确,不是最强模型,是 at the frontier in price-performance(性价比前沿)。

智能不封顶,定价封顶。 这就是当下马斯克的打法。

但尴尬的是,九月末这一波模型更新,上面这张对比表发布即过时。如今的对手已是 GPT-6 Astra 与 Opus 5.5 了。

聊完价格,安全能力也是官方重点提及的。

官方给了一组双向指标:既看危险请求拦不拦得住,也看正常工作误不误伤:

生物安全:LatchBio 生物安全基准 62.4% 登顶。这是危险问题要会拒绝的能力。

网络安全:自家基准 HackerBench v0.3 上,危险双重用途请求只放行 3.3%,同时很少误拦正当的安全工作。

一个模型的护栏水平,不取决于它拒绝了多少坏请求,坏请求全拒谁都做得到,把分刷成 100% 毫无意义。而是看它在拒绝坏请求时,保住了多少误拦。 拒绝率 96.7% 与低误伤,是 Grok 4.7 在强调的。

榜单排名:

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

在Artificial Analysis榜单中,Grok 4.7排名16位。

用户评价:

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

Grok 4.7 真实表现究竟如何,302.AI将在接下来的实测中了解其实际生产力边界。


1. Grok 4.7 模型基础信息

(1)实测模型在 302.AI 的价格:

模型名称上下文说明302.AI内的价格
grok-4.7500000缓存写入 $0.5 / 1M tokens缓存读取 $0.5 / 1M tokens输入$2 / 1M tokens输出 $6 / 1M tokens
gpt-6-sol1000000缓存写入 $2.5 / 1M tokens缓存读取 $0.2 / 1M tokens输入 $2 / 1M tokens输出 $10 / 1M tokens

(2)测评目的:

本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。

(3)测评方法:

本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。

题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0

💡记分规则:

按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。

(4)测评工具:

  • 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
  • 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒

编程案例分数评级:

⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。

⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。

⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。

⭐⭐及以下 C级(不合格): 不可用,存在明显问题。


2. Grok 4.7 测试结果总览

302.AI 多模态模型测评分数榜单:

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

3. Grok 4.7 案例展示

案例 1:多模态推理

提示词:根推测以下图片分别描述的是哪些著名电影

答案:

  1. Snakes on a Plane《航班蛇患》
  2. Independence Day《独立日》
  3. Mean Girls《贱女孩》
  4. Paths of Glory《光荣之路》
  5. 8 Mile《8英里》
  6. The Matrix Revolutions《黑客帝国3:矩阵革命》
  7. Field of Dreams《梦幻之地》
  8. Alpha and Omega《丛林有情狼》
  9. The Thirteenth Floor《异次元骇客》
  10. The Sum of All Fears《惊天核网》
Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

Grok 4.7:9部推理正确

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

GPT-6 Sol:全部推理正确

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

案例 2:程序化 SVG 图形生成

绘制一幅运动员在网球对打的动态svg图

Grok 4.7 输出效果:

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

GPT-6 Sol 输出效果:

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI
绘制一幅马快跑到河边饮水的动态svg图

Grok 4.7 输出效果:

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

GPT-6 Sol 输出效果:

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI
测评点Grok 4.7GPT-6 Sol
语义表达准确度⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐
图形构造复杂度⭐⭐⭐⭐⭐⭐
动态实现质量⭐⭐⭐⭐⭐⭐⭐

案例 3:3D 跑酷小游戏

Create a polished 3D endless runner game as a single self-contained HTML file.
The gameplay should be inspired by the familiar mechanics of mobile endless runners: the character automatically runs forward along a multi-lane path, while the player can switch lanes, jump, slide, and dodge obstacles. Add collectible items, increasing speed, score tracking, and game-over/restart states.
Create a completely original setting, characters, environment, and visual identity. Do not copy the visual style, characters, locations, props, UI, or assets of any existing game. Use a stylized 3D aesthetic with a strong sense of depth and motion.
Include:
Smooth third-person camera following the character
Three-lane movement with responsive controls
Jumping, sliding, and obstacle avoidance
Procedurally generated sections so the run can continue
Moving obstacles and varied environmental hazards
Collectibles and score progression
Increasing difficulty and speed
Polished animations, lighting, particles, and camera effects
Keyboard and mouse controls
A clear start screen, HUD, game-over screen, and restart button
The final result should feel like a complete, polished 3D mini-game rather than a technical demo.

Grok 4.7 输出效果:

完整网页:https://eyq1jiav2n.302ai.app

录屏演示:

简评:

✅ 核心优势:

  1. 使用了完整的 Three.js 真 3D 渲染,支持真实光照、阴影等;
  2. 游戏系统完整:车道切换、跳跃、滑铲、速度递增、距离里程碑、best 分持久化等;

❌ 不足之处:

  1. 视觉表现力一般,整体画面偏暗,无收集物触发特效等,吸引力减弱;
  2. 未做移动端触控适配。

GPT-6 Sol 输出效果:

完整网页:https://902o82i50x.302ai.app

录屏演示:

简评:

✅ 核心优势:

  1. 使用了 3D 相机系统,有相机跟随、抖动、闪光、速度线等相机效果,技术含量更高;
  2. 几何体为 3D 多边形组成,深度排序正确,遮挡关系自然,场景纵深合理;
  3. 有音频反馈,用 WebAudio 动态合成音效,提升了游戏体验;

❌ 不足之处:

  1. 虽由 3D 多边形构建,但视觉风格偏“积木感”;
  2. 无本地最高分持久化,重开后无”BEST”记录,降低重复挑战动机。
测评点Grok 4.7GPT-6 Sol
玩法创意性⭐⭐⭐⭐⭐⭐⭐⭐
视觉执行力⭐⭐⭐⭐⭐
技术实现⭐⭐⭐⭐⭐⭐

案例 4:沉浸式数字博物馆

Create a premium immersive 3D web experience about the history and making of traditional Chinese mooncakes, delivered as a single self-contained HTML file.
Design it as a cinematic digital museum rather than a conventional webpage. The visitor should move through a virtual exhibition space and experience the story through carefully choreographed camera movements, lighting, animations, spatial transitions, and interactive 3D objects.
The experience should include:
Origin & History — a cinematic introduction explaining the origins and cultural evolution of mooncakes through an immersive historical gallery.
Ingredients — interactively explore flour, lotus seeds, egg yolks, nuts, and other ingredients as detailed 3D objects.
Making Process — show the complete process: preparing the filling, making the dough, wrapping, shaping with a wooden mold, baking, and the final mooncake emerging from the oven.
Mooncake Showcase — create several original regional and traditional mooncake variations with different shapes, patterns, fillings, and textures.
Cultural Story — connect mooncakes with the Mid-Autumn Festival, family reunion, the full moon, lanterns, and traditional Chinese symbolism.
Build all visual elements yourself with Three.js and procedural geometry/materials. Do not rely on external images, downloaded 3D models, stock assets, or image textures. Model the mooncakes, ingredients, utensils, exhibition architecture, lanterns, moon, clouds, tables, shelves, and other major visual elements from scratch.
Use a sophisticated visual language: dark museum architecture, warm golden illumination, subtle volumetric atmosphere, realistic materials, soft shadows, reflections, floating particles, and restrained Chinese-inspired visual details.
The transitions should feel like a digital film or high-end interactive museum installation rather than a website slideshow. Use cinematic camera choreography, depth of field, slow reveals, object close-ups, environmental animation, and smooth transitions between exhibition spaces.
Make the experience highly polished and interactive. Users should be able to explore objects, trigger animations, zoom into the mooncake-making process, and move naturally between different exhibition areas.
The final result should feel like an award-winning interactive digital exhibition, with strong storytelling, atmosphere, spatial depth, and visual craftsmanship — not a collection of simple 3D objects placed on a webpage.

Grok 4.7 输出效果:

完整网页:https://w1bko49rx1.302ai.app

录屏演示:

简评:

✅ 核心优势:

  1. 六大展厅覆盖,内容全面:首页→由来→食材→制作工序→月饼标本→花园造景,打造真正沉浸式的数字展览体验;
  2. 电影级的相机编排,设置了自动巡览 + 手动拖拽组合,平滑曲线实现相机绕物体旋转 + 滚轮拉近效果,视觉冲击力极大提升;
  3. 材质与纹理全程序化生成,使用 Canvas 2D 绘制;
  4. HUD/UI 完整,章节面板、inspect 卡片、loading、intro 完整。

❌ 不足之处:

  1. 代码量过大,Three.js 打包内联约 4.6 万行;
  2. 阴影被禁用,主要靠 SpotLight 与烘焙感替代。

GPT-6 Sol 输出效果:

完整网页:https://xol9z7a2dj.302ai.app

录屏演示:

简评:

✅ 核心优势:

  1. 设有 5 个独立圆形展厅,按章节分段,底部带进度条;
  2. 相机跟随系统成熟,可根据拖拽自由调整视角;
  3. 视觉语言统一,代码工程质量高。

❌ 不足之处:

  1. 加载依赖 CDN module,离线状态下不可用;
  2. 部分物体几何精度有限,细看质感不足;
  3. 交互提示偏弱,部分功能鼠标悬停时没有高亮/描边反馈。
测评点Grok 4.7GPT-6 Sol
视觉执行力⭐⭐⭐⭐⭐⭐⭐⭐
叙事与信息完整度⭐⭐⭐⭐⭐⭐⭐⭐⭐
交互与用户体验⭐⭐⭐⭐⭐⭐⭐

4. Grok 4.7 模型实测结论

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

Grok 4.7 的评价始终绕不开一套矛盾:脱离价格谈性能,它算不上赛场里的最高分选手;将成本纳入权衡,它又站到了性价比的前沿位置。结合基准榜单和多轮实测来看,Grok 4.7 对比上代 Grok4.6 的提升确实是可感知的,但和第一梯队旗舰相比,短板同样无法回避。

优势

  1. 复杂长任务的完成度提升较明显

Grok 4.7 展现出在长时任务、复杂知识方向上的提升。对于需要模型持续处理多个步骤、不断生成代码并维持整体结构的任务,优势会更明显。

结合本次实测案例来看,Grok 4.7 对复杂需求的拆解和执行能力都比较突出。尤其是案例 4 的数字博物馆,效果堪称惊艳。模型能够一次性搭建多展厅结构、相机巡览、交互系统以及完整的内容叙事,最终产出的并非简单的 3D 物体堆砌,而是具备一定完整度的沉浸式体验。

  1. 低单价仍是最现实的优势

Grok 4.7 与上一代 Grok 4.6 保持了一致定价,输入 2 美元/百万 Token,输出 6 美元/百万 Token,按单价来看确实是前沿模型里最低的一档。在模型能力已经能与第一梯队竞争的情况下,这个价格给足了使用空间。尤其是对于需要大量调用模型、又需要一定复杂任务能力的开发者来说,低单价会直接降低试错成本。

短板

  1. 跑分存在环境差异,通用综合能力还有提升空间

官方基准里,Grok 4.7 在 CursorBench、Terminal-Bench、EEBench 等项目上都有明显提升,第三方独立测试则分数回落,并未同步来到绝对领先的位置。Artificial Analysis 综合榜单只排到 16 位,综合智能指数 46 分,和 GPT‑6 Astra、Fable 5.1 拉开了一档差距。

而从实测案例中也可以看出,Grok 4.7 在复杂项目上确实具备较强的生成能力,但距离真正意义上的工程优化还有一段距离。对于这类大型 HTML/Three.js 项目,代码越长,后续维护和修改的成本也会随之增加。

此外,模型针对安全护栏做了迭代,生物安全、网络安全基准表现不错,兼顾拦截风险请求和不误伤正常工作。然而在通用对话、精细指令理解方面,可能偶尔会出现输出冗余、逻辑僵硬的情况。

  1. Token 消耗可能带来隐性成本

虽然 Grok 4.7 维持和 Grok 4.6 完全一致的定价,但部分社区反馈也提到,在处理复杂任务时,模型会输出更长的推理链路,输出 Token 消耗量会抬升。

简单任务下,Grok 4.7 的单 Token 成本优势明显,而在长流程持续迭代场景,整体花费不一定比高端模型更低。

Grok 4.7 并没有朝着全能通用模型的方向做全面迭代,更多是把资源倾斜在了长流程工程、Agent 这类专项能力上。其能力区间不能单纯看跑分来定义,潜在问题也不能用低价标签去掩盖。实际选型中,除了参考基准分数与公开标价,任务复杂度、迭代次数、token 消耗这些实际运行因素,都需要纳入考量,才能判断它是否适配自身的业务场景。


常见问题 FAQ

Q1:Grok 4.7 是什么?和 Grok 4.6 有什么区别?

Grok 4.7 是 SpaceXAI 于 2026年9月22日发布的最新旗舰模型,与 Grok 4.6 保持同价同速(输入 $2、输出 $6/百万 Token),主打「同价能力大幅升级」。相比 4.6,它在长时任务、复杂知识工作方向提升可感知,官方基准 CursorBench、Terminal-Bench、EEBench 等项目都有明显进步;同时迭代了安全护栏,生物安全基准 LatchBio 以 62.4% 登顶。Artificial Analysis 综合榜单排名第 16 位。

Q2:Grok 4.7 的性价比体现在哪?

官方定位很准确:不是最强模型,而是 at the frontier in price-performance(性价比前沿)。对比数据:Fable 5.1 的 CursorBench 分数只高 5.5%,成本却是五倍以上;Harvey 法律基准 Grok 4.7 拿 19.6%,Fable 只有 6.7%,用低价拿到近三倍的分。这套打法可以概括为「智能不封顶,定价封顶」。不过对手表发布即过时——9 月末 GPT-6 Astra、Opus 5.5 已经上线,对比需要重算。

Q3:Grok 4.7 的价格是多少?上下文多大?

Grok 4.7 与 Grok 4.6 定价完全一致:输入 $2/百万 Token、输出 $6/百万 Token,在 302.AI 平台缓存写入/读取均为 $0.5/百万 Token,上下文 50 万 Token。按单价看是前沿模型里最低一档。对比同场实测的 GPT-6 Sol(输入 $2/输出 $10,1M 上下文),Grok 4.7 输出便宜 40%,但上下文只有 Sol 的一半。

Q4:Grok 4.7 的安全能力怎么样?

安全护栏是官方重点强调的方向,指标是双向的:既看危险请求拦不拦得住,也看正常工作会不会误伤。生物安全方面,LatchBio 基准 62.4% 登顶;网络安全方面,HackerBench v0.3 上危险双重用途请求只放行 3.3%,同时很少误拦正当安全工作。把拒绝率刷到 100% 毫无意义,能在拦住坏请求的同时保住低误拦率才算合格的护栏。

Q5:Grok 4.7 实测表现如何?哪些任务最强?

302.AI 用多模态推理、SVG 图形生成、3D 跑酷小游戏、沉浸式数字博物馆 4 组实测:Grok 4.7 对复杂需求的拆解和执行能力比较突出,最亮眼的是数字博物馆案例——一次性搭建多展厅结构、相机巡览、交互系统和完整内容叙事,产出具备完整度的沉浸式体验,效果堪称惊艳。整体上适合需要持续多步骤、不断生成代码并维持整体结构的长程任务。

Q6:Grok 4.7 有哪些短板和隐性成本?

根据 302.AI 实测与社区反馈:1)第三方独立测试分数较官方基准回落,AA 榜单 16 位、综合智能指数 46 分,与 GPT-6 Astra、Fable 5.1 差一档;2)通用对话和精细指令理解偶尔输出冗余、逻辑僵硬;3)隐性 Token 成本——复杂任务下推理链路变长,输出 Token 消耗抬升,长流程持续迭代场景总花费不一定比高端模型低;4)大型工程项目的维护修改成本随之增加。

Q7:Grok 4.7 适合哪些人用?怎么选?

它是「定价封顶」打法下的专项性价比之选:适合需要大量调用模型、又要有复杂任务能力的开发者——低单价直接降低试错成本,长程 Coding 和 Agent 场景优势明显。但选型不能只看标价:任务复杂度高、迭代次数多、Token 消耗大的场景,要把实际运行成本纳入考量;追求全能通用能力或第一梯队绝对性能的用户,GPT-6 Astra、Fable 5.1 仍是更稳的选择。

Q8:如何在 302.AI 上调用 Grok 4.7 API?

在 302.AI 调用 Grok 4.7 有三种方式:1)客户端——对话框选择模型菜单,输入 grok 获取相应版本;2)聊天机器人——应用超市→聊天机器人选择模型;3)API——API超市→语言大模型→Grok→grok-4.7→点击 Playground 在线调用。接口兼容 OpenAI 格式,支持 Python、Node.js 等语言。302.AI 按需付费、无需月费,成本可控。

5. 如何在 302.AI 上使用

1. 使用302.AI客户端

步骤指引:对话框内选择模型菜单

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

输入grok即可获取相应版本调用

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

2. 聊天机器人中使用

步骤指引 :应用超市→聊天机器人→立即体验

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

选择模型:其他模型→grok-4.7→确认

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

3. 使用模型 API

步骤指引:API超市→语言大模型→Grok→grok-4.7

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

点击【Playground】在线调用 API

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI

想即刻体验 Grok 4.7 模型?

👉立即注册免费试用302.AI,开启你的AI之旅!👈

为什么选择302.AI?

● 灵活付费:无需月费,按需付费,成本可控

● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求

● 开源生态:支持开发者深度定制,打造专属AI应用

● 易用性:界面友好,操作简单,快速上手

Grok 4.7 实测:智能不封顶定价封顶,长程Agent性价比之选 | 302.AI
All Rights Reserved by 302.AI
赞 (0)
302.AI
上一篇 5天前
下一篇 2024 年 9 月 4 日 下午4:03

相关推荐

  • 务实派旗舰 GPT-6 Sol 实测:既然打不过对手,价格先砍一半 | 302.AI

    📖 文章导读:9月22日,OpenAI 推出 GPT-6 Sol 与 Luna,以直降 50% 的定价和升级的缓存机制正面硬刚 Anthropic。本期针对 GPT-6 Sol 的实测显示,模型表现稳定,工程实现力有所提升,虽未展现碾压级突破,但凭借“够用且便宜”的优势,或可成为长周期 Agent 及批量任务的高性价比首选。 9 月 22 日,Anthrop…

    5天前 • 基准实验室
    1.4K0
  • DeepSeek-V4.1-Flash 实测:552B新架构,原生多模态,正式接棒V4 Pro | 302.AI

    📖 文章导读:9 月 10 日,DeepSeek V4.1 Flash发布。新模型采用全新架构,原生补齐多模态,大幅压缩KV Cache并下调价格,正式接棒V4 Pro。本期测评通过真实任务实测发现,其展现出逼近甚至局部超越 Pro 的能力,性价比极高。虽极限复杂任务仍有瑕疵,但“Pro 级能力、Flash 级价格”已初步坐实。一文解析其实战表现与选型参考。…

    2026 年 9 月 11 日 • 基准实验室
    1.8K0
  • GPT-6 Astra 实测:Computer Use 突破,AGI 还是高阶 Agent?| 302.AI

    📖 文章导读:AGI 时代已来?OpenAI 发布 GPT-6 Astra 引热议。新模型在推理与编程效果上表现惊艳,更带来突破性的 Computer Use 能力,让 AI 像人类一样自主操作电脑。究竟是 AGI 降临还是高阶 Agent?本期实测将其放入真实工作场景,围绕多模态、3D构建及电脑操作等维度展开实测,一探其实际表现。 每隔几个月,AI 圈就会…

    2026 年 9 月 9 日 • 基准实验室
    9520
  • Gemini 3.8 Flash 实测:最强Flash,编程逼近Opus 5,4大场景解析 | 302.AI

    📖 文章导读:Google 六周连发三代 Flash 模型,Gemini 3.8 Flash 定位“最强 Flash”,跑分直逼旗舰,强化编程与 Agent 且维持低价。实测揭示真实使用体验:响应够快,但复杂任务细节完成度明显逊于同级竞品,重速度轻打磨。它是高效搭 Demo的利器,但绝非所谓的“旗舰平替”。 Google 又更新 Gemini 了。从 7 月…

    2026 年 9 月 7 日 • 基准实验室
    2.0K0

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注