GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

📖 文章导读:
智谱最新原生多模态模型 GLM-5.3-Flash 以神秘黑马之姿横空出世,首日即终结 DeepSeek 长达 56 天的霸榜。模型支持百万级上下文,在视觉推理、前端编程等实测中表现卓越。极致性价比令人眼前一亮,价格仅为同水平顶尖模型的四十分之一。本文将通过硬核案例,带你实测这款“便宜又能打”的颠覆性模型。

8月20日,名为 Ox Alpha 的匿名模型出现在 OpenRouterOpenCode 上。没有预告,没有文档,连厂商 Logo 都没有。这个神秘模型上线首日,就如电影《牛来》一样以黑马之姿冲上了 OpenRouter 热度榜首,单日 Token 消耗量是平台历史最高值的 4 倍。而在代码评测榜 OpenCode 上,它直接终结了 DeepSeek 连续 56 天的霸榜地位。8 月 26 日,这款“牛来”模型才终于摘下面具:智谱最新的原生多模态模型 GLM-5.3-Flash 正式上线。

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

作为智谱 GLM-5 系列第一个原生多模态模型,GLM-5.3-Flash 拥有 320B 总参数、18B 激活参数,原生支持图片、视频、文件和文本,上下文窗口达到 1M Token。更重要的是,它并不是简单把 GLM-5.3 做小以后重新包装一次,而是一个全新的预训练模型,用了 30 万亿 Token 的多模态预训练数据。这种设计直接带来了一个很有意思的结果:模型规模没有明显缩掉,实际推理时需要动用的参数却少了很多。

跑分上,Artificial Analysis 综合智能指数拿下 57 分,与 Claude Opus 4.8 打成平手,同时超过 GLM-5.2,也高于 DeepSeek V4 Pro 的 53 分。

与此同时,原生多模态又极大扩展了模型的能力边界。 它不只是会看图片、读视频,而是可以把视觉反馈直接塞进 Coding Loop :写完网页以后自己截图检查,做游戏以后进入实机环境观察运行状态,处理 PPT、PDF、DOCX、XLSX 时也可以根据最终视觉效果继续修改。这样一来,模型判断“任务完成”的标准,就开始从代码和日志,延伸到真正的页面、游戏和文档成品。

然而,真正夸张的在于其定价。GLM-5.3-Flash 的 API 定价只有 输入 0.8 元,输出 2.8 元/百万 Token,缓存命中 0.23 元。上线前两周限时半价,输入 0.4 元,输出 1.4 元。这比 DeepSeek V4 Flash 在空闲时段的价格还要便宜一半。同样顶级的智力,对比 Claude Opus 4.8,价格甚至只有后者的约四十分之一。

榜单排名:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

目前在 Artificial Analysis 榜单中位列第15位。

用户评价:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

参数量不算特别夸张,价格低得离谱,还第一次加入原生多模态。这款模型究竟是否便宜又能打?实际使用体验如何?接下来,302.AI将直接把它扔进真实案例中一探究竟。


1. 实测模型基础信息

(1)实测模型在 302.AI 的价格:

模型名称上下文说明302.AI内的价格
glm-5.3-flash1000000缓存读取 $0.015 / 1M tokens输入 $0.075 / 1M tokens输出 $0.25 / 1M tokens
deepseek-v4-flash-vision-exp1000000闲时价格缓存读取:$ 0.007 / 1M tokens输入:$ 0.22 / 1M tokens输出:$ 0.66 / 1M tokens
高峰期价格 (北京时间:09:00‑12:00,14:00‑18:00)缓存读取:$ 0.014 / 1M tokens输入:$ 0.44 / 1M tokens输出:$ 1.32 / 1M tokens

(2)测评目的:

本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。

(3)测评方法:

本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。

题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0

💡记分规则:

按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。

(4)测评工具:

  • 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
  • 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒

编程案例分数评级:

⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。

⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。

⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。

⭐⭐及以下 C级(不合格): 不可用,存在明显问题。


2. 测试结果总览

302.AI 多模态模型测评分数榜单:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

3. 案例展示

案例 1:多模态逻辑推理

提示词:看图猜字谜:图片表现的分别代表哪两个美国城市?

解析:

SEAT + CATTLE – CAT = SEATTLE(西雅图)

BOY + AWL – YAWL + STONE – E = BOSTON(波士顿)

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

GLM-5.3-Flash:2 个字谜中有 1 个推理正确

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

DeepSeek-V4-Flash-Vision-Exp:2 个字谜中有 1 个推理正确

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

提示词:找出图中规律不同的一个图形

解析:这些图形中,两侧都各有一条短线。而第五个图形的两条线位于同一侧。

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

GLM-5.3-Flash:推理正确

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

DeepSeek-V4-Flash-Vision-Exp:结论正确,但推理逻辑不自洽

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

案例 2:程序化 SVG 图形生成

提示词:将参考图展示的画面绘制为动态svg

参考图 1:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

GLM-5.3-Flash 输出效果:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

DeepSeek-V4-Flash-Vision-Exp 输出效果:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

参考图 2:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

GLM-5.3-Flash 输出效果:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

DeepSeek-V4-Flash-Vision-Exp 输出效果:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

简评:

GLM-5.3-Flash 在语义还原、图形复杂度和动态表现上都优于 DeepSeek,能够先分析出图片出处、场景构造和叙事意图。

测评点GLM-5.3-FlashDeepSeek-V4-Flash-Vision-Exp
语义表达准确度⭐⭐⭐⭐⭐⭐⭐⭐⭐
图形构造复杂度⭐⭐⭐⭐⭐⭐⭐
动态实现质量⭐⭐⭐⭐⭐⭐⭐

案例 3:网页复刻

提示词:复刻截图所展示的网页。

网页截图:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

(来源:Zama Khan Mohammed)

GLM-5.3-Flash 输出效果:

DeepSeek-V4-Flash-Vision-Exp 输出效果:

简评:

两组模型都较完整地还原了网页内容,GLM-5.3-Flash 输出的页面视觉精度更高,功能细节完整可用。

测评点GLM-5.3-FlashDeepSeek-V4-Flash
功能完整性⭐⭐⭐⭐⭐⭐⭐⭐⭐
视觉表现力⭐⭐⭐⭐⭐⭐⭐⭐
还原度⭐⭐⭐⭐⭐⭐⭐⭐

案例 4:建筑草图复原

提示词

根据参考图理解房间的空间结构,将其还原为一个可交互的Three.js 3D场景。

尽可能准确地复现图中的房间布局、建筑结构、家具位置、比例关系、材质、色彩和灯光氛围,并根据参考图合理推断不可见的空间结构。

视角支持鼠标旋转、缩放和自由查看。整体效果应尽可能还原参考图的空间感和视觉风格。

参考图:

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

GLM-5.3-Flash 输出效果:

简评:

✅ 核心优势:

  1. 使用 ES Module + importmap,符合现代前端规范,封装了 mk() 通用创建函数,大幅减少重复代码;
  2. 场景空间感更强、建模更细致,实现圆角家具,以及布料编织纹理处理,视觉效果更柔和真实;
  3. 配色和灯光系统搭配得当,面积光模拟物理更准确,吊灯、落地灯均有对应的 PointLight 实时光照。

❌ 不足之处:

  1. 引入了较多扩展库,增加了加载依赖;
  2. 落地窗外缺少天空贴图,略显空白。

DeepSeek-V4-Flash-Vision-Exp 输出效果:

简评:

✅ 核心优势:

  1. 基础设施较还原,配色系统更大胆明亮,灯光系统非常完整,光线自然和谐;
  2. 明确设定了房间尺寸,所有家具的位置和比例关系都较为严谨。

❌ 不足之处:

  1. 代码组织方式较为传统,使用<script>标签直接加载,未使用 ES Module;
  2. 部分装饰物几何精度一般,形状略显生硬,窗户严重穿模。
测评点GLM-5.3-FlashDeepSeek-V4-Flash
建模质感⭐⭐⭐⭐⭐⭐⭐
视觉表现力⭐⭐⭐⭐⭐⭐⭐
还原度⭐⭐⭐⭐⭐⭐⭐

4. GLM-5.3-Flash 模型实测结论

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

结合跑分和实测体感可以感知到,GLM-5.3-Flash 是一款综合能力完成度很高,尤其适合 Coding、多模态和日常生产力场景的模型。

1. 最稳的底盘:综合能力

从本次测试来看,GLM-5.3-Flash 的基础推理、图像理解以及复杂信息处理能力都比较稳定。尤其是在图片与代码结合的任务里,它对于画面结构、元素关系和视觉意图的理解比较到位。

在图形规律观察案例中,它就与 DeepSeek 的推理拉开了差距,推理逻辑严谨自洽,并非将图片“翻译”成文字再处理,而是真正在视觉空间里做出规律识别和推理;类似的表现也出现在网页复刻和建筑草图复原中。它需要先从截图里理解页面层级、视觉关系以及空间结构,再把这些信息转化成 HTML、SVG 或 Three.js 代码。尤其是建筑草图复原这种任务,模型需要自行根据已有信息推断房间尺寸、家具位置、材质和光照关系。

这种能力放到真实场景里,意味着它能看懂产品截图里的布局问题、能识别设计稿中的视觉冲突,这种能力的价值远高于单纯的图像识别。因此,原生多模态能力的补齐也可以视作为 GLM-5.3 的“底盘”增加了一层稳固性。当任务从文字延伸到图片、页面、图表、视频甚至真实运行环境之后,模型的稳定性反而是最难得的。

2. 最能打的招牌:Coding

如果要给 GLM-5.3-Flash 找一个最值得关注的使用场景,Coding 仍然可以放在前。这一能在实测中体现为:模型对于最终交付物的完成度有了更明显的追求。

在程序化 SVG 生成案例中,GLM-5.3-Flash 会先理解参考图里的构图、元素关系和动态逻辑,再把这些视觉信息拆解成对应的图形与动画。而在网页复刻和 Three.js 建模的案例中,模型最终给出的结果,已经比较接近一个真正可以运行和继续修改的工程,而不是停留在把参考图大致画出来的阶段。

值得一提的是,GLM-5.3-Flash 开始自己检查输出的作品。通过视觉反馈,它可以在代码生成后对实际渲染结果进行多轮检查,发现问题以后继续修改。网页有元素遮挡,就调整布局;场景比例不对,就重新修改模型。对于前端、游戏和 3D 这类任务,这种能力尤其重要。

3. 最离谱的优势:性价比

GLM-5.3-Flash 最夸张的地方在于,单看能力,它已经足够进入主流前沿模型的竞争范围,你很难把它和目前的定价联系起来。输入 0.8 元、输出 2.8 元/百万 Token,本身已经很便宜,再叠加限时半价,使用成本进一步下降。即便拿同样主打高性价比的 DeepSeek V4 Flash 来比,GLM-5.3-Flash 在输入和输出成本上依然有明显优势。

更重要的是,这种低价对于模型真正的使用方式会产生变化:当一个模型足够贵的时候,我们会本能地控制它的使用频率。复杂任务才调用,Prompt 尽量一次写对,代码也不太敢让它反复调试;但价格降到这个程度以后,就可以让模型开始适合承担大量高频工作,直接把长文档丢给模型,让它反复修改网页、跑多轮代码测试,甚至承接大量后台自动化任务。

模型能力决定它能“做什么”,价格则决定它能“做多少”。

对于一款综合能力已经接近前沿水平的模型来说,低成本带来的价值并不只是省钱,而是让更多任务真正有机会交给模型处理。模型便宜到可以被频繁调用,它才开始从一个需要精打细算的工具,变成真正可以融入日常工作流的基础设施。


常见问题 FAQ

Q1:GLM-5.3-Flash 是什么?和 GLM-5.3 有什么不同?

GLM-5.3-Flash 是智谱推出的 GLM-5 系列第一个原生多模态模型,拥有 320B 总参数、18B 激活参数,原生支持图片、视频、文件和文本,上下文窗口达 1M Token。它并非简单把 GLM-5.3 缩小,而是一个全新的预训练模型,使用了 30 万亿 Token 的多模态预训练数据。模型规模没有明显缩水,实际推理所需参数却少很多。

Q2:GLM-5.3-Flash 的多模态能力有多强?

GLM-5.3-Flash 原生支持图片、视频、文件(PPT、PDF、DOCX、XLSX)和文本。它不仅会看图读视频,还能把视觉反馈直接塞进 Coding Loop:写完网页自己截图检查、做游戏后进入实机环境观察运行状态、处理文档时根据最终视觉效果继续修改。它判断任务完成的标准从代码和日志延伸到真正的页面、游戏和文档成品。

Q3:GLM-5.3-Flash 的价格是多少?

GLM-5.3-Flash 的 API 定价为输入 0.8 元、输出 2.8 元/百万 Token,缓存命中 0.23 元;上线前两周限时半价,输入 0.4 元、输出 1.4 元。在 302.AI 平台,价格为缓存读取 $0.015、输入 $0.075、输出 $0.25/百万 Token。比 DeepSeek V4 Flash 空闲时段还便宜一半,约为 Claude Opus 4.8 的四十分之一。

Q4:GLM-5.3-Flash 的上下文窗口有多大?

GLM-5.3-Flash 支持 1M Token 上下文窗口,可以处理大型代码库、长篇文档、多页 PPT/PDF 以及复杂的多模态任务历史。更大的上下文配合原生多模态能力,让它可以同时在视觉和文本之间保持连贯的推理,适合需要长期项目状态和视觉反馈迭代的场景。

Q5:GLM-5.3-Flash 为什么能终结 DeepSeek 的霸榜?

GLM-5.3-Flash 上线首日就以黑马姿态冲上 OpenRouter 热度榜首,单日 Token 消耗量是平台历史最高值的 4 倍,在代码评测榜 OpenCode 上直接终结了 DeepSeek 连续 56 天的霸榜。Artificial Analysis 榜单中位列第 15 位。它用更小的激活参数、原生多模态能力和极低的价格,实现了综合能力和性价比的双重突破。

Q6:GLM-5.3-Flash 擅长哪些场景?

根据 302.AI 实测,GLM-5.3-Flash 主要擅长:1)多模态逻辑推理;2)程序化 SVG 图形生成;3)网页复刻;4)建筑草图复原。它最显眼的是 Coding 能力,写代码、做前端、做游戏都能把视觉反馈纳入迭代循环,同时也擅长处理 PPT、PDF、DOCX、XLSX 等多文件格式。

Q7:GLM-5.3-Flash 有哪些局限性?

在 302.AI 实测中,GLM-5.3-Flash 虽然综合能力最稳、Coding 最能打、性价比最离谱,但作为相对较新的模型,仍需关注:1)榜单排名并非绝对顶尖(Artificial Analysis 第 15 位);2)在极端复杂任务上的细节打磨仍待验证;3)实验性定位意味着部分能力边界还在探索中。建议结合真实任务做进一步检验。

Q8:如何在 302.AI 上调用 GLM-5.3-Flash API?

在 302.AI 调用 GLM-5.3-Flash 的步骤是:1)注册并充值 302.AI 账号;2)进入 API 超市,搜索 GLM-5.3-Flash;3)获取 API Key;4)使用在线调试功能测试;5)通过兼容 OpenAI 格式的接口接入 Python、Node.js 等应用。也可以上传图片、视频或文档作为多模态输入,或在 302.AI 客户端中直接使用。

5. 如何在 302.AI 上使用

1. 使用302.AI客户端

步骤指引:对话框内选择模型菜单

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

输入glm-5.3即可获取相应版本调用

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

2. 聊天机器人中使用

步骤指引 :应用超市→聊天机器人→立即体验

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

选择模型:国产模型→glm-5.3-flash→确认

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

3. 使用模型 API

步骤指引:API超市→语言大模型→智谱→lm-5.3-flash

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

点击【Playground】在线调用 API

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI

想即刻体验 GLM-5.3-Flash 模型?

👉立即注册免费试用302.AI,开启你的AI之旅!👈

为什么选择302.AI?

● 灵活付费:无需月费,按需付费,成本可控

● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求

● 开源生态:支持开发者深度定制,打造专属AI应用

● 易用性:界面友好,操作简单,快速上手

GLM-5.3-Flash 实测:终结DeepSeek霸榜,1M 上下文 + 多模态 + Coding,把前沿能力卷到白菜价 | 302.AI
All Rights Reserved by 302.AI
(0)
302.AI
上一篇 2天前
下一篇 2024 年 11 月 18 日 下午6:58

相关推荐

  • DeepSeek-V4-Flash-Vision-Exp 实测:视觉能力补全,离多模态 Agent 又近一步 | 302.AI

    📖 文章导读:DeepSeek 终于给 V4 Flash 装上“眼睛”,多模态模型 V4-Flash-Vision-Exp 近期上线,在保持极低价格的同时补齐了视觉短板。本文将通过多轮真实使用场景测评,结果显示,其文本能力未缩水,视觉理解已达实用水平,尽管在复杂推断与代码精细度上有瑕疵,但仍是低成本 Agent 工作流的性价比利器。 8 月 21 日,Dee…

    2天前 基准实验室
    2670
  • GLM-5.3实测:定价不变,Coding能力再进化,智谱新旗舰解析 | 302.AI

    📖 文章导读:不换基座,仅靠后训练能跑出什么水平?智谱最新旗舰模型 GLM-5.3 上线,以极低价格实现效能提升。实测 Coding 场景表现卓越,前端审美攀升。随着即将到来的开源,这款高性价比的“工程全能体”正强势杀入顶尖 Coding 模型第一梯队。 2026年8月,大模型的竞技焦点已全面转向长程工程落地与生产力交付的深水区。继6月上线GLM-5.2之后…

    4天前 基准实验室
    4630
  • 三周两更,Gemini 3.7 Flash 实测:340 Token/s,Agent能力跃升,但还不是Pro | 302.AI

    📖 文章导读:三周两更,谷歌把 Gemini 3.7 Flash 端了上来。不仅 API 价格腰斩,更以“主力工作模型”自居,轻量级模型能否承担旗舰职能?本期实测表明,3.7 Flash 在速度与成本上极具竞争力,是高频生产任务的实用派首选,但工程深度与精度仍有明显上限。 8 月 13 日,Gemini 3.7 Flash 正式发布。距离 Gemini 3.…

    2026 年 8 月 20 日 基准实验室
    7740
  • Grok 4.6 实测:1.5万亿参数,成本仅Opus 1/4,3大场景硬刚 Claude Opus 5 | 302.AI

    📖 文章导读:距上代发布仅一月,SpaceXAI “光速”推出旗舰模型 Grok 4.6。此次摒弃参数堆砌,转而深耕数据质量与长程Agent能力,剑指编程与复杂工作流。本文基于实测,将其正面硬刚 Claude Opus 5,实测发现,Grok 4.6 视觉上限极高、长流程代码抗打,且使用成本仅为竞品四分之一,但细节与稳定性仍存短板。一文看懂这款高性价比模型的…

    2026 年 8 月 18 日 基准实验室
    8390

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注