📖 文章导读:
智谱最新原生多模态模型 GLM-5.3-Flash 以神秘黑马之姿横空出世,首日即终结 DeepSeek 长达 56 天的霸榜。模型支持百万级上下文,在视觉推理、前端编程等实测中表现卓越。极致性价比令人眼前一亮,价格仅为同水平顶尖模型的四十分之一。本文将通过硬核案例,带你实测这款“便宜又能打”的颠覆性模型。
8月20日,名为 Ox Alpha 的匿名模型出现在 OpenRouter 和 OpenCode 上。没有预告,没有文档,连厂商 Logo 都没有。这个神秘模型上线首日,就如电影《牛来》一样以黑马之姿冲上了 OpenRouter 热度榜首,单日 Token 消耗量是平台历史最高值的 4 倍。而在代码评测榜 OpenCode 上,它直接终结了 DeepSeek 连续 56 天的霸榜地位。8 月 26 日,这款“牛来”模型才终于摘下面具:智谱最新的原生多模态模型 GLM-5.3-Flash 正式上线。

作为智谱 GLM-5 系列第一个原生多模态模型,GLM-5.3-Flash 拥有 320B 总参数、18B 激活参数,原生支持图片、视频、文件和文本,上下文窗口达到 1M Token。更重要的是,它并不是简单把 GLM-5.3 做小以后重新包装一次,而是一个全新的预训练模型,用了 30 万亿 Token 的多模态预训练数据。这种设计直接带来了一个很有意思的结果:模型规模没有明显缩掉,实际推理时需要动用的参数却少了很多。
跑分上,Artificial Analysis 综合智能指数拿下 57 分,与 Claude Opus 4.8 打成平手,同时超过 GLM-5.2,也高于 DeepSeek V4 Pro 的 53 分。
与此同时,原生多模态又极大扩展了模型的能力边界。 它不只是会看图片、读视频,而是可以把视觉反馈直接塞进 Coding Loop :写完网页以后自己截图检查,做游戏以后进入实机环境观察运行状态,处理 PPT、PDF、DOCX、XLSX 时也可以根据最终视觉效果继续修改。这样一来,模型判断“任务完成”的标准,就开始从代码和日志,延伸到真正的页面、游戏和文档成品。
然而,真正夸张的在于其定价。GLM-5.3-Flash 的 API 定价只有 输入 0.8 元,输出 2.8 元/百万 Token,缓存命中 0.23 元。上线前两周限时半价,输入 0.4 元,输出 1.4 元。这比 DeepSeek V4 Flash 在空闲时段的价格还要便宜一半。同样顶级的智力,对比 Claude Opus 4.8,价格甚至只有后者的约四十分之一。
榜单排名:

目前在 Artificial Analysis 榜单中位列第15位。
用户评价:

参数量不算特别夸张,价格低得离谱,还第一次加入原生多模态。这款模型究竟是否便宜又能打?实际使用体验如何?接下来,302.AI将直接把它扔进真实案例中一探究竟。
1. 实测模型基础信息
(1)实测模型在 302.AI 的价格:
| 模型名称 | 上下文 | 说明 | 302.AI内的价格 |
|---|---|---|---|
| glm-5.3-flash | 1000000 | 缓存读取 $0.015 / 1M tokens输入 $0.075 / 1M tokens输出 $0.25 / 1M tokens | |
| deepseek-v4-flash-vision-exp | 1000000 | 闲时价格 | 缓存读取:$ 0.007 / 1M tokens输入:$ 0.22 / 1M tokens输出:$ 0.66 / 1M tokens |
| 高峰期价格 (北京时间:09:00‑12:00,14:00‑18:00) | 缓存读取:$ 0.014 / 1M tokens输入:$ 0.44 / 1M tokens输出:$ 1.32 / 1M tokens |
(2)测评目的:
本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。
(3)测评方法:
本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。
题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0
💡记分规则:
按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。
(4)测评工具:
- 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
- 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒
编程案例分数评级:
⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。
⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。
⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。
⭐⭐及以下 C级(不合格): 不可用,存在明显问题。
2. 测试结果总览
302.AI 多模态模型测评分数榜单:

3. 案例展示
案例 1:多模态逻辑推理
提示词:看图猜字谜:图片表现的分别代表哪两个美国城市?
解析:
SEAT + CATTLE – CAT = SEATTLE(西雅图)
BOY + AWL – YAWL + STONE – E = BOSTON(波士顿)

GLM-5.3-Flash:2 个字谜中有 1 个推理正确

DeepSeek-V4-Flash-Vision-Exp:2 个字谜中有 1 个推理正确

提示词:找出图中规律不同的一个图形
解析:这些图形中,两侧都各有一条短线。而第五个图形的两条线位于同一侧。

GLM-5.3-Flash:推理正确

DeepSeek-V4-Flash-Vision-Exp:结论正确,但推理逻辑不自洽

案例 2:程序化 SVG 图形生成
提示词:将参考图展示的画面绘制为动态svg
参考图 1:

GLM-5.3-Flash 输出效果:

DeepSeek-V4-Flash-Vision-Exp 输出效果:

参考图 2:

GLM-5.3-Flash 输出效果:

DeepSeek-V4-Flash-Vision-Exp 输出效果:

简评:
GLM-5.3-Flash 在语义还原、图形复杂度和动态表现上都优于 DeepSeek,能够先分析出图片出处、场景构造和叙事意图。
| 测评点 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp |
| 语义表达准确度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 图形构造复杂度 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 动态实现质量 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
案例 3:网页复刻
提示词:复刻截图所展示的网页。
网页截图:

(来源:Zama Khan Mohammed)
GLM-5.3-Flash 输出效果:
DeepSeek-V4-Flash-Vision-Exp 输出效果:
简评:
两组模型都较完整地还原了网页内容,GLM-5.3-Flash 输出的页面视觉精度更高,功能细节完整可用。
| 测评点 | GLM-5.3-Flash | DeepSeek-V4-Flash |
| 功能完整性 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 视觉表现力 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 还原度 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
案例 4:建筑草图复原
提示词:
根据参考图理解房间的空间结构,将其还原为一个可交互的Three.js 3D场景。
尽可能准确地复现图中的房间布局、建筑结构、家具位置、比例关系、材质、色彩和灯光氛围,并根据参考图合理推断不可见的空间结构。
视角支持鼠标旋转、缩放和自由查看。整体效果应尽可能还原参考图的空间感和视觉风格。
参考图:

GLM-5.3-Flash 输出效果:
简评:
✅ 核心优势:
- 使用 ES Module + importmap,符合现代前端规范,封装了
mk()通用创建函数,大幅减少重复代码; - 场景空间感更强、建模更细致,实现圆角家具,以及布料编织纹理处理,视觉效果更柔和真实;
- 配色和灯光系统搭配得当,面积光模拟物理更准确,吊灯、落地灯均有对应的 PointLight 实时光照。
❌ 不足之处:
- 引入了较多扩展库,增加了加载依赖;
- 落地窗外缺少天空贴图,略显空白。
DeepSeek-V4-Flash-Vision-Exp 输出效果:
简评:
✅ 核心优势:
- 基础设施较还原,配色系统更大胆明亮,灯光系统非常完整,光线自然和谐;
- 明确设定了房间尺寸,所有家具的位置和比例关系都较为严谨。
❌ 不足之处:
- 代码组织方式较为传统,使用
<script>标签直接加载,未使用 ES Module; - 部分装饰物几何精度一般,形状略显生硬,窗户严重穿模。
| 测评点 | GLM-5.3-Flash | DeepSeek-V4-Flash |
| 建模质感 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 视觉表现力 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 还原度 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
4. GLM-5.3-Flash 模型实测结论

结合跑分和实测体感可以感知到,GLM-5.3-Flash 是一款综合能力完成度很高,尤其适合 Coding、多模态和日常生产力场景的模型。
1. 最稳的底盘:综合能力
从本次测试来看,GLM-5.3-Flash 的基础推理、图像理解以及复杂信息处理能力都比较稳定。尤其是在图片与代码结合的任务里,它对于画面结构、元素关系和视觉意图的理解比较到位。
在图形规律观察案例中,它就与 DeepSeek 的推理拉开了差距,推理逻辑严谨自洽,并非将图片“翻译”成文字再处理,而是真正在视觉空间里做出规律识别和推理;类似的表现也出现在网页复刻和建筑草图复原中。它需要先从截图里理解页面层级、视觉关系以及空间结构,再把这些信息转化成 HTML、SVG 或 Three.js 代码。尤其是建筑草图复原这种任务,模型需要自行根据已有信息推断房间尺寸、家具位置、材质和光照关系。
这种能力放到真实场景里,意味着它能看懂产品截图里的布局问题、能识别设计稿中的视觉冲突,这种能力的价值远高于单纯的图像识别。因此,原生多模态能力的补齐也可以视作为 GLM-5.3 的“底盘”增加了一层稳固性。当任务从文字延伸到图片、页面、图表、视频甚至真实运行环境之后,模型的稳定性反而是最难得的。
2. 最能打的招牌:Coding
如果要给 GLM-5.3-Flash 找一个最值得关注的使用场景,Coding 仍然可以放在前。这一能在实测中体现为:模型对于最终交付物的完成度有了更明显的追求。
在程序化 SVG 生成案例中,GLM-5.3-Flash 会先理解参考图里的构图、元素关系和动态逻辑,再把这些视觉信息拆解成对应的图形与动画。而在网页复刻和 Three.js 建模的案例中,模型最终给出的结果,已经比较接近一个真正可以运行和继续修改的工程,而不是停留在把参考图大致画出来的阶段。
值得一提的是,GLM-5.3-Flash 开始自己检查输出的作品。通过视觉反馈,它可以在代码生成后对实际渲染结果进行多轮检查,发现问题以后继续修改。网页有元素遮挡,就调整布局;场景比例不对,就重新修改模型。对于前端、游戏和 3D 这类任务,这种能力尤其重要。
3. 最离谱的优势:性价比
GLM-5.3-Flash 最夸张的地方在于,单看能力,它已经足够进入主流前沿模型的竞争范围,你很难把它和目前的定价联系起来。输入 0.8 元、输出 2.8 元/百万 Token,本身已经很便宜,再叠加限时半价,使用成本进一步下降。即便拿同样主打高性价比的 DeepSeek V4 Flash 来比,GLM-5.3-Flash 在输入和输出成本上依然有明显优势。
更重要的是,这种低价对于模型真正的使用方式会产生变化:当一个模型足够贵的时候,我们会本能地控制它的使用频率。复杂任务才调用,Prompt 尽量一次写对,代码也不太敢让它反复调试;但价格降到这个程度以后,就可以让模型开始适合承担大量高频工作,直接把长文档丢给模型,让它反复修改网页、跑多轮代码测试,甚至承接大量后台自动化任务。
模型能力决定它能“做什么”,价格则决定它能“做多少”。
对于一款综合能力已经接近前沿水平的模型来说,低成本带来的价值并不只是省钱,而是让更多任务真正有机会交给模型处理。模型便宜到可以被频繁调用,它才开始从一个需要精打细算的工具,变成真正可以融入日常工作流的基础设施。
常见问题 FAQ
Q1:GLM-5.3-Flash 是什么?和 GLM-5.3 有什么不同?
GLM-5.3-Flash 是智谱推出的 GLM-5 系列第一个原生多模态模型,拥有 320B 总参数、18B 激活参数,原生支持图片、视频、文件和文本,上下文窗口达 1M Token。它并非简单把 GLM-5.3 缩小,而是一个全新的预训练模型,使用了 30 万亿 Token 的多模态预训练数据。模型规模没有明显缩水,实际推理所需参数却少很多。
Q2:GLM-5.3-Flash 的多模态能力有多强?
GLM-5.3-Flash 原生支持图片、视频、文件(PPT、PDF、DOCX、XLSX)和文本。它不仅会看图读视频,还能把视觉反馈直接塞进 Coding Loop:写完网页自己截图检查、做游戏后进入实机环境观察运行状态、处理文档时根据最终视觉效果继续修改。它判断任务完成的标准从代码和日志延伸到真正的页面、游戏和文档成品。
Q3:GLM-5.3-Flash 的价格是多少?
GLM-5.3-Flash 的 API 定价为输入 0.8 元、输出 2.8 元/百万 Token,缓存命中 0.23 元;上线前两周限时半价,输入 0.4 元、输出 1.4 元。在 302.AI 平台,价格为缓存读取 $0.015、输入 $0.075、输出 $0.25/百万 Token。比 DeepSeek V4 Flash 空闲时段还便宜一半,约为 Claude Opus 4.8 的四十分之一。
Q4:GLM-5.3-Flash 的上下文窗口有多大?
GLM-5.3-Flash 支持 1M Token 上下文窗口,可以处理大型代码库、长篇文档、多页 PPT/PDF 以及复杂的多模态任务历史。更大的上下文配合原生多模态能力,让它可以同时在视觉和文本之间保持连贯的推理,适合需要长期项目状态和视觉反馈迭代的场景。
Q5:GLM-5.3-Flash 为什么能终结 DeepSeek 的霸榜?
GLM-5.3-Flash 上线首日就以黑马姿态冲上 OpenRouter 热度榜首,单日 Token 消耗量是平台历史最高值的 4 倍,在代码评测榜 OpenCode 上直接终结了 DeepSeek 连续 56 天的霸榜。Artificial Analysis 榜单中位列第 15 位。它用更小的激活参数、原生多模态能力和极低的价格,实现了综合能力和性价比的双重突破。
Q6:GLM-5.3-Flash 擅长哪些场景?
根据 302.AI 实测,GLM-5.3-Flash 主要擅长:1)多模态逻辑推理;2)程序化 SVG 图形生成;3)网页复刻;4)建筑草图复原。它最显眼的是 Coding 能力,写代码、做前端、做游戏都能把视觉反馈纳入迭代循环,同时也擅长处理 PPT、PDF、DOCX、XLSX 等多文件格式。
Q7:GLM-5.3-Flash 有哪些局限性?
在 302.AI 实测中,GLM-5.3-Flash 虽然综合能力最稳、Coding 最能打、性价比最离谱,但作为相对较新的模型,仍需关注:1)榜单排名并非绝对顶尖(Artificial Analysis 第 15 位);2)在极端复杂任务上的细节打磨仍待验证;3)实验性定位意味着部分能力边界还在探索中。建议结合真实任务做进一步检验。
Q8:如何在 302.AI 上调用 GLM-5.3-Flash API?
在 302.AI 调用 GLM-5.3-Flash 的步骤是:1)注册并充值 302.AI 账号;2)进入 API 超市,搜索 GLM-5.3-Flash;3)获取 API Key;4)使用在线调试功能测试;5)通过兼容 OpenAI 格式的接口接入 Python、Node.js 等应用。也可以上传图片、视频或文档作为多模态输入,或在 302.AI 客户端中直接使用。
5. 如何在 302.AI 上使用
1. 使用302.AI客户端
步骤指引:对话框内选择模型菜单

输入glm-5.3即可获取相应版本调用

2. 聊天机器人中使用
步骤指引 :应用超市→聊天机器人→立即体验

选择模型:国产模型→glm-5.3-flash→确认

3. 使用模型 API
步骤指引:API超市→语言大模型→智谱→lm-5.3-flash

点击【Playground】在线调用 API

想即刻体验 GLM-5.3-Flash 模型?
👉立即注册免费试用302.AI,开启你的AI之旅!👈
为什么选择302.AI?
● 灵活付费:无需月费,按需付费,成本可控
● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求
● 开源生态:支持开发者深度定制,打造专属AI应用
● 易用性:界面友好,操作简单,快速上手
