文章导读:
MiniMax 重磅发布新一代旗舰模型 M3,一举成为全球首个同时具备 Frontier 三件套——前沿 Coding 与 Agent 能力、1M 超长上下文、原生多模态的开源权重模型。作为开源阵营中罕见的“全能选手”,其真实表现如何?实测表明:M3 的代码生成与长程 Agent 能力是最大亮点,多模态补齐版图,高性价比依旧是杀手锏,但与顶尖闭源模型的差距依然存在。
在国产大模型持续冲高的 2026 上半年,MiniMax 再次带来了一位重磅选手:MiniMax M3。这一次,MiniMax 直接把 Frontier 三件套——前沿 Coding 与 Agentic 能力、百万 token 级超长上下文、原生多模态同时点满,并将其以 open-weight 形式推向市场,一举成为目前首个同时具备这三项能力的开源权重模型。

在公开基准测试中,M3 在 SWE-Bench Pro、Claw-Eval、OmniDocBench 等多项评测中进入全球第一梯队,并同步推出专门面向 Agent 场景打造的 MiniMax Code 产品。那么,这款被官方定义为“Frontier 开源模型”的新成员,实际表现究竟如何?
在进入本期实测之前,M3 有几个核心特点值得了解:
1.Frontier 级的 Coding 与 Agent 能力
相比传统代码生成模型,M3 更强调长程任务执行与自主协作能力。官方数据显示,其在 SWE-Bench Pro 上超过 GPT-5.5 和 Gemini 3.1 Pro,在 Claw-Eval 自主 Agent 评测中取得最高分。在 CUDA Kernel 优化、论文复现等案例中,也能体现模型在长时间任务规划、持续迭代、自我验证等方面的出色能力。
2.100 万 Token 超长上下文
M3 支持最高 1M Token 上下文窗口,能够同时容纳大型代码库、长篇文档、实验记录以及复杂任务历史。为了支撑这一能力,MiniMax 推出了全新的 MSA(MiniMax Sparse Attention)架构,在提升上下文长度的同时降低长上下文推理成本,为长程 Agent 和复杂协作任务提供基础设施支撑。
3.原生多模态架构
不同于后期接入视觉模块的方案,M3 从预训练阶段便采用图文混合训练路线,支持图像与视频输入。大规模的 Interleaved Data(图文交错数据)对于提升模型跨模态理解能力至关重要,这也使其在文档理解、图表分析以及复杂视觉推理场景中具备更强表现。
4.面向真实任务优化的训练思路
除了模型架构本身,MiniMax 还构建了交互式用户模拟器框架,让模型在训练阶段就接触更接近真实开发流程的协作场景。相比围绕单轮任务优化的传统评测体系,这种训练方式更强调需求澄清、多轮协作、任务切换以及长期项目推进能力,也成为 M3 Agent 能力的重要来源。

接下来,302.AI将通过多维度实测,全面考察 MiniMax M3 的真实表现。
I. 实测模型基础信息
(1)实测模型在 302.AI 的价格:

(2)测评目的:
本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。
(3)测评方法:
本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。
题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0
💡记分规则:
按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。
(4)测评工具:
- 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
- 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒
编程案例分数评级:
⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。
⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。
⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。
⭐⭐及以下 C级(不合格): 不可用,存在明显问题。
II. 测试结果总览
302.AI 多模态模型测评分数榜单:

III. 案例展示
案例 1:多模态推理
提示词:图中的挂毯缺了一块,请推断出缺失部分的颜色。

MiniMax M3:在提示下,M3 的推理仍存在用视觉读取结果强靠因式分解规律的情况,得出的结论“红色”实为图像分析的结果,未能真正洞察颜色组合规则。

附 GPT-5.5 的合理推理过程:

案例 2:程序化 SVG 图形生成
提示词:绘制一幅跨年烟花秀的动态SVG
MiniMax M3:输出效果与 M2.7 相比,精细度提升,其余未见明显差距,

MiniMax M2.7:

提示词:绘制一只猫追逐毛线球的动态SVG
MiniMax M3:在图形连接和运动状态上效果优于 M2.7,但仍有提升空间

MiniMax M2.7:

案例 3:品牌 Landing Page
Create a modern, high-end landing page for a creative architecture and design studio called "Vistal".
The design should feel premium, editorial, and internationally polished, similar to websites featured on Awwwards, ArchDaily, or leading architecture magazines.
Requirements
Create a complete landing page.
Include a navigation bar.
Include a visually striking hero section.
Include projects, services, or portfolio showcase.
Include a feature blog section.
Include an about section.
Include statistics, testimonials, or achievements.
Include a footer.
Design Direction
Prioritize typography, composition, spacing, and storytelling.
Use large editorial-style headlines.
Create a premium and memorable visual identity.
Add tasteful animations and hover interactions.
Feel free to use asymmetrical layouts, image overlaps, creative grids, or horizontally scrolling sections.
Avoid generic SaaS aesthetics.
Focus on originality and visual sophistication.
OUTPUT REQUIREMENTS
Generate the entire website as a SINGLE self-contained HTML file.
The output must contain:
Responsive design
Smooth animations and interactions
No external dependencies except optional Google Fonts
MiniMax M3
✅ 优势项:
- 设计方向适配提示词意图:配色方案避开科技感,衬线字体凸显高级感,加深品牌印象
- 非传统的多样性布局:非对称网格、横向滚动区域、图片重叠,提升视觉丰富度
- 交互效果出色:包括滚动揭示、数字递增、鼠标视差、水平滚动支持等
MiniMax M2.7 输出的落地页效果也基本符合要求,但风格明显偏商业 SaaS,布局偏保守,并且缺少独立的 statistics/achievements 区块
| 测评点 | MiniMax M3 | MiniMax M2.7 |
| 功能完整性 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| 视觉与交互 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 代码质量与工程思维 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
案例 4:Three.js 3D 动画
Create a visually stunning single-page HTML experience using Three.js.
Concept:
Create an elegant 3D mechanical pocket watch that can automatically disassemble and reassemble itself.
The experience should feel like a premium product showcase rather than an engineering simulation.
Visual Direction:
Inspired by:
Luxury watch advertisements
Apple product reveal animations
Museum exhibition displays
Precision craftsmanship
Use:
Warm brass and gold materials
Polished steel accents
Glass crystal cover
Soft studio lighting
Dark neutral background
Cinematic depth and shadows
Scene Composition:
The watch should be suspended in space above a subtle display platform.
The watch is composed of distinct parts:
Front glass
Outer case
Dial
Hour hand
Minute hand
Second hand
Multiple gears of different sizes
Main spring housing
Rear cover
Each component should be an independent Three.js object.
Animation Sequence:
When the page loads:
The fully assembled watch slowly rotates.
After a short delay:
The watch enters Exploded View mode.
Components separate one by one.
Parts move outward along different directions.
Each part rotates slightly while traveling.
The internal mechanism becomes visible.
Exploded State:
All parts remain perfectly aligned in space.
The viewer can clearly understand how the watch is constructed.
Gears continue spinning gently.
Reassembly Sequence:
After a pause:
Parts return in reverse order.
Components precisely snap back into position.
The watch becomes whole again.
The hands begin moving.
The watch resumes its slow showcase rotation.
Camera:
Create subtle cinematic camera motion:
Slow orbit
Gentle zoom
Smooth transitions
The camera should feel like a luxury commercial rather than a game.
Interaction:
Provide buttons:
Explode
Reassemble
Auto Demo
Allow mouse drag rotation using OrbitControls.
UI:
Display a small elegant information panel showing:
Total Components
Assembly Status
Animation Progress
Technical Expectations:
Use proper Three.js Groups and hierarchy.
Each component must maintain an original transform.
Exploded positions should be calculated relative to component locations.
Animations should be smooth and coordinated.
Maintain high frame rate.
Quality Goal:
The final result should resemble a premium industrial design showcase or luxury watch presentation seen in a keynote event.
Output Requirements:
Output ONLY the complete HTML file.
MiniMax M3 输出效果:
本案例我们使用 Gemini 3.1 Pro 的输出效果作为对比:
- 在材质真实度、表盘纹理、指针精确度、UI 面板设计等视觉表现上,Gemini 确实占领高地,表盘设计处理细致,甚至添加了太阳纹+罗马数字+品牌文字,而 M3 则依靠基础几何体+简单齿轮的组合
- 在动画细腻度上,M3 采用线性插值移动,而 Gemini 采用了 GSAP 缓动曲线+组件交错动画,控制实现更精确
- 不过,Gemini 输出的 650 行代码也更容易导致加载延迟
| 测评点 | MiniMax M3 | Gemini 3.1 Pro |
| 功能完整性 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 视觉与交互 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 动画品质 | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 代码组织 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
IV. MiniMax M3 模型实测结论

综合多维度实测,MiniMax M3 展现出一款极具特色且诚意十足的前沿开源模型应有的水准,尤其在长程任务、代码生成、前端输出等场景中展现出了以往只有闭源模型才具备的综合素质。然而,在望尘莫及和无限接近之间,仍存在一道可感知的差距。
具体来看:
1. Coding 与 Agent 能力是最大亮点
无论是官方展示的 CUDA Kernel 优化、ICLR 论文复现案例,还是我们在网页生成、SVG 动画、Three.js 场景等编程任务中的实际测试,都能感受到 M3 相比前代模型明显增强的工程能力。模型不再满足于完成单次代码生成,而是开始展现出更强的任务规划、结构设计以及复杂项目组织能力。
这也是 MiniMax 在真实开发流程上的针对性训练成果,配合自研的 MSA 稀疏注意力架构,M3 为长文档处理和复杂 Agent 工作流提供了坚实底座,模型明显朝着长程 Agent 的方向演进,开始具备持续迭代、自我修正以及处理复杂工程任务的能力,这也是当前顶级模型竞争最核心的方向之一。
2. 多模态补齐能力版图
相比前序模型,M3 最大的变化之一便是正式补齐了原生多模态能力。
在文档理解、视觉分析以及图文混合任务中,M3 已经能够提供稳定可用的结果,并且在部分专业基准测试中取得了不错成绩。但从本次实测来看,其视觉推理能力仍然存在一定局限,在部分需要真正理解图像规律与抽象关系的问题上,偶尔会过于依赖视觉读取结果而非深层推理,推理的深度和直觉判断与 GPT-5.5 这类闭源顶尖模型存在一定差异性。
与此同时,在高要求的创意生成与视觉呈现任务中,M3 虽然能够完整完成任务,但与 Gemini 3.1 Pro 等模型相比,客观差距依然存在。换言之,多模态已经成为 M3 的重要加分项,但尚未成为其绝对优势项。
3. 性价比依然是核心竞争力之一
除了模型能力本身,M3 延续了此前产品一贯的高性价比路线。
无论是 Token Plan 的定价策略,还是 API 成本控制,M3 都展现出较高的使用门槛友好度。不得不说,在当前开源与闭源模型价格差异依然明显的背景下,这无疑是 M3 具备竞争力的重要原因。
当然,从实际体验来看,其速度表现可能仍有进一步优化空间。从社交平台部分开发者的反馈中,也能看到关于 M3 响应速度和长任务执行效率的讨论。尽管 MSA 架构已大幅降低每 Token 计算量,但在 Agent 多轮迭代时,绝对响应延迟度依然较高。考虑到 M3 本身采用了更大的上下文规模以及更复杂的 Agent 能力设计,这种现象并不令人意外,但对于追求即时反馈的用户而言,仍然会影响整体体验。
MiniMax M3 可以视作开源大模型发展史上一个不可忽略的注脚,它尚未全面站上 GPT-5.5、Gemini 3.1 Pro 或 Claude Opus 4.7 所在的高度,但其在 Coding、Agent、长上下文与多模态协同能力上做出的独特探索,为开源社区注入了新的可能性。对于重视长程工程任务、追求高性价比,同时愿意接受一定性能折衷的开发者而言,M3 绝对是当前值得重点关注和尝试的开源选项之一。
V. 如何在 302.AI 上使用
1. 使用302.AI客户端
步骤指引:对话框内选择模型菜单

输入minimax即可获取相应版本调用

2. 聊天机器人中使用
步骤指引 :应用超市→聊天机器人→立即体验

选择模型:国产模型→MiniMax-M3→确认

3. 使用模型 API
步骤指引:API超市→语言大模型→MiniMax→MiniMax-M3


点击【立即体验】在线调用 API

想即刻体验 MiniMax M3 模型?
👉立即注册免费试用302.AI,开启你的AI之旅!👈
为什么选择302.AI?
● 灵活付费:无需月费,按需付费,成本可控
● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求
● 开源生态:支持开发者深度定制,打造专属AI应用
● 易用性:界面友好,操作简单,快速上手
