
qwen/qwen3-30b-a3b-fp8
Qwen3 - 30B - A3B 模型的非思考模式 FP8 量化版本
2025-06-10
输入:
$0.1/1M tokens
输出:
$0.5/1M tokens
大额采购联系客户经理享专属优惠
API介绍
Qwen3-30B-A3B-Instruct-2507-FP8 是阿里巴巴通义实验室推出的高效混合专家(MoE)语言模型的 FP8 量化版本,核心定位为“小激活、大能力、低延迟”的企业级智能推理引擎。
- MoE 架构精巧设计:总参数约 30B,激活参数仅 3B(A3B),在保持高智能密度的同时大幅降低计算开销
- FP8 量化加速:采用 FP8 精度,在 NVIDIA H100/A100 等硬件上实现 2 倍以上推理吞吐提升,显存占用显著减少
- 128K 超长上下文:原生支持长文本输入,适用于文档摘要、多轮对话、复杂任务规划等场景
- 指令微调优化:专为高质量指令遵循训练,在逻辑推理、代码生成、多语言问答中输出精准可靠
───────────────────────────────────────────────────────────────────
核心能力
⚡ 极致能效比:以接近 7B 稠密模型的计算成本,实现 30B 级别的综合能力,单位算力产出更高
🧠 精准任务执行:经过精细对齐训练,能准确理解格式、风格、多步骤等细粒度指令要求
🌍 多语言自然表达:覆盖中、英、日、法等主流语言,输出符合本地文化语境与专业习惯
🛡️ 生产环境就绪:FP8 量化 + MoE 架构,兼顾性能、成本与稳定性,适合高并发企业级应用部署
Playground
登录后,探索更多精彩功能! 点击登录
API统计
API列表 (1)
API价格表
$¥ 円 ₽