qwen/qwen3-30b-a3b-fp8

qwen/qwen3-30b-a3b-fp8

Qwen3 - 30B - A3B 模型的非思考模式 FP8 量化版本
2025-06-10
语言大模型
输入:
$0.1/1M tokens
输出:
$0.5/1M tokens
大额采购联系客户经理享专属优惠

API介绍

Qwen3-30B-A3B-Instruct-2507-FP8 是阿里巴巴通义实验室推出的高效混合专家(MoE)语言模型的 FP8 量化版本,核心定位为“小激活、大能力、低延迟”的企业级智能推理引擎。

  • MoE 架构精巧设计:总参数约 30B,激活参数仅 3B(A3B),在保持高智能密度的同时大幅降低计算开销
  • FP8 量化加速:采用 FP8 精度,在 NVIDIA H100/A100 等硬件上实现 2 倍以上推理吞吐提升,显存占用显著减少
  • 128K 超长上下文:原生支持长文本输入,适用于文档摘要、多轮对话、复杂任务规划等场景
  • 指令微调优化:专为高质量指令遵循训练,在逻辑推理、代码生成、多语言问答中输出精准可靠

───────────────────────────────────────────────────────────────────

核心能力

极致能效比:以接近 7B 稠密模型的计算成本,实现 30B 级别的综合能力,单位算力产出更高

🧠 精准任务执行:经过精细对齐训练,能准确理解格式、风格、多步骤等细粒度指令要求

🌍 多语言自然表达:覆盖中、英、日、法等主流语言,输出符合本地文化语境与专业习惯

🛡️ 生产环境就绪:FP8 量化 + MoE 架构,兼顾性能、成本与稳定性,适合高并发企业级应用部署

Playground

登录后,探索更多精彩功能! 点击登录

API统计

API列表 (1)

API描述接口地址请求方法稳定性参数说明
Chat(PPIO派欧云)
POST
稳定
查看详情

API价格表

$
模型说明上下文官网原价302.AI价格官网价差

qwen/qwen3-30b-a3b-fp8

-
128000

输入$0.1 / 1M tokens
输出$0.5 / 1M tokens

输入$0.1 / 1M tokens
输出$0.5 / 1M tokens

原价