
qwen2-vl-2b-instruct
来自通义千问,扩展上下文至32k,增强图像理解能力,能更好地识别图片中的多语种和手写体
2024-08-30
价格:
大额采购联系客户经理享专属优惠
API介绍
Qwen2-VL-2B-Instruct 是阿里巴巴通义实验室推出的轻量级多模态指令微调模型,核心定位为“高效图文理解 + 低资源部署”的边缘端视觉语言助手。
- 极致轻量化设计:仅 2B 参数规模,在保持基本多模态能力的同时大幅降低计算与内存开销
- 原生多模态支持:可直接处理图像与文本混合输入,适用于截图问答、简单图表识别、商品图描述等常见场景
- 长上下文兼容:支持高达 32K token 上下文(部分实现支持更长),满足基础图文对话与短文档分析需求
- 中文场景优化:针对中文界面、广告图、社交图片等内容进行专项训练,输出更贴合本土用户习惯
───────────────────────────────────────────────────────────────────
核心能力
👁️ 基础视觉理解:能识别图像中的主体对象、文字(结合内建 OCR 能力)、简单布局及常见 UI 元素
🧠 图文协同响应:根据指令完成如“描述这张美食照片”“提取截图中的联系电话”等任务,输出简洁准确
⚡ 本地高效运行:可在 RTX 3060、MacBook M 系列等消费级设备上流畅推理,适合移动端或嵌入式应用
🧩 快速集成友好:提供标准 Transformers 接口,易于接入现有应用,作为低成本多模态模块使用
Playground
登录后,探索更多精彩功能! 点击登录
API统计
API列表 (1)
API价格表
$¥ 円 ₽