qwen2-vl-2b-instruct

qwen2-vl-2b-instruct

来自通义千问,扩展上下文至32k,增强图像理解能力,能更好地识别图片中的多语种和手写体
2024-08-30
语言大模型
Model capability: image
价格:
限时免费
大额采购联系客户经理享专属优惠

API介绍

Qwen2-VL-2B-Instruct 是阿里巴巴通义实验室推出的轻量级多模态指令微调模型,核心定位为“高效图文理解 + 低资源部署”的边缘端视觉语言助手。

  • 极致轻量化设计:仅 2B 参数规模,在保持基本多模态能力的同时大幅降低计算与内存开销
  • 原生多模态支持:可直接处理图像与文本混合输入,适用于截图问答、简单图表识别、商品图描述等常见场景
  • 长上下文兼容:支持高达 32K token 上下文(部分实现支持更长),满足基础图文对话与短文档分析需求
  • 中文场景优化:针对中文界面、广告图、社交图片等内容进行专项训练,输出更贴合本土用户习惯

───────────────────────────────────────────────────────────────────

核心能力

👁️ 基础视觉理解:能识别图像中的主体对象、文字(结合内建 OCR 能力)、简单布局及常见 UI 元素

🧠 图文协同响应:根据指令完成如“描述这张美食照片”“提取截图中的联系电话”等任务,输出简洁准确

本地高效运行:可在 RTX 3060、MacBook M 系列等消费级设备上流畅推理,适合移动端或嵌入式应用

🧩 快速集成友好:提供标准 Transformers 接口,易于接入现有应用,作为低成本多模态模块使用

Playground

登录后,探索更多精彩功能! 点击登录

API统计

API列表 (1)

API描述接口地址请求方法稳定性参数说明
Chat(通义千问)
POST
稳定
查看详情

API价格表

$
模型说明上下文302.AI价格

qwen2-vl-2b-instruct

-
32000

限时免费