通义开源32B视觉模型,阿里与DeepSeek前后脚上新!能看图说话
智东西3月25日报道,昨天,阿里云通义千问开源更小尺寸的视觉理解模型Qwen2.5-VL-32B-Instruct。与昨夜DeepSeek V3新版本DeepSeek-V3-0324的发布时间几乎前后脚。
Qwen2.5-VL-32B-Instruct的优势主要集中于三个方面:研究人员调整了输出风格,使其回答详细、格式规范且更符合人类偏好;在数学推理能力方面,可应对复杂数学问题;在图像解析、内容识别、视觉逻辑推导等任务中更准确并具备细粒度分析能力。
该模型是在1月底开源的视觉模型Qwen2.5-VL系列的基础上,研究人员基于强化学习持续优化的模型,新模型使用Apache 2.0协议开源。
GitHub地址:
https://github.com/QwenLM/Qwen2.5-VL
Hugging Face地址:
https://huggingface.co/Qwen/Qwen2.5-VL-32B-Instruct
4月1-2日,智东西联合主办的2025中国生成式AI大会(北京站)将举行。35+位嘉宾/企业已确认,将围绕DeepSeek、大模型与推理模型、具身智能、AI智能体与GenAI应用带来分享和讨论。更多嘉宾陆续揭晓。欢迎报名~
多项基准测试中,Qwen2.5-VL-32B-Instruct的表现超过了Mistral-Small-3.1-24B和Gemma-3-27B-IT,以及参数规模更大的Qwen2-VL-72B-Instruct模型。
在强调复杂任务多步骤推理的MMMU、MMMU-Pro和MathVista中,Qwen2.5-VL-32B-Instruct表现优于Mistral-Small-3.1-24B、Gemma-3-27B-IT、Qwen2-VL-72B-Instruct。
同时,注重主观用户体验评估的MM-MT-Bench基准测试中,该模型相较于其前代Qwen2-VL-72B-Instruct表现更好。
纯文本能力方面,Qwen2.5-VL-32B-Instruct是同规模模型中整体表现最好的。
相比于Qwen2.5-VL系列模型,基于快思考模式,Qwen2.5-VL-32B在强化学习框架下优化了主观体验和数学推理能力。
阿里云通义千问的研究团队下一步研究将聚焦于长且有效的推理过程,以突破视觉模型在处理高度复杂、多步骤视觉推理任务中的边界。
GenAICon 2025北京站预告