阿里云开源全模态模型Qwen2.5-Omni-7B,手机上就能部署快讯
TechWeb.com.cn
2025-03-27 10:32
导读
在语音理解、图片理解、视频理解、语音生成等领域的测评分数,Qwen2.5-Omni全维度远超Google的Gemini-1.5-Pro等同类模型,Qwen2.5-Omni支持文本、图像、音频和视频等多种输入形式。
【TechWeb】3月27日消息,阿里云宣布通义千问Qwen2.5-Omni-7B正式开源。
Qwen2.5-Omni支持文本、图像、音频和视频等多种输入形式,并实时生成文本与自然语音合成输出。
阿里云介绍,在权威的多模态融合任务OmniBench等测评中,Qwen2.5-Omni全维度远超Google的Gemini-1.5-Pro等同类模型。在语音理解、图片理解、视频理解、语音生成等领域的测评分数,均领先于专门的Audio或VL模型,且语音生成测评分数(4.51)达到了与人类持平的能力。

目前,Qwen2.5-Omni已在魔搭社区和Hugging Face 同步开源,开发者和企业可免费下载商用Qwen2.5-Omni,手机等终端智能硬件也可轻松部署运行。另外,用户也可在Qwen Chat上直接体验。
Qwen
-Omni
测评
生成
文本
1.TMT观察网遵循行业规范,任何转载的稿件都会明确标注作者和来源;
2.TMT观察网的原创文章,请转载时务必注明文章作者和"来源:TMT观察网",不尊重原创的行为TMT观察网或将追究责任;
3.作者投稿可能会经TMT观察网编辑修改或补充。