阿里千问发布Qwen3.5-Omni全模态大模型
阿里千问正式发布新一代全模态大模型Qwen3.5-Omni,涵盖Plus、Flash、Light三种规格,支持256k长上下文,可处理超过10小时的音频输入及400秒以上的720P音视频输入。该模型基于超过1亿小时音视频数据进行原生多模态预训练,支持113种语言和方言的语音识别及36种语言的语音生成,相比上代Qwen3-Omni多语言能力大幅提升。
Qwen3.5-Omni在音频/音视频理解、推理和交互任务中取得215项SOTA成绩,通用音频理解和推理能力全面超越Gemini-3.1 Pro。此外还引入语义中断、声音克隆等实时交互功能。

