阿里巴巴旗下 Qwen 团队近日发布新一代原生全模态模型 Qwen3.8-Omni-Flash,将音频、视频理解与 AI 智能体能力进一步结合。该模型支持文本、图像、音频和视频四种输入形式,并提供 100 万 Token 上下文窗口。Qwen 官方称,相比上一代 Qwen3.5-Omni-Plus,其在 29 项基准测试中的平均成绩提升超过 25%,同时显著降低音频和音视频处理成本。
这次升级的关键在于架构方式:Qwen3.8-Omni-Flash 不是把语音识别、图像识别等能力简单拼接,而是在模型层面原生处理不同类型的信息。阿里巴巴希望模型不仅能“看懂”或“听懂”音视频内容,还能在理解信息之后规划任务、调用工具并完成实际工作。
音频能力是 Qwen3.8-Omni-Flash 最突出的部分。按照 Qwen 公布的数据,该模型在部分音频基准测试中已经超过 Gemini 3.8 Flash:WildClawBench-MM 多模态工具调用测试中,Qwen3.8-Omni-Flash 为 71.0 分,Gemini 3.8 Flash 为 58.9 分;DailyOmni 测试中分别为 85.1 分和 84.0 分;SpotSoundBench 中分别为 67.2 分和 39.7 分;MMAU 测试中分别为 81.8 分和 76.9 分。
多说话人会议语音识别也是重点方向。Qwen 公布的 AliMeeting 测试数据显示,Qwen3.8-Omni-Flash 的说话人错误率 DER 为 3.35,带说话人归属的词错误率 cpWER 为 17.18;上一代 Qwen3.5-Omni-Plus 对应数据分别为 88.11 和 89.61,新模型在该测试中的变化幅度非常明显。
不过,Qwen3.8-Omni-Flash 并非在所有项目上领先 Gemini 3.8 Flash。AgenticVBench 测试中,Gemini 3.8 Flash 为 45.0 分,Qwen 为 36.8 分;OmniGAIA 中分别为 78.6 分和 74.0 分,部分视频理解测试中 Gemini 也保持优势。因此,Qwen 所强调的“逼近 Gemini”更多体现在整体音频和音视频能力,而不是所有多模态项目全面领先。
成本是另一项重要变化。Qwen 表示,与此前模型相比,其音频输入的估算成本每小时下降超过 98%,音频加视频输入的成本每小时下降超过 93%。按照官方计算方式,“每小时”成本以两分钟素材的处理价格乘以 30 计算,其中视频输入条件为 720p、每秒 1 帧。
目前阿里云公布的国际区域价格为:每百万 Token 输入 0.15 美元,命中缓存的输入 Token 为 0.016 美元,每百万输出 Token 为 0.47 美元;中国大陆以及部分其他区域价格会有所不同。由于音频和视频可以直接作为模型输入,这种定价结构更适合会议记录、长音频分析、视频审核、字幕生成以及大规模媒体内容处理等场景。
100 万 Token 上下文窗口进一步放大了这一优势。Qwen3.8-Omni-Flash 最大输入长度接近 99.2 万 Token,思考模式下最大输入长度约为 98.4 万 Token,最大输出长度达到 13.1 万 Token。这意味着开发者可以把规模很大的音频或视频内容直接交给模型处理,而不必像过去一样频繁切片、抽帧,再分别用多个模型完成语音识别、视觉理解和文本推理。
阿里云官方资料显示,Qwen3.8-Omni-Flash 能够处理 113 种语言和方言的音频输入,并支持空间音频分析;通过相关参数,模型可以处理双声道立体声以及四声道空间音频。同时,该模型支持函数调用、联网搜索、上下文缓存等能力,可直接用于更复杂的智能体工作流。
应用方向上,Qwen 团队此次重点强调“智能体交付”。例如,模型可以分析长视频、定位其中的关键内容,并进一步调用工具完成视频编辑、内容整理、会议总结、字幕生成等任务。Qwen 还公布了面向多模态智能体开发的 Qwen-MM-Plugins,并计划推出 Qwen-Live-Harness,帮助开发者构建基于音视频输入的智能体应用。
与上一代 Qwen3.5-Omni 相比,这次升级的重点不只是提高传统意义上的识别准确率,而是试图改变音视频 AI 的使用方式。过去的多模态应用通常需要先把视频抽帧、音频转写,再把不同结果交给语言模型处理;Qwen3.8-Omni-Flash 则试图将这些环节尽可能统一到一个原生全模态模型中,并利用 100 万 Token 上下文直接处理更长的原始内容。
Qwen3.8-Omni-Flash 目前通过阿里云百炼提供服务,支持北京、新加坡、中国香港、日本东京、德国法兰克福和美国弗吉尼亚等区域。该模型并未像部分此前 Qwen 模型那样直接开放权重,阿里巴巴此次主要开放配套的多模态插件和相关开发工具。
整体来看,Qwen3.8-Omni-Flash 更新的核心不只是基准成绩提升,而是同时压低音视频处理成本、扩大上下文规模,并将音视频理解与工具调用结合起来。尤其是超过 98% 的音频输入成本降幅,如果实际使用成本能够达到官方测算水平,将使长时间会议录音、播客、直播和视频素材的大规模自动分析更容易,也会进一步加剧 Qwen 与 Google Gemini 等多模态模型之间的竞争。





