今日,阿里通义 Qwen 团队推出新一代“原生全模态”模型 Qwen3.8-Omni-Flash。其价格大幅下降,能力显著提升,还将多模态推进到“端到端干活”的落地阶段。
相比上一代 Qwen3.5-Omni-Plus,Qwen3.8-Omni-Flash 的 API 每小时音频输入价格降幅超 98%,每小时音视频输入价格降幅超 93%。如此大幅降价,使其更有资格进军生产力场景。
该模型支持 1M 长上下文,可处理文本、图像、音频、视频输入。在 29 项评测里,平均得分较上一代提升超 25%。在多个评测中,得分也有大幅提升,且官方称其音视频能力接近 Gemini 3.8 Flash,音频能力整体超过。
团队开源了两套配套,基于此跑通多个完整工作流,如 MV 创作、短剧翻译出海等。翻译还能保留原说话人的音色特征,展现出多模态在实际工作中的强大应用能力。
一是“Agentic 长音视频理解”,按需感知提升准确率并降低成本;二是将模型本身作为研发工具,实现“大模型负责研发、小模型面向业务”的新范式。
Qwen3.8-Omni-Flash-Realtime 支持持续低延迟交互,首发“听声辨位”,是首个支持该能力的全模态大模型。
编辑观点:阿里通义 Qwen 此次发布的新模型优势明显,价格与能力兼具,多模态落地成果显著,有望在行业中占据重要地位,推动全模态技术发展。