9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,并已在千问AI平台提供调用。该模型可同时处理文本、图像、音频和视频输入,支持1M上下文长度,官方称其在保持同尺寸文本模型能力的同时,全模态能力较上一代明显提升。
据官方公布的数据,在累计30项评测中,Qwen3.8-Omni-Flash相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%。其中在音视频Agent、Coding和长程任务方面,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。基础能力方面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR与ISR指标分别提升8.5分和14.1分。在会议场景评测AliMeeting中,DER与cpWER指标从88.11和89.61降至3.35和17.18。
阿里方面表示,该模型的音视频能力接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。价格方面,API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。以百万Token图文音视频输入计算,价格已降至0.8元。
为支持长音视频处理,阿里扩展了Qwen-MM-Plugins,并开源Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行,后者面向实时、持续的全模态交互。在长音视频理解方面,模型支持按需描述、Agentic主动取证、会议任务推进和视频深度研究报告。可控音视频Caption可指定描述对象、时间范围、信息粒度和输出格式。
在Agentic长音视频理解测试中,OmniVideoBench准确率从63.4提升至67.8,Token消耗从145,736降至79,117,降幅约45.7%。会议场景中,模型支持最长一小时音视频输入,可完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,并分析项目风险。结合工具调用,还可发送邮件、整理任务或编码。
音视频生产方面,Music2MV可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词。短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检。长电影解说中,用户提供影片和一句话需求,Agent可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。
在模型优化实验中,Qwen3.8-Omni-Flash在12小时内尝试提升Qwen2.5-Omni-3B的四川话识别能力。模型自主选定评测集,经4轮实验构建3413条训练数据,字符错误率从25.79%降至15.30%,相对下降约40.7%。信息压缩方面,Qwen-MM-Plugins开源了Video2Note,可将数小时视频内容生成图文对应的PDF笔记。Omni Skill Creator可从操作演示中提炼标准作业流程,并转化为可复用的Agent Skill。
同步推出的实时版Qwen3.8-Omni-Flash-Realtime可在音视频流输入同时完成感知与响应,并结合实时上下文调用工具。该版本支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达。官方称,这是首个支持“听声辨位”的全模态大模型,融合空间声音与视觉信息,判断声源方向和距离。模型还可通过Skill注入身份设定、表达风格、业务知识与交互规则。
在Agentic Omni Understanding评测中,官方在OmniVideoBench、Video-MME-v2和LVOmniBench上,对比了Qwen3.8-Omni-Flash与Gemini 3.8 Flash的Static模式和接入Qwen Code的Agent模式表现。官方同时公布了Qwen3.8-Omni-Flash-Realtime API在不同输入场景下的实际吞吐与延迟性能信息以及完整性能测试结果。
从行业视角看,全模态模型正成为大模型厂商竞争的新焦点。阿里此次发布将音视频输入价格大幅拉低,同时开源配套工具链,意在降低开发者和企业接入多模态能力的门槛。在会议纪要、内容生产、实时交互等企业服务场景中,全模态模型的成本结构和工具生态将直接影响其商业化落地速度。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。