千问团队发布Qwen3.8-Omni-Flash全模态模型,可在同一工作流中处理文本、图像、音频和视频,支持100万Token上下文。

官方称,该模型在30项评测中的平均得分较Qwen3.5-Omni-Plus提升超26%,重点提升了音视频智能体、编程、长上下文及实时多模态交互能力。模型可用于长视频分析、会议纪要、视频研究和多模态工具调用。

千问同时开源了Qwen-MM-Plugins和Qwen-Live Harness,分别面向长程任务和实时交互场景;多模态输入API价格最低为0.8元/百万Token。