千问推出 Qwen3.8-Omni-Flash 模型 支持多模态输入及长上下文处理

·作者 TechRitual Editorial·AI - 人工智能
千问推出 Qwen3.8-Omni-Flash 模型 支持多模态输入及长上下文处理
✏️ 原创内容| TechRitual World 编辑部

千问新一代原生全模态模型 Qwen 3.8-Omni-Flash 已于 9 月 18 日正式上线。根据了解,此模型支持文本、图像、音频及视频输入,并可处理长达 1M 的上下文,能够在理解内容的基础上自主规划任务、调用工具并完成创作与交付。

Qwen 3.8-Omni-Flash 提升音视频处理能力

从功能上看,Qwen 3.8-Omni-Flash 在延续编程、文本处理及 GUI 操作能力的同时,进一步扩展了音视频相关任务的处理能力。针对长音视频的理解,该模型可面对数小时的视频内容,从问题出发决定关注的画面和声音信息,并通过多轮取证定位关键内容。结合工具后,模型还可从会议中提炼纪要、待办事项与风险信息,并继续执行发送邮件、写代码或检索多模态资料生成报告等后续任务。

在音视频创作方面,该模型可应用于音乐视频制作、短剧翻译及长电影解说等场景。例如,在音乐视频创作中,模型能够理解歌曲结构、节奏及情绪,输出带时间戳的句级歌词;在短剧翻译中,能够完成角色识别、口语化翻译、配音克隆、音轨重混与成片质检;在长电影处理中,则可完成情节提炼、解说规划、配音配乐、剪辑渲染及最终质检。

此外,该模型还可将长视频内容转化为可重用的信息资产,包括自动梳理知识点、拆解步骤,生成图文对应的 PDF 笔记,并进一步转化为经过校验和评测的 Agent Skill。实时交互版本 Qwen 3.8-Omni-Flash-Realtime 则可在音视频流输入过程中同步完成感知与响应,适用于口语陪练、空间音频感知及智能客服等场景。

在配套方面,官方同步扩展了 Qwen-MM-Plugins,新增面向音视频理解与创作的多项能力,并开源 Qwen-Live Harness,用于持续、实时的音视频交互与任务执行。根据官方数据,在累计 30 项评测中,Qwen 3.8-Omni-Flash 相比上一代 Qwen 3.5-Omni-Plus 平均得分提升超过 26%;同时,API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。

目前,该模型已上线千问 AI 平台。

阅读 techritual.com 繁体中文原文

T
关于作者
TechRitual Editorial

The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.