Qwen3-Omni - 30B原生全模态,能看能听还能说

Qwen3-Omni - 30B原生全模态,能看能听还能说


甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0

Qwen 团队终于把全模态做到了端到端:文本、图片、音频、视频全吃进去,输出文字和自然语音。30B 总参数只激活 3B,MoE 架构,Apache 2.0 可商用。

和之前的 Qwen 多模态模型有什么不同?

之前 Qwen3.6-VL 等是「文本模型 + 视觉适配器」的拼接方案。Qwen3-Omni 是原生端到端训练——文本、图像、音频、视频在同一架构里联合学习,不是后接模块。而且能直接输出语音,不是调 TTS API,是模型原生生成的自然语音。

Thinker–Talker 架构

  • Thinker(思考模块):处理多模态理解,带 chain-of-thought 推理
  • Talker(输出模块):多 codebook 设计,同时生成文本和语音流,延迟压到最低
  • 两个模块协同工作,思考完直接说,不需要额外调用 TTS

能力覆盖面

输入输出典型场景
语音文字19 语种语音识别、语音翻译
语音语音语音对话、同声传译
音频文字音乐分析、音效描述、音频详细标注
图片文字OCR、图像问答、图像数学推理
视频文字视频描述、场景转场分析、导航指令生成
视频+音频文字/语音音视频联合理解、实时多模态对话
语音函数调用语音驱动的 Agent 行为

三个版本

版本特点适用
InstructThinker + Talker 全量,语音输入+语音/文字输出实时对话、语音助手
Thinking只有 Thinker,带 CoT 推理,文字输出复杂推理任务
CaptionerInstruct 微调版,音频细粒度描述、低幻觉音频标注、音效描述

跑分亮点

36 个音频/视频基准中 22 个 SOTA、32 个开源 SOTA。ASR、音频理解和语音对话性能对标 Gemini 2.5 Pro。119 种文本语言、19 种语音输入语言、10 种语音输出语言。

部署

HuggingFace Transformers 已合并代码(需从 GitHub 源码安装,PyPI 尚未发版),vLLM 也已支持。MoE 只激活 3B,24GB 显存可跑,门槛和 Qwen3.6-35B-A3B 同级。

GitHub: https://github.com/QwenLM/Qwen3-Omni HuggingFace: https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct 技术报告: 见 GitHub assets/Qwen3_Omni.pdf

14900举报0子龙•26天前
点击获取 ^_^
被收录:

暂无评论