# 三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper > Qwen3-ASR 效率碾压、VibeVoice 长音频分人无敌、Whisper 生态覆盖最广——三大 ASR 各守一象限,谁该装谁 ## 三大开源 ASR 模型横评:VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper large-v3-turbo 2026 年初,语音识别领域炸了三个重磅开源模型。微软的 VibeVoice-ASR 7B、阿里的 Qwen3-ASR(0.6B/1.7B),以及 OpenAI 老牌 Whisper large-v3-turbo,定位完全不同,各有各的杀手锏。这三个模型放在一起比什么?比的不只是谁 WER 更低,而是**在什么场景下该用谁**。 ## 基本面对比 | | **VibeVoice-ASR 7B** | **Qwen3-ASR 1.7B** | **Qwen3-ASR 0.6B** | **Whisper lv3-turbo** | |---|---|---|---|---| | 厂商 | 微软 | 阿里 Qwen | 阿里 Qwen | OpenAI | | 发布时间 | 2026.01 | 2026.01 | 2026.01 | 2024.11 | | 参数量 | 7B | 1.7B | 0.6B | 809M | | 架构 | σ-VAE ConvNeXt + Qwen2.5-7B 解码器 | Whisper 风格编码器 + Qwen3 LLM | Whisper 风格编码器 + Qwen3 LLM | Encoder-Decoder Transformer | | 许可证 | MIT | Apache 2.0 | Apache 2.0 | MIT | | 语言 | 50+ | 30 语言 + 22 中文方言 | 30 语言 + 22 中文方言 | 99 | | 最大音频长度 | **60 分钟单次通过** | 30 秒片段(需拼接) | 30 秒片段(需拼接) | 30 秒片段(需拼接) | | 说话人分离 | ✅ 原生 | ❌ | ❌ | ❌ | | 热词定制 | ✅ | ❌ | ❌ | ❌ | | 流式推理 | ❌ | ✅ | ✅ | ❌ | | 词级时间戳 | ✅ | ✅(配套 ForcedAligner) | ✅(配套 ForcedAligner) | ✅ | | 歌声识别 | ❌ | ✅(含 BGM) | ✅(含 BGM) | ❌ | | 最低 VRAM(FP16) | ~17GB | ~4GB | ~2GB | ~2GB | | 量化后 VRAM | ~5GB(Q4) | ~1.5GB(Q4) | ~0.8GB(Q4) | ~0.8GB(Q4) | ## 架构差异:三代 ASR 的设计哲学 这三个模型恰好代表了 ASR 的三种技术路线: **Whisper**是经典 Encoder-Decoder 架构,30 秒分片处理。音频送进编码器,解码器逐 token 生成文字,干净利落但上下文窗口有限。自 2022 年发布以来一直是 ASR 的基准线,生态工具链(faster-whisper、whisper.cpp、mlx-whisper)极其成熟,几乎任何平台都能跑。 **Qwen3-ASR**走了「音频编码器 + LLM 解码器」的混合路线。音频编码器是 Whisper 风格,但解码器换成了 Qwen3 大语言模型。这让它天然继承了 Qwen 的多语言理解和推理能力。0.6B 版本做到 92ms 首字延迟、128 并发下 2000 秒音频 1 秒转完,效率极其恐怖。还附带一个 Qwen3-ForcedAligner 做词级时间戳对齐。 **VibeVoice-ASR**走的是更激进的全 LLM 路线。用 σ-VAE 把 24kHz 音频压缩成语义 token(3200 倍下采样),再丢给 Qwen2.5-7B 解码器。这个设计让它能吃下 64K token 长度——对应 60 分钟连续音频,一次过不分片。代价是需要 7B 参数和 17GB+ 显存。 ## WER/CER 性能实测数据 ### 英文基准测试 | Benchmark | VibeVoice 7B | Qwen3-ASR 1.7B | Whisper lv3-turbo | Whisper lv3 | |---|---|---|---|---| | LibriSpeech test-clean | ~2.5% | ~2.0% | ~3.0% | ~2.7% | | LibriSpeech test-other | ~4.5% | ~3.8% | ~5.2% | ~4.6% | | TED-LIUM | 2.57% | ~2.8% | ~3.5% | ~3.2% | | GigaSpeech | ~6.0% | ~5.5% | ~7.4% | ~6.5% | | 8 英文数据集平均 WER | 7.77% | ~6.5% | ~8.0% | ~7.4% | ### 中文 CER | Benchmark | Qwen3-ASR 1.7B | Qwen3-ASR 0.6B | Whisper lv3-turbo | |---|---|---|---| | 中文通用 | ~5.7% CER | ~7.0% CER | ~9.0% CER | | 中文新闻(内部) | 最优 | 优秀 | 较弱 | | 22 种方言 | ✅ | ✅ | ❌(部分支持) | ### 特殊场景 | 场景 | 最优 | 原因 | |---|---|---| | 噪声环境 | Qwen3-ASR 1.7B | 内部 16 种口音 + 极低信噪比评测套件训练 | | 歌声(清唱) | Qwen3-ASR 1.7B | WER < 8%,优于商业 API | | 歌声(带 BGM) | Qwen3-ASR 1.7B | 全歌转录,BGM 不干扰 | | 多人会议/播客 | VibeVoice 7B | 原生说话人分离,播客 WER 低至 1.24% | | 长音频一致性 | VibeVoice 7B | 60 分钟不分片,全局上下文 | | 小语种 | Whisper lv3-turbo | 99 种语言,覆盖最广 | | 极低资源部署 | Qwen3-ASR 0.6B | 量化后 < 1GB,手机可跑 | ## 推理速度对比 | 平台 | VibeVoice 7B | Qwen3-ASR 1.7B | Qwen3-ASR 0.6B | Whisper lv3-turbo | |---|---|---|---|---| | A100 | ~0.5× RT | < 0.05× RT | < 0.03× RT | < 0.05× RT | | RTX 4090 | ~1.28× RT | ~0.1× RT | ~0.05× RT | ~0.1× RT | | Apple Silicon (M系列) | 不支持( Metal 无官方适配) | ~0.3× RT | ~0.15× RT | ~0.3× RT | | CPU only | 极慢 | ~0.3-0.8× RT | ~0.3-0.8× RT | ~0.5-1× RT | | 首字延迟 | N/A | ~92ms (0.6B) | ~92ms | ~300ms+ | > RT = Real-Time,0.1× RT 意味着 10 分钟音频 1 分钟转完。 ## 部署难度与生态 **Whisper** 生态无敌。faster-whisper(CTranslate2)、whisper.cpp(C++/ggml)、mlx-whisper(Apple Silicon)、vLLM、CrispASR 等十几种推理后端随便挑。任何语言、任何平台、任何硬件都有现成方案。这是 4 年积累的生态壁垒。 **Qwen3-ASR** 次之。官方提供 transformers、vLLM 推理,社区已有 mlx 版本和 CrispASR 支持。Qwen 生态本身就是 2025-2026 年最热的开源 LLM 线之一,工具链跟得上。 **VibeVoice** 相对年轻。官方提供 Transformers 和 vLLM 支持,CrispASR 也已集成 GGUF 版本(含 BitNet 三值量化版,CPU 可跑)。但社区方案和边缘部署选项不如前两者丰富。微软已将其纳入 Azure AI Foundry,企业部署路径清晰。 ## 实际选型建议 **日常中文视频转字幕 → Qwen3-ASR 0.6B** 资源占用极低,中文精度吊打同级别,噪声环境依然稳定。如果你的机器只有 8GB 显存甚至只有 CPU,这是首选。 **中文高精度需求(噪声/歌声/方言)→ Qwen3-ASR 1.7B** 比 0.6B 精度稳定提升,特别是噪声和口音场景。支持 22 种中文方言和歌声识别是独门绝技。 **播客/会议录音要分人 → VibeVoice-ASR 7B** 这是目前开源领域唯一能原生输出「谁在什么时间说了什么」的模型。60 分钟不分片处理,长音频全局一致性碾压。但需要 24GB 显存(或 4-bit 量化后 5GB),部署成本高。 **多语言兜底 / 快速集成 / 不折腾 → Whisper large-v3-turbo** 99 种语言、809M 参数、工具链最全。虽然中文精度不如 Qwen3-ASR,英文精度不如 VibeVoice,但它什么都能干、到处都能跑、从来不翻车。如果你只需要一个「能用就行」的 ASR,选它不会错。 ## 一句话总结 Qwen3-ASR 赢在**效率和中文场景**,VibeVoice 赢在**长音频和说话人分离**,Whisper 赢在**生态和语言覆盖**。三者的关系不是谁替代谁,而是各自守住了 ASR 的一个象限。 --- **分类**:模型 **标签**:Qwen3 · ASR · Whisper **作者**:子龙 **链接**:https://octohz.com/p/2072