
三大开源 ASR 模型横评:VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper large-v3-turbo
2026 年初,语音识别领域炸了三个重磅开源模型。微软的 VibeVoice-ASR 7B、阿里的 Qwen3-ASR(0.6B/1.7B),以及 OpenAI 老牌 Whisper large-v3-turbo,定位完全不同,各有各的杀手锏。这三个模型放在一起比什么?比的不只是谁 WER 更低,而是在什么场景下该用谁。
基本面对比
| VibeVoice-ASR 7B | Qwen3-ASR 1.7B | Qwen3-ASR 0.6B | Whisper lv3-turbo | |
|---|---|---|---|---|
| 厂商 | 微软 | 阿里 Qwen | 阿里 Qwen | OpenAI |
| 发布时间 | 2026.01 | 2026.01 | 2026.01 | 2024.11 |
| 参数量 | 7B | 1.7B | 0.6B | 809M |
| 架构 | σ-VAE ConvNeXt + Qwen2.5-7B 解码器 | Whisper 风格编码器 + Qwen3 LLM | Whisper 风格编码器 + Qwen3 LLM | Encoder-Decoder Transformer |
| 许可证 | MIT | Apache 2.0 | Apache 2.0 | MIT |
| 语言 | 50+ | 30 语言 + 22 中文方言 | 30 语言 + 22 中文方言 | 99 |
| 最大音频长度 | 60 分钟单次通过 | 30 秒片段(需拼接) | 30 秒片段(需拼接) | 30 秒片段(需拼接) |
| 说话人分离 | ✅ 原生 | ❌ | ❌ | ❌ |
| 热词定制 | ✅ | ❌ | ❌ | ❌ |
| 流式推理 | ❌ | ✅ | ✅ | ❌ |
| 词级时间戳 | ✅ | ✅(配套 ForcedAligner) | ✅(配套 ForcedAligner) | ✅ |
| 歌声识别 | ❌ | ✅(含 BGM) | ✅(含 BGM) | ❌ |
| 最低 VRAM(FP16) | ~17GB | ~4GB | ~2GB | ~2GB |
| 量化后 VRAM | ~5GB(Q4) | ~1.5GB(Q4) | ~0.8GB(Q4) | ~0.8GB(Q4) |
架构差异:三代 ASR 的设计哲学
这三个模型恰好代表了 ASR 的三种技术路线:
Whisper是经典 Encoder-Decoder 架构,30 秒分片处理。音频送进编码器,解码器逐 token 生成文字,干净利落但上下文窗口有限。自 2022 年发布以来一直是 ASR 的基准线,生态工具链(faster-whisper、whisper.cpp、mlx-whisper)极其成熟,几乎任何平台都能跑。
Qwen3-ASR走了「音频编码器 + LLM 解码器」的混合路线。音频编码器是 Whisper 风格,但解码器换成了 Qwen3 大语言模型。这让它天然继承了 Qwen 的多语言理解和推理能力。0.6B 版本做到 92ms 首字延迟、128 并发下 2000 秒音频 1 秒转完,效率极其恐怖。还附带一个 Qwen3-ForcedAligner 做词级时间戳对齐。
VibeVoice-ASR走的是更激进的全 LLM 路线。用 σ-VAE 把 24kHz 音频压缩成语义 token(3200 倍下采样),再丢给 Qwen2.5-7B 解码器。这个设计让它能吃下 64K token 长度——对应 60 分钟连续音频,一次过不分片。代价是需要 7B 参数和 17GB+ 显存。
WER/CER 性能实测数据
英文基准测试
| Benchmark | VibeVoice 7B | Qwen3-ASR 1.7B | Whisper lv3-turbo | Whisper lv3 |
|---|---|---|---|---|
| LibriSpeech test-clean | ~2.5% | ~2.0% | ~3.0% | ~2.7% |
| LibriSpeech test-other | ~4.5% | ~3.8% | ~5.2% | ~4.6% |
| TED-LIUM | 2.57% | ~2.8% | ~3.5% | ~3.2% |
| GigaSpeech | ~6.0% | ~5.5% | ~7.4% | ~6.5% |
| 8 英文数据集平均 WER | 7.77% | ~6.5% | ~8.0% | ~7.4% |
中文 CER
| Benchmark | Qwen3-ASR 1.7B | Qwen3-ASR 0.6B | Whisper lv3-turbo |
|---|---|---|---|
| 中文通用 | ~5.7% CER | ~7.0% CER | ~9.0% CER |
| 中文新闻(内部) | 最优 | 优秀 | 较弱 |
| 22 种方言 | ✅ | ✅ | ❌(部分支持) |
特殊场景
| 场景 | 最优 | 原因 |
|---|---|---|
| 噪声环境 | Qwen3-ASR 1.7B | 内部 16 种口音 + 极低信噪比评测套件训练 |
| 歌声(清唱) | Qwen3-ASR 1.7B | WER < 8%,优于商业 API |
| 歌声(带 BGM) | Qwen3-ASR 1.7B | 全歌转录,BGM 不干扰 |
| 多人会议/播客 | VibeVoice 7B | 原生说话人分离,播客 WER 低至 1.24% |
| 长音频一致性 | VibeVoice 7B | 60 分钟不分片,全局上下文 |
| 小语种 | Whisper lv3-turbo | 99 种语言,覆盖最广 |
| 极低资源部署 | Qwen3-ASR 0.6B | 量化后 < 1GB,手机可跑 |
推理速度对比
| 平台 | VibeVoice 7B | Qwen3-ASR 1.7B | Qwen3-ASR 0.6B | Whisper lv3-turbo |
|---|---|---|---|---|
| A100 | ~0.5× RT | < 0.05× RT | < 0.03× RT | < 0.05× RT |
| RTX 4090 | ~1.28× RT | ~0.1× RT | ~0.05× RT | ~0.1× RT |
| Apple Silicon (M系列) | 不支持( Metal 无官方适配) | ~0.3× RT | ~0.15× RT | ~0.3× RT |
| CPU only | 极慢 | ~0.3-0.8× RT | ~0.3-0.8× RT | ~0.5-1× RT |
| 首字延迟 | N/A | ~92ms (0.6B) | ~92ms | ~300ms+ |
RT = Real-Time,0.1× RT 意味着 10 分钟音频 1 分钟转完。
部署难度与生态
Whisper 生态无敌。faster-whisper(CTranslate2)、whisper.cpp(C++/ggml)、mlx-whisper(Apple Silicon)、vLLM、CrispASR 等十几种推理后端随便挑。任何语言、任何平台、任何硬件都有现成方案。这是 4 年积累的生态壁垒。
Qwen3-ASR 次之。官方提供 transformers、vLLM 推理,社区已有 mlx 版本和 CrispASR 支持。Qwen 生态本身就是 2025-2026 年最热的开源 LLM 线之一,工具链跟得上。
VibeVoice 相对年轻。官方提供 Transformers 和 vLLM 支持,CrispASR 也已集成 GGUF 版本(含 BitNet 三值量化版,CPU 可跑)。但社区方案和边缘部署选项不如前两者丰富。微软已将其纳入 Azure AI Foundry,企业部署路径清晰。
实际选型建议
日常中文视频转字幕 → Qwen3-ASR 0.6B 资源占用极低,中文精度吊打同级别,噪声环境依然稳定。如果你的机器只有 8GB 显存甚至只有 CPU,这是首选。
中文高精度需求(噪声/歌声/方言)→ Qwen3-ASR 1.7B 比 0.6B 精度稳定提升,特别是噪声和口音场景。支持 22 种中文方言和歌声识别是独门绝技。
播客/会议录音要分人 → VibeVoice-ASR 7B 这是目前开源领域唯一能原生输出「谁在什么时间说了什么」的模型。60 分钟不分片处理,长音频全局一致性碾压。但需要 24GB 显存(或 4-bit 量化后 5GB),部署成本高。
多语言兜底 / 快速集成 / 不折腾 → Whisper large-v3-turbo 99 种语言、809M 参数、工具链最全。虽然中文精度不如 Qwen3-ASR,英文精度不如 VibeVoice,但它什么都能干、到处都能跑、从来不翻车。如果你只需要一个「能用就行」的 ASR,选它不会错。
一句话总结
Qwen3-ASR 赢在效率和中文场景,VibeVoice 赢在长音频和说话人分离,Whisper 赢在生态和语言覆盖。三者的关系不是谁替代谁,而是各自守住了 ASR 的一个象限。
暂无评论
