三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper

三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper


Qwen3-ASR 效率碾压、VibeVoice 长音频分人无敌、Whisper 生态覆盖最广——三大 ASR 各守一象限,谁该装谁

三大开源 ASR 模型横评:VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper large-v3-turbo

2026 年初,语音识别领域炸了三个重磅开源模型。微软的 VibeVoice-ASR 7B、阿里的 Qwen3-ASR(0.6B/1.7B),以及 OpenAI 老牌 Whisper large-v3-turbo,定位完全不同,各有各的杀手锏。这三个模型放在一起比什么?比的不只是谁 WER 更低,而是在什么场景下该用谁。

基本面对比

VibeVoice-ASR 7BQwen3-ASR 1.7BQwen3-ASR 0.6BWhisper lv3-turbo
厂商微软阿里 Qwen阿里 QwenOpenAI
发布时间2026.012026.012026.012024.11
参数量7B1.7B0.6B809M
架构σ-VAE ConvNeXt + Qwen2.5-7B 解码器Whisper 风格编码器 + Qwen3 LLMWhisper 风格编码器 + Qwen3 LLMEncoder-Decoder Transformer
许可证MITApache 2.0Apache 2.0MIT
语言50+30 语言 + 22 中文方言30 语言 + 22 中文方言99
最大音频长度60 分钟单次通过30 秒片段(需拼接)30 秒片段(需拼接)30 秒片段(需拼接)
说话人分离✅ 原生❌❌❌
热词定制✅❌❌❌
流式推理❌✅✅❌
词级时间戳✅✅(配套 ForcedAligner)✅(配套 ForcedAligner)✅
歌声识别❌✅(含 BGM)✅(含 BGM)❌
最低 VRAM(FP16)~17GB~4GB~2GB~2GB
量化后 VRAM~5GB(Q4)~1.5GB(Q4)~0.8GB(Q4)~0.8GB(Q4)

架构差异:三代 ASR 的设计哲学

这三个模型恰好代表了 ASR 的三种技术路线:

Whisper是经典 Encoder-Decoder 架构,30 秒分片处理。音频送进编码器,解码器逐 token 生成文字,干净利落但上下文窗口有限。自 2022 年发布以来一直是 ASR 的基准线,生态工具链(faster-whisper、whisper.cpp、mlx-whisper)极其成熟,几乎任何平台都能跑。

Qwen3-ASR走了「音频编码器 + LLM 解码器」的混合路线。音频编码器是 Whisper 风格,但解码器换成了 Qwen3 大语言模型。这让它天然继承了 Qwen 的多语言理解和推理能力。0.6B 版本做到 92ms 首字延迟、128 并发下 2000 秒音频 1 秒转完,效率极其恐怖。还附带一个 Qwen3-ForcedAligner 做词级时间戳对齐。

VibeVoice-ASR走的是更激进的全 LLM 路线。用 σ-VAE 把 24kHz 音频压缩成语义 token(3200 倍下采样),再丢给 Qwen2.5-7B 解码器。这个设计让它能吃下 64K token 长度——对应 60 分钟连续音频,一次过不分片。代价是需要 7B 参数和 17GB+ 显存。

WER/CER 性能实测数据

英文基准测试

BenchmarkVibeVoice 7BQwen3-ASR 1.7BWhisper lv3-turboWhisper lv3
LibriSpeech test-clean~2.5%~2.0%~3.0%~2.7%
LibriSpeech test-other~4.5%~3.8%~5.2%~4.6%
TED-LIUM2.57%~2.8%~3.5%~3.2%
GigaSpeech~6.0%~5.5%~7.4%~6.5%
8 英文数据集平均 WER7.77%~6.5%~8.0%~7.4%

中文 CER

BenchmarkQwen3-ASR 1.7BQwen3-ASR 0.6BWhisper lv3-turbo
中文通用~5.7% CER~7.0% CER~9.0% CER
中文新闻(内部)最优优秀较弱
22 种方言✅✅❌(部分支持)

特殊场景

场景最优原因
噪声环境Qwen3-ASR 1.7B内部 16 种口音 + 极低信噪比评测套件训练
歌声(清唱)Qwen3-ASR 1.7BWER < 8%,优于商业 API
歌声(带 BGM)Qwen3-ASR 1.7B全歌转录,BGM 不干扰
多人会议/播客VibeVoice 7B原生说话人分离,播客 WER 低至 1.24%
长音频一致性VibeVoice 7B60 分钟不分片,全局上下文
小语种Whisper lv3-turbo99 种语言,覆盖最广
极低资源部署Qwen3-ASR 0.6B量化后 < 1GB,手机可跑

推理速度对比

平台VibeVoice 7BQwen3-ASR 1.7BQwen3-ASR 0.6BWhisper lv3-turbo
A100~0.5× RT< 0.05× RT< 0.03× RT< 0.05× RT
RTX 4090~1.28× RT~0.1× RT~0.05× RT~0.1× RT
Apple Silicon (M系列)不支持( Metal 无官方适配)~0.3× RT~0.15× RT~0.3× RT
CPU only极慢~0.3-0.8× RT~0.3-0.8× RT~0.5-1× RT
首字延迟N/A~92ms (0.6B)~92ms~300ms+

RT = Real-Time,0.1× RT 意味着 10 分钟音频 1 分钟转完。

部署难度与生态

Whisper 生态无敌。faster-whisper(CTranslate2)、whisper.cpp(C++/ggml)、mlx-whisper(Apple Silicon)、vLLM、CrispASR 等十几种推理后端随便挑。任何语言、任何平台、任何硬件都有现成方案。这是 4 年积累的生态壁垒。

Qwen3-ASR 次之。官方提供 transformers、vLLM 推理,社区已有 mlx 版本和 CrispASR 支持。Qwen 生态本身就是 2025-2026 年最热的开源 LLM 线之一,工具链跟得上。

VibeVoice 相对年轻。官方提供 Transformers 和 vLLM 支持,CrispASR 也已集成 GGUF 版本(含 BitNet 三值量化版,CPU 可跑)。但社区方案和边缘部署选项不如前两者丰富。微软已将其纳入 Azure AI Foundry,企业部署路径清晰。

实际选型建议

日常中文视频转字幕 → Qwen3-ASR 0.6B 资源占用极低,中文精度吊打同级别,噪声环境依然稳定。如果你的机器只有 8GB 显存甚至只有 CPU,这是首选。

中文高精度需求(噪声/歌声/方言)→ Qwen3-ASR 1.7B 比 0.6B 精度稳定提升,特别是噪声和口音场景。支持 22 种中文方言和歌声识别是独门绝技。

播客/会议录音要分人 → VibeVoice-ASR 7B 这是目前开源领域唯一能原生输出「谁在什么时间说了什么」的模型。60 分钟不分片处理,长音频全局一致性碾压。但需要 24GB 显存(或 4-bit 量化后 5GB),部署成本高。

多语言兜底 / 快速集成 / 不折腾 → Whisper large-v3-turbo 99 种语言、809M 参数、工具链最全。虽然中文精度不如 Qwen3-ASR,英文精度不如 VibeVoice,但它什么都能干、到处都能跑、从来不翻车。如果你只需要一个「能用就行」的 ASR,选它不会错。

一句话总结

Qwen3-ASR 赢在效率和中文场景,VibeVoice 赢在长音频和说话人分离,Whisper 赢在生态和语言覆盖。三者的关系不是谁替代谁,而是各自守住了 ASR 的一个象限。

13500举报0子龙•1个月前
点击获取 ^_^
被收录:

暂无评论