
中文口播稿出海东南亚怎么配音?覆盖云端统一方案(Qwen-Audio-3.0-TTS/ElevenLabs/MiniMax/豆包)、开源单模型(Scicom/Confucius4)和各语种专用模型(JaiTTS/VieNeu-TTS/Malaysian-TTS),含选型矩阵
背景
做东南亚内容出海,经常需要把中文口播稿翻成越南语、马来语、泰语再配 AI 语音。翻译环节随便一个大模型都能干,真正的瓶颈在 小语种 TTS(文字转语音)。本文是 2026 年 8 月调研后的选型结论,覆盖云端统一方案、开源单模型方案和各语种专用模型。
一、一个模型通吃三语(云端 API)
| 模型 | 越南语 | 马来语 | 泰语 | 声音克隆 | 情绪控制 | 特点 |
|---|---|---|---|---|---|---|
| Qwen-Audio-3.0-TTS | ✅ | ✅ | ✅ | ✅ | ✅ 自然语言指令 | 16 语种,Artificial Analysis 排行 #1,Flash(实时) + Plus(高质量) 两个版本,阿里云 Model Studio 调用 |
| ElevenLabs v3 | ✅ | ✅ | ✅ | ✅ | ✅ | 74 语种,质量天花板,按字符计费较贵 |
| MiniMax speech-2.6/2.8 | ✅ | ✅ | ✅ | ✅ | 部分 | 40 语种,国产,性价比高 |
| 豆包语音合成 2.0(火山引擎) | ✅ | ✅ | ✅ | ❌ | ❌ | 国产最便宜,10 万字包新客 ¥22.5 |
| Azure / Google Gemini-TTS | ✅ | ✅ | ✅ | ❌/✅ | ✅ | Gemini-TTS 支持自然语言控制;Azure 老音色偏播音腔 |
| 8nabler TTS | ✅ | ✅ | ✅ | ✅(30s) | 部分 | 东南亚企业级方案,sub-100ms 延迟 |
来源:ElevenLabs 语言列表、MiniMax 文档、火山引擎 TTS 文档、Qwen-Audio-3.0-TTS 发布博客
注意区分:Qwen3-TTS(开源,仅 10 语种,不含泰马越)和 Qwen-Audio-3.0-TTS(API 专供,16 语种含泰马越)是两个不同产品。
二、一个模型通吃三语(开源可本地部署)
| 模型 | 越南语 | 马来语 | 泰语 | 声音克隆 | 参数量 | 特点 |
|---|---|---|---|---|---|---|
| Scicom Multilingual-TTS | ✅ | ✅ | ✅ | ✅ | 0.6B / 1.7B | 150+ 语言,基于 Neucodec,mesolitica 团队出品,Apache 2.0 |
| Confucius4-TTS | ✅ | ✅ | ✅ | ✅ 跨语言迁移 | 未公开 | 网易有道出品,一个声音说 14 种语言无口音,代码即将开源 |
| MMS-TTS(Meta) | ✅ | ✅ | ✅ | ❌ | ~300M | 1100+ 语言,Transformers 几行代码调用,质量一般 |
- Scicom 是目前唯一可用的开源单模型三语+声音克隆方案
- Confucius4-TTS 的跨语言声音迁移能力很有吸引力(同一个人声无缝切换泰/马/越),但截至 2026 年 8 月代码和权重尚未发布
三、各语种专用开源模型(质量最高)
🇻🇳 越南语 — 开源生态最丰富
| 模型 | 参数 | 声音克隆 | 特点 |
|---|---|---|---|
| VieNeu-TTS v3 Turbo | — | ✅ 即时 | 2324 stars,48kHz 高保真,20 个内置声音(北/中/南三区),CPU ONNX int8 可跑,越英混读,流式推理 |
| Viterbox | — | ✅ 3~10s | 基于 Resemble AI Chatterbox 微调,3000+ 小时数据,500+ 说话人,24 语言 |
| Gwen-TTS | 0.6B | ✅ | 基于 Qwen3-TTS 微调,1000 小时 TikTok 越南语数据,有在线 demo |
| G-OmniVoice | 0.6B | ✅ 3~10s | OmniVoice 越南优化版,WER 最低 + 高说话人相似度 |
| VietTTS | — | ✅ | OpenAI API 兼容接口,Docker 部署 |
越南语开源 TTS 在东南亚三语中生态最强,VieNeu-TTS v3 Turbo 是当前最佳选择(覆盖方言区、CPU 友好、功能全面)。
🇹🇭 泰语 — 有 SOTA 级专用模型
| 模型 | 参数 | 声音克隆 | 特点 |
|---|---|---|---|
| JaiTTS-v1.0 | — | ✅ 零样本 | 2026.04 最新,CER 1.94%(超人类参考 1.98%),直接处理数字和泰英混语,长文本稳定,人评 400 次对比胜率 70.8% |
| SiangTTS | LoRA | ✅ | VoxCPM2 泰语 LoRA,单张 3090 可训练 |
| ThonburianTTS | — | ✅ | F5-TTS 泰语微调,玛希隆大学出品 |
| SakThai TTS | 82M | ❌ | Kokoro-82M GGUF 141MB,15 语言含泰语,CPU 可跑,树莓派级别 |
| PyThaiTTS | — | ❌ | Python 库,集成多个模型(lunarlist/khanomtan/vachana) |
JaiTTS 是目前泰语 TTS 的 SOTA,CER 超越人类参考,人评大幅领先商业模型,不是"半成品"。
🇲🇾 马来语 — mesolitica 团队深耕
| 模型 | 参数 | 声音克隆 | 特点 |
|---|---|---|---|
| Malaysian-TTS-4B | 4B | ❌ 固定发音人 | Qwen3-4B + DistilCodec,24k 采样率,马英混语切换,可控音高语速 |
| Malaysian-TTS-1.7B GGUF | 1.7B | ❌ | Q4_K_M 仅 1.3GB,本地轻量部署 |
| MeloTTS-MS | — | ❌ | MeloTTS 马来语 fork,马来西亚 BERT + 马来语音素器 |
| malaya-speech VITS | — | ❌ | Python 库,VITS 端到端,多发音人 |
| RVC Malaysian Voices | RVC v2 | ✅ 声音转换 | 4 个马来语声音模型(2 男 2 女),可接 TTS 管线 |
mesolitica(huseinzol05)一直在深耕马来语 NLP,从 1.7B 到 4B 有完整的模型迭代。马来语专用模型没有声音克隆,但可通过 RVC 后处理实现人声定制。
四、选型建议
按场景
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 质量优先 + 不想部署 | Qwen-Audio-3.0-TTS-Plus 或 ElevenLabs | 三语统一,声音克隆 + 情绪控制,质量最高 |
| 性价比 + 国内直连 | 豆包或 MiniMax | 人民币结算,豆包试水几乎免费 |
| 本地部署一个模型 | Scicom Multilingual-TTS-1.7B | 唯一开源三语 + 声音克隆方案 |
| 本地部署追求质量 | JaiTTS + Malaysian-TTS-4B + VieNeu-TTS v3 | 各语种最强,但需维护三套环境 |
| 混合省钱 | 越南语走 VieNeu-TTS(免费),马来语 + 泰语调 API | 越南语开源能打,省掉 API 费 |
| 等一等 | Confucius4-TTS | 跨语言声音迁移是杀手特性,等开源 |
避坑提醒
- Qwen3-TTS ≠ Qwen-Audio-3.0-TTS:前者开源 10 语种(不含泰马越),后者 API 16 语种(含泰马越)
- 声调语言:越南语 6 声调、泰语 5 声调,别用传统拼接式 TTS(Azure/Google 老音色),合成出来当地人一听就是机器味
- MMS-TTS:虽然覆盖 1100+ 语言,但没有声音克隆,质量一般,只适合验证文本可合成性
入口
云端 API:
- Qwen-Audio-3.0-TTS:阿里云 Model Studio
- ElevenLabs:elevenlabs.io
- MiniMax 语音 API:platform.minimax.io
- 豆包语音(火山引擎):volcengine.com/product/tts
开源单模型:
越南语专用:
- VieNeu-TTS v3 Turbo:GitHub
- Viterbox:HuggingFace
- Gwen-TTS:GitHub
泰语专用:
- JaiTTS-v1.0:GitHub
- SiangTTS:HuggingFace
- SakThai TTS:HuggingFace
马来语专用:
- Malaysian-TTS-4B:HuggingFace
- MeloTTS-MS:GitHub
- RVC Malaysian Voices:HuggingFace
暂无评论
