# 东南亚口播配音选型:越南语/马来语/泰语 TTS 模型横评 > 中文口播稿出海东南亚怎么配音?覆盖云端统一方案(Qwen-Audio-3.0-TTS/ElevenLabs/MiniMax/豆包)、开源单模型(Scicom/Confucius4)和各语种专用模型(JaiTTS/VieNeu-TTS/Malaysian-TTS),含选型矩阵 ## 背景 做东南亚内容出海,经常需要把中文口播稿翻成越南语、马来语、泰语再配 AI 语音。翻译环节随便一个大模型都能干,真正的瓶颈在 **小语种 TTS(文字转语音)**。本文是 2026 年 8 月调研后的选型结论,覆盖云端统一方案、开源单模型方案和各语种专用模型。 ## 一、一个模型通吃三语(云端 API) | 模型 | 越南语 | 马来语 | 泰语 | 声音克隆 | 情绪控制 | 特点 | |------|--------|--------|------|---------|---------|------| | **Qwen-Audio-3.0-TTS** | ✅ | ✅ | ✅ | ✅ | ✅ 自然语言指令 | 16 语种,Artificial Analysis 排行 #1,Flash(实时) + Plus(高质量) 两个版本,阿里云 Model Studio 调用 | | ElevenLabs v3 | ✅ | ✅ | ✅ | ✅ | ✅ | 74 语种,质量天花板,按字符计费较贵 | | MiniMax speech-2.6/2.8 | ✅ | ✅ | ✅ | ✅ | 部分 | 40 语种,国产,性价比高 | | 豆包语音合成 2.0(火山引擎) | ✅ | ✅ | ✅ | ❌ | ❌ | 国产最便宜,10 万字包新客 ¥22.5 | | Azure / Google Gemini-TTS | ✅ | ✅ | ✅ | ❌/✅ | ✅ | Gemini-TTS 支持自然语言控制;Azure 老音色偏播音腔 | | 8nabler TTS | ✅ | ✅ | ✅ | ✅(30s) | 部分 | 东南亚企业级方案,sub-100ms 延迟 | 来源:[ElevenLabs 语言列表](https://help.elevenlabs.io/hc/en-us/articles/13313366263441-What-languages-do-you-support)、[MiniMax 文档](https://platform.minimax.io/docs/api-reference/api-overview)、[火山引擎 TTS 文档](https://www.volcengine.com/docs/6561/2528925)、[Qwen-Audio-3.0-TTS 发布博客](https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual) > **注意区分**:Qwen3-TTS(开源,仅 10 语种,不含泰马越)和 Qwen-Audio-3.0-TTS(API 专供,16 语种含泰马越)是两个不同产品。 ## 二、一个模型通吃三语(开源可本地部署) | 模型 | 越南语 | 马来语 | 泰语 | 声音克隆 | 参数量 | 特点 | |------|--------|--------|------|---------|--------|------| | **Scicom Multilingual-TTS** | ✅ | ✅ | ✅ | ✅ | 0.6B / 1.7B | 150+ 语言,基于 Neucodec,mesolitica 团队出品,Apache 2.0 | | **Confucius4-TTS** | ✅ | ✅ | ✅ | ✅ 跨语言迁移 | 未公开 | 网易有道出品,一个声音说 14 种语言无口音,代码即将开源 | | MMS-TTS(Meta) | ✅ | ✅ | ✅ | ❌ | ~300M | 1100+ 语言,Transformers 几行代码调用,质量一般 | - Scicom 是目前唯一可用的**开源单模型三语+声音克隆**方案 - Confucius4-TTS 的跨语言声音迁移能力很有吸引力(同一个人声无缝切换泰/马/越),但截至 2026 年 8 月代码和权重尚未发布 ## 三、各语种专用开源模型(质量最高) ### 🇻🇳 越南语 — 开源生态最丰富 | 模型 | 参数 | 声音克隆 | 特点 | |------|------|---------|------| | [VieNeu-TTS v3 Turbo](https://github.com/pnnbao97/VieNeu-TTS) | — | ✅ 即时 | 2324 stars,48kHz 高保真,20 个内置声音(北/中/南三区),CPU ONNX int8 可跑,越英混读,流式推理 | | [Viterbox](https://huggingface.co/dolly-vn/viterbox) | — | ✅ 3~10s | 基于 Resemble AI Chatterbox 微调,3000+ 小时数据,500+ 说话人,24 语言 | | [Gwen-TTS](https://github.com/ggroup-ai-lab/gwen-tts) | 0.6B | ✅ | 基于 Qwen3-TTS 微调,1000 小时 TikTok 越南语数据,有在线 demo | | [G-OmniVoice](https://huggingface.co/g-group-ai-lab/g-omnivoice) | 0.6B | ✅ 3~10s | OmniVoice 越南优化版,WER 最低 + 高说话人相似度 | | [VietTTS](https://github.com/dangvansam/viet-tts) | — | ✅ | OpenAI API 兼容接口,Docker 部署 | 越南语开源 TTS 在东南亚三语中生态最强,VieNeu-TTS v3 Turbo 是当前最佳选择(覆盖方言区、CPU 友好、功能全面)。 ### 🇹🇭 泰语 — 有 SOTA 级专用模型 | 模型 | 参数 | 声音克隆 | 特点 | |------|------|---------|------| | [JaiTTS-v1.0](https://github.com/JTS-AI-Team/JaiTTS) | — | ✅ 零样本 | 2026.04 最新,CER 1.94%(超人类参考 1.98%),直接处理数字和泰英混语,长文本稳定,人评 400 次对比胜率 70.8% | | [SiangTTS](https://huggingface.co/dubbing-ai/SiangTTS-VoxCPM2-Thai-LoRA) | LoRA | ✅ | VoxCPM2 泰语 LoRA,单张 3090 可训练 | | [ThonburianTTS](https://huggingface.co/biodatlab/ThonburianTTS) | — | ✅ | F5-TTS 泰语微调,玛希隆大学出品 | | [SakThai TTS](https://huggingface.co/Nanthasit/sakthai-tts-model) | 82M | ❌ | Kokoro-82M GGUF 141MB,15 语言含泰语,CPU 可跑,树莓派级别 | | [PyThaiTTS](https://pythainlp.org/PyThaiTTS/) | — | ❌ | Python 库,集成多个模型(lunarlist/khanomtan/vachana) | JaiTTS 是目前泰语 TTS 的 SOTA,CER 超越人类参考,人评大幅领先商业模型,不是"半成品"。 ### 🇲🇾 马来语 — mesolitica 团队深耕 | 模型 | 参数 | 声音克隆 | 特点 | |------|------|---------|------| | [Malaysian-TTS-4B](https://huggingface.co/mesolitica/Malaysian-TTS-4B-v0.1) | 4B | ❌ 固定发音人 | Qwen3-4B + DistilCodec,24k 采样率,马英混语切换,可控音高语速 | | [Malaysian-TTS-1.7B GGUF](https://huggingface.co/mradermacher/Malaysian-TTS-1.7B-v1-GGUF) | 1.7B | ❌ | Q4_K_M 仅 1.3GB,本地轻量部署 | | [MeloTTS-MS](https://github.com/mesolitica/MeloTTS-MS) | — | ❌ | MeloTTS 马来语 fork,马来西亚 BERT + 马来语音素器 | | [malaya-speech VITS](https://malaya-speech.readthedocs.io/en/latest/tts-vits.html) | — | ❌ | Python 库,VITS 端到端,多发音人 | | [RVC Malaysian Voices](https://huggingface.co/fahmifauzi/rvc-malaysian-voices) | RVC v2 | ✅ 声音转换 | 4 个马来语声音模型(2 男 2 女),可接 TTS 管线 | mesolitica(huseinzol05)一直在深耕马来语 NLP,从 1.7B 到 4B 有完整的模型迭代。马来语专用模型没有声音克隆,但可通过 RVC 后处理实现人声定制。 ## 四、选型建议 ### 按场景 | 场景 | 推荐方案 | 理由 | |------|---------|------| | **质量优先 + 不想部署** | Qwen-Audio-3.0-TTS-Plus 或 ElevenLabs | 三语统一,声音克隆 + 情绪控制,质量最高 | | **性价比 + 国内直连** | 豆包或 MiniMax | 人民币结算,豆包试水几乎免费 | | **本地部署一个模型** | Scicom Multilingual-TTS-1.7B | 唯一开源三语 + 声音克隆方案 | | **本地部署追求质量** | JaiTTS + Malaysian-TTS-4B + VieNeu-TTS v3 | 各语种最强,但需维护三套环境 | | **混合省钱** | 越南语走 VieNeu-TTS(免费),马来语 + 泰语调 API | 越南语开源能打,省掉 API 费 | | **等一等** | Confucius4-TTS | 跨语言声音迁移是杀手特性,等开源 | ### 避坑提醒 - **Qwen3-TTS ≠ Qwen-Audio-3.0-TTS**:前者开源 10 语种(不含泰马越),后者 API 16 语种(含泰马越) - **声调语言**:越南语 6 声调、泰语 5 声调,别用传统拼接式 TTS(Azure/Google 老音色),合成出来当地人一听就是机器味 - **MMS-TTS**:虽然覆盖 1100+ 语言,但没有声音克隆,质量一般,只适合验证文本可合成性 ## 入口 **云端 API:** - Qwen-Audio-3.0-TTS:[阿里云 Model Studio](https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide) - ElevenLabs:elevenlabs.io - MiniMax 语音 API:platform.minimax.io - 豆包语音(火山引擎):volcengine.com/product/tts **开源单模型:** - Scicom Multilingual-TTS:[GitHub](https://github.com/Scicom-AI-Enterprise-Organization/Multilingual-TTS) - Confucius4-TTS:[在线 Demo](https://confucius4-tts.youdao.com/gradio)(代码即将开源) **越南语专用:** - VieNeu-TTS v3 Turbo:[GitHub](https://github.com/pnnbao97/VieNeu-TTS) - Viterbox:[HuggingFace](https://huggingface.co/dolly-vn/viterbox) - Gwen-TTS:[GitHub](https://github.com/ggroup-ai-lab/gwen-tts) **泰语专用:** - JaiTTS-v1.0:[GitHub](https://github.com/JTS-AI-Team/JaiTTS) - SiangTTS:[HuggingFace](https://huggingface.co/dubbing-ai/SiangTTS-VoxCPM2-Thai-LoRA) - SakThai TTS:[HuggingFace](https://huggingface.co/Nanthasit/sakthai-tts-model) **马来语专用:** - Malaysian-TTS-4B:[HuggingFace](https://huggingface.co/mesolitica/Malaysian-TTS-4B-v0.1) - MeloTTS-MS:[GitHub](https://github.com/mesolitica/MeloTTS-MS) - RVC Malaysian Voices:[HuggingFace](https://huggingface.co/fahmifauzi/rvc-malaysian-voices) --- **分类**:教程 **标签**:TTS · 越南语 · 泰语 **作者**:子龙 **链接**:https://octohz.com/p/2077