东南亚口播配音选型:越南语/马来语/泰语 TTS 模型横评

东南亚口播配音选型:越南语/马来语/泰语 TTS 模型横评


中文口播稿出海东南亚怎么配音?覆盖云端统一方案(Qwen-Audio-3.0-TTS/ElevenLabs/MiniMax/豆包)、开源单模型(Scicom/Confucius4)和各语种专用模型(JaiTTS/VieNeu-TTS/Malaysian-TTS),含选型矩阵

背景

做东南亚内容出海,经常需要把中文口播稿翻成越南语、马来语、泰语再配 AI 语音。翻译环节随便一个大模型都能干,真正的瓶颈在 小语种 TTS(文字转语音)。本文是 2026 年 8 月调研后的选型结论,覆盖云端统一方案、开源单模型方案和各语种专用模型。

一、一个模型通吃三语(云端 API)

模型越南语马来语泰语声音克隆情绪控制特点
Qwen-Audio-3.0-TTS✅✅✅✅✅ 自然语言指令16 语种,Artificial Analysis 排行 #1,Flash(实时) + Plus(高质量) 两个版本,阿里云 Model Studio 调用
ElevenLabs v3✅✅✅✅✅74 语种,质量天花板,按字符计费较贵
MiniMax speech-2.6/2.8✅✅✅✅部分40 语种,国产,性价比高
豆包语音合成 2.0(火山引擎)✅✅✅❌❌国产最便宜,10 万字包新客 ¥22.5
Azure / Google Gemini-TTS✅✅✅❌/✅✅Gemini-TTS 支持自然语言控制;Azure 老音色偏播音腔
8nabler TTS✅✅✅✅(30s)部分东南亚企业级方案,sub-100ms 延迟

来源:ElevenLabs 语言列表、MiniMax 文档、火山引擎 TTS 文档、Qwen-Audio-3.0-TTS 发布博客

注意区分:Qwen3-TTS(开源,仅 10 语种,不含泰马越)和 Qwen-Audio-3.0-TTS(API 专供,16 语种含泰马越)是两个不同产品。

二、一个模型通吃三语(开源可本地部署)

模型越南语马来语泰语声音克隆参数量特点
Scicom Multilingual-TTS✅✅✅✅0.6B / 1.7B150+ 语言,基于 Neucodec,mesolitica 团队出品,Apache 2.0
Confucius4-TTS✅✅✅✅ 跨语言迁移未公开网易有道出品,一个声音说 14 种语言无口音,代码即将开源
MMS-TTS(Meta)✅✅✅❌~300M1100+ 语言,Transformers 几行代码调用,质量一般
  • Scicom 是目前唯一可用的开源单模型三语+声音克隆方案
  • Confucius4-TTS 的跨语言声音迁移能力很有吸引力(同一个人声无缝切换泰/马/越),但截至 2026 年 8 月代码和权重尚未发布

三、各语种专用开源模型(质量最高)

🇻🇳 越南语 — 开源生态最丰富

模型参数声音克隆特点
VieNeu-TTS v3 Turbo—✅ 即时2324 stars,48kHz 高保真,20 个内置声音(北/中/南三区),CPU ONNX int8 可跑,越英混读,流式推理
Viterbox—✅ 3~10s基于 Resemble AI Chatterbox 微调,3000+ 小时数据,500+ 说话人,24 语言
Gwen-TTS0.6B✅基于 Qwen3-TTS 微调,1000 小时 TikTok 越南语数据,有在线 demo
G-OmniVoice0.6B✅ 3~10sOmniVoice 越南优化版,WER 最低 + 高说话人相似度
VietTTS—✅OpenAI API 兼容接口,Docker 部署

越南语开源 TTS 在东南亚三语中生态最强,VieNeu-TTS v3 Turbo 是当前最佳选择(覆盖方言区、CPU 友好、功能全面)。

🇹🇭 泰语 — 有 SOTA 级专用模型

模型参数声音克隆特点
JaiTTS-v1.0—✅ 零样本2026.04 最新,CER 1.94%(超人类参考 1.98%),直接处理数字和泰英混语,长文本稳定,人评 400 次对比胜率 70.8%
SiangTTSLoRA✅VoxCPM2 泰语 LoRA,单张 3090 可训练
ThonburianTTS—✅F5-TTS 泰语微调,玛希隆大学出品
SakThai TTS82M❌Kokoro-82M GGUF 141MB,15 语言含泰语,CPU 可跑,树莓派级别
PyThaiTTS—❌Python 库,集成多个模型(lunarlist/khanomtan/vachana)

JaiTTS 是目前泰语 TTS 的 SOTA,CER 超越人类参考,人评大幅领先商业模型,不是"半成品"。

🇲🇾 马来语 — mesolitica 团队深耕

模型参数声音克隆特点
Malaysian-TTS-4B4B❌ 固定发音人Qwen3-4B + DistilCodec,24k 采样率,马英混语切换,可控音高语速
Malaysian-TTS-1.7B GGUF1.7B❌Q4_K_M 仅 1.3GB,本地轻量部署
MeloTTS-MS—❌MeloTTS 马来语 fork,马来西亚 BERT + 马来语音素器
malaya-speech VITS—❌Python 库,VITS 端到端,多发音人
RVC Malaysian VoicesRVC v2✅ 声音转换4 个马来语声音模型(2 男 2 女),可接 TTS 管线

mesolitica(huseinzol05)一直在深耕马来语 NLP,从 1.7B 到 4B 有完整的模型迭代。马来语专用模型没有声音克隆,但可通过 RVC 后处理实现人声定制。

四、选型建议

按场景

场景推荐方案理由
质量优先 + 不想部署Qwen-Audio-3.0-TTS-Plus 或 ElevenLabs三语统一,声音克隆 + 情绪控制,质量最高
性价比 + 国内直连豆包或 MiniMax人民币结算,豆包试水几乎免费
本地部署一个模型Scicom Multilingual-TTS-1.7B唯一开源三语 + 声音克隆方案
本地部署追求质量JaiTTS + Malaysian-TTS-4B + VieNeu-TTS v3各语种最强,但需维护三套环境
混合省钱越南语走 VieNeu-TTS(免费),马来语 + 泰语调 API越南语开源能打,省掉 API 费
等一等Confucius4-TTS跨语言声音迁移是杀手特性,等开源

避坑提醒

  • Qwen3-TTS ≠ Qwen-Audio-3.0-TTS:前者开源 10 语种(不含泰马越),后者 API 16 语种(含泰马越)
  • 声调语言:越南语 6 声调、泰语 5 声调,别用传统拼接式 TTS(Azure/Google 老音色),合成出来当地人一听就是机器味
  • MMS-TTS:虽然覆盖 1100+ 语言,但没有声音克隆,质量一般,只适合验证文本可合成性

入口

云端 API:

  • Qwen-Audio-3.0-TTS:阿里云 Model Studio
  • ElevenLabs:elevenlabs.io
  • MiniMax 语音 API:platform.minimax.io
  • 豆包语音(火山引擎):volcengine.com/product/tts

开源单模型:

  • Scicom Multilingual-TTS:GitHub
  • Confucius4-TTS:在线 Demo(代码即将开源)

越南语专用:

泰语专用:

马来语专用:

12400举报0子龙•1个月前
点击获取 ^_^
被收录:

暂无评论