甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0
开源语音交互 AI 虚拟伴侣,13.5K Stars。支持实时语音对话、视觉感知、Live2D 形象,桌面宠物模式可完全离线运行
5秒样本零样本TTS,1分钟数据微调即可克隆声音。支持中英日韩粤跨语言推理,集成WebUI工具链,58k Stars
集成翻译、配音、语音克隆,支持横竖屏,输出适配抖音、小红书、B站、YouTube、TikTok
7 引擎 TTS + 语音克隆 + 全局语音输入,本地运行零隐私泄露
68种语言语音转文字,支持多语言识别/翻译/语种检测,命令行即可使用
微软删除官方推理代码后,社区补上的完整 MLX 实现。支持 1.5B/7B 语音合成、零样本语音克隆、量化加速。
开源本地语音合成工作室,ElevenLabs 的免费替代品,支持 23 种语言
微软开源的前沿语音AI模型,支持60分钟长音频识别和90分钟多说话人语音合成