标签「语音」共 9 条内容
Qwen3-Omni - 30B原生全模态,能看能听还能说模型

甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0

151000子龙子龙•26天前
Open-LLM-VTuber - 开源语音交互 AI 虚拟伴侣,Live2D 形象+完全离线源码

开源语音交互 AI 虚拟伴侣,13.5K Stars。支持实时语音对话、视觉感知、Live2D 形象,桌面宠物模式可完全离线运行

102000子龙子龙•27天前
GPT-SoVITS - 1分钟数据训练高质量TTS模型模型

5秒样本零样本TTS,1分钟数据微调即可克隆声音。支持中英日韩粤跨语言推理,集成WebUI工具链,58k Stars

169001子龙子龙•4个月前
KrillinAI - AI 视频翻译配音工具,一键生成全平台内容api

集成翻译、配音、语音克隆,支持横竖屏,输出适配抖音、小红书、B站、YouTube、TikTok

95000子龙子龙•4个月前
Voicebox - 开源 AI 语音工作室,本地替代 ElevenLabs模型

7 引擎 TTS + 语音克隆 + 全局语音输入,本地运行零隐私泄露

104000子龙子龙•4个月前
Whisper — OpenAI 开源语音识别模型模型

68种语言语音转文字,支持多语言识别/翻译/语种检测,命令行即可使用

139000子龙子龙•4个月前
vibevoice-mlx - VibeVoice TTS MLX 推理实现(Mac Studio 部署指南)MacOS

微软删除官方推理代码后,社区补上的完整 MLX 实现。支持 1.5B/7B 语音合成、零样本语音克隆、量化加速。

161000子龙子龙•5个月前
Voicebox模型

开源本地语音合成工作室,ElevenLabs 的免费替代品,支持 23 种语言

148000子龙子龙•5个月前
VibeVoice - 微软开源语音AI程序员

微软开源的前沿语音AI模型,支持60分钟长音频识别和90分钟多说话人语音合成

134000子龙子龙•5个月前