标签「音频」共 2 条内容
Qwen3-Omni - 30B原生全模态,能看能听还能说模型

甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0

151000子龙子龙•26天前
VoxCPM2 - 开源无分词器 TTS 模型,30 语言语音合成与声音克隆模型

OpenBMB 开源的 2B 参数文本转语音模型,支持 30 语言、Voice Design 声音设计、可控声音克隆,48kHz 输出,Apache-2.0 可商业使用

192000子龙子龙•4个月前