站内搜索「ASR」共 15 条结果

推荐模型
三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs WhisperQwen3-ASR 效率碾压、VibeVoice 长音频分人无敌、Whisper 生态覆盖最广——三大 ASR 各守一象限,谁该装谁
1个月前

推荐模型
短视频音视频联合分析:Qwen3.5-Omni 五条链路实测与选型要同时读画面+声音分析快手/抖音短视频,实测硅基流动 Qwen3-Omni、DashScope Qwen3.5-Omni flash/plus、本地抽帧+ASR 五条链路,给出选型建议和避坑点。
26天前

推荐源码
Open-LLM-VTuber - 开源语音交互 AI 虚拟伴侣,Live2D 形象+完全离线开源语音交互 AI 虚拟伴侣,13.5K Stars。支持实时语音对话、视觉感知、Live2D 形象,桌面宠物模式可完全离线运行
27天前

推荐源码
Duix Avatar - 开源 AI 数字人工具包,离线视频生成+声音克隆真正开源的 AI 数字人克隆工具,15K Stars。支持外观+声音克隆、文本/语音驱动生成视频,完全离线运行,Docker 一键部署
27天前

推荐模型
Google Gemma 4 12B - 无编码器多模态大模型Google DeepMind 开源多模态模型,11.95B参数支持文本+图像+音频,256K上下文,原生函数调用,Apache 2.0免费商用
3个月前

推荐模型
Qwen3-Omni - 30B原生全模态,能看能听还能说甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0
26天前








