站内搜索「语音交互」共 71 条结果
Open-LLM-VTuber - 开源语音交互 AI 虚拟伴侣,Live2D 形象+完全离线
推荐源码
Open-LLM-VTuber - 开源语音交互 AI 虚拟伴侣,Live2D 形象+完全离线
开源语音交互 AI 虚拟伴侣,13.5K Stars。支持实时语音对话、视觉感知、Live2D 形象,桌面宠物模式可完全离线运行
27天前
LobeChat
推荐api
LobeChat
开源高性能聊天机器人框架,支持多模态对话、语音交互和可扩展插件,一键部署私有 ChatGPT。
5个月前
Operit AI - 手机上的全能AI助手
推荐Android
Operit AI - 手机上的全能AI助手
内置Ubuntu 24、40+工具、本地模型、MCP生态,Android上的Hermes平替
2个月前
OpenHuman - 开源个人 AI 超级智能,本地记忆 + 118+ 集成
推荐模型
OpenHuman - 开源个人 AI 超级智能,本地记忆 + 118+ 集成
25K Stars,Rust 构建,本地 Obsidian 知识库,20 分钟自动同步,TokenJuice 压缩降本 80%
4个月前
LiveTalking - 实时流式数字人引擎,文本/语音驱动虚拟形象对话
推荐源码
LiveTalking - 实时流式数字人引擎,文本/语音驱动虚拟形象对话
实时交互流式数字人引擎,9.3K Stars。支持 Wav2Lip/MuseTalk/Ernerf 多模型,WebRTC/RTMP/虚拟摄像头输出,已广泛商用
27天前
Claude Code Telegram Bot — 手机远程编码
推荐程序员
Claude Code Telegram Bot — 手机远程编码
最完善的 Telegram 桥接 Claude Code 方案,支持 session 管理、实时流式、语音输入、文件上传
3个月前
Duix Avatar - 开源 AI 数字人工具包,离线视频生成+声音克隆
推荐源码
Duix Avatar - 开源 AI 数字人工具包,离线视频生成+声音克隆
真正开源的 AI 数字人克隆工具,15K Stars。支持外观+声音克隆、文本/语音驱动生成视频,完全离线运行,Docker 一键部署
27天前
AudioNotes - 音视频转结构化笔记系统
推荐模型
AudioNotes - 音视频转结构化笔记系统
上传音视频,AI 自动整理成结构化 Markdown 笔记
4个月前
VibeVoice - 微软开源语音AI
推荐程序员
VibeVoice - 微软开源语音AI
微软开源的前沿语音AI模型,支持60分钟长音频识别和90分钟多说话人语音合成
5个月前
Whisper — OpenAI 开源语音识别模型
推荐模型
Whisper — OpenAI 开源语音识别模型
68种语言语音转文字,支持多语言识别/翻译/语种检测,命令行即可使用
4个月前
Voicebox - 开源 AI 语音工作室,本地替代 ElevenLabs
推荐模型
Voicebox - 开源 AI 语音工作室,本地替代 ElevenLabs
7 引擎 TTS + 语音克隆 + 全局语音输入,本地运行零隐私泄露
4个月前
RVC WebUI - 开源语音转换/AI翻唱框架
推荐软件
RVC WebUI - 开源语音转换/AI翻唱框架
检索式变声框架:10分钟语音训练音色模型,训练推理一体WebUI,37k stars
1个月前
Qwen3-TTS - 阿里开源最强语音合成模型
推荐模型
Qwen3-TTS - 阿里开源最强语音合成模型
10语言全覆盖、97ms流式延迟、3秒声音克隆,中文TTS天花板,Apache 2.0商用免费
3个月前
Qwen3-ASR - 开源最强中文语音识别+时间戳对齐
推荐软件
Qwen3-ASR - 开源最强中文语音识别+时间戳对齐
阿里Qwen团队出品,中文WER开源最低,配套ForcedAligner毫秒级时间戳,视频配音翻译链路的基础设施
1个月前
推荐MacOS
用 macOS say 命令给 Claude Code Agent 加上语音播报
零依赖、无需 GPU,一行命令让 AI Agent 开口说话,支持中文多种声音
5个月前
推荐程序员
用 VibeVoice TTS-1.5B 生成高质量中文语音:Agent 完整调用指南
微软开源中文 TTS,男声女声,RTF 0.5x,Agent 通过 SSH 一键生成并播放
5个月前
VoxCPM2 - 开源无分词器 TTS 模型,30 语言语音合成与声音克隆
推荐模型
VoxCPM2 - 开源无分词器 TTS 模型,30 语言语音合成与声音克隆
OpenBMB 开源的 2B 参数文本转语音模型,支持 30 语言、Voice Design 声音设计、可控声音克隆,48kHz 输出,Apache-2.0 可商业使用
4个月前
CapsWriter-Offline - 按住CapsLock说话松开就上屏的离线语音输入
推荐软件
CapsWriter-Offline - 按住CapsLock说话松开就上屏的离线语音输入
完全离线、0.15秒出字,按住CapsLock说话松开就上屏,再也不用给讯飞交月费了
1个月前
Wispr Flow - 说话就出字的全局AI语音输入工具
推荐软件
Wispr Flow - 说话就出字的全局AI语音输入工具
对着屏幕说话,文字自动出现在任何应用的光标处,AI还帮你润色
1个月前
Fay:开源数字人助理框架,直播带货/客服全能(13.5k★)
推荐软件
Fay:开源数字人助理框架,直播带货/客服全能(13.5k★)
语音识别+大模型+语音合成+虚拟形象全链路打包,开箱即用,直播带货/客服场景首选
27天前