站内搜索「语音交互」共 50 条结果

推荐教程
vibevoice-mlx - VibeVoice TTS MLX 推理实现(Mac Studio 部署指南)微软删除官方推理代码后,社区补上的完整 MLX 实现。支持 1.5B/7B 语音合成、零样本语音克隆、量化加速。
3个月前

推荐教程
VibeVoice 社区版 - PyTorch/CUDA 多 GPU 推理完整代码微软删除官方 TTS 推理代码后,社区 fork 保留的 PyTorch 完整实现。支持单卡/多卡推理、语音克隆、Gradio Demo。
3个月前

推荐软件
录音宝 - 高质量录音+录音转文字当进入录音整理阶段时,它的波形是竖向的,左侧是准确的时间,右侧是模糊转译的文字提示,虽然文字错误很多,但大概能知道此处在讲什么,提高了回听内容的效率。当然这个 app 也有准确听译的选项,我判断是人工听写+收费功能,从来没试过。
10年前

推荐源码
MarkItDown - 微软开源文档转 Markdown 工具微软开源的 Python 工具,一键将 PDF/Word/Excel/PPT 等文件转换为 Markdown,支持 OCR 和 MCP
4个月前

推荐源码
Vercel AI SDK - TypeScript AI 工具包由 Next.js 团队打造的免费开源 TypeScript AI SDK,提供统一的 LLM 提供商接口、流式传输、工具调用、结构化输出、Agent 工作流等能力,支持 React/Vue/Svelte/Node.js
3个月前

推荐源码
agentic-video-editor - 多 Agent 协作的 AI 视频自动剪辑工具基于 Google Gemini + FFmpeg,通过 Director/Editor/Reviewer 多 Agent 流水线,将原始素材和创意简报自动剪辑成精品广告,支持 YAML 管道配置与风格模板
3个月前

推荐源码
MoneyPrinterPlus - AI一键生成短视频+自动发布到抖音/快手/小红书/视频号/B站开源AI短视频生成与自动发布工具,支持LLM文案生成、多平台TTS配音、ffmpeg混剪、Selenium自动发布
3个月前












