站内搜索「音频」共 89 条结果

推荐模型
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放
1个月前

推荐模型
TeaCache - 扩散模型免训练推理加速,视频/图片/音频生成提速神器CVPR 2025 Highlight,通过智能缓存跳过冗余时间步,无需重训模型即可大幅加速扩散模型推理。支持Wan2.1/FLUX/HunyuanVideo等20+主流模型
3个月前

推荐程序员
StemDeck - 本地 AI 音轨分离工具将音频分离成人声、鼓、贝斯、吉他、钢琴、其他 6 轨,支持 MP3/WAV 导入和 YouTube URL 粘贴,完全本地运行,无需账号/上传/订阅
3个月前

推荐模型
claude-real-video — 让LLM真正看视频场景感知关键帧提取+音频转写,不是固定采样,快剪不漏、静态不重复,本地处理,支持YouTube/Instagram/TikTok链接和本地文件
2个月前

推荐软件
res-downloader - 爱享素材下载器,全能网络资源嗅探工具Go + Wails 跨平台下载工具,代理抓包嗅探视频/音频/m3u8/直播流,支持视频号/抖音/快手/小红书,适合自媒体批量获取素材
5个月前

推荐模型
Google Gemma 4 12B - 无编码器多模态大模型Google DeepMind 开源多模态模型,11.95B参数支持文本+图像+音频,256K上下文,原生函数调用,Apache 2.0免费商用
3个月前

推荐模型
三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs WhisperQwen3-ASR 效率碾压、VibeVoice 长音频分人无敌、Whisper 生态覆盖最广——三大 ASR 各守一象限,谁该装谁
1个月前

推荐程序员
chinese-independent-developer - 收录1500+中国独立开发者产品的开源导航站每日更新,按日期收录网站和App,涵盖AI工具、图像视频、音频、效率工具等,适合寻找灵感或发现新产品的开发者
5个月前

推荐软件
Telegram-Media-Downloader - 突破 TG 下载限制的浏览器脚本支持在 Telegram Web 中下载被群组/频道限制保存的图片、视频、GIF 和音频的浏览器脚本,兼容 Tampermonkey/Violentmonkey 等多种用户脚本管理器,适合需要备份 TG 媒体内容的用户
5个月前










