站内搜索「音频」共 89 条结果
Avantree Saturn-无线音频蓝牙适配器
推荐硬件
Avantree Saturn-无线音频蓝牙适配器
让你的传统音箱变成蓝牙音箱,外观做工OK,核心指标过硬,几个接口和开关的位置选择都和合理,不但能在家也能随时带出去用
10年前
SadTalker - 单图+音频生成说话人脸动画
推荐模型
SadTalker - 单图+音频生成说话人脸动画
CVPR 2023 论文项目,一张照片+一段音频即可生成逼真的数字人/虚拟主播视频,支持口型同步和表情控制
4个月前
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构
推荐模型
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构
FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放
1个月前
惠威Q10-目前能找到的最好用的无线音频蓝牙适配器
推荐硬件
惠威Q10-目前能找到的最好用的无线音频蓝牙适配器
一秒钟让你的传统音箱变成蓝牙音箱!
11年前
TeaCache - 扩散模型免训练推理加速,视频/图片/音频生成提速神器
推荐模型
TeaCache - 扩散模型免训练推理加速,视频/图片/音频生成提速神器
CVPR 2025 Highlight,通过智能缓存跳过冗余时间步,无需重训模型即可大幅加速扩散模型推理。支持Wan2.1/FLUX/HunyuanVideo等20+主流模型
3个月前
LongCat-Video-Avatar 1.5 — 美团开源数字人
推荐模型
LongCat-Video-Avatar 1.5 — 美团开源数字人
音频驱动数字人视频生成,照片+语音生成对口型视频,支持唱歌/双人对话/动漫动物,8步推理,MIT协议可商用
2个月前
StemDeck - 本地 AI 音轨分离工具
推荐程序员
StemDeck - 本地 AI 音轨分离工具
将音频分离成人声、鼓、贝斯、吉他、钢琴、其他 6 轨,支持 MP3/WAV 导入和 YouTube URL 粘贴,完全本地运行,无需账号/上传/订阅
3个月前
fal.ai - 开发者首选的生成式AI媒体平台
推荐模型
fal.ai - 开发者首选的生成式AI媒体平台
1000+图像视频音频3D模型一行API调用,自研推理引擎比竞品快10倍,H100低至$1.2/小时,SOC2企业合规
3个月前
LTX-2.3 - 开源最强音视频一体生成模型
推荐模型
LTX-2.3 - 开源最强音视频一体生成模型
Lightricks出品22B DiT模型,单一模型同时生成同步视频+音频,支持图生视频/文生视频,蒸馏版8步出片
3个月前
claude-real-video — 让LLM真正看视频
推荐模型
claude-real-video — 让LLM真正看视频
场景感知关键帧提取+音频转写,不是固定采样,快剪不漏、静态不重复,本地处理,支持YouTube/Instagram/TikTok链接和本地文件
2个月前
VibeVoice - 微软开源语音AI
推荐程序员
VibeVoice - 微软开源语音AI
微软开源的前沿语音AI模型,支持60分钟长音频识别和90分钟多说话人语音合成
5个月前
res-downloader - 爱享素材下载器,全能网络资源嗅探工具
推荐软件
res-downloader - 爱享素材下载器,全能网络资源嗅探工具
Go + Wails 跨平台下载工具,代理抓包嗅探视频/音频/m3u8/直播流,支持视频号/抖音/快手/小红书,适合自媒体批量获取素材
5个月前
LuxTTS - 1GB显存的极速TTS声音克隆
推荐模型
LuxTTS - 1GB显存的极速TTS声音克隆
150倍实时速度,48kHz高清音质,3秒参考音频克隆声音,Apache 2.0免费商用
2个月前
Google Gemma 4 12B - 无编码器多模态大模型
推荐模型
Google Gemma 4 12B - 无编码器多模态大模型
Google DeepMind 开源多模态模型,11.95B参数支持文本+图像+音频,256K上下文,原生函数调用,Apache 2.0免费商用
3个月前
三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper
推荐模型
三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs Whisper
Qwen3-ASR 效率碾压、VibeVoice 长音频分人无敌、Whisper 生态覆盖最广——三大 ASR 各守一象限,谁该装谁
1个月前
Omni-SimpleMem - LLM Agent 终身记忆系统
推荐模型
Omni-SimpleMem - LLM Agent 终身记忆系统
支持文本、图像、音频、视频的多模态终身记忆,LoCoMo SOTA
5个月前
cobalt - 极简风格的全能媒体下载工具
推荐酷站
cobalt - 极简风格的全能媒体下载工具
界面极简的全能型在线下载工具,支持多种媒体平台链接解析,可选自动/音频/静音三种下载模式,无需安装软件,适合快速下载各类网络媒体内容
5个月前
MiniMax H3 — 开源全模态视频生成模型
推荐模型
MiniMax H3 — 开源全模态视频生成模型
33B参数开源视频生成模型,文生视频/图生视频/首尾帧过渡,原生同步音频,支持2K,ComfyUI Day-0原生支持
1个月前
chinese-independent-developer - 收录1500+中国独立开发者产品的开源导航站
推荐程序员
chinese-independent-developer - 收录1500+中国独立开发者产品的开源导航站
每日更新,按日期收录网站和App,涵盖AI工具、图像视频、音频、效率工具等,适合寻找灵感或发现新产品的开发者
5个月前
Telegram-Media-Downloader - 突破 TG 下载限制的浏览器脚本
推荐软件
Telegram-Media-Downloader - 突破 TG 下载限制的浏览器脚本
支持在 Telegram Web 中下载被群组/频道限制保存的图片、视频、GIF 和音频的浏览器脚本,兼容 Tampermonkey/Violentmonkey 等多种用户脚本管理器,适合需要备份 TG 媒体内容的用户
5个月前