站内搜索「音视频」共 22 条结果

推荐模型
短视频音视频联合分析:Qwen3.5-Omni 五条链路实测与选型要同时读画面+声音分析快手/抖音短视频,实测硅基流动 Qwen3-Omni、DashScope Qwen3.5-Omni flash/plus、本地抽帧+ASR 五条链路,给出选型建议和避坑点。
26天前

推荐模型
Omniparse — 将任意文档/图片/音视频解析为LLM友好格式Ingest, parse, and optimize any data format:PDF/Word/PPT/Excel、图片、音频、视频一键转结构化Markdown,专为GenAI框架优化
4个月前

推荐模型
LTX-2.5 - Lightricks 开源视频生成模型,22B 参数音视频同步83 万下载的开源视频模型天花板——文生视频/图生视频/音视频同步/4K 20 秒,8GB 显存量化可跑
1个月前
推荐程序员
用 AI Agent 下载抖音无水印视频 — 纯终端方案无需浏览器、无需登录、无需 cookies,一条命令下载抖音无水印视频到本地。基于 iesdouyin 移动端 SSR 解析,纯 Python 实现。
5个月前

推荐MacOS
mlx-video - Mac原生MLX视频生成库(LTX-2.3+Wan2.2)一个库在Apple Silicon上原生跑LTX-2.3和Wan2.2两大视频模型,纯MLX加速,CLI一行出片,比PyTorch MPS快1.7倍
3个月前

推荐源码
LiveTalking - 实时流式数字人引擎,文本/语音驱动虚拟形象对话实时交互流式数字人引擎,9.3K Stars。支持 Wav2Lip/MuseTalk/Ernerf 多模型,WebRTC/RTMP/虚拟摄像头输出,已广泛商用
27天前

推荐随笔
MiniMax H3 开源后,视频模型格局要重洗了(主流模型大盘点)首个开源全能参考视频模型:消费级显卡可跑,效果≈Seedance 2.0 Fast 八成、成本仅十分之一。附Seedance/可灵/万相/LTX/Veo/Grok/FLUX3逐家盘点
1个月前

推荐模型
Qwen3-Omni - 30B原生全模态,能看能听还能说甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0
26天前










