站内搜索「场景」共 273 条结果

推荐软件
NetBird — 全栈开源 Mesh VPN,内置管理面板和 OIDC 身份集成全栈开源 Mesh VPN 平台,内置管理面板和 OIDC 集成,从零构建的自托管 WireGuard 网络方案
1个月前

推荐模型
LTX-2.5 - Lightricks 开源视频生成模型,22B 参数音视频同步83 万下载的开源视频模型天花板——文生视频/图生视频/音视频同步/4K 20 秒,8GB 显存量化可跑
1个月前

推荐软件
TurboOCR — GPU 极限速度的文档解析器OCR/版面/表格/公式全流水线跑在显卡上,PDF 进 Markdown 出,单卡 5090 最快 559 图/秒,比传统 OCR 快 15-90 倍
1个月前

推荐模型
三大开源 ASR 横评 - VibeVoice-ASR 7B vs Qwen3-ASR vs WhisperQwen3-ASR 效率碾压、VibeVoice 长音频分人无敌、Whisper 生态覆盖最广——三大 ASR 各守一象限,谁该装谁
1个月前

推荐软件
Video-Subtitle-Remover:AI 本地去字幕/去水印工具 (12.6k Star)基于 STTN/LaMA/ProPainter 等多算法的视频硬字幕和文本水印去除工具,完全本地运行,支持 Windows/Mac/Linux/Docker
1个月前

推荐模型
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放
1个月前

推荐随笔
MiniMax H3 开源后,视频模型格局要重洗了(主流模型大盘点)首个开源全能参考视频模型:消费级显卡可跑,效果≈Seedance 2.0 Fast 八成、成本仅十分之一。附Seedance/可灵/万相/LTX/Veo/Grok/FLUX3逐家盘点
1个月前

推荐源码
LiveTalking - 实时流式数字人引擎,文本/语音驱动虚拟形象对话实时交互流式数字人引擎,9.3K Stars。支持 Wav2Lip/MuseTalk/Ernerf 多模型,WebRTC/RTMP/虚拟摄像头输出,已广泛商用
27天前

推荐模型
Qwen3-Omni - 30B原生全模态,能看能听还能说甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0
27天前










