站内搜索「文字」共 92 条结果

推荐模型
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放
1个月前

推荐软件
MiniMax H3 完整使用教程:部署、长视频、实时直播33B 开源全模态视频模型,从零部署到 Motion Context 长视频拼接、低显存优化、fal.ai H3 Max 实时直播,一份搞定
28天前

推荐源码
LiveTalking - 实时流式数字人引擎,文本/语音驱动虚拟形象对话实时交互流式数字人引擎,9.3K Stars。支持 Wav2Lip/MuseTalk/Ernerf 多模型,WebRTC/RTMP/虚拟摄像头输出,已广泛商用
27天前

推荐源码
Duix Avatar - 开源 AI 数字人工具包,离线视频生成+声音克隆真正开源的 AI 数字人克隆工具,15K Stars。支持外观+声音克隆、文本/语音驱动生成视频,完全离线运行,Docker 一键部署
27天前

推荐模型
短视频音视频联合分析:Qwen3.5-Omni 五条链路实测与选型要同时读画面+声音分析快手/抖音短视频,实测硅基流动 Qwen3-Omni、DashScope Qwen3.5-Omni flash/plus、本地抽帧+ASR 五条链路,给出选型建议和避坑点。
26天前

推荐模型
Phantom - 字节开源主体一致性视频生成模型(产品图进,同款商品视频出)字节ICCV 2025开源模型:喂几张产品图,生成视频里你的商品全程不跑偏,电商带货视频复刻的换主体神器,权重直接部署
26天前

推荐软件
BiliNote - AI 视频笔记生成工具:让 AI 为你的视频做笔记扔个B站/YouTube/抖音链接进去,自动出带截图、可跳转原片的 Markdown 笔记,还支持笔记内容 AI 问答。开源可自部署,7.3k Stars。
16天前

推荐源码
Jev DSH 决策引擎 - 给 DeepSeek Harness 装上结构化决策外挂(选工具/派活/评分不拍脑袋)TypeSafe 的 Jev 决策模型有 DSH 原生插件了,一条命令装上,Agent 选工具从此有概率有置信度,不再靠猜
4小时前

推荐软件
LICEcapLICEcap 是一款屏幕录制工具,支持导出 GIF 动画图片格式,直观易用,功能灵活,支持 Windows 和 OSX,录制过程中还可以随意改变录屏范围。除支持 .GIF 动画外,LICEcap 还支持自身的无损 .LCF 文件格式。嗯,免费还开源。
10年前










