站内搜索「https」共 275 条结果
Qwen3.8 微调指南(Unsloth)
推荐教程
Qwen3.8 微调指南(Unsloth)
使用 Unsloth 微调 Qwen3.8-27B 的完整教程:SFT、视觉微调、强化学习、导出
1个月前
TurboOCR — GPU 极限速度的文档解析器
推荐软件
TurboOCR — GPU 极限速度的文档解析器
OCR/版面/表格/公式全流水线跑在显卡上,PDF 进 Markdown 出,单卡 5090 最快 559 图/秒,比传统 OCR 快 15-90 倍
1个月前
Tarsier2-Recap-7B - 字节视频描述专精模型,7B超GPT-4o
推荐源码
Tarsier2-Recap-7B - 字节视频描述专精模型,7B超GPT-4o
字节跳动蒸馏版视频理解模型,DREAM-1K描述F1超越GPT-4o,8.3B参数低门槛部署
1个月前
最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap
推荐模型
最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap
三家最新开源MoE视觉大模型,全部30B级只激活3B,定位完全不同
1个月前
YouMind - 玉伯的AI创作工作室:从找资料到写稿一气呵成
推荐软件
YouMind - 玉伯的AI创作工作室:从找资料到写稿一气呵成
语雀之父玉伯新作:Board看板剪藏素材+AI对话式研究+可改写初稿,把'看过'变成'产出'的AI创作闭环工具
1个月前
OJO - 全球首个设计Agent团队工作台:从想法到可交互原型
推荐软件
OJO - 全球首个设计Agent团队工作台:从想法到可交互原型
不是单个AI画页面,而是自己组建Agent设计团队:需求分析/线框/UI审查/视觉基因分工协作,调研驱动,一张画布走到代码交付
1个月前
Qwen开源模型全家桶选购指南(3.5/3.6/3.8全系列)
推荐模型
Qwen开源模型全家桶选购指南(3.5/3.6/3.8全系列)
从0.8B到397B全覆盖,编程/视觉/推理/端侧一张表选对模型
1个月前
ChatCut - 打字就能剪片的AI剪辑师:对话式视频编辑
推荐软件
ChatCut - 打字就能剪片的AI剪辑师:对话式视频编辑
像跟剪辑师说话一样下指令:文字稿删字即剪片、去口水词、MG动画配乐一体,还能挂进ChatGPT/Codex当插件,剪辑技能可复用
1个月前
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构
推荐模型
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构
FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放
1个月前
M5 Max 实测 Qwen3.8-27B MLX 4bit 并发扩展性:1→32 并行全数据
推荐硬件
M5 Max 实测 Qwen3.8-27B MLX 4bit 并发扩展性:1→32 并行全数据
64GB 统一内存本地跑 27B,252 次请求零报错。低并发看响应,高并发看总量,甜蜜区在 N≤4
29天前
video-talkcraft - 口播稿+配音一键成片的 agent skill,78张动效配方卡
推荐Skills
video-talkcraft - 口播稿+配音一键成片的 agent skill,78张动效配方卡
字级配音同步、七层反PPT镜头系统、三重验收自动返工,把Claude Code/Codex变成口播视频动效工作室
28天前
MiniMax H3 Max - fal.ai 免注册白嫖的极速视频生成
推荐软件
MiniMax H3 Max - fal.ai 免注册白嫖的极速视频生成
生成快过播放:5秒768p约2.5秒出片带原生音效,不注册每天免费5条,API促销价今天截止
27天前
Open-LLM-VTuber - 开源语音交互 AI 虚拟伴侣,Live2D 形象+完全离线
推荐源码
Open-LLM-VTuber - 开源语音交互 AI 虚拟伴侣,Live2D 形象+完全离线
开源语音交互 AI 虚拟伴侣,13.5K Stars。支持实时语音对话、视觉感知、Live2D 形象,桌面宠物模式可完全离线运行
27天前
LiveTalking - 实时流式数字人引擎,文本/语音驱动虚拟形象对话
推荐源码
LiveTalking - 实时流式数字人引擎,文本/语音驱动虚拟形象对话
实时交互流式数字人引擎,9.3K Stars。支持 Wav2Lip/MuseTalk/Ernerf 多模型,WebRTC/RTMP/虚拟摄像头输出,已广泛商用
27天前
LivePortrait:快手开源实时肖像动画神器(19k★)
推荐软件
LivePortrait:快手开源实时肖像动画神器(19k★)
一张照片实时驱动表情/姿态,4090 上毫秒级推理,配口型模型可组完整数字人,开源 MIT
27天前
Fay:开源数字人助理框架,直播带货/客服全能(13.5k★)
推荐软件
Fay:开源数字人助理框架,直播带货/客服全能(13.5k★)
语音识别+大模型+语音合成+虚拟形象全链路打包,开箱即用,直播带货/客服场景首选
27天前
Duix Avatar - 开源 AI 数字人工具包,离线视频生成+声音克隆
推荐源码
Duix Avatar - 开源 AI 数字人工具包,离线视频生成+声音克隆
真正开源的 AI 数字人克隆工具,15K Stars。支持外观+声音克隆、文本/语音驱动生成视频,完全离线运行,Docker 一键部署
27天前
VideoDevour - 视频吃进去,图文报告吐出来
推荐软件
VideoDevour - 视频吃进去,图文报告吐出来
扔一段视频进去,自动出带章节配图的 Markdown 报告,网课笔记/会议纪要/内容素材一站搞定
26天前
FunClip - 按文字剪视频,不用拖时间轴
推荐软件
FunClip - 按文字剪视频,不用拖时间轴
上传视频自动语音转写,选中文字段落就剪出对应片段,还支持按说话人剪辑和 LLM 辅助选段
26天前
Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★)
推荐软件
Awesome-LLMs-for-Video-Understanding:视频理解大模型全家桶清单(3.3k★)
IEEE TCSVT 收录的 Vid-LLM 综述配套清单:论文+代码+数据集+基准全整理,选型与研究必备
26天前