站内搜索「Omni」共 18 条结果
Omni-SimpleMem - LLM Agent 终身记忆系统
推荐模型
Omni-SimpleMem - LLM Agent 终身记忆系统
支持文本、图像、音频、视频的多模态终身记忆,LoCoMo SOTA
5个月前
OmniGet - 开源桌面课程学习神器
推荐源码
OmniGet - 开源桌面课程学习神器
集课程下载+视频学习+电子书阅读于一体,支持Udemy/抖音/快手/小红书等,内置时间戳笔记、闪卡、专注计时器
4个月前
Omniparse — 将任意文档/图片/音视频解析为LLM友好格式
推荐模型
Omniparse — 将任意文档/图片/音视频解析为LLM友好格式
Ingest, parse, and optimize any data format:PDF/Word/PPT/Excel、图片、音频、视频一键转结构化Markdown,专为GenAI框架优化
4个月前
Qwen3-Omni - 30B原生全模态,能看能听还能说
推荐模型
Qwen3-Omni - 30B原生全模态,能看能听还能说
甩一段视频进去,画面内容、背景音乐、音效、对白全给你分析出来——阿里原生全模态模型,30B只激活3B,还能直接用语音回答你,Apache 2.0
26天前
短视频音视频联合分析:Qwen3.5-Omni 五条链路实测与选型
推荐模型
短视频音视频联合分析:Qwen3.5-Omni 五条链路实测与选型
要同时读画面+声音分析快手/抖音短视频,实测硅基流动 Qwen3-Omni、DashScope Qwen3.5-Omni flash/plus、本地抽帧+ASR 五条链路,给出选型建议和避坑点。
26天前
Tarsier2-Recap-7B - 字节视频描述专精模型,7B超GPT-4o
推荐源码
Tarsier2-Recap-7B - 字节视频描述专精模型,7B超GPT-4o
字节跳动蒸馏版视频理解模型,DREAM-1K描述F1超越GPT-4o,8.3B参数低门槛部署
1个月前
MiniMax H3 — 开源全模态视频生成模型
推荐模型
MiniMax H3 — 开源全模态视频生成模型
33B参数开源视频生成模型,文生视频/图生视频/首尾帧过渡,原生同步音频,支持2K,ComfyUI Day-0原生支持
1个月前
MiniMax H3 完整使用教程:部署、长视频、实时直播
推荐软件
MiniMax H3 完整使用教程:部署、长视频、实时直播
33B 开源全模态视频模型,从零部署到 Motion Context 长视频拼接、低显存优化、fal.ai H3 Max 实时直播,一份搞定
28天前
VoxCPM2 - 开源无分词器 TTS 模型,30 语言语音合成与声音克隆
推荐模型
VoxCPM2 - 开源无分词器 TTS 模型,30 语言语音合成与声音克隆
OpenBMB 开源的 2B 参数文本转语音模型,支持 30 语言、Voice Design 声音设计、可控声音克隆,48kHz 输出,Apache-2.0 可商业使用
4个月前
最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap
推荐模型
最新开源视觉大模型横评:Qwen3.6 vs Keye-VL-2.0 vs Tarsier2-Recap
三家最新开源MoE视觉大模型,全部30B级只激活3B,定位完全不同
1个月前
TurboOCR — GPU 极限速度的文档解析器
推荐软件
TurboOCR — GPU 极限速度的文档解析器
OCR/版面/表格/公式全流水线跑在显卡上,PDF 进 Markdown 出,单卡 5090 最快 559 图/秒,比传统 OCR 快 15-90 倍
1个月前
MOSS-VL:边看边答的开源实时视频理解模型
推荐软件
MOSS-VL:边看边答的开源实时视频理解模型
复旦OpenMOSS开源11B实时视频理解模型:边看边答、主动沉默、动态纠错,NF4版单卡24G可跑
26天前
MiniMax Design — AI Agent 商业视频工作台(H3 模型)
推荐软件
MiniMax Design — AI Agent 商业视频工作台(H3 模型)
策划/分镜/生成/剪辑/交付全流程 Agent 串联,无限画布+技能插件生态+商业模板;配开源 H3 视频模型,768P 0.5元/秒、2K 0.8元/秒,年卡低至0.4元/秒
1个月前
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构
推荐模型
FLUX 3 - Black Forest Labs 多模态统一模型,图像视频音频一个架构
FLUX 1/2 团队新作:图像/视频/音频联合训练的世界模型,视频+原生音频最长 20 秒,Early Access 已开放
1个月前
LocalMiniDrama本地短剧助手 - 数据不出本机的AI短剧/漫剧工作站:梗概进,成片出
推荐软件
LocalMiniDrama本地短剧助手 - 数据不出本机的AI短剧/漫剧工作站:梗概进,成片出
本地AI短剧/漫剧工作站:梗概进成片出,剧本→角色→分镜→合成全流程,数据不出本机,开源免费无订阅,模型API自己接
12天前
MinerU - 文档解析引擎
推荐程序员
MinerU - 文档解析引擎
开源文档解析引擎,OpenDataLab 出品 78k Star。PDF/Word/PPT/Excel/图片一键转 LLM 友好的 Markdown/JSON,公式转 LaTeX、表格转 HTML、跨页表格合并、109 语言 OCR;Pipeline 后端纯 CPU 可跑,VLM 后端精度 95+,另有 mineru.net 在线服务免部署
5个月前
Qwen3.8-27B - 27B多模态新王,终端编程超Opus 4.6 Max
推荐模型
Qwen3.8-27B - 27B多模态新王,终端编程超Opus 4.6 Max
Qwen3.6-27B正统后继:原生多模态+混合线性注意力架构,262K上下文,终端编程基准超Opus 4.6 Max,Apache 2.0可商用,量化后16GB内存可跑
1个月前
东南亚口播配音选型:越南语/马来语/泰语 TTS 模型横评
推荐教程
东南亚口播配音选型:越南语/马来语/泰语 TTS 模型横评
中文口播稿出海东南亚怎么配音?覆盖云端统一方案(Qwen-Audio-3.0-TTS/ElevenLabs/MiniMax/豆包)、开源单模型(Scicom/Confucius4)和各语种专用模型(JaiTTS/VieNeu-TTS/Malaysian-TTS),含选型矩阵
1个月前