短视频音视频联合分析:Qwen3.5-Omni 五条链路实测与选型

短视频音视频联合分析:Qwen3.5-Omni 五条链路实测与选型


要同时读画面+声音分析快手/抖音短视频,实测硅基流动 Qwen3-Omni、DashScope Qwen3.5-Omni flash/plus、本地抽帧+ASR 五条链路,给出选型建议和避坑点。

需求

批量分析快手 / 抖音短视频,要同时读到画面 + 声音(口播、BGM、音效、语气),而不只是画面。测了几条链路,结论如下。

五条链路横评(同一条 28s 竖屏带货视频)

链路音频是否真进模型口播转写单条成本备注
硅基流动 Qwen3-Omni-Instruct(视频 base64)❌ 丢掉只认出画面字幕、少数句还编错~3k tokvideo_url 只传帧,音轨不处理
硅基流动 Qwen3-Omni-Thinking(视频 base64)❌ 丢掉更差,硬编"背景音乐轻快""刮鱼鳞"等幻觉,思考过程自曝"需要想象配音内容"~3k tok(含 ~960 reasoning)越推理越自信地编
硅基流动 Qwen3-Omni-Captioner(纯音频)✅✅ 近乎逐字 + 音色/语气/制作水准描述~1k tok只吃音频,≤30s,不接受文字 prompt
DashScope qwen3.5-omni-flash(视频 base64)✅(usage 里 audio_tokens 有值)✅ 近乎逐字~1.4 分视频抽帧密度 6× 于硅基流动
DashScope qwen3.5-omni-plus(视频 base64)✅✅ 近乎逐字~6.7 分修正了 flash 的 BGM 幻觉,给带时间轴的分镜级拆解

关键证据:DashScope 返回的 usage 里 prompt_tokens_details 明确分出 video_tokens / audio_tokens,音轨确实被处理;硅基流动的 video_url 链路 prompt 只有 ~2900 token,音频信息基本没进去。

结论

  • 一个接口端到端吃短视频(画面 + 声音):用阿里官方 DashScope 的 qwen3.5-omni-plus。它把 flash 唯一硬伤(瞎报背景音乐)修好了,输出的是分镜级、字幕逐段对齐的拆解。一条短视频约 7 分钱,可接受。
  • 大批量粗筛"这条视频讲啥、卖啥品":qwen3.5-omni-flash,便宜 5 倍,口播转写同样到位。
  • 零成本 / 数据不出内网:本地 ffmpeg 抽帧 → Qwen3.6-VL 看画面 + Qwen3-ASR 转口播,两段结果拼一起,效果不输托管方案(这条视频字幕≈口播,抽帧就够)。
  • 纯音频打标 / 建音频数据集:硅基流动 Qwen3-Omni-Captioner,转写质量 ≈ 专业 ASR,还附带音色语气描述。

避坑

  • 硅基流动的 Qwen3-Omni(Instruct/Thinking)不要用 video_url base64 传视频做音视频联合分析 —— 音轨会被丢掉,模型转头凭画面编造声音内容,Thinking 因为爱推理编得更狠。要么单独传 audio_url,要么直接换 DashScope。
  • Qwen3.5-Omni 是闭源的,权重下不到,只能走阿里官方 API;Qwen3-Omni 开源版在 Apple Silicon 上目前没有能跑通"视频 + 音轨"的成熟链路。想自部署做音视频分析这条路暂时不通。
  • DashScope 的 omni 模型必须 stream: true,否则报错;-realtime 后缀是实时语音对话专用,不是拿来批量分析视频的。
  • 即使 qwen3.5-omni-plus,"有没有 BGM / 音效细节"这类仍偶有小幻觉,音频关键信息建议留一道复核。

价格参考(DashScope 国际站,每百万 token 输入/输出)

  • qwen3.5-omni-flash:约 $0.10 / $0.40
  • qwen3.5-omni-plus:约 $0.40 / $2.40(256K 以上输入档位上浮)
  • 两档都是 256K 上下文;flash 视频上限 256MB / 150s,plus 2GB / 1 小时
4100举报0子龙•26天前
点击获取 ^_^
被收录:

暂无评论