
微信视觉团队出品,Apache-2.0 可商用——2B 打赢别家 8B,MMEB-v2 新 SOTA;Matryoshka 可变维度,256 维保住 98.7% 性能,视频号/朋友圈搜索同款技术
这是什么
微信视觉团队(Tencent WeChat Vision)刚开源的通用多模态 embedding 模型——把文本、图片、视频、视觉文档、图文混排全部映射到同一个向量空间,一套模型支撑检索、推荐、分类、聚类。Apache-2.0 协议,可商用。
这不是实验室玩具:已在微信视频号、公众号、朋友圈、电商的搜索推荐里大规模部署,论文里放了 26 项内部任务 benchmark 和 14 次线上 A/B 测试的数据。
差异化卖点
1. 小模型打赢大模型 2B 版本在 MMEB-v2 榜单总分 77.9,比 Qwen3-VL-Embedding-2B 高 4.7 分、比 DME-2B 高 3.1 分,甚至略超 Qwen3-VL-Embedding-8B;9B 版本总分 80.6 刷新 SOTA。同档位下目前最强。
2. Matryoshka 可变维度——工程部署的杀手锏 一次前向计算,按需输出 64/128/256/512/1024/2048 多种维度。论文实测:砍到 256 维时图像/视频任务仍保留 98.7% 的 2048 维性能。意味着向量存储和检索成本可以砍一个数量级,精度几乎不掉——这是真正上过生产线的团队才会做的设计。
3. 全家桶一次给齐 2B / 4B / 9B 三个规格 + 推理代码 + MMEB-v3 官方评测脚本(带多卡 torchrun 支持), HuggingFace 直接下,授权干净(Apache-2.0)。
规格速览
| 模型 | 向量维度 | 适合场景 |
|---|---|---|
| WeMM-Embedding-2B | 64–2048 | 本地/边缘部署,性价比之王 |
| WeMM-Embedding-4B | 64–2560 | 平衡点 |
| WeMM-Embedding-9B | 64–4096 | 冲榜/精度优先 |
资源
- 论文:arXiv:2608.24053
- 代码:github.com/Tencent/WeMM-Embedding
- 权重:HuggingFace
tencent/WeMM-Embedding-2B / 4B / 9B
一句话点评
做 RAG、多模态搜索、agent 记忆检索的,这个直接替换掉现有的 embedding 方案去试——2B 的尺寸、8B+ 的精度、可变维度的存储弹性,还是微信亿级流量验证过的方案。目前开源多模态 embedding 的第一选择。
暂无评论
