BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月08日

注册 / 登录

微信换底座:你刷的视频号、搜的朋友圈共用一个AI模型

微信视觉团队8月25日发布技术报告,把自研通用多模态嵌入模型 WeMM-Embedding 的权重和代码全部开源。9月8日,这款模型因为另一个数字被再讨论一次:微信员工对外分享称,它已在朋友圈搜索、视频号推荐、公众号推荐和微信电商中大规模使用,每天调用量10亿次,并在国际榜单 MMEB-v2 上拿了第一。

榜单成绩确实罕见。9B 版本在 MMEB-v2 上得到80.6分,按论文口径排名第一;体量小得多的2B版本拿到77.9分,已经压过此前分数最高的8B开源模型。

嵌入模型——把人写的文字、拍的照片、剪的视频压进同一串可比较的坐标——为什么能同时出现在推荐和搜索两条链路上?它换掉的到底是哪一层,换完之后谁受影响?把论文和仓库里的原始表述逐条拆开,答案比转述版本更有意思。

一个模型,四条业务线:朋友圈用在"搜",不在"推"

论文对部署范围的表述,比二手转述精细得多。在推荐链路里,WeMM-Embedding 服务公众号、视频号和微信电商的内容:模型表征用于候选召回、排序特征构造、用户行为序列建模和跨域内容理解。在搜索链路里,被检索的对象才是视频号视频、公众号文章和朋友圈内容,支持单模态与跨模态查询。

换句话说,朋友圈在这一轮改造里对应的是搜索,电商对应的是推荐。多数转述把四块统一写成"朋友圈推荐",与论文不一致。这个区分决定了对创作者生态影响的判断边界——搜索侧改变的是"能不能被找到",推荐侧改变的是"会不会被推给谁",两者机制完全不同。

论文还引入了 Semantic ID 这个环节:把内容表征用三级残差量化压成一串离散编码,既作为索引结构,也作为用户行为序列里的紧凑特征。对线上系统来说,这类离散标识比高维浮点向量更省存储,也更容易塞进用户长期兴趣建模。

从CLIP到多模态大模型:这一步为什么非走不可

技术报告在引言里交代了换底层的动因。早期 CLIP 类模型用两个各自独立的编码器分别处理图和文,再把结果投到同一空间做对齐,天然难以表达"图文交错"的输入:一篇图文混排的推文、一条带字幕的视频、一份带图表的文档,进去之前就被拆散了。后续把视觉编码器接进文本编码器的做法扩大了适用范围,但在任务和多模态组合越来越多样时仍受限。

WeMM-Embedding 的路径是直接架在多模态大模型骨干上——论文称三个版本均基于 Qwen3.5 原生多模态架构构建。文本与视觉 token 按输入原始顺序排成一串,末尾追加一个专门的标记位,取它最后一层的隐藏状态作为整体表征。

一个细节更能说明工程意图:同一输入里可以放多个标记位。论文举例,一段视频后接语音转写文本,在视频 token 之后放一个标记、在句尾再放一个标记,就能在一次前向计算里同时得到"只看画面"和"画面加字幕"两种表征。业务侧不必再为不同模态需求维护多套向量、多套索引。

训练分两步:先用数亿级异构配对数据做宽域多模态对齐,再用规模约为前者十分之一的精修语料做细粒度相关性学习,同时把9B作为冻结教师向2B和4B蒸馏。论文称这一阶段带来约1分提升。

80.6分的含金量:0.4分与0.1分

MMEB-v2 覆盖78个数据集,图像与视频任务用 Hit@1、视觉文档任务用 NDCG@5。9B 的80.6分,与表中分数最接近的未开源权重闭源提交相差0.4分。

"超过所有已提交的开源与闭源模型"这句话有明确范围:论文脚注注明榜单状态截至2026年8月24日,取自 MMEB 官方榜单;对比表中并未出现 OpenAI 或 Cohere 的同类模型,部分转述里的"超越 OpenAI"缺乏论文依据。

真正有信息量的对比发生在小模型之间。2B 得分77.9,比表中最强的8B开源基线高出0.1分,参数量只有后者的四分之一。另一组数字更直白:在支持可变维度截断后,2B 把向量压到256维,仍保留全维度图像与视频性能的98.7%。

两组数字指向同一件事——榜单第一是副产品,能不能塞进线上系统的算力预算才是主命题。9B 负责打榜,真正在几十亿级内容库上做召回的,大概率是小模型加短向量。

"日均10亿次":这个数字来自哪里

必须把证据分开。arXiv 技术报告与 GitHub 仓库中,关于线上规模的表述只有"deployed at scale""large-scale deployment"这类定性说法,通篇没有出现日均调用量、QPS、请求条数等任何数字。10亿次这个量级,来自微信员工在社交平台的分享并经媒体报道,属于企业内部人员口径,而非可复核的公开数据。

14项线上 A/B 实验的情况类似:论文只有计数与定性描述。原文称这些实验取得一致提升并已推全上线,效果表述是"改善了内容匹配、推荐质量和用户互动,长尾与新发布内容收益明显",没有给出单项实验的名称、指标和百分比。内部26项任务基准上,其平均得分72.0,对比的同类开源模型为60.9。

结论是:模型进入生产系统的召回与检索环节可以确认,具体调用量级与收益幅度目前无法外部核验。

对创作者真正有意思的,是"长尾和新内容"

论文里最容易被划过去、却最值得内容生态注意的一句,是关于长尾与新内容的自述。

依赖行为积累的召回,天然偏向已有互动的存量内容:一条刚发布、基数为零的内容很难进入候选集。语义表征补上的是另一条通道——"内容像不像"可以部分替代"内容火不火"来产生候选。论文报告的收益方向,与这套机制是自洽的。这属于平台自身披露,尚未见第三方验证。

另一处细节同样反直觉:论文承认加精排模型并不能稳定带来提升,因此线上只有限使用。这与"多堆一层打分模型必然更好"的行业直觉相反,也说明推荐质量的瓶颈并不总在最后那一层。

接下来盯什么

三个可观察的量:微信是否会公布 A/B 实验的具体指标幅度;开源权重与线上实际部署版本之间是否存在能力差(论文发布2B/4B/9B三档,但未说明各业务用的是哪一档);以及音频输入这条短板何时补上——在 MMEB-v3 的11项音频任务上,WeMM-Embedding 被记为0分。

对用户端而言,统一语义底座意味着图文交错的内容第一次能被同一套坐标衡量,跨业务的重复内容与搬运更容易被识别出来。至于个性化会因此更准还是更窄,这份技术报告没有给出任何讨论:隐私、内容安全、推荐多样性在全文中没有专门章节,信息茧房不在其论证范围内。这一层判断只能留给后续披露,也应当成为外界继续追问的部分。

参考数据来源

  1. WeChat Vision, Tencent Inc. · 《WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report》(arXiv:2608.24053) · 2026年8月25日 · https://arxiv.org/html/2608.24053v1
  2. Tencent · WeMM-Embedding 开源仓库 README 与模型清单(Apache License 2.0) · 2026年8月25日 · https://github.com/Tencent/WeMM-Embedding
  3. IT之家(凤凰网科技转载) · 微信员工透露WeMM-Embedding多模态模型已在微信大规模使用 · 2026年9月8日 · https://tech.ifeng.com/c/8wFL1Pu27oS


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。