短视频推荐系统完整拆解,双塔 + Wide&Deep 底层 AI 算法全解析
导语很多人疑惑短视频 APP 总能精准推送感兴趣内容,甚至怀疑 APP 会监听语音。实际上整套个性化推荐完全依靠多阶段 AI 算法链路,不存在录音窃听行为。本期以短视频平台标准技术架构为例,完整拆解「多路召回→粗排→精排→重排打散」四层漏斗流程,重点讲解双塔向量召回模型、Wide&Deep 混合排序模型两大工业级核心算法,同时解析随机扰动、多样性打散机制如何缓解信息茧房,附带推荐系统工程落地思路,零基础看懂千人千面背后 AI 底层逻辑。
一、先澄清核心误区:短视频 APP 不会偷听你的语音
平台个性化推荐仅基于APP 内行为数据,不会读取麦克风录音、外部聊天记录:
[*]采集数据范围:视频停留时长、完播率、点赞、收藏、评论、转发、搜索关键词、观看类目;
[*]无跨应用、无麦克风采集行为,不存在 “偷听聊天推对应内容” 机制;
[*]所有行为数据仅用于用户兴趣建模,平台官方算法可视化工具可完整查看推荐逻辑。
推荐系统核心目标:亿级视频池中,毫秒级筛选高匹配内容,兼顾精准匹配与内容多样性,避免用户长期只刷单一品类内容。
二、短视频推荐四层漏斗完整业务链路
海量视频会经过四层逐层筛选,候选内容量级持续收窄、匹配精度持续提升:
[*]召回层(多路双塔召回):亿级视频 → 数千条候选
[*]粗排层:数千条 → 几百条轻量过滤
[*]精排层(Wide&Deep 核心打分):几百条按互动概率排序
[*]重排打散层(随机扰动):调整列表多样性,打破信息茧房
完整数据流转闭环
创作者上传视频→多模态提取画面 / 音频 / 文本特征生成内容向量用户刷视频产生互动行为→训练生成用户兴趣向量双塔相似度匹配召回→排序模型打分→打散后展示→新行为回流更新用户模型
三、第一层:双塔模型(多路召回核心算法)
通俗定义
双塔模型由用户塔、内容塔两个独立神经网络构成,分别输出低维稠密 Embedding 向量,通过余弦相似度计算匹配度,实现海量内容快速检索。
[*]用户塔输入用户行为特征:7 天观看记录、点赞 / 收藏类目、停留时长、设备、时段;神经网络压缩为固定长度用户兴趣向量,代表用户整体偏好。
[*]内容塔输入视频多模态特征:画面帧、背景音乐、标题文案、话题标签、创作者分类;输出视频特征向量,代表内容属性。
[*]匹配逻辑将用户向量与全量视频向量做余弦相似度计算,相似度越高代表兴趣匹配度越高,快速取出 Top 千条候选视频进入下一环节;工程配套:搭配向量数据库(Milvus/FAISS)实现毫秒级向量检索,避免全量遍历计算造成卡顿。
多路召回补充机制
单一双塔容易兴趣狭窄,平台会同时启用多条召回通路:
[*]兴趣向量召回(双塔)
[*]协同过滤召回(同偏好用户爱看内容)
[*]热门新视频召回
[*]搜索历史相关召回多路合并扩充候选池,从源头减少内容同质化。
四、第二层:粗排(轻量化快速过滤)
双塔输出数千条候选后,使用极简线性模型快速打分,过滤明显低匹配视频,缩减至几百条,作用是平衡算力开销:精排大模型算力消耗极高,无法直接处理数千条内容,粗排提前剔除低潜力视频,减轻下游计算压力。
五、第三层:Wide&Deep 精排模型(行业通用排序核心)
Google 提出的混合深度学习模型,分为 Wide 记忆模块、Deep 泛化模块,同时解决 “精准匹配” 和 “挖掘潜在兴趣” 两大需求,是短视频、电商平台通用精排方案稀土掘金。
1. Wide 模块(记忆能力)
线性 LR 模型,依靠人工交叉特征记住历史强关联行为:例如 “喜欢美食视频用户大概率爱看厨具内容”,擅长用户历史明确偏好,保证推荐稳定不出错;核心是记忆已发生过的用户 - 内容强交互关系。
2. Deep 模块(泛化探索能力)
深度神经网络,将离散类目、标签转为 Embedding 向量,挖掘隐藏潜在兴趣组合;比如经常露营 + 数码的用户,会推送户外数码测评,挖掘用户未接触过但潜在感兴趣内容,拓展兴趣边界。
3 联合输出逻辑
Wide 线性输出 + Deep 多层网络输出融合,预测完播、点赞、转发等互动概率,按综合分数对候选视频排序,分数越高越优先展示。
六、第四层:重排 + 随机扰动(缓解信息茧房关键)
仅按分数排序会出现 “全是同类视频”,也就是信息茧房,平台通过打散、随机扰动两套机制优化列表多样性:
1. 多样性打散策略 MMR
综合「匹配分数」与「和已有视频相似度」,高分同类内容适当后置,穿插不同类目视频;比如连续 3 条美食高分视频,会插入旅行、科普内容平衡列表。
2. ε-Greedy 随机扰动机制
设定小概率探索权重,不严格按分数降序,给冷门、新领域视频一定曝光机会;用户对扰动产生的新内容产生互动后,系统自动更新兴趣向量,拓展用户兴趣池arXiv。
作用总结
既保证高匹配内容优先展示,又主动推送跨领域内容,长期避免用户视野单一。
七、推荐系统核心特征分类
[*]用户特征:观看序列、互动行为、注册时长、活跃时段、地域
[*]内容特征:视频画面、音频、标题、话题、发布时间、播放热度
[*]上下文特征:当前时段、网络环境、设备类型
[*]交互特征:用户与视频历史互动记录
八、推荐系统 AI 开发实战场景延伸
[*]私有知识库 RAG 检索可复用双塔向量思路:文档向量 + 用户提问向量相似度匹配;2 电商、资讯信息流推荐通用双塔 + Wide&Deep 技术栈;
[*]本地个性化 AI 对话系统可轻量复刻向量召回逻辑,实现专属内容推荐。
九、新手高频认知误区澄清
误区 1:APP 会偷听日常聊天推送对应视频
纠正:无麦克风采集推荐逻辑,仅 APP 内观看、互动行为建模。
误区 2 推荐只靠单一打分模型
纠正:完整系统是四层漏斗链路,召回、粗排、精排、打散分工明确,缺一不可。
误区 3 算法只会推送同类内容
纠正:内置随机扰动、多样性打散机制,主动引入跨领域内容缓解信息茧房。
误区 4 双塔和 Wide&Deep 功能重复
纠正:双塔负责海量内容快速筛选(召回),Wide&Deep 负责精细打分排序,分属上下游不同环节。
十、本期全文总结
[*]短视频个性化推荐基于四层 AI 漏斗:多路双塔召回→粗排→Wide&Deep 精排→多样性重排;
[*]双塔模型通过用户 / 内容向量余弦匹配,实现亿级内容毫秒级候选筛选,是召回层核心;
[*]Wide&Deep 分为记忆模块(已知偏好)、泛化模块(潜在兴趣),平衡精准度与探索性;
[*]随机扰动、MMR 打散策略用于打破信息茧房,避免推荐列表同质化;
[*]推荐仅采集 APP 内互动行为,不存在麦克风窃听、跨应用数据采集;
[*]双塔向量检索思路可迁移至 RAG 私有文档问答、各类信息流个性化系统。
页:
[1]