查看: 49|回复: 0

推荐系统如何兼顾速度与精度:拆解抖音短视频推荐底层设计

[复制链接]

3075

主题

0

回帖

9264

积分

超级版主

积分
9264
发表于 2026-8-31 17:39:35 | 显示全部楼层 |阅读模式
本文基于抖音精选公开课《算法专家的抖音推荐说明书》公开内容整理优化,解析短视频推荐系统最核心矛盾:高精度模型计算量大、响应慢;追求速度又容易损失推荐准确性,看看抖音如何在毫秒级响应约束下做到千人千面抖音。

一、推荐系统永恒矛盾:速度 vs 精度

当你手指轻轻上滑,抖音需要在百毫秒之内,从千万级视频池里选出几条最适合你的内容展示出来。
这里存在天然冲突:
  • 高精度深度学习模型:可以深度理解用户兴趣、视频多模态内容,预测点赞、完播、转发概率,但参数量大、推理耗时高,如果拿大模型直接对全库视频打分,延迟会完全无法接受。
  • 轻量简单模型:计算速度飞快,可以扛住每秒百万级请求,但对复杂兴趣刻画不足,推荐结果容易同质化、不准。
短视频产品对延迟非常敏感:一旦刷新等待超过几百毫秒,用户就会明显感知卡顿,直接影响体验。所以行业通用解法不是用一个模型搞定全部,而是设计漏斗式分层架构:层层筛选,前面层级保速度,后面层级保精度,把算力花在最少量候选集上。
完整链路分为四大阶段:召回 → 粗排 → 精排 → 重排
二、第一层:召回 — 海量内容的快速海选

视频库规模达到千万甚至亿级别,不可能把每一条视频送入复杂模型计算。召回的目标:快速捞出一千条左右 “有可能你会喜欢” 的候选视频,优先保证覆盖面和速度,允许牺牲一部分精度抖音。
抖音采用多路召回策略并行捞取候选,再合并去重:
  • 双塔向量召回(核心)双塔模型分为用户塔、内容塔:用户塔基于你的历史浏览、点赞、停留行为输出用户兴趣向量;视频塔离线解析视频画面、音频、标题、字幕,输出视频向量。线上只做向量相似度检索,借助向量数据库 ANN 近似检索,毫秒级完成匹配。视频向量可以离线预计算存储,大幅降低线上算力开销。
  • 协同过滤召回:推荐和你行为相似用户爱看的内容。
  • 作者 & 类目召回:关注博主新作、你常看品类的新视频。
  • 热点、地域、探索召回:热门爆款、同城内容,同时加入一定探索流量,避免陷入信息茧房。
阶段输出:千万级视频池 → ~1000 条候选视频。
三、第二层:粗排 — 算力约束下快速过滤

召回输出上千条候选,依旧不能全部送入重型精排模型。粗排是速度的第一道关卡,耗时通常控制在 10‑20ms,快速筛掉 90% 明显不匹配的内容抖音。
粗排使用轻量化模型,输入用户短期兴趣、视频热度、发布时间、基础互动、场景特征(网络、时间)做快速打分。它不追求预测极度精准,核心任务:把大概率不感兴趣的内容压到队列后方,把候选规模进一步压缩。
阶段输出:1000 条 → 几百条候选。
四、第三层:精排 — 用重型模型换取高精度

经过前面两层过滤,候选集已经缩小到可控范围,此时就可以把算力释放出来,上大模型做精细打分。
精排是整个推荐链路精度核心,使用复杂深度模型(MMoE 多任务学习等),同时预测多个业务目标:完播率、点赞、评论、分享、关注等。综合多目标输出一条视频的综合期望得分,完成排序稀土掘金。
这里依然要做工程优化:模型蒸馏、INT8 量化、算子融合、请求批处理,在模型变大的同时严格控制推理延迟,保证整体链路维持在百毫秒级别以内。
阶段输出:几百条 → 几十条高分候选。
五、第四层:重排 — 面向真实体验做规则调整

精排输出的分数只代表 “单条视频预估收益”,直接按分数输出会出现大量同质化内容,例如连续推送同一类视频,造成审美疲劳。
重排不再改动模型打分,而是做序列层面调整:
  • 使用 MMR 最大边际相关性算法打散同质化内容;
  • 处理重复内容、去重;
  • 兼顾新视频扶持、多样性、合规过滤;
  • 加入少量探索流量,帮助挖掘用户潜在兴趣,避免兴趣茧房稀土掘金。
阶段输出:几十条 → 最终展示给用户的 feed 列表。
六、除分层漏斗之外,还有哪些优化手段?

分层漏斗是架构基础,同时抖音还配套大量工程与模型技术,持续平衡速度与精度:
  • 模型轻量化技术:模型蒸馏,用大模型训练小模型;参数剪枝、量化压缩,降低推理开销,做到 “小模型尽量逼近大模型效果”。
  • 多级缓存策略:用户向量、视频 Embedding、热点数据做分层缓存,减少重复计算;区分新老视频缓存 TTL,兼顾实时性与性能。
  • 离线与在线计算分离:大量特征、视频向量离线预计算,线上只做实时增量更新,减少线上计算压力。
  • 服务降级与兜底策略:当某一路召回服务超时,自动降级切换到热门兜底流,保证用户不会刷不出内容,牺牲局部精度换取可用性。
七、总结

抖音推荐平衡速度与精度的核心思想可以概括一句话:不在全量数据上跑昂贵大模型,而是用轻量环节先做大规模过滤,把宝贵算力集中到少量高价值候选集上
召回保广度、粗排保速度、精排保精度、重排保体验。分层漏斗架构 + 多路召回 + 模型轻量化 + 工程系统优化,共同实现:高并发场景下百毫秒响应,同时维持高质量个性化推荐结果。
思考延伸:这套分层思路并不只适用于短视频,电商、资讯、信息流推荐系统,几乎都能看到召回‑粗排‑精排‑重排的影子。

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|天翼网

相关侵权、举报、投诉及建议等,请发 E-mail:2026@typc.net

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|晋ICP备2026008270号-1|晋公网安备14010602111293号

QQ客服返回顶部