查看: 47|回复: 0

算法如何把用户和内容变成数据:读懂推荐系统的特征工程

[复制链接]

3075

主题

0

回帖

9264

积分

超级版主

积分
9264
发表于 2026-8-31 17:42:47 | 显示全部楼层 |阅读模式
本帖最后由 数智星河 于 2026-8-31 17:43 编辑
      本文整理优化自抖音精选公开课《算法专家的抖音推荐说明书》公开内容。推荐系统并不会真正 “看懂” 视频、读懂人心,它只会处理数字。特征工程,就是把现实世界的视频、用户行为、环境场景,转成模型可以计算的数字向量的整套工作流程
      刷抖音时你看到的一条一分钟短视频,在计算机眼里是海量原始像素数据。我们简单算一笔账:一段 60 秒短视频,每秒 30 帧,单帧 1080P 画面拥有 1920×1080 像素,每个像素包含 RGB 三色通道。平台每天新增上亿条视频,如果直接把原始音视频全部喂给模型,算力会直接过载,服务器根本无法承担如此庞大的计算量。
      所以算法不会直接处理原始音视频,而是做信息提炼:过滤冗余信息,提取可以区分内容、区分用户的关键信号,转化为结构化特征。人类依靠情感、逻辑、价值观理解内容;机器学习模型依靠特征做统计关联与匹配,这就是特征工程的价值。
在短视频推荐体系中,所有信息抽象成三大类特征档案:

1. 内容特征:回答平台上有什么;解析视频画面、音频、文本,生成内容的数字画像。
2. 用户特征:回答你是谁、你喜欢什么;基于你的点击、停留、互动行为构建用户数字画像。
3. 上下文特征:回答当下处于什么场景;记录时间、地点、环境,捕捉你此刻的状态与需求。

三者最终都会转化为**高维特征向量**,一串由浮点数组成的数组。例如一条萌宠搞笑视频,可以简单理解为三维向量:萌宠度 0.9、幽默感 0.8、节奏感 0.6;工业场景向量维度通常是 128 维、512 维甚至更高。在高维向量空间中,用户、视频、场景都表现为空间中的向量箭头。算法的任务,就是毫秒级找到和用户向量方向最接近的视频向量,完成匹配推荐。

一、内容特征:多模态拆解一条短视频

一条视频不是单一文件,而是视觉、音频、文本三路信息流的集合,系统会分别对三路信息提取特征,再完成融合对齐。
1. 视频流(视觉信息)

系统抽取视频关键帧,做裁剪、缩放,将像素数值归一化到 0‑1 区间,稳定模型计算。
  • 预训练视觉模型:提取颜色、纹理、物体、场景等静态外观特征;
  • 动态特征模型:引入时间维度,捕捉人物动作、镜头运动等动态信息。
视觉特征回答:画面里有什么,画面如何运动变化。
2. 音频流(声音信息)

原始音频只是随时间波动的波形,对模型来说只是噪音,需要多层转换:
  • 傅里叶变换:把时域波形拆解成不同频率的信号;
  • 梅尔标度转换:模拟人耳听觉特性,过滤人耳不敏感频率,放大对情绪、语义重要频段,生成梅尔频谱图;
  • 深度学习模型把梅尔频谱当作图像输入,提取音频语义向量。
音频特征回答:声音说了什么,传递怎样的情绪氛围。
3. 文本流(文字信息)

来源包含视频标题、话题标签、简介、OCR 识别画面文字、语音转写字幕。流程:分词拆分语义单元,词向量映射,借助 Transformer 编码器生成整段文本的全局语义向量。
文本特征回答:这条视频核心在讲什么内容。
4. 多模态对齐与融合

早期简单方案是特征拼接:直接把图像、音频、文本向量首尾拼接,只是简单叠加维度,不同模态语义互相独立,无法建立关联。
现代工业方案核心是多模态语义对齐 + Transformer 多头注意力融合
  • 对比学习做模态对齐:把视觉、音频、文本向量投射到同一个语义空间。让同一个视频的不同模态向量在空间相互靠近,不同视频向量互相远离,打通画面、声音、文字语义关联。
  • 多头注意力完成深度融合:注意力机制可以通俗理解成记者采访:Query(查询)代表关注点,Key(键)是候选对象标签,Value(值)是候选对象信息。通过点积计算匹配度,Softmax 换算权重,加权聚合有效信息,抑制无关信息。多头注意力相当于派出多个拥有不同视角的 “记者”,各自独立计算注意力,最后把结果汇总融合,生成完整的全局内容 Embedding,代表整条视频综合语义。最后,还会结合视频 ID Embedding、历史统计热度信号,对内容向量做微调修正,兼顾内容语义与用户协同行为信号。
二、用户特征:把你的行为翻译成数字画像

用户特征回答三个核心问题:你是谁、你做过什么、你和谁相似,分为静态特征与动态行为特征两大类。
1. 静态特征

注册时采集的基础属性:性别、年龄、地域等,信息稳定,用来做基础区分。
2. 用户行为信号(最核心)

  • 显性反馈:点赞、收藏、转发、关注、点 “不感兴趣”,属于用户明确表达喜好的强信号。
  • 隐性反馈:停留时长、滑动速度、是否完整看完视频、反复回看。用户不会主动点击,但细微行为可以暴露兴趣的细微变化,是推荐系统非常看重的数据来源。
  • 关系协同信号:关注账号、私信互动;和你点赞、收藏过相同内容的其他用户群体,基于协同过滤挖掘潜在兴趣内容。
3. 特征编码:把现实信息变成模型可读数字

不是所有信息天然就是数字,工业界需要各类编码手段处理离散、连续数据:
  • 独热编码 / 多热编码:对性别、类别这类离散枚举值,转化为开关数组;多热编码用于多选类兴趣标签。但城市、视频 ID 这类海量枚举,独热编码会产生极度稀疏的超大向量,无法直接使用。
  • Embedding 向量化:对海量离散 ID 做降维,把成千上万离散 ID 压缩到低维稠密向量空间,解决特征稀疏难题。
  • 连续特征处理:播放时长这类原生数字不能直接送入模型。例如 23 秒,在 30 秒短视频里属于高完成度,在长视频里属于快速划走。常用归一化、分桶离散化处理,消除绝对值歧义,让模型更容易理解相对含义。
最终,用户的静态属性、海量历史行为全部编码、聚合,生成动态更新的用户 Embedding 向量,也就是算法眼中你的数字画像。
三、上下文特征:算法不止看人和内容,更要看当下场景

人的喜好高度受环境影响。周一早高峰通勤,用户倾向快节奏简短资讯;深夜休息,更容易沉浸情绪向内容。上下文特征记录推荐发生时的环境变量:时间、地点、网络环境,甚至社会热点等外部信号,让推荐适配当下真实诉求,而不是只依赖用户长期固定画像。
上下文同样会编码成特征向量,参与模型计算。最终匹配不只是 “用户向量 vs 视频向量”,而是用户 + 内容 + 上下文三者共同参与打分预测
四、特征工程在完整推荐链路中的位置

召回、粗排、精排、重排每一个环节,都高度依赖特征输出:
  • 召回层:使用用户 Embedding、视频多模态 Embedding 做向量检索,完成海量内容海选;
  • 粗排、精排:输入用户、内容、上下文全套特征,训练深度学习模型,预测完播、点赞、评论等多目标概率;
  • 重排:基于输出结果做多样性、规则层面调整。
没有高质量特征,再强大的模型也无法产出好的推荐效果。特征工程是整套推荐系统的地基。
五、总结

推荐系统没有读心术。
  • 视频不会被机器 “看懂”,而是被拆解为视觉、音频、文本三路信息,经多模态对齐融合得到内容向量;
  • 用户不会被机器 “读懂”,你的每一次滑动、停留、点赞,被编码转化为动态更新的用户向量;
  • 场景环境信息也会数字化,共同参与匹配计算。
人和内容的匹配本质上,就是高维向量空间里的距离计算。你在 APP 上的每一次交互,都在持续改写属于你的用户向量,持续影响下一轮推荐结果。这套特征工程思想,也广泛应用在电商、资讯、广告等工业推荐系统当中。

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|天翼网

相关侵权、举报、投诉及建议等,请发 E-mail:2026@typc.net

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|晋ICP备2026008270号-1|晋公网安备14010602111293号

QQ客服返回顶部