2.2.1-01 理论部分

(1)背景与核心定义

电商排序场景的特征天然异构:包含离散ID(用户/商品ID、类目、品牌)、连续数值(价格、点击率、GMV)、时序行为序列(点击/加购/购买历史)、多模态预训练向量(文本相关性、图像特征)等,它们维度不同、结构不同、语义空间完全独立。

异构特征 Tokenization 是 Transformer 落地推荐排序的前置核心模块。其定义为:

将不同类型、不同维度、不同语义的异构特征,通过编码、投影、分组、序列化等方式,转换为统一维度、语义可区分、可直接输入 Transformer 的 Feature Token 序列,让注意力机制能够平等地对所有特征做细粒度交互建模。

(2)核心设计目标
(3)主流技术范式(对应电商排序场景)

(3-01)离散特征:ID Embedding → 单 Token

最基础的范式:每个离散特征字段(性别、类目、品牌)的 ID 值,通过 Embedding 查表得到向量,直接作为一个独立 Token。

(3-02)连续特征:数值编码 → 投影 → Token

主流有两种实现路线:

  1. 分桶离散化:将价格、年龄等连续值按分位数/等宽分桶,转为离散 ID 后做 Embedding,和离散特征处理逻辑一致。

  2. 直接线性投影:每个连续特征通过独立的线性层,直接映射到 hidden_dim 维度,作为一个 Token(FT-Transformer 的标准方案)。

(3-03)分组特征 Token(实验采用方法)

(3-04)序列特征:行为 Item → 序列 Token + 位置编码

用户行为序列(点击、加购、购买)中,每个商品的 Embedding 直接作为序列中的一个 Token,叠加位置编码保留时序依赖关系。

(4)实验核心设计
(5)参考论文

(1)RankMixer: Scaling Up Ranking Models in Industrial Recommenders

(2)HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction

(3)OneTrans: Unified Feature Interaction and Sequence Modeling with One Transformer

(4)HHFT: Hierarchical Heterogeneous Feature Transformer for Recommendation Systems

2.2.1-02 实验部分

效果图

   在Transformer的基座排序模型上,所有特征都Tokenization到256维度,最后的AUC在6k步,训练AUC就会有明显提升,提升从0.876-->0.886,提升了1.0pt+。