电商排序场景的特征天然异构:包含离散ID(用户/商品ID、类目、品牌)、连续数值(价格、点击率、GMV)、时序行为序列(点击/加购/购买历史)、多模态预训练向量(文本相关性、图像特征)等,它们维度不同、结构不同、语义空间完全独立。
异构特征 Tokenization 是 Transformer 落地推荐排序的前置核心模块。其定义为:
将不同类型、不同维度、不同语义的异构特征,通过编码、投影、分组、序列化等方式,转换为统一维度、语义可区分、可直接输入 Transformer 的 Feature Token 序列,让注意力机制能够平等地对所有特征做细粒度交互建模。
(3-01)离散特征:ID Embedding → 单 Token
最基础的范式:每个离散特征字段(性别、类目、品牌)的 ID 值,通过 Embedding 查表得到向量,直接作为一个独立 Token。
(3-02)连续特征:数值编码 → 投影 → Token
主流有两种实现路线:
分桶离散化:将价格、年龄等连续值按分位数/等宽分桶,转为离散 ID 后做 Embedding,和离散特征处理逻辑一致。
直接线性投影:每个连续特征通过独立的线性层,直接映射到 hidden_dim 维度,作为一个 Token(FT-Transformer 的标准方案)。
(3-03)分组特征 Token(实验采用方法)
思路:按语义将特征划分为若干组(如商品属性组、用户属性组、交叉特征组、LLM向量组),同组内特征先拼接,再通过独立 MLP 投影为 1 个(或少量)Token。
核心优势:
大幅压缩 Token 数量(从上百个特征压缩到 10 个以内),将注意力算力控制在可接受范围;
同语义特征在组内先做局部交互,减少跨语义噪声,提升注意力效率。
代表工作:RankMixer、Group Transformer,以及你当前的精排架构。
(3-04)序列特征:行为 Item → 序列 Token + 位置编码
用户行为序列(点击、加购、购买)中,每个商品的 Embedding 直接作为序列中的一个 Token,叠加位置编码保留时序依赖关系。
(1)RankMixer: Scaling Up Ranking Models in Industrial Recommenders
(2)HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction
(3)OneTrans: Unified Feature Interaction and Sequence Modeling with One Transformer
(4)HHFT: Hierarchical Heterogeneous Feature Transformer for Recommendation Systems

在Transformer的基座排序模型上,所有特征都Tokenization到256维度,最后的AUC在6k步,训练AUC就会有明显提升,提升从0.876-->0.886,提升了1.0pt+。