2.2.2-01 理论部分
(1)论文思想和解决问题
论文思想:字节跳动 TikTok 搜索团队,SIGIR 2026 发表的论文HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction。论文打破了传统「先序列压缩、后特征交叉」的两阶段串行范式,用统一 Transformer 骨干实现双向、深层、早阶段的序列-特征交互。
**核心解决问题:**工业界经典精排链路(如 LONGER + RankMixer)遵循「序列建模 → 特征交叉」的串行两阶段流程,HyFormer 论文明确指出其三大本质问题。
- 交互延迟且浅层:序列信息先被压缩成 1 个/少量向量,再和静态特征拼接做交叉,跨模态(序列/静态)的细粒度依赖无法被捕捉,早期层的表示无法受益于跨域上下文。
- 缩放效率低下:增加模型深度、序列长度时,只能单独提升序列模块或交叉模块,无法转化为联合表示的增益,算力投入的收益边际递减。
- 信息流单向:只有序列信息流向特征交叉模块,全局特征无法反向指导序列建模的注意力聚焦,序列建模缺少上下文约束。
(2)核心设计模块
- HyFormer 全称为 Hybrid Transformer,核心是以 Global Query Tokens 为语义桥梁,将序列建模与特征交叉统一到同一个 Transformer 骨干中,通过「解码-增强」交替迭代的方式,实现双向深度融合。
- 模块1: 初始全局查询生成( Query Generation)
- 从原始异构特征中生成初始的 Global Query Tokens,作为后续序列解码与特征交叉的共享载体。
- NS Tokens(Non-Sequence Tokens):分组 Token 化后的异构静态特征(用户属性、商品属性、交叉特征等,对应你代码的分组投影结果);
- 各行为序列的均值池化结果:点击/加购/购买等多条序列先做全局池化,提供初始序列上下文。
- 将两者拼接后,通过轻量 MLP 生成多组初始 Query Token(每条行为序列对应 Nq 个 Query Token)。
- 模块2: 序列交叉注意力解码(Query Decoding)
- 当前层的 Query Tokens 作为查询,对长行为序列做 Cross-Attention,把序列信息注入到 Query 中,完成序列建模。
- 多序列独立解码:不同类型的行为序列(点击、加购、购买、会话)各自独立做 Cross-Attention,不直接拼接,避免语义混淆;
- 门控机制:使用 sigmoid 门控控制序列信息的注入强度,适配稀疏序列(如购买序列有效长度很短)的场景;
- 因果约束 + RoPE:序列侧自注意力强制因果掩码,搭配旋转位置编码,防止位置信息泄露导致 AUC 虚高。
- 模块3: 异构特征混合增强(Query Decoding)
- 将更新后的 Query Tokens 与 NS Tokens 拼接,通过高效 Token 混合(RankMixer 式 FFN)做全域特征交叉,用全局特征反向增强 Query 的表达。
-
- 把所有序列的 Query Token + NS Token 在 Token 维度拼接;
-
- 通过 Pre-LN + FFN + Post-Norm 的结构做 Token 级特征混合;
-
- 输出再拆分为各序列 Query Token 和 NS Token,进入下一层 Block。
- 模块4: 完整执行流程
- 每一层 HyFormer Block 按固定顺序执行,形成「序列解码 → 特征增强」的交替迭代。
- 序列自注意力演化:各行为序列先做因果自注意力,更新序列自身的表示;
- Query 解码:各序列的 Query Token 对对应序列做 Cross-Attention,吸收序列信息;
- Query 增强:所有 Query + NS Token 拼接后做 Token 混合,完成全域特征交叉;
- 拆分输出:将混合结果拆回 Query Token 与 NS Token,传入下一层。
- 堆叠多层 Block 后,最终的 Query + NS Token 组成 Summary Memory,作为后续Decoder 的 Cross-Attention 记忆输入。
(3)核心创新点
-
- 范式升级:从「单向两阶段」升级为「双向交替迭代」,序列与特征交互更早、更深、更充分;
-
- 缩放效率提升:增加层数/参数时,序列建模和特征交叉同时受益,算力转化效率远高于两阶段架构;
-
- 多序列友好:天然支持多条异构行为序列,避免序列拼接带来的语义稀释;
-
- 工业落地友好:基于 Cross-Attention 而非全量 Self-Attention,推理时延可控,符合线上精排的时延约束。
(3)参考论文
(1)RankMixer: Scaling Up Ranking Models in Industrial Recommenders
- 发表方:字节跳动,arXiv 2025
- 核心贡献:提出 Token-based 统一排序架构,用多头 Token Mixing 替代二次复杂度的自注意力,兼顾 Transformer 的高并行性与工业界的强时延约束,可支撑十亿级参数缩放。
- 明确了「异构特征 → 语义分组 → 独立投影 → 统一 Token 序列」的工业界标准化流程;
(2)OneTrans: Unified Feature Interaction and Sequence Modeling with One Transformer
- 发表方:字节跳动,WWW 2026
- 核心贡献:首个用单个 Transformer 统一序列建模与特征交叉的工业级工作;HyFormer 在此基础上优化了 Latent Query 设计与交替架构,解决了 OneTrans 多序列效果差的问题。
(4)HHFT: Hierarchical Heterogeneous Feature Transformer for Recommendation Systems
- 发表方:阿里巴巴(淘宝天猫),arXiv 2025
- 核心贡献:分层异构特征 Transformer,按语义划分特征块,使用块专属的 QKV 投影避免不同语义空间的特征混淆。提出「语义特征分区」思想,与 HyFormer 的分组 Token 化思路形成呼应。
- 提出「语义特征分区」思想,是分组 Token 化的进阶版本;验证了异构特征混洗会导致语义稀释,从理论上
2.2.1-02 实验部分