MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践

0
MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践


美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型。围绕规模可扩展性、场景可延展性与架构高效性三大挑战,MTFM以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升模型 Scaling 能力,借鉴 LLM 优化实践提升深层网络训练效果,并以 User-Level 训练范式与定制算子保证系统开销可控。美团外卖多个业务订单量提升 2.06%~6.68% 不等,推理成本降低 24%,相关工作已被 KDD 2026 收录。

1. 引言

我们去年提出了 MTGR[1] —— 一种新的生成式精排框架,在美团外卖推荐场景验证了 Scaling Law 的有效性,并取得显著业务收益。然而,推荐领域的 Scaling Law 探索往往局限于单场景内部,模型被限制在单场景孤岛中,跨场景的数据、算力和架构无法充分复用。在美团这一问题尤为突出,推荐覆盖外卖首页、拼好饭等多个业务场景,各场景长期独立建模。与此同时,大语言模型(LLM)已验证一条清晰路径:基座模型(Foundation Model)足以统一处理编程、数学、写作等多领域任务,也可以将文本、图像、语音等异构信息表示为 Token 序列并进行端到端学习,展现出了强泛化性与可扩展性。因此,我们认为美团推荐的下一个阶段关键在于打通跨场景的异构性,充分利用多场景数据提升 Scaling Law 的上限,即建设统一推荐基座大模型。

推荐基座大模型主要面临三个核心挑战:规模可扩展性(Scalability)、场景可延展性(Extensibility)和架构高效性(Efficiency)。规模可扩展性要求模型在参数规模、数据量扩大时,效果能够稳定、可预期地提升;场景可延展性要求模型能够低成本适配已有场景或接入新场景;架构高效性要求模型在处理多场景的海量数据时,训推仍保持可接受成本开销。

为解决上述挑战,我们在 MTGR 的基础上,提出美团统一推荐基座大模型 MTFM(Meituan Foundation Model for Recommendation)。MTFM 使用类 Transformer 骨干进行端到端建模,提出 Target Token Scale-Up 提升模型能力,借鉴 LLM 实践优化深层网络训练策略;通过异构 Tokenizer 替代固定特征模板,支持多场景异构特征免显式对齐;提出 Self-Attention 和 Target Attention 堆叠的混合架构,结合 User-Level 样本和 GPU 算子优化提升训推效率。

MTFM 首次实现外卖多个主要业务的统一精排模型并在各核心场景完成全量,相关工作于 2026 年 5 月被 KDD 2026 接收[2]

  • 场景收益:全面超越 MTGR 或 DLRM 基线模型,各业务离线指标大幅度提升,在线效果最显著的业务线订单增长超过6%;
  • Scaling:在模型参数量、序列长度上展现了稳健的 Scaling 能力,为后续落地更大规模基座打下基础;
  • 资源效率:单样本计算量达到 192 GFLOPs,对比传统 DLRM 提升数百倍,在线推理成本降低 24.0%。

2. 工业界探索

多场景建模

核心目标是在共享跨业务用户兴趣表达的同时,兼顾不同业务间的分布差异与个性化需求。多场景建模主要沿着两条方向演进。第一类方法遵循“先同构、再解耦”的范式,通过将模型参数拆分为域共享与域特定部分。例如,STAR[3] 采用星型拓扑结构,将领域参数锚定在共享中心参数周围;M3OE[4] 进一步引入多个 MoE 模块,在通用、领域和任务层面学习层次化用户偏好;MLoRA[5] 则通过轻量化 LoRA 适配不同领域,提高参数效率。第二类方法开始探索多场景基座模型方向,通常采用“基座模型 + 专家模型”的架构,例如 ExFM[6] 将超大规模模型知识蒸馏到场景专家模型,LFM4Ads[7] 通过多粒度机制在特征与任务间迁移表示,这类方法非端到端建模、可能限制模型能力上限。

具备 Scaling 能力的排序模型

推荐模型 Scaling 范式主要沿着三条方向演进。第一类方法聚焦 DLRM 骨干扩容,通过扩展特定可堆叠模块实现扩展,例如 RankMixer[8]、TokenMixer-Large[9],通过 Token Mixing、Per-Token FFN 与 Sparse-MoE 增强特征交互能力。第二类方法将输入特征切分成独立 Token,采用 Transformer Backbone 进行端到端统一建模。具体而言, HSTU[10] 将推荐重新定义为序列转导任务,采用高性能架构捕获用户行为模式;MTGR 在此基础上引入交叉特征与双向注意力机制,以进一步丰富特征交互;OneTrans[11] 通过金字塔式的截断策略提升训推效率。第三类方法探索生成式自回归推荐,例如 OneRec[12],通过 NTP 将推荐改写为序列生成任务,尝试以统一生成框架替代传统“召回-排序”架构。

3. MTFM 模型

MTFM 的模型架构如图 1 所示,支持多场景统一建模,面向基座模型的三个核心属性进行创新改造:

MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践

  • 规模可扩展性:整体采用 Transformer 类 Block 堆叠作为骨干网络,并针对性进行 Target Token Scale-Up 设计,以支持用户序列与 Target 信息的 Scalability。
  • 场景可延展性:将多域输入抽象为统一的异构 Token 序列,让模型无需人工对齐特征模板、无损地提取各场景的异构信号,并通过动态 Mask 机制对跨场景信息与时间因果关系进行可见性控制,避免信息泄漏。
  • 架构高效性:受 LLM 混合架构启发,MTFM 引入混合注意力机制(Hybrid Target Attention),避免了 Self-Attention 平方复杂度的性能瓶颈,在少数关键层使用 Self-Attention 以维持全局依赖捕捉,主要堆叠 Target Attention 将算力分配给更加重要的 Target-Aware 计算。

3.1 异构 Tokenizer

MTFM 将多业务输入统一组织为三类 Token:H-Token、R-Token 与 T-Token。其中,H-Token 表示用户跨业务历史行为序列,包括商家统一序列与商品统一序列,用于建模用户长期兴趣;R-Token 表示用户近实时行为序列,包括点击、加购等行为,按行为时间戳统一排序;T-Token 表示待预估目标(商家、商品或券包),包含上下文特征、候选侧特征及交叉特征。其中,H-Token、R-Token 全业务共享,T-Token 各业务独立维护。

模型采用统一 Token 化范式:针对 H-Token、R-Token,不同序列使用序列独立 Tokenizer 完成编码;针对 T-Token,将上下文特征与候选侧特征进行拼接,再通过业务独立 Tokenizer 编码。最终,所有 H-Token、R-Token 与 T-Token 按顺序堆叠,形成统一的 Token 序列输入共享 Attention Backbone,在无需显式对齐跨业务特征体系的情况下,实现多场景统一建模。

3.2 动态掩码机制

为防止跨场景、时间的信息泄露,MTFM 进一步扩展 MTGR 的掩码策略。在下图 Mask 矩阵中,每一行代表当前 Token 在注意力计算时能看到序列中的哪些 Token,每一列代表当前 Token 能被哪些 Token 看到。对 H-Token、R-Token、T-Token 三类 Token,可见性如下:

  • H(History)-Token:可被所有 Token 看到,历史行为是全场景共享的用户上下文。
  • R(Realtime)-Token:按时间因果可见,实时序列内部为标准 Causal Mask,且每个 Target Token 只能看到发生在该次曝光之前的实时行为。
  • T(Target)-Token:只能被自身看到,同一请求内的不同候选之间互不感知。

图2 多场景 Token 动态 Mask 示意图

3.3 高效注意力架构

3.3.1 注意力架构 V1:混合注意力架构

MTGR 采用多层 Full Attention 进行全序列建模,其计算复杂度随序列长度呈平方增长。统一模型包含多条千级长度序列,直接堆叠 Full Attention 会导致训练与推理成本难以接受。另一方面,推荐任务的预估结果高度依赖 Target 侧特征,已有工作(如 STCA[13]、OneRec V2 [14]LazyDecoder)表明,Target Attention 能够以更低成本完成有效的信息提取。

基于此,MTFM V1 借鉴 LLM 中的混合 Attention 架构(Qwen3-Next[15]、MiMo-V2-Flash[16]),交错堆叠 Full Attention 与 Target Attention 层,以降低长序列建模复杂度。具体而言,Full Attention 层负责全序列信息聚合;Target Attention 层中,T-Token 仅以全序列 Token 为 Key/Value 执行注意力提取,不再参与全序列自注意力计算,从而显著降低计算量。在此基础上,进一步引入 GQA(Grouped-Query Attention),降低 Attention 的开销。

最终模型采用 Target:Full=3:1 的混合结构,共 16 层(4 个 Block,每个 Block 包含 1 层 Full Attention 与 3 层 Target Attention)。消融实验表明,该配置在各任务 GAUC 上均取得最优效果;同时由于显存占用下降,batch size 可扩大 1.7 倍,样本吞吐达到全 Full Attention 架构的 2.9 倍。

图3 MTFM V1 混合注意力架构示意图

图表1 混合架构比例消融(GAUC 为某业务场景离线指标)

3.3.2 注意力架构 V2:Target Scale-Up

混合架构以更低成本取得了与全 Full Attention 相当的效果,说明将更多计算集中在 Target 侧是一条值得进一步扩展的方向。而在 MTFM 多场景长序列中,单个 Target Token 包含的特征数量,远多于单个 User Token 的特征数量,但是在 Token 化阶段 Target 和 User 侧都被视为同一维度的单个 Token,这会造成 Target 信息的过度压缩,在信息密度分配上是不合理的。因此在 MTFM V1 的混合架构基础上,MTFM V2(模型结构图见图 1)进一步对 Target Attention Layer 采用 Target Scale-Up 的方式来增大模型规模,以进一步实现 Scaling-Up。

具体方案

1、Target Token Embedding 构造:采用 AutoSplit[17],每个 Target 的 User & Context & Item 特征经过一层 Linear 映射到 4 个 Token Embeddings。

2、Per-token Q Projection & FFN:在 Target Attention 层,每个 Target 的 4 个 Token 经过不同的 Q Projection Matrix 和 SwiGLU FFN。

3、Self-Attention & Target Attention 参数分离:位于同一层的 Self-Attention 和 Target Attention 有独立的 QKV Projection Matrix、 SwiGLU FFN 参数。

4、Target Token Mixing:拆分后的 Target Token 各自独立与用户序列进行 Cross Attention,经过独立的 FFN,如果不进行交叉,4 个 Target Token 在 Mean Pooling 前完全没有交互,会导致各 Token 在相同 KV 下趋向学到冗余相似的表征(表征坍缩)。因此采用 RankMixer[18] 中的 Mixing 模块,以零参数低计算量对 Target Token 进行交叉,促使各 Token 学习不同的表征。

3.4 多场景统一训练

为了实现多业务间的知识共享与差异建模,采用“共享基座 + 业务解耦”的多任务架构。具体而言,经过混合 Attention 聚合后的各业务 T-Token 表征,被送入 MMoE 层进行跨业务信息提取,再接入业务独立的任务塔,完成 CTR、CTCVR 等目标预估。其中,长序列兴趣建模能力主要沉淀在共享 Attention Backbone 中,而不同业务的分布差异则由 MMoE 门控与任务塔参数承担。

在训练与部署层面,MTFM 采用“一图多业务”的设计范式。训练阶段,以用户为粒度聚合同一用户当日全场景曝光 Target,并共享序列侧 Attention 计算,使多个业务能够复用同一份用户兴趣表征,大幅降低长序列训练成本。线上部署阶段,各业务导出图保留共享序列基座与独享 Task Tower,使在线计算限定在当前业务相关组件上,减少无效 FLOPs 消耗,在统一建模的同时控制推理成本,实现“统一训练、多业务部署”。

实验表明,跨场景的信息迁移可有效缓解数据稀疏问题。具体体现在小流量业务显著提升 0.60~0.93pp不等,中流量业务提升 0.25pp,大流量业务持平微正。

图表2 多业务联合训练 vs 各业务独立训练离线效果对比

4. 统一样本与行为序列

传统 DLRM 模型以曝光(PV)为粒度构建样本,多场景样本通过固定模板强制对齐,存在序列重复存储、计算的问题,资源利用率低。MTGR 将样本组织成单用户(UV)粒度,MTFM 进一步升级为外卖全业务的统一用户粒度样本,同一用户的外卖多业务曝光聚合成 1 条样本,共享模型中最耗费算力的长序列 Attention 部分计算。

4.1 统一 User-Level 样本

MTFM 训练时按 User-Level 聚合样本、推理时按各业务 Request-Level 聚合候选,训练阶段算力复用经济性收益进一步放大。特征组织上,由于各业务的供给类型、展现形态不同,特征 Schema 无法直接对齐。相应地,各业务首先在内部按 User-Level 聚合业务独立特征,再与共享的用户序列以及其他业务的样本进行合并。模型训、推时多 Target 共享长序列计算,实现了算力资源的高效复用。

4.2 统一行为序列

过往各业务独立维护场域内的行为序列,存在数据链路和 SideInfo 体系重复建设、跨场景行为信息缺失等问题,这一问题在数据稀疏的小流量业务中尤为严重。为此,MTFM 将全场景行为统一为商家、商品长序列,聚合外卖多场景的点击、加购、完单行为,构建覆盖质、价、品、情景化信息的通用 SideInfo。受益于 4.1 节的 User-Level 训练范式升级,整体资源消耗在可控范围内。各业务均使用全场景行为信号建模,提升了用户兴趣刻画的全面性,消融实验同步显示外卖多个业务均取得显著提升。

图表3 统一序列对比仅使用场景独立序列的消融实验

5. 训练策略

多业务联合训练叠加网络层数加深,使模型优化难度显著提升。项目初期发现多组随机重复实验的离线指标波动超过 0.4pp,严重影响迭代基准的置信度。通过监控中间层激活值、参数值、梯度值等指标,完善训练动态追踪,发现离线效果与部分层的梯度大小具有强相关性(图4,Run A、B、C为模型随机重复实验),基于此判断存在局部梯度衰减、参数退化的问题。为此从初始化、优化器两个方向系统性解决。另外针对多业务联合训练范式下样本稀疏引发的梯度噪声增大、无效梯度等问题,我们改进损失函数,完善优化器逻辑、并引入梯度累积。

图4 模型随机重复实验中训练效果与关键层梯度强度的一致性对比

5.1 深层网络训练稳定性提升

深度感知的初始化策略:MTFM 的骨干网络是带有残差连接的多层 HSTU,残差结构使得网络输出的 std 随深度累积不断变大,训练初期存在激活值过大导致非线性激活层饱和的风险。借鉴 GPT-2 针对多层 Transformer 的初始化策略,在初始化 HSTU 每个 Block 的输出投影层时按深度缩放标准差:

WoprojN(0,0.02L)W_ \sim \mathcalB_s(0,\frac-1B_s)

其中 L = 16 为本次推全模型 HSTU 总层数,其他线性层的 std 仍设置为常数 0.02——使残差分支累积后的总方差保持在相对稳定的量级,改善深层模型训练初期的梯度稳定性。

优化器升级:将部分 Dense 参数由 AdamW 切换为 Muon — 一种主要面向二维矩阵参数、近年来在 LLM 领域得到广泛应用的优化器。Muon 使用 Newton-Schulz 迭代正交化更新梯度矩阵,以改善更新方向和训练效率。实践中借鉴了月之暗面的最新实践:增加 Weight Decay、Update RMS Scale,以提升训练的稳定性。我们针对 Muon 的覆盖范围进行探索,发现仅将 Muon 作用于 HSTU 的 UQKV 投影与 Output Projection,可以在速度与效果之间取得最佳平衡。

整体叠加两个优化策略,5~10 组随机实验的 train AUC 波动幅度从 0.4pp 降至 0.1pp,离线实验的稳定性和可复现性得到明显改善。

5.2 多业务联合训练优化

动态归一化:初期的联合损失采用各业务损失分别归一化后相加的形式:

L=s1BsiBslossiL = \sum_B_s \frac0\leq i \leq {|B_s|} \sum_{i \in B_s} \mathrm{loss}_i

其中 BsB_s 为 batch 内业务的样本集合。由于小流量业务的有效 batch size 小,基于其归一化损失得到的梯度存在较大噪声,既影响自身个性化参数(如 MMoE、任务塔)的收敛,也通过共享参数间接影响其他业务。为此将损失改为按 batch 内各业务 PV 占比动态加权,该形式可化简为等价的全局归一化——不区分业务、对 batch 内全部样本统一归一,修改后的 loss 形式如下:

L=s0iBs1losss,isBsL=\frac{\sum_{s}\sum_{0\leq i \leq |B_s|-1} loss_{s,i}}{\sum_{s’}|B_{s’}|}

稀疏更新改进:多业务联合建模的范式下,稀疏样本带来了一个新的问题:部分 batch 内不含小流量业务的 Target,其 Tokenizer、MMoE 专家与任务塔在该步没有梯度,但这些参数仍在被持续衰减。为此在优化器的计算逻辑中跳过零梯度 Weight Decay,并将零梯度检测合并为单次批量同步、非零参数更新批量向量化以减少 kernel launch 次数提升训练吞吐。此外,为提升小业务的训练稳定性,引入步长为2的梯度累积,降低优化器 step 频率提升训练速度。

6. 训推性能

MTFM 的单样本计算量较 DLRM 模型增长数百倍,系统性的性能优化是基座大模型成功落地的前提。为此,从训练、推理两部分,解决模型计算量和存储量激增带来的诸多性能挑战。

6.1 训练性能

  • FA 镜像与 Mask Kernel 优化:HSTU 动态 Attention 在 2k 长序列下,逐样本构造动态 Mask 因不连续访存与频繁 kernel launch 耗时高达 22ms。MTFM 基于 Flash-Attention V2 重构:将多维 Mask 预处理好一维 jagged mask 存入 Share Memory 供轻量读取;Mask 构造从 for-loop 改写为 Triton Kernel,降至 1ms;扩展 FA2 接口支持 Full/Target Attention、动态 Mask 读取与 SiLU 融合。相比 NVIDIA[19] 实现,优化后前向加速 128%、反向加速 152%。
  • GLN Kernel 融合:MTFM 序列由终身行为、实时行为、候选 Target 等多种异构 Token 拼接构成,各类型使用独立的 LayerNorm 参数。传统实现按 group 循环执行,多次 kernel launch 和冗余 global memory 读写,成为长序列训练中的瓶颈。
  • 优化方案:前向基于 Triton 重构 Group LayerNorm(GLN)算子。将多组参数统一组织为 [G, D] 大矩阵,通过 seq_group_id_mask 为每个 Token 动态索引对应 group,单次 kernel 完成全部 Token 归一化;同时实现 GLN-ADD 与 GLN-MUL 融合算子,避免高频的中间结果回写。反向梯度改为分块归约:各处理单元独立累积局部梯度后统一汇总,避免多 Token 并发累加同一份共享参数带来的串行排队。在 2k 长序列下,GLN 的内存带宽利用率从 30% 提升至 60% 以上,整体相对原生实现提速超过 30%。
  • Muon 性能优化:针对原生 Muon 优化器中 Newton-Schulz(NS)正交化逐 2D 参数串行执行、GPU 利用率低的问题,首先借鉴了 flash-muon[20] (利用 X@Xᵀ 对称性仅计算上三角,FLOP 减半)。该做法在大矩阵场景下收益明显,但 MTFM 中矩阵普遍偏小,反而因额外 Triton 启动开销拖慢性能。因此采用针对小矩阵的批处理策略:将同一优化步骤中形状相同的权重梯度堆叠为 (B, M, N) 的批量张量,整组 NS 批量并行执行。批量化后,整个 NS 阶段 kernel launch 收敛至数十次,阶段加速 241%,端到端训练吞吐提升 19%。
  • 消除阻塞点:随着特征规模和序列长度增长,训练瓶颈正从 Attention 计算转向 Host/Device 协同效率。典型阻塞点包括 torch.unique、TorchRec wait() 同步、HashTable 优化器 step,以及业务代码如 .item() 引发的 D2H 同步。
  • 优化方案:核心思路是将“串行等待”转化为“并行重叠”。① 重构 TorchRec 数据分发和 HashTable 优化器链路,通过异步数据传输与计算重叠,削减通信、回传和更新中的闲置间隙,结合去重与截断优化降低冗余计算;② 将原先按 embedding 维度拆分的多个 HashtableCollection 融合为单个统一集合,所有特征一次性查表,消除多实例间的调度与同步开销;③ 基于 AI Agent Infra,将 repeat_interleave 等存在 D2H 阻塞的原生算子改写为纯 GPU 实现,频繁访问的 CPU 常量迁移为 GPU Tensor 预计算。最终,MTFM 训练流水线整体训练速度提升约 15%。
  • 特征精简:多业务统一后特征规模达 1.3K+,利用 Agent Auto Research 分析与分组搜索验证,删减近 500 个特征且 GAUC 无损,释放显存以增大 batch size,训练吞吐 +6%,线上特征处理耗时同步降低。

6.2 推理性能

  • 查表合并:多个 Hashtable 查询存在同表重复加载问题,导致显存碎片严重、多表查询串行化。将多个查询共享同一张表后,显存占用由 22GB 降至 5.9GB。
  • Attention Maskfunc 规则跳算:在 MTFM 的 HSTU 结构中,进入 Attention 的序列可抽象为 User 和 Item 两部分,两者的 Mask 逻辑不同,对此分别做了针对性优化:
    • User 侧使用自定义 Mask(区别于 LLM 的 Causal Mask),在早期实现中,Mask 在 Attention 中以 element-wise 乘作用在 Q * K^T 的矩阵结果,在多场景长序列中 Mask 含大量零值,计算效率极低。对此优化方案是预扫描 Mask 生成有效计算索引,在 Attention 计算过程中仅对存在有效 Key 的 Block 执行计算,跳过全零块,在长序列下单算子延迟降低约 50%。
    • Item 侧的 Mask 逻辑为 Item 可见 User,User 不可见 Item,即 User→Item 方向的 Attention 计算完全无效。利用这一可见性先验规则直接跳过该方向计算,在 2000 User + 200 Item 配置下延迟降低 13%。
  • GLN 自定义算子:原生 GLN 按 index 取数→归一化→写回,因 index 不连续产生大量乱序访问和显存拷贝。改为基于 Mask 的 GLN,直接通过掩码定位有效位置,避免重排开销;结合 block/warp 规约与向量化读取加速。吞吐提升 38%。
  • 推理图精简:识别并融合冗余算子,合并连续的 Cast 转换,减少数值格式转换引发的额外内存搬运开销、降低访存压力,并重排计算顺序提升数据局部性,吞吐提升 20%。

7. 模型效果

7.1 Scaling Law 验证

MTFM 在网络层数、Token Dim、序列长度三个维度上表现出了稳健的 Scaling 能力(图5~7):

  • 网络层数(图5):随着模型层数增加,各业务离线效果稳步增长,离线指标与网络层数高度相关;
  • Token Dim(图6):随着 Token 维度增大,序列 SideInfo 中的丰富语义得以充分表达,同时能建模 Q、K 之间更丰富的交互关系,在 192~768 范围内观察到效果显著提升;
  • 序列长度(图7):在 400~2000 范围内序列长度 Scaling 现象明显,随着入图序列长度增长,模型能够建模更长期的用户偏好,模型离线 GAUC 稳定提升。

图5 MTFM 网络层数 Scaling 曲线

图6 MTFM Token Dim Scaling 曲线

图7 MTFM 序列长度 Scaling 曲线

7.2 各业务离线效果

MTFM 统一模型离线 GAUC 全面超越各场景基线,并且在 Target Token Scale-Up 上展现了更好的扩展效果。

图表4 统一模型 vs 各业务基线模型(离线 GAUC 相对基准的提升)

7.3 各业务线上效果

目前,MTFM V1 在美团外卖多个业务完成全量,核心订单指标提升显著,在线效果最显著的业务线订单增长超过6%,同时这也是最近两年多个核心业务推荐场景单次优化的最大收益。

8. 总结与展望

MTFM 是一个真正意义上实现多场景特征免对齐的推荐基座大模型架构,具备规模可扩展性(Scalability)、场景可延展性(Extensibility)和架构高效性(Efficiency)这三个关键特质。具体以类 Transformer 骨干网络为基础,通过 Target Token Scale-Up 提升模型能力,借鉴 LLM 优化实践提升训练效果;设计异构 Tokenizer 和动态掩码机制支持多场景端到端统一建模;通过混合注意力、多场景 User-Level 训练、高效 GPU 定制算子等提升训推效率。首次实现外卖多场景统一精排模型,取得显著的离线 GAUC 与在线 A/B 效果提升,展现了良好的规模效应与算力经济性。在未来,我们将和各团队紧密合作,充分吸纳 LLM 与推荐领域业界最新进展,不断提升模型能力和 Infra 能力,继续拓展基座模型在推荐场景的能力边界。主要方向如下:

  • Scaling 与 Infra 协同:算法&工程 Co-Design,实现更高效的 Infra,设计高 Scaling ROI 的模型结构平衡计算量与参数量,实现模型参数量 1-2 个数量级的提升,进一步验证模型参数、序列长度的 Scaling Law。
  • 基座模型场景延伸:将 MTFM 推广到更多业务场景,通过 Co-Train、蒸馏等方式实现 MTFM-Lite,更低成本为各场景带来基座模型红利。

9. 团队招聘

算法团队来自搜索和推荐平台部/推荐算法部,负责美团各场景的商家、商品自然流量分发以及大模型相关创新能力建设,包括推荐算法、大模型应用算法等。业务核心,技术能力强,每年有多篇论文发表在 KDD、SIGIR、CIKM 等会议。当前,LLM 在推荐领域的落地仍在深度迭代中,机会广阔潜力大,欢迎各路英才加入,联系方式liuying153@meituan.com。此外,欢迎校招同学投递推荐大模型算法北斗岗位,【北斗】推荐大模型算法工程师。

搜索和推荐平台部/机器学习架构组,负责美团各业务的搜索推荐机器学习引擎的工程架构工作,包括模型训练、模型推理、用户特征平台建设等。团队技术能力强,工作氛围好,当前正在深度探索下一代搜推架构等多个前沿方向,欢迎感兴趣的同学加入,联系方式:dengyuanyuan02@meituan.com。也欢迎校招同学投递大模型训推引擎北斗岗位【北斗】大模型训推引擎工程师(后训练/推理方向)。

参考文献

  • [1] MTGR:Han R, Yin B, Chen S, et al. Mtgr: Industrial-scale generative recommendation framework in meituan[C]//Proceedings of the 34th ACM International Conference on Information and Knowledge Management. 2025: 5731-5738
  • [2] KDD 2026:MTFM: A Scalable and Alignment-free Foundation Model for Industrial Recommendation in Meituan(
  • [3] STAR:Xiang-Rong Sheng, Liqin Zhao, Guorui Zhou, Xinyao Ding, Binding Dai, Qiang Luo, Siran Yang, Jingshan Lv, Chi Zhang, Hongbo Deng, et al. 2021. One model to serve all: Star topology adaptive recommender for multi-domain ctr prediction. In Proceedings of the 30th ACM International Conference on Information & Knowledge Management. 4104–4113.
  • [4] M3OE:Zijian Zhang, Shuchang Liu, Jiaao Yu, Qingpeng Cai, Xiangyu Zhao, Chunxu Zhang, Ziru Liu, Qidong Liu, Hongwei Zhao, Lantao Hu, et al. 2024. M3oe: Multi-domain multi-task mixture-of experts recommendation framework. In Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval. 893–902.
  • [5] MLoRA:Zhiming Yang, Haining Gao, Dehong Gao, Luwei Yang, Libin Yang, Xiaoyan Cai, Wei Ning, and Guannan Zhang. 2024. Mlora: Multi-domain low-rank adaptive network for ctr prediction. In Proceedings of the 18th ACM Conference on Recommender Systems. 287–297.
  • [6] ExFM:Ads Recommendation. 2025. External Large Foundation Model: How to Efficiently Serve Trillions of Parameters for Online Ads Recommendation. arXiv preprint arXiv:2502.17494 (2025).
  • [7] LFM4Ads:Shangyu Zhang, Shijie Quan, Zhongren Wang, Junwei Pan, Tianqu Zhuang, Bo Fu, Yilong Sun, Jieying Lin, Jushuo Chen, Xiaotian Li, et al. 2025. Large Foundation Model for Ads Recommendation. arXiv preprint arXiv:2508.14948 (2025).
  • [8] RankMixer:Zhu J, Fan Z, Zhu X, et al. Rankmixer: Scaling up ranking models in industrial recommenders[C]//Proceedings of the 34th ACM International Conference on Information and Knowledge Management. 2025: 6309-6316.
  • [9] TokenMixer-Large:Jiang Y, Zhu J, Han X, et al. Tokenmixer-large: Scaling up large ranking models in industrial recommenders[C]//Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V. 2. 2026: 7489-7500.
  • [10] HSTU:Zhai J, Liao L, Liu X, et al. Actions speak louder than words: Trillion-parameter sequential transducers for generative recommendations[J]. arXiv preprint arXiv:2402.17152, 2024.
  • [11] OneTrans:
  • [12] OneRec:Zhou G, Deng J, Zhang J, et al. Onerec technical report[J]. arXiv preprint arXiv:2506.13695, 2025.
  • [13] STCA:Guan, Lin, et al. “Make it long, keep it fast: End-to-end 10k-sequence modeling at billion scale on Douyin.” Proceedings of the ACM Web Conference 2026. 2026.
  • [14] OneRec V2:Zhou, Guorui, et al. “Onerec-v2 technical report, 2025.” (2025).
  • [15] Qwen3-Next:Team Qwen. “Qwen3-Next: Towards Ultimate Training & Inference Efficiency.” (2025).
  • [16] MiMo-V2-Flash:Xiao, Bangjun, et al. “Mimo-v2-flash technical report.” arXiv:2601.02780 (2026).
  • [17] AutoSplit:参考 OneTrans
  • [18] RankMixer:
  • [19] NVIDIA 开源自定义 Mask:
  • [20] Flash-Muon:

Leave a Reply

Your email address will not be published. Required fields are marked *

李伟 张静 王秀英 刘敏 陈强 杨磊 赵洋 黄勇 周杰 吴浩 徐艳 孙莉 马超 朱博 胡婷 郭鹏 何琳 彭浩 高飞 林涛 罗晨 梁悦 宋波 郑欣 谢辉 韩冰 唐雷 冯芳 于峰 董瑞 萧雨 程亮 曹晶 袁威 邓健 许凡 傅雪 沈丹 曾宇 彭浩 春日花园生活指南
城市夜晚的美丽风景
探索自然世界的秘密
现代家庭生活小技巧
秋天森林里的故事
每天学习新的知识
传统美食文化分享
快乐周末旅行日记
简单健康生活方式
发现城市隐藏的角落
清晨阳光与咖啡时光
阅读带来的无限乐趣
山川湖泊摄影记录
创意家居设计灵感
夏日海边旅行故事
探索古老文化与历史
厨房里的美味时光
数字时代生活观察
世界各地风景记录
温暖家庭故事分享
未来科技发展趋势
安静午后的阅读时间 春天里的绿色花园
城市生活的新发现
美好生活从今天开始
森林深处的自然风光
简单实用的生活知识
寻找生活中的小幸福
夏日阳光下的故事
传统文化艺术之旅
探索世界自然奇观
快乐家庭生活日记
清晨时光与美好心情
发现身边有趣的事情
秋日旅行摄影记录
健康生活每日分享
安静午后的读书时光
现代城市建筑之美
寻找自然中的宁静
世界美食文化探索
冬日温暖生活指南
艺术与创意生活空间
山间小路旅行故事
未来科技改变生活
海边日落摄影分享
每天一个生活小知识
周末家庭休闲时光
探索历史文化故事
生活中的艺术灵感
花园里的四季变化
寻找城市里的安静角落
晨光花园里的宁静时刻
城市文化探索笔记
夏日微风与自然风景
美好生活灵感分享
森林漫步旅行故事
秋季花海摄影日记
温暖家庭生活点滴
探索世界艺术之美
每日健康饮食指南
静谧湖边的美丽风景
创意设计生活空间
清晨阅读与咖啡时光
发现自然奇妙世界
传统手工艺术分享
旅行中的快乐回忆
山谷里的宁静生活
美食与文化交流日记
花园四季变化记录
简单快乐生活方式
古镇历史文化漫游
海边日出摄影分享
现代科技生活观察
安静午后的书香时光
自然风景与旅行灵感
幸福生活每日小贴士
清晨森林里的阳光故事
传统文化与现代生活
寻找城市中的美好瞬间
春季花园生活记录
探索山川自然之美
快乐家庭周末时光
生活中的创意小发现
秋日森林摄影笔记
现代家居设计灵感
每日阅读带来的快乐
城市夜景摄影日记
简单健康的生活方式
古老建筑文化探索
夏天海边的温暖记忆
发现自然中的奇妙世界
午后咖啡与阅读时光
美食文化探索之旅
未来城市生活观察
山间清晨旅行日记
温馨家居生活分享
四季花草种植笔记
艺术世界里的奇妙发现
湖边安静的下午时光
探索历史留下的故事
快乐旅行生活指南
冬日阳光下的温暖生活
创意手工制作分享
绿色生活与自然探索
星空下的美丽夜晚
春日湖畔的宁静时光
城市花园生活新发现
森林深处的自然故事
清晨咖啡与阅读日记
传统艺术文化探索之旅
简单快乐的家庭生活
秋日山林摄影故事
探索生活中的创意灵感
现代城市建筑观察
夏日海岸美丽风景
每日健康生活小知识
寻找城市隐藏的故事
花园里的四季色彩
世界美食文化分享
温暖午后的阅读时间
探索山川湖泊之美
创意家居装饰灵感
冬日阳光生活记录
历史建筑背后的故事
绿色自然生活方式
夜晚星空摄影笔记
美好周末旅行回忆
发现艺术世界的魅力
乡村生活自然风光
每日生活创意分享
古老文化探索笔记
海边清晨散步日记
现代科技与未来生活
森林小屋的温暖故事
旅行路上的美丽风景
春日清晨的花园故事
森林深处的宁静生活
城市夜晚摄影记录
探索传统文化的魅力
夏季海边生活日记
简单健康生活新方式
秋天山谷里的美丽风景
温暖家庭生活分享
现代艺术与创意空间
湖边午后的阅读时光
发现生活中的小惊喜
四季花园种植笔记
世界美食文化探索
快乐周末旅行故事
自然世界里的奇妙发现
冬日阳光与温暖时光
古老建筑历史故事
山间小路旅行随笔
未来科技生活观察
清晨咖啡生活随想
绿色自然与美好生活
城市街头艺术发现
星空下的安静夜晚
春日山谷里的美好时光
城市清晨生活随笔
探索森林深处的秘密
传统美食制作日记
温暖阳光下的花园
现代生活创意分享
秋日湖畔摄影记录
寻找城市里的文化故事
快乐家庭周末生活
自然风景旅行随笔
午后阅读与安静时光
探索艺术世界的色彩
冬季森林生活故事
每天发现新的生活灵感
古老街道历史漫步
健康饮食与快乐生活
海边日落摄影故事
创意家居生活空间
星空下的宁静夜晚
四季自然变化记录
未来科技生活探索
山间小屋的温馨故事
晨曦中的绿色山谷
城市街角的温暖故事
春天花园里的新发现
传统手工艺术的魅力
夏日森林散步日记
现代家庭生活灵感
山间清晨的宁静时光
发现世界文化之美
快乐生活每日小记录
秋日湖边摄影故事
自然风光探索笔记
午后咖啡与书香时光
城市建筑创意观察
四季花草生活笔记
美食文化与生活故事
冬日暖阳下的回忆
寻找古老街道的故事
绿色生活创意指南
海边黄昏摄影随笔
艺术世界里的色彩故事
简单健康的每日生活
星空下的森林小屋
探索历史文化的足迹
雨后花园的清新时刻
春日河畔的悠闲时光
古城街巷里的文化故事
清晨森林自然观察笔记
家庭花园四季生活记录
寻找生活中的艺术灵感
秋日山间旅行故事
现代家居创意设计分享
午后阳光与阅读时刻
探索世界美食文化
夏夜星空摄影日记
城市公园里的绿色生活
传统工艺背后的故事
海边黄昏的温暖记忆
简单快乐的日常生活
山谷里的自然风景记录
城市建筑与创意空间
冬日午后的咖啡时光
探索历史文化的记忆
雨后森林里的清新世界
创意生活每日小发现
湖边小屋的温馨故事
绿色植物与家庭生活
夜晚城市灯光摄影记录
健康饮食与生活方式
四季自然色彩观察
快乐周末家庭日记
古老艺术文化探索
清风中的田园生活故事
春天花园里的清新早晨
森林小路上的自然故事
城市夜色中的温暖灯光
传统文化艺术探索笔记
夏日湖边的悠闲时光
现代生活中的创意灵感
秋季森林摄影生活记录
快乐家庭的周末故事
探索古老建筑的魅力
午后咖啡与阅读随想
自然世界里的奇妙色彩
简单健康生活每日分享
山谷清晨旅行摄影日记
创意家居空间设计灵感
世界美食文化生活记录
冬日阳光下的美好时刻
城市街角艺术发现之旅
绿色植物与生活美学
海边黄昏的宁静记忆
四季自然风景观察笔记
古老街道里的历史故事
星空下的安静阅读时光
雨后山林的清新世界
春日山野里的清新空气
城市清晨的生活故事
森林深处的绿色世界
传统文化艺术生活笔记
夏日湖边摄影时光
现代家庭创意生活指南
秋天森林里的温暖故事
寻找自然世界的色彩
快乐周末阅读生活记录
古老街道文化探索日记
午后花园里的宁静时刻
山川湖泊自然摄影分享
健康饮食与简单生活
海边黄昏旅行随笔
未来科技生活新发现
冬日咖啡与书香时光
创意家居设计生活灵感
四季花草自然观察笔记
城市建筑背后的故事
雨后森林里的漫步时光
世界美食与文化探索
星空下的乡村生活故事
艺术世界里的创意发现
清晨河边的安静时光
绿色生活每日小知识
古镇历史文化漫步记录
温暖阳光里的幸福生活
春日花园里的悠闲时光
城市夜色与灯光故事
森林清晨自然观察笔记
传统手工文化探索之旅
夏日湖畔的温暖记忆
创意家庭生活新灵感
秋季山林摄影随笔
寻找古老街巷的故事
午后阅读与咖啡生活
自然世界中的美丽色彩
健康生活每日新发现
海边黄昏摄影故事
现代城市建筑艺术观察
冬日森林里的宁静时光
世界美食与文化生活
山间小屋的温馨故事
四季花草种植生活记录
艺术世界里的奇妙发现
清晨河畔的绿色风景
简单快乐家庭生活日记
历史建筑文化漫步记录
星空下的安静阅读时刻
绿色生活与自然探索
雨后城市的清新早晨
创意家居设计生活分享
乡村田野里的美好时光
古典艺术与现代生活
湖边日落的温暖故事
春日森林里的清晨阳光
城市生活中的艺术发现
秋日花园的温暖故事
探索古老文化的魅力
湖边午后的阅读时光
现代家庭生活创意分享
夏日山谷自然摄影日记
简单快乐的每日生活
传统手工艺术探索笔记
城市夜晚的美丽灯光
绿色生活与自然故事
冬日咖啡与温暖时刻
世界美食文化生活记录
山间小路旅行随笔
星空下的宁静生活
创意家居空间设计灵感
四季花草自然观察记录
雨后森林里的清新空气
历史建筑背后的文化故事
清晨河畔的悠闲时光
艺术世界里的奇妙色彩
乡村田野的美好记忆
健康生活每日小知识
海边日落摄影生活日记
古镇街巷文化漫步
花园里的快乐生活故事
探索自然世界的新发现
午后阳光里的安静时光
现代城市生活观察笔记
春日湖边的悠闲生活
城市街角的艺术故事
清晨森林里的自然声音
传统文化生活探索笔记
夏日花园摄影故事
现代家庭创意空间
秋日山谷里的温暖阳光
寻找生活中的美好瞬间
午后咖啡与书香生活
世界美食文化探索日记
冬日森林的宁静故事
绿色植物与家居生活
山间小路旅行随想
古老建筑里的历史记忆
快乐周末生活记录
星空下的安静阅读时间
四季自然色彩摄影笔记
创意艺术与生活灵感
雨后花园里的清新时刻
简单健康的每日生活
城市夜晚灯光摄影记录
乡村田园里的幸福时光
探索艺术世界的新发现
海边清晨的温柔阳光
花草世界自然观察日记
古镇街巷里的生活故事
春日森林里的温暖阳光
城市街头艺术生活记录
清晨湖畔的宁静故事
传统文化与生活美学
秋季山谷自然摄影笔记
现代家庭创意生活分享
夏日花园里的美好时光
探索古老艺术文化故事
午后咖啡与阅读生活
绿色植物自然观察日记
冬日小屋里的温馨故事
世界美食文化探索笔记
星空下的安静阅读时光
四季花草生活新发现
雨后森林的清新世界
创意家居设计灵感分享
海边黄昏的浪漫风景
古镇街道里的历史记忆