Netflix 在 10% 的流量上测试 GenRec,报告相对提升 0.006%
Netflix 工程师 Ying Li、Arjun Rao 和 Shradha Sehgal 在使用大约少了 40 倍的 Phase 2 标签的情况下,测试了一个基于 LLM 的排序器,并在一个未披露的核心指标上报告了 0.006% 的相对提升。
By RuntimeWire Staff · Published
Primary source: Netflix TechBlog
Why it matters
GenRec gives recommendation engineers a concrete design to examine: compress behavioral context, refresh ranking-specific training more often than the foundation model and constrain LLM scores to a known catalog. Its narrow 0.006% relative online gain also shows the difficulty of beating a mature ranker, even with fewer labels and lower serving costs.

Netflix 工程师 Ying Li、Arjun Rao 和 Shradha Sehgal 将 GenRec(一种由 LLM 支持的排序器)与该流媒体服务成熟的生产推荐系统进行了对比测试。Netflix 在大约 10% 的流量上对 GenRec 进行了为期四周的测试,并报告其核心在线指标出现统计显著的 0.006% 相对提升。
该结果出现在一篇2026 年 8 月 10 日的技术论文 中,并扩展了 Netflix 在7 月 30 日的工程文章 中披露的内容。Li、Rao 和 Sehgal 在 GenRec 的第二阶段训练中使用的标注示例数大约比 Netflix 的生产模型少 40 倍时仍实现了该提升(约少 40 倍的标注示例)。这一比较刻画了实验的权衡:与经过大量调优的基线相比,在线增益非常小,但同时伴随更少的频繁刷新标签和更短的服务上下文。
Netflix TechBlog 文章 列出 Li、Rao 和 Sehgal 为作者。技术论文 则新增了 Rein Houthooft、Yaochen Zhu 和 Ashish Rastogi,并列出了来自 Netflix 多个团队(涵盖会员 AI、AI 平台与服务以及产品)的贡献者。Rao 在其描述中 将他在 Netflix 的工作描述为面向排序和页面构建的应用研究与机器学习工程的混合。
伊利诺伊大学厄巴纳-香槟分校的简介 描述了 Sehgal 的研究生学习以及涉及机器学习系统和基于 LLM 的类比挖掘的工作。Li、Rao 和 Sehgal 还共同撰写了一篇关于 learned verbalization 的 2026 年 2 月论文,该论文研究如何将原始交互日志转换为 LLM 可以高效使用的语言表示。
GenRec 将上述工作扩展到全目录排序系统。作者将其描述为朝向 LLM 原生推荐栈的初步步骤,而非面向外部客户的商业产品。该项目将会员历史、片目元数据和请求上下文转换为文本,然后使用经过 Netflix 适配的基础模型和一个目录感知的评分头对可用片目进行排序。Netflix 尚未表示 GenRec 已替换其全服务的推荐器,披露材料中也未涉及外部定价或融资信息,因为 GenRec 是一个内部工程项目。
将推荐转为语言形式
Netflix 的现有生产系统 依赖数千个手工构建的特征,覆盖会员、片目和交互。不同的架构分别处理序列建模、特征交互和多目标优化。多年累积的新增功能使这些机制非常强大,但也增加了为某个内容类别或推荐面引入变更所需的工程工作量。
随着 Netflix 将推荐范围从电影和剧集扩展到游戏、直播节目和播客,这一负担有所增加。会员会产生数千亿交互事件,包括播放、观看时长、明确反馈、添加到列表以及中途放弃的会话。Netflix 未说明该总量覆盖的时间区间,但如此庞大的规模解释了为何在推理前用文本替代手工输入仍然需要积极的过滤。
GenRec 改变了模型的输入。会员历史、片目元数据和请求上下文 被转换为自然语言或轻结构化的描述。这些描述可以包含 观看时长、明确反馈、设备、地区设置、时间、订阅年限以及推荐将出现的展示面。
研究团队在历史到达模型之前对其进行了过滤。长时播放和正面评分会获得更详细的描述。短暂或噪声较多的交互可以被丢弃。重复行为,包括狂欢式追剧会话,可以被压缩为摘要。较旧的活动比近期的、高信号的行为占用更少的篇幅。
这一选择使得提示构建成为一个生产工程问题。每多一个 token 都会消耗 GPU 容量并可能提高延迟。全文指出,Netflix 将 GenRec 的上下文从大约 5,000 个 token 缩减到约 1,700 个,且其离线排序指标几乎没有恶化(从约 5,000 缩到约 1,700)。在此配置下,由于服务成本大致与上下文长度成正比,Netflix 报告称成本下降到原来水平的大约三分之一。
该模型分两阶段训练。第一阶段使用专有的 Netflix 数据对一个开源基础模型进行适配,教会共享的基础模型关于目录和会员行为的知识。Netflix 未公开该基础模型的身份。第二阶段则将该基础模型用于排序训练,使用更频繁刷新的示例、推荐目标和奖励信号。
这种划分反映了推荐数据的快速衰减性。第一阶段的基础模型更新相对不频繁,而第二阶段则更常刷新以跟踪新内容、流行度模式和会员的最新兴趣。与在第一阶段截止日期训练的新鲜第一阶段模型相比,第二阶段在离线排序指标上大约带来了 35% 至 50% 的提升(约 35% 到 50% 的增益)。该比较与 GenRec 针对 Netflix 生产排序器的评估是不同的参照。
研究人员还对大约 10 亿和 100 亿参数量级的骨干模型进行了比较([在 1 亿到 10 亿参数量级的对比](https://arxiv.org/html/2608.10257?ref=runtimewire))。论文报告称,随着第二阶段训练数据量的增加,两种模型尺寸的离线平均倒数排名(mean reciprocal rank)均呈单调改善。Netflix 未披露用于在线实验的模型参数数量。
小幅在线增益与有限的适用范围
在离线评估中,GenRec 在使用大约 40 倍更少的第二阶段标注示例的情况下,相对于 Netflix 的生产基线将平均倒数排名提升了约 1.6%(相对基线)。平均倒数排名衡量的是第一个相关结果出现的位置:若相关片目位于第一位则比位于更下方得到更多的分值。因此 1.6% 的数字描述的是离线测试中的排序位置,而不是观看量、留存或收入。
随后 Netflix 将大约 10% 的流量分配给为期四周的测试,覆盖选定的批量计算推荐展示面。Netflix 报告称在短期和长期指标上均取得了统计显著的提升。披露的示例为其核心在线指标出现了0.006% 的相对提升。
论文并未指明该在线指标的具体含义、其绝对基线、置信区间,或对会员留存、观看或财务表现的任何影响。统计显著性意味着 Netflix 的试验在其设计下检测到了效果;但这并不证明该变化具有广泛的产品或业务影响。若无公开的基线,该相对百分比也无法转换为绝对增益。
基线是一个 Netflix 多年调优的排序器。在更少的、但更频繁刷新的标签下达到或略微超越该基线,可能有助于 Netflix 在电影、剧集、游戏、直播节目和播客等多种内容类型间适配排序,而无需为每种展示面构建大量专门化机制。已发布的测试并不能证明 GenRec 在实时展示面、在每个国家、在所有会员群体,或在具有不同流量和数据特征的公司中都能产生可比的结果。
将 LLM 保持在目录内
通用语言模型在推荐场景中存在若干问题。它可能偏向全球流行片目、捏造 Netflix 并不提供的片目,并忽视关于不同内容类别应如何呈现的产品规则。
Li, Rao, Sehgal 和他们的合作者增加了一个 目录感知评分头,该评分头可以在单次前向传播中对可用候选集进行排序。论文描述了会员偏好和上下文的池化表示,这与每个目录项的学习嵌入相结合。将输出限制在目录内可以防止 GenRec 推荐不存在或不可用的内容。
该服务设计也避免了自回归解码。GenRec 在 Netflix 的内部 LLM 基础设施上运行,vLLM 处于仅预填模式,消费会员上下文并对候选项进行打分,而不是逐令牌生成推荐文本。这降低了当会员打开产品界面时为解码器模型提供服务的推理负担。
Netflix 使用奖励加权训练来引导排序,朝向更长期的会员满意度和业务需求。其他奖励则在电影、剧集、游戏、直播节目和播客之间重新平衡曝光。研究人员测试了强化学习方法,并报告了相对于监督微调的额外初步收益。他们选择了更简单的加权损失方法,原因是训练成本、运行稳定性和更易维护。
论文将 GenRec 与工业界的工作并列,这些工作来自 Google、Spotify 和 Kuaishou,关注语言模型主干和用于推荐的生成式检索。这些项目解决了相关的排序问题,尽管 Netflix 的对比仍然是其自身成熟的生产系统。GenRec 的公开结果并未提供跨公司的基准。
对于规模较小的推荐团队而言,有用的内容在于工程选择,而不是 Netflix 结果的规模:在推理前压缩行为历史,比基础模型更频繁地刷新专门用于排序的训练,并将评分约束在已知目录内。评估该设计的团队仍需衡量在自身的延迟、GPU、数据和标注限制下,LLM 排序器是否能胜过专门模型。Netflix 的实验并未提供证据表明其服务端的经济性可转移到较小的机构。
Li, Rao, Sehgal 和他们的合作者已经证明,在受控的服务设计下,以 LLM 支持的排序器可以与 Netflix 现有模型竞争。需要进一步证据则需在实时界面、更大比例的流量或披露的会员结果上进行测试。目前,0.006% 的相对在线增益仍是一个狭窄的实验性结果,而更大的贡献是将行为日志转化为受目录约束的排序的可文档化架构。