Netflix、トラフィックの10%でGenRecをテスト、相対的なリフトは0.006%と報告

NetflixのエンジニアYing Li、Arjun Rao、Shradha Sehgalは、運用中のモデルに比べて約40倍少ないPhase 2ラベルを用いてLLMを活用したランカーをテストし、開示されていない主要指標で0.006%の相対的な向上を報告した。

By · Published

Primary source: Netflix TechBlog

Why it matters

GenRec gives recommendation engineers a concrete design to examine: compress behavioral context, refresh ranking-specific training more often than the foundation model and constrain LLM scores to a known catalog. Its narrow 0.006% relative online gain also shows the difficulty of beating a mature ranker, even with fewer labels and lower serving costs.

Illustration of Netflix's GenRec LLM-backed ranker reshaping a large streaming catalog, with highlighted tiles and reordered rows showing changed recommendations.

Netflix のエンジニア Ying LiArjun RaoShradha Sehgal は、GenRec(LLMを活用したランカー)を、同ストリーミングサービスの成熟した本番用レコメンダーと比較試験した。NetflixはGenRecを全トラフィックの約10%で4週間テストし、そのコアのオンライン指標に対して統計的に有意な相対改善率0.006%を報告した

この成果は2026年8月10日付の技術論文に掲載され、Netflixの7月30日のエンジニアリング投稿を拡張している。Li、Rao、Sehgal は、GenRecの第2フェーズの訓練でNetflixの本番モデルに比べて約40倍少ないラベル付き例を用いた状態でその改善を達成した。この比較は実験のトレードオフを示している:非常に小さなオンライン上の改善と、強くチューニングされたベースラインに対する比較、そしてより少ない頻繁に更新されるラベルと短いサービングコンテキストの組み合わせである。

Netflix TechBlogの投稿ではLi、Rao、Sehgalが著者として記載されている。技術論文には Rein Houthooft、Yaochen Zhu、Ashish Rastogi が加えられ、メンバーAI、AIプラットフォームとサービング、プロダクトにまたがるNetflixのチームからの寄稿者が含まれている。Raoは自身のNetflixでの業務をランキングとページ構築に関する応用研究と機械学習エンジニアリングの混合だと述べている。

University of Illinois Urbana-Champaignのプロフィールは、Sehgalの大学院での研究と機械学習システムやLLMベースのアナロジー・マイニングに関する業務を紹介している。Li、Rao、Sehgal はまた、ローデータのインタラクションログをLLMが効率的に利用できる言語に変換する問題である「learned verbalization」についての2026年2月の論文の共著者でもある。

GenRecはその研究をフルカタログのランキングシステムへと展開している。著者らはこれを外部顧客向けの商用製品ではなく、LLM-native recommendation stackへの初期の一歩として位置付けている。プロジェクトはメンバー履歴、タイトルのメタデータ、リクエストコンテキストをテキストに変換し、Netflix向けに適応したファンデーションモデルとカタログ対応のスコアリングヘッドを用いて利用可能なタイトルをランク付けする。NetflixはGenRecがサービス全体のレコメンダーを置き換えたとは述べておらず、開示資料には外部向けの価格や資金調達に関する記載もない。GenRecは社内のエンジニアリングプロジェクトであるためである。

推薦を言語へ移す

Netflixの既存の本番システムは、メンバー、タイトル、インタラクションを覆う何千もの手作りの特徴量に依存している。系列モデリング、特徴量相互作用、複数の目的を扱うために別々のアーキテクチャが存在する。長年の追加によってその機構は機能的になっている一方で、コンテンツカテゴリや推薦サーフェスを導入する際に必要なエンジニアリング量も増えている。

映画やシリーズに加えてゲーム、ライブ番組、ポッドキャストへと推薦を拡張するにつれて、その負担は大きくなっている。メンバーは再生、視聴時間、明示的なフィードバック、リストへの追加、途中で終了したセッションなどを含む数千億件ものインタラクションイベントを生成する。Netflixはその総数がどの期間にわたるものかは明示していないが、この量が手作りの入力をテキストに置き換える際にも推論前の積極的なフィルタリングを必要とする理由を説明している。

GenRecはモデルへの入力を変更する。メンバー履歴、タイトルのメタデータ、リクエストコンテキストを自然言語または軽く構造化された説明に変換する。これらの説明には視聴時間、明示的フィードバック、デバイス、ロケール、時間、サブスクリプションの継続期間、そして推薦が表示されるサーフェスが含まれる可能性がある。

研究チームはその履歴がモデルに到達する前にフィルタリングを行う。長時間の再生や肯定的な評価にはより詳細を与える。短い、あるいはノイズの多いインタラクションは省略されることがある。連続視聴を含む反復的な行動は要約に圧縮され得る。古いアクティビティには、最近のより信号の強い行動よりも少ないスペースが割かれる。

この選択はプロンプト構成を本番環境のエンジニアリング問題に変える。追加のトークンはGPU容量を消費し、レイテンシを上げる可能性がある。完全な論文ではNetflixがGenRecのコンテキストを約5,000トークンから概ね1,700トークンに削減したが、オフラインのランキング指標にほとんど劣化を与えなかったと述べている。この構成ではサービングコストがおおむねコンテキスト長に比例していたため、Netflixはコストが元の約3分の1に落ちたと報告している。

モデルは2段階で訓練される。第1段階ではオープンソースのベースモデルをプロプライエタリなNetflixデータで適応させ、ファンデーションモデルにカタログとメンバー行動を学習させる。Netflixはベースモデルを特定していない。第2段階では、そのファンデーションをランキング用に訓練し、より頻繁に更新される例、推薦目的、および報酬信号を用いる。

この分離は推薦データの陳腐化の速さを反映している。第1フェーズのファンデーションモデルは比較的長い間隔で更新される一方、第2フェーズは新しいコンテンツ、人気パターン、メンバーの最新の興味を追跡するためにより頻繁にリフレッシュされる。第1フェーズのカットオフ日時点で新たに訓練した第1フェーズモデルと比較すると、第2フェーズはオフラインのランキング指標で概ね35%から50%の改善を示した。この比較はGenRecをNetflixの本番ランカーと評価した結果とは別のものである。

研究者らはまた、おおむね1ビリオンパラメータ級と10ビリオンパラメータ級のバックボーンを比較したと報告している。論文は、フェーズ2の訓練データ量が増えるにつれて両モデルサイズでオフラインの平均逆順位(mean reciprocal rank)が単調に改善したと記している。Netflixはオンライン実験で使用したモデルのパラメータ数は開示していない。

小さなオンライン数値とその狭い限界

オフライン評価では、GenRecはNetflixの本番ベースラインに対して平均逆順位を約1.6%相対改善した一方で、第2フェーズのラベル付き例を約40倍少なく使用していた。平均逆順位は最初の関連結果がどれだけ上位に出るかを測る指標であり、1位にある関連タイトルはリスト下位に置かれるよりも大きなクレジットを得る。したがって1.6%という数値は視聴、定着、収益ではなくオフラインテストにおけるランキング位置を示している。

その後、Netflixは選定されたバッチ計算された推薦サーフェスに対してトラフィックの約10%を4週間割り当ててテストを行った。Netflixは短期および長期指標で統計的に有意な改善を報告した。開示された例としては、コアのオンライン指標における0.006%の相対改善が挙げられている。

論文はそのオンライン指標自体、絶対ベースライン、信頼区間、あるいはメンバーの定着、視聴、財務パフォーマンスへの影響については特定していない。統計的有意性はNetflixの実験設計の下で効果が検出されたことを示すものであり、それが広範なプロダクトまたはビジネス上の影響を持っていたことを確立するものではない。相対パーセンテージは、非公開のベースラインなしには絶対的な増分に変換できない。

ベースラインは何年もかけてチューニングされたランカーである。より少ない頻繁にリフレッシュされるラベルでそれに匹敵するかわずかに上回ることができれば、Netflixは各サーフェスごとに多くの専門的な機構を構築することなく、映画、シリーズ、ゲーム、ライブ番組、ポッドキャストにわたるランキングを適応させる手助けになる可能性がある。公表されたテストは、GenRecがリアルタイムのサーフェスですべての国やあらゆるメンバーコホートで、あるいはトラフィックやデータプロファイルが異なる企業で同等の結果を出すことを保証するものではない。

カタログ内にLLMを留める

汎用の言語モデルはレコメンデーションに対していくつかの問題を呈する。世界的に人気のあるタイトルを優先したり、Netflixが扱っていないタイトルを生成したり、異なるコンテンツカテゴリをどのように提示すべきかを定めたプロダクトルールを無視したりする可能性がある。

Li, Rao, Sehgal and their collaborators added a カタログ対応のスコアリングヘッド that can 利用可能な候補集合を単一のフォワードパスでランク付けできる。論文は会員の嗜好とコンテキストのプールされた表現を記述しており、これが各カタログアイテムの学習済み埋め込みと結合される。出力をカタログに制限することで、GenRecが存在しないまたは利用できないコンテンツを推奨するのを防いでいる。

サービング設計は自己回帰的なデコーディングも回避している。GenRecはNetflixの内部LLMインフラストラクチャ上でvLLMをprefill-onlyモードで動作させ、会員コンテキストを取り込み、推薦テキストをトークンごとに生成することなく候補をスコアリングする。これにより、会員がプロダクトサーフェスを開いたときにデコーダモデルをサーブする推論負荷が軽減される。

Netflixは報酬重み付けトレーニングを用いてランキングをより長期的な会員満足度やビジネス要件に向けて誘導している。その他の報酬は映画、シリーズ、ゲーム、ライブ番組、ポッドキャスト間の露出のバランスを調整する。研究者らは強化学習手法を検証し、教師ありファインチューニングに対する追加の予備的な改善を報告した。彼らはトレーニングコスト、運用の安定性、保守の容易さから、より単純な加重損失アプローチを選択した。

論文はGenRecをGoogle、Spotify、Kuaishouにおける言語モデル基盤とレコメンデーションのための生成的リトリーバルに関する産業的な取り組みと並べて位置づけている。situates GenRec alongside industrial work at Google, Spotify and Kuaishou on language-model backbones and generative retrieval for recommendation. これらのプロジェクトは関連するランキング課題に取り組んでいるが、Netflixの比較対象は依然として同社の成熟したプロダクションシステムである。GenRecの公開された結果は、企業間のベンチマークを提供していない。

小規模なレコメンデーションチームにとって有益なのは、Netflixの成果の規模そのものよりもエンジニアリング上の選択である:推論前に行動履歴を圧縮すること、ファンデーションモデルよりもランキング特化のトレーニングをより頻繁に更新すること、そしてスコアを既知のカタログに制約すること。設計を評価するチームは、自分たちのレイテンシ、GPU、データ、ラベリングの制約のもとで、LLMランカーが専門特化モデルに勝るかどうかを測定する必要があるだろう。Netflixの実験は、そのサービングに関する経済性が小規模な事業に移転することを示す証拠を提示していない。

Li, Rao, Sehgal and their collaborators have shown that an LLM-backed ranker can compete with Netflix's incumbent model under a controlled serving design. さらなる証拠には、リアルタイムのサーフェス上でのテスト、より広範なトラフィックシェア、または開示された会員の結果が必要である。現時点では、0.006%の相対的なオンラインでの改善は狭い実験結果に留まっており、より大きな貢献は行動ログをカタログ制約されたランキングに変換するための文書化されたアーキテクチャである。

Reader comments

Conversation for this story loads after sign-in.