
Netflix е тествала езиков модел като заместител на ръчно построената логика зад препоръките си и е пуснала резултатите публично. Системата се казва GenRec, описана е в техническия блог на компанията от 30 юли и в научна публикация в arXiv, подадена на 10 август 2026 г. от Ying Li, Shradha Sehgal, Arjun Rao, Rein Houthooft, Yaochen Zhu и Ashish Rastogi. В A/B тест върху около 10% от трафика на Netflix в продължение на четири седмици GenRec е постигнал статистически значимо подобрение спрямо действащия продукционен ranker.
Какво прави GenRec
Досегашният подход в препоръчващите системи стъпва на feature engineering: инженери описват поведението ви като плътни числови вектори — колко пъти сте гледали даден жанр, в кой час, на какво устройство — и захранват с тях специализиран модел.
GenRec тръгва от друго място. Историята ви се превежда в обикновен текст („21 май, 14:00 ч., телевизор, Wednesday, гледане, 30 минути“) и се подава на езиков модел с около 10 млрд. параметъра. Netflix нарича това преминаване от feature engineering към context engineering.
Снимка: Netflix / arXiv
Изходът не е генериран текст. Отгоре стои т.нар. catalog-aware scoring head — слой, който раздава оценка само на реални заглавия от каталога. Това решава един от класическите проблеми при използване на LLM за препоръки: модел, оставен да генерира свободно, измисля несъществуващи сериали и препоръчва предимно глобални хитове.
Две фази на трениране
Схемата е двустепенна. Фаза 1 дообучава готов open source модел върху данните на Netflix и се пуска рядко. Само тази стъпка вдига офлайн метриките за подреждане с 10–20% спрямо базовия отворен модел.
Фаза 2 е честото post-training върху конкретни данни за подреждане и бизнес цели, с reward-weighted loss, за да не гони моделът само кликове, а дългосрочна стойност за абоната. Тя добавя още 35–50% спрямо току-що обучен модел от фаза 1, а след две седмици разликата стига около 80%.
Най-интересното число обаче е друго: за фаза 2 са били нужни около 40 пъти по-малко етикетирани примера от продукционния модел. При това GenRec ползва и по-малко входни сигнали.
Числата от теста
- Офлайн: около 1,6% относително подобрение на MRR спрямо продукционната система.
- Онлайн: 4 седмици, ~10% от трафика, +0,006% относително на основната дългосрочна метрика — стойност, която в мащаба на Netflix се смята за значима. The Decoder посочва и подобрение от 0,115% на краткосрочната метрика.
Разликите изглеждат микроскопични, но точно това е логиката на зрелите препоръчващи системи: продукционният ranker е шлифован с години, а всяка стотна от процента се превежда в часове гледане.
Цената на inference
Езиков модел с 10 млрд. параметъра, който оценява цял каталог за всяка заявка, звучи скъпо. Netflix решава това с два трика.
Първо, моделът върви върху vLLM в prefill-only режим: контекстът се прочита веднъж и в едно преминаване се раздават оценки на всички кандидати, без скъпото автогенериращо декодиране.
Второ, самият контекст е орязан. Инженерите пазят пълни детайли за силните сигнали (дълго гледане, палец нагоре), изхвърлят шума (секунди възпроизвеждане, случайни кликове) и компресират повтарящите се серии при binge гледане. Така промптът пада от около 5000 до около 1700 токена без забележима загуба на качество. Тъй като цената на обслужване расте приблизително пропорционално на дължината на контекста, свиването до една трета сваля и сметката горе-долу толкова.
Контекст
Netflix не е сама. Публикацията сочи PLUM, GLIDE и OneRec-Think като примери за същия завой в индустрията — от отделни, ръчно построени модели към споделен foundation backbone. Логиката е позната от NLP: вместо десетки малки специализирани модели, които трудно си предават подобренията, един общ модел, дообучаван за конкретни задачи.
Стрийминг платформите иначе все по-често слагат AI в продукта отпред — от етикетите за AI песни в Apple Music до разговорното търсене. GenRec е обратното: моделът е дълбоко в машинарията и вие не бихте разбрали, че е там.
Ограниченията са казани честно. Опитите с reinforcement learning са дали резултат, но с висока цена на трениране и са отложени за по-нататък. Резултатите важат за конкретните повърхности с пакетни изчисления, върху които е правен тестът — не за целия продукт.
Заключение
GenRec още не е заменил продукционната система на Netflix; той е доказателство, че може. Ако едно дообучено 10-милиардно LLM бие шлифован с години ranker при 40 пъти по-малко етикетирани данни, икономиката на цялата дисциплина се променя — най-скъпият ресурс в препоръките спира да бъде инженерният труд по признаци и става изчислителната мощ за inference. А тя, за разлика от ръчната логика, поевтинява всяка година.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google