ਕਿਉਂ Netflix ਨੇ ਹੱਥ ਨਾਲ ਤਿਆਰ ਕੀਤੇ ਗਏ ਫੀਚਰਾਂ ਤੋਂ ਪਿੱਛੇ ਮੁੜਨ ਦਾ ਫੈਸਲਾ ਕੀਤਾ

ਆਪਣੇ ਇਤਿਹਾਸ ਦੇ ਜ਼ਿਆਦਾਤਰ ਹਿੱਸੇ ਵਿੱਚ, Netflix ਦਾ ਰੈਕਮੈਂਡੇਸ਼ਨ ਪਾਈਪਲਾਈਨ ਹਜ਼ਾਰਾਂ ਮੈਨੂਅਲੀ ਤੈਅ ਕੀਤੇ ਗਏ ਗੁਣਾਂ (attributes) 'ਤੇ ਨਿਰਭਰ ਸੀ—ਨੰਬਰਮੈਟਿਕ ਵੈਕਟਰ ਜੋ ਉਪਭੋਗਤਾਵਾਂ, ਟਾਈਟਲਜ਼ ਅਤੇ ਉਹਨਾਂ ਵਿਚਕਾਰ ਹਰ ਇੰਟਰੈਕਸ਼ਨ ਦਾ ਵਰਣਨ ਕਰਦੇ ਸਨ। ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਨਵੇਂ ਕੰਟੈਂਟ ਟਾਈਪ—ਜਿਵੇਂ ਕਿ ਲਾਈਵ ਸਪੋਰਟਸ, ਪੌਡਕਾਸਟ, ਜਾਂ ਗੇਮਾਂ—ਨੂੰ ਇੱਕ ਨਵੇਂ ਫੀਚਰ ਸੈੱਟ ਵਿੱਚ ਬਦਲਣ ਲਈ ਹਫ਼ਤਿਆਂ ਲੱਗ ਜਾਂਦੇ ਸਨ ਤਾਂ ਜੋ ਸਿਸਟਮ ਇਸਨੂੰ ਰੈਕਮੈਂਡ ਕਰਨਾ ਸ਼ੁਰੂ ਕਰ ਸਕੇ। ਇਹ ਪ੍ਰਕਿਰਿਆ ਮਹਿੰਗੀ, ਅਸਥਿਰ ਅਤੇ ਕੈਟਾਲਾਗ ਦੇ ਤੇਜ਼ੀ ਨਾਲ ਵਧ ਰਹੇ ਵਿਸਥਾਰ ਦੇ ਨਾਲ ਤਾਲਮੇਲ ਬਣਾ ਕੇ ਰੱਖਣਾ ਮੁਸ਼ਕਲ ਸੀ।

ਤਿਆਰ ਮਿਲਣ ਵਾਲੇ (Off-the-shelf) ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ (LLMs) ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਕੰਮ ਨਹੀਂ ਕਰ ਰਹੇ ਸਨ। ਉਹ ਸਭ ਤੋਂ ਮਸ਼ਹੂਰ ਟਾਈਟਲਜ਼ ਵੱਲ ਜ਼ਿਆਦਾ ਝੁਕ ਰਹੇ ਸਨ, ਕਦੇ-ਕਦੇ ਅਜਿਹੀਆਂ ਚੀਜ਼ਾਂ ਬਾਰੇ ਗਲਤ ਜਾਣਕਾਰੀ (hallucinate) ਦੇ ਰਹੇ ਸਨ ਜੋ ਮੌਜੂਦ ਹੀ ਨਹੀਂ ਹਨ, ਅਤੇ ਉਹਨਾਂ ਬਿਜ਼ਨਸ ਨਿਯਮਾਂ ਨੂੰ ਲਾਗੂ ਕਰਨ ਵਿੱਚ ਮੁਸ਼ਕਲ ਮਹਿਸੂਸ ਕਰ ਰਹੇ ਸਨ ਜੋ ਰੈਕਮੈਂਡੇਸ਼ਨਾਂ ਨੂੰ ਸੁਰੱਖਿਅਤ ਅਤੇ ਪ੍ਰਸੰਗਿਕ ਰੱਖਦੇ ਹਨ। ਇਸ ਲਈ Netflix ਨੇ ਇੱਕ ਵਿਸ਼ੇਸ਼ LLM-ਅਧਾਰਤ ਪਾਈਪਲਾਈਨ ਬਣਾਈ ਜੋ ਪ੍ਰੋਡਕਸ਼ਨ ਦੀਆਂ ਸੀਮਾਵਾਂ ਦਾ ਧਿਆਨ ਰੱਖਦੇ ਹੋਏ ਲੈਂਗੂਏਜ ਮਾਡਲ ਦੀਆਂ ਸ਼ਕਤੀਆਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੀ ਹੈ।

GenRec ਦੇ ਅੰਦਰ: ਇੱਕ ਦੋ-ਪੜਾਵੀ ਟ੍ਰੇਨਿੰਗ ਪਾਈਪਲਾਈਨ

GenRec ਦੋ ਵੱਖ-ਵੱਖ ਪੜਾਵਾਂ ਤੋਂ ਬਣਿਆ ਹੈ:

  1. Base model fine-tuning – Netflix ਇੱਕ open-weight ਲੈਂਗੂਏਜ ਮਾਡਲ ਤੋਂ ਸ਼ੁਰੂਆਤ ਕਰਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਅੰਦਰੂਨੀ ਦੇਖਣ ਦੇ ਡੇਟਾ (viewing data) 'ਤੇ fine-tune ਕਰਦਾ ਹੈ। ਇਹ ਮਾਡਲ ਦੇ ਮੂਲ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਬਦਲੇ ਬਿਨਾਂ ਉਸਨੂੰ ਕੈਟਾਲਾਗ ਦੀ ਸ਼ਬਦਾਵਲੀ ਅਤੇ ਉਪਭੋਗਤਾ ਵਿਵਹਾਰ ਦੇ ਪੈਟਰਨ ਸਿਖਾਉਂਦਾ ਹੈ।
  2. Recommendation ranking – ਟ੍ਰੇਨਿੰਗ ਦਾ ਦੂਜਾ ਦੌਰ fine-tuned ਮਾਡਲ ਨੂੰ ਇੱਕ ranker ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ ਜੋ ਕਿਸੇ ਦਿੱਤੇ ਗਏ ਉਪਭੋਗਤਾ ਲਈ ਉਮੀਦਵਾਰ ਟਾਈਟਲਜ਼ ਨੂੰ ਸਕੋਰ ਕਰਦਾ ਹੈ। Netflix ਇਸ ਪੜਾਅ ਨੂੰ ਅਕਸਰ ਤਾਜ਼ਾ (refresh) ਕਰਦਾ ਹੈ ਤਾਂ ਜੋ ਮਾਡਲ ਨਵੀਆਂ ਰਿਲੀਜ਼ਾਂ ਅਤੇ ਬਦਲਦੇ ਰੁਝਾਨਾਂ ਦੇ ਨਾਲ ਅਪ-ਟੂ-ਡੇਟ ਰਹੇ।

ਪੁਰਾਣੇ ਸਿਸਟਮ ਤੋਂ ਮੁੱਖ ਅੰਤਰ ਇਹ ਹੈ ਕਿ ਉਪਭੋਗਤਾ ਦੇ ਇਤਿਹਾਸ ਨੂੰ ਮਾਡਲ ਨੂੰ ਕਿਵੇਂ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਵਾਚ ਸੈਸ਼ਨਾਂ ਨੂੰ ਡੈਂਸ ਵੈਕਟਰਾਂ (dense vectors) ਵਿੱਚ ਕੰਪਰੈੱਸ ਕਰਨ ਦੀ ਬਜਾਏ, GenRec ਹਰ ਇੰਟਰੈਕਸ਼ਨ—ਜਿਵੇਂ ਕਿ ਚਲਾਉਣ ਦਾ ਸਮਾਂ, thumbs-up ਜਾਂ thumbs-down, ਜਲਦੀ ਛੱਡ ਦੇਣਾ—ਨੂੰ ਸਧਾਰਨ ਅੰਗਰੇਜ਼ੀ ਵਾਕਾਂ ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਫਿਰ ਮਾਡਲ ਪੂਰੇ ਸੈਸ਼ਨ ਨੂੰ ਇੱਕ ਛੋਟੀ ਗੱਲਬਾਤ ਵਜੋਂ ਪੜ੍ਹਦਾ ਹੈ, ਅਤੇ ਕਿਸੇ ਵੀ ਪ੍ਰਤੱਖ (explicit) ਫੀਚਰ ਇੰਜੀਨੀਅਰਿੰਗ ਤੋਂ ਬਿਨਾਂ ਜੈਨਰੇ (genre) ਦੀ ਪਸੰਦ ਜਾਂ ਮੂਡ ਵਿੱਚ ਸੂਖਮ ਬਦਲਾਅ ਨੂੰ ਸਮਝ ਲੈਂਦਾ ਹੈ।

ਪ੍ਰਦਰਸ਼ਨ ਅਤੇ ਕੁਸ਼ਲਤਾ ਵਿੱਚ ਵਾਧਾ

ਚਾਰ ਹਫ਼ਤਿਆਂ ਦੇ ਇੱਕ ਪ੍ਰਯੋਗ ਵਿੱਚ, ਜਿਸ ਵਿੱਚ Netflix ਦੇ 10% ਟ੍ਰੈਫਿਕ ਨੂੰ GenRec ਨਾਲ ਜੋੜਿਆ ਗਿਆ ਸੀ, ਨਵੇਂ ਸਿਸਟਮ ਨੇ ਦੋ ਮੈਟ੍ਰਿਕ ਪਰਿਵਾਰਾਂ ਵਿੱਚ ਅੰਕੜਾ ਵਿਗਿਆਨਕ ਤੌਰ 'ਤੇ ਮਹੱਤਵਪੂਰਨ ਵਾਧਾ ਦਿਖਾਇਆ:

  • Short-term engagement – ਰੋਜ਼ਾਨਾ ਰੈਕਮੈਂਡੇਸ਼ਨਾਂ ਨੂੰ ਚਲਾਉਣ ਵਾਲੇ ਮੁੱਖ ਕਲਿੱਕ-ਥਰੂ ਅਤੇ ਵਾਚ-ਟਾਈਮ ਸਿਗਨਲਾਂ ਵਿੱਚ 0.115% ਦਾ ਵਾਧਾ।
  • Long-term core metrics – ਸਬਸਕ੍ਰਾਈਬਰ-ਰਿਟੈਂਸ਼ਨ ਅਤੇ ਸਮੁੱਚੇ ਸੰਤੁਸ਼ਟੀ ਸਕੋਰਾਂ ਵਿੱਚ 0.006% ਦਾ ਵਾਧਾ, ਜੋ ਕਿ ਕਾਰੋਬਾਰ ਲਈ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹਨ।

ਆਫਲਾਈਨ, ਇੱਕ held-out ਡੇਟਾਸੈਟ 'ਤੇ ਰੈਂਕਿੰਗ ਦੀ ਗੁਣਵੱਤਾ ਪ੍ਰੋਡਕਸ਼ਨ ਬੇਸਲਾਈਨ ਦੇ ਮੁਕਾਬਲੇ 1.6% ਸੁਧਰ ਗਈ। ਇਸ ਤੋਂ ਵੀ ਵੱਧ ਹੈਰਾਨੀਜਨਕ ਗੱਲ ਡੇਟਾ ਕੁਸ਼ਲਤਾ ਹੈ: ਦੂਜੇ ਟ੍ਰੇਨਿੰਗ ਪੜਾਅ ਨੂੰ ਉਸੇ ਪ੍ਰਦਰਸ਼ਨ ਪੱਧਰ ਤੱਕ ਪਹੁੰਚਣ ਲਈ ਰਵਾਇਤੀ ਪਾਈਪਲਾਈਨ ਦੀ ਲੋੜ ਵਾਲੇ ਲੇਬਲਡ ਉਦਾਹਰਣਾਂ ਦੇ ਲਗਭਗ 1/40 ਹਿੱਸੇ ਦੀ ਹੀ ਲੋੜ ਸੀ।

ਕੰਪਿਊਟ ਬਿੱਲ ਨੂੰ ਕੰਟਰੋਲ ਵਿੱਚ ਰੱਖਣ ਲਈ, Netflix ਮਾਡਲ ਨੂੰ vLLM ਦੇ ਨਾਲ ਚਲਾਉਂਦਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਸਰਵਿੰਗ ਸਟੈਕ ਹੈ ਜੋ ਟੈਕਸਟ ਬਣਾਉਣ ਦੀ ਬਜਾਏ ਇੱਕ ਸਿੰਗਲ ਫਾਰਵਰਡ ਪਾਸ ਵਿੱਚ ਹਰ ਉਮੀਦਵਾਰ ਨੂੰ ਸਕੋਰ ਕਰਦਾ ਹੈ। ਸਿਸਟਮ ਹਮਲਾਵਰ ਫਿਲਟਰਿੰਗ ਵੀ ਲਾਗੂ ਕਰਦਾ ਹੈ ਤਾਂ ਜੋ ਸਿਰਫ਼ ਉੱਚ-ਸਿਗਨਲ ਵਾਲੀਆਂ ਘਟਨਾਵਾਂ ਹੀ ਮਾਡਲ ਦੇ ਕੰਟੈਕਸਟ ਵਿੰਡੋ ਵਿੱਚ ਆਉਣ, ਜਿਸ ਨਾਲ ਬੇਲੋੜੇ ਟੋਕਨ ਘਟ ਜਾਂਦੇ ਹਨ ਅਤੇ ਲੇਟੈਂਸੀ ਘੱਟ ਜਾਂਦੀ ਹੈ।

"ਫੀਚਰਸ" ਤੋਂ "ਕੰਟੈਕਸਟ" ਵੱਲ ਤਬਦੀਲੀ ਦਾ ਕੀ ਮਤਲਬ ਹੈ

GenRec ਇੱਕ ਵਿਆਪਕ ਲਹਿਰ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿੱਥੇ "ਕੰਟੈਕਸਟ ਇੰਜੀਨੀਅਰਿੰਗ" ਹੱਥ ਨਾਲ ਤਿਆਰ ਕੀਤੇ ਗਏ ਫੀਚਰਾਂ ਦੀ ਜਗ੍ਹਾ ਲੈਂਦੀ ਹੈ। ਹਰੇਕ ਰੈਕਮੈਂਡੇਸ਼ਨ ਕੰਮ ਲਈ ਇੱਕ ਵਿਸ਼ੇਸ਼ ਆਰਕੀਟੈਕਚਰ ਤਿਆਰ ਕਰਨ ਦੀ ਬਜਾਏ, ਇੰਜੀਨੀਅਰ ਇਹ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਕਿ ਟੈਕਸਟ ਪ੍ਰੋਂਪਟ ਵਿੱਚ ਕਿਹੜੇ ਸਿਗਨਲਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨਾ ਹੈ ਅਤੇ ਫਿਰ ਲੈਂਗੂਏਜ ਮਾਡਲ ਨੂੰ ਉਹਨਾਂ 'ਤੇ ਵਿਚਾਰ ਕਰਨ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਇਹ ਪਹੁੰਚ ਨਵੇਂ ਕੰਟੈਂਟ ਟਾਈਪਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨ ਦੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਤੇਜ਼ ਕਰਦੀ ਹੈ: ਇੱਕ ਪੌਡਕਾਸਟ ਐਪੀਸੋਡ ਜਾਂ ਲਾਈਵ-ਸਟ੍ਰੀਮ ਕੀਤੀ ਗਈ ਗੇਮ ਨੂੰ ਇੱਕ ਵਾਕ ਵਿੱਚ ਦੱਸਿਆ ਜਾ ਸਕਦਾ ਹੈ ਅਤੇ ਉਹ ਤੁਰੰਤ ਰੈਕਮੈਂਡੇਸ਼ਨ ਪੂਲ ਵਿੱਚ ਸ਼ਾਮਲ ਹੋ ਸਕਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਮਹੀਨਿਆਂ ਲੰਬੀ ਫੀਚਰ-ਡੈਫੀਨੇਸ਼ਨ ਦੀ ਪ੍ਰਕਿਰਿਆ ਤੋਂ ਬਚਿਆ ਜਾ ਸਕਦਾ ਹੈ।

ਬਾਕੀ ਰਹਿੰਦੀਆਂ ਰੁਕਾਵਟਾਂ

LLM-ਅਧਾਰਤ ਰੈਕਮੈਂਡਰ ਕੋਈ ਜਾਦੂਈ ਹੱਲ (silver bullet) ਨਹੀਂ ਹਨ। ਮਸ਼ਹੂਰ ਚੀਜ਼ਾਂ 'ਤੇ ਜ਼ਿਆਦਾ ਜ਼ੋਰ ਦੇਣ ਦੀ ਉਹਨਾਂ ਦੀ ਰੁਝਾਨ ਅਜੇ ਵੀ ਕੈਟਾਲਾਗ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦੀ ਹੈ, ਅਤੇ ਸ਼ਕਤੀਸ਼ਾਲੀ GPUs ਦੀ ਲੋੜ ਕਾਰਜਸ਼ੀਲ ਲਾਗਤਾਂ ਨੂੰ ਵਧਾਉਂਦੀ ਹੈ। vLLM ਅਤੇ ਹਮਲਾਵਰ ਫਿਲਟਰਿੰਗ ਦੇ ਬਾਵਜੂਦ, Netflix ਦੇ ਪੱਧਰ 'ਤੇ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ ਨੂੰ ਚਲਾਉਣ ਲਈ ਲੇਟੈਂਸੀ ਦੇ ਟੀਚਿਆਂ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਸਾਵਧਾਨੀਪੂਰਵਕ ਇੰਜੀਨੀਅਰਿੰਗ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।