Tencent ਨੇ ਇਸ ਹਫ਼ਤੇ WeMM-Embedding ਮਾਡਲ ਲਾਂਚ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ 2 ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਮਲਟੀਮੋਡਲ (multimodal) ਸਿਸਟਮ ਹੈ ਜੋ ਪਹਿਲਾਂ ਹੀ WeChat ਦੇ ਸਰਚ, ਰਿਕਮੈਂਡੇਸ਼ਨ ਅਤੇ ਈ-ਕਾਮਰਸ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹੈ। ਇਹ ਰਿਲੀਜ਼ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਦਿਖਾਉਂਦੀ ਹੈ ਜੋ ਅਸਲ ਦੁਨੀਆ ਦੀ ਰਿਟ੍ਰੀਵਲ ਕੁਆਲਿਟੀ (retrieval quality), ਘੱਟ ਲੇਟੈਂਸੀ (low latency) ਅਤੇ ਛੋਟੇ ਇੰਡੈਕਸ ਸਾਈਜ਼ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।

“ਡਿਪਲਾਈਮੈਂਟ ਸਟੋਰੀ” (deployment story) ਦੇ ਆਲੇ-ਦੁਆਲੇ ਇੰਨਾ ਹੰਗਾਮਾ ਕਿਉਂ ਹੈ

ਜ਼ਿਆਦਾਤਰ ਨਵੇਂ AI ਮਾਡਲ ਚਮਕਦਾਰ ਬੈਂਚਮਾਰਕ ਟੇਬਲਾਂ ਦੇ ਨਾਲ ਆਉਂਦੇ ਹਨ ਜੋ ਚੁਣੇ ਹੋਏ ਡੇਟਾਸੈਟਾਂ 'ਤੇ ਸਕੋਰਾਂ ਦੀ ਤੁਲਨਾ ਕਰਦੇ ਹਨ। ਉਹ ਨੰਬਰ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਆਪਣੀ ਗੱਲ ਸਾਬਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦੇ ਹਨ, ਪਰ ਉਹ ਸ਼ਾਇਦ ਹੀ ਉਨ੍ਹਾਂ ਮੈਟ੍ਰਿਕਸ ਵਿੱਚ ਬਦਲਦੇ ਹਨ ਜੋ ਉਤਪਾਦਾਂ ਨੂੰ ਚਲਾਉਂਦੇ ਹਨ: ਕੋਈ ਕੁਐਰੀ (query) ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਵਾਪਸ ਆਉਂਦੀ ਹੈ, ਇੱਕ ਇੰਡੈਕਸ ਕਿੰਨੀ ਮੈਮੋਰੀ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਅਤੇ ਮਾਡਲ ਉਪਭੋਗਤਾ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੀ ਗਈ ਅਸਪਸ਼ਟ (noisy) ਸਮੱਗਰੀ ਨਾਲ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਨਜਿੱਠਦਾ ਹੈ। WeMM ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਹੀ ਇੱਕ ਪ੍ਰੋਡਕਸ਼ਨ-ਗ੍ਰੇਡ (production-grade) ਕੰਪੋਨੈਂਟ ਹੋਣ ਕਰਕੇ ਇਸ ਕਹਾਣੀ ਨੂੰ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਇਹ ਕੋਈ ਲੈਬ ਪ੍ਰਯੋਗ ਨਹੀਂ ਹੈ ਜੋ ਕਿਸੇ ਅਗਲੀ ਟੀਮ ਦੁਆਰਾ ਅਪਣਾਏ ਜਾਣ ਦੀ ਉਡੀਕ ਕਰ ਰਿਹਾ ਹੋਵੇ; ਇਹ ਪਹਿਲਾਂ ਹੀ Channels, Moments, ਅਤੇ e-commerce ਨੂੰ ਚਲਾ ਰਿਹਾ ਹੈ।

ਤਕਨੀਕੀ ਗੱਲਾਂ (technical hooks) ਜੋ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਨੋਟ ਕਰਨੀਆਂ ਚਾਹੀਦੀਆਂ ਹਨ

  • ਅਸਲੀ ਮਲਟੀਮੋਡਲ ਹੈਂਡਲਿੰਗ (True multimodal handling) – ਇਹ ਮਾਡਲ ਟੈਕਸਟ, ਚਿੱਤਰ (images), ਵੀਡੀਓ ਫਰੇਮ ਅਤੇ ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਥੰਬਨੇਲ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਐਮਬੈਡਿੰਗ ਸਪੇਸ ਵਿੱਚ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ। ਇੱਕ ਉਪਭੋਗਤਾ “sunset” ਟਾਈਪ ਕਰ ਸਕਦਾ ਹੈ ਅਤੇ ਵੱਖ-ਵੱਖ ਟੈਕਸਟ-ਸਿਰਫ਼ ਅਤੇ ਵਿਜ਼ਨ-ਸਿਰਫ਼ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਜੋੜਨ ਦੀ ਬਜਾਏ ਇੱਕ ਮਿਲਦਾ-ਜੁਲਦਾ ਵੀਡੀਓ ਕਲਿੱਪ, ਇੱਕ ਫੋਟੋ, ਜਾਂ ਇੱਕ ਖ਼ਬਰ ਦਾ ਲੇਖ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦਾ ਹੈ।

  • ਸਾਈਜ਼ ਮਾਇਨੇ ਰੱਖਦਾ ਹੈ, ਪਰ ਉਸ ਤਰੀਕੇ ਨਾਲ ਨਹੀਂ ਜਿਸ ਤਰ੍ਹਾਂ ਤੁਸੀਂ ਸੋਚਦੇ ਹੋ – 2 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ 'ਤੇ, ਇਹ ਮਾਡਲ ਉਨ੍ਹਾਂ 9 ਬਿਲੀਅਨ ਤੋਂ ਵੱਧ ਵਾਲੇ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ “ਛੋਟਾ” ਹੈ ਜੋ ਲੀਡਰਬੋਰਡਾਂ 'ਤੇ ਹਾਵੀ ਹਨ। ਫਿਰ ਵੀ, ਇਹ ਇੰਟਰਐਕਟਿਵ ਸੇਵਾਵਾਂ ਲਈ ਲੋੜੀਂਦੀ ਲੇਟੈਂਸੀ (latency) ਦੀਆਂ ਸ਼ਰਤਾਂ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੈ। ਇੱਕ ਮਾਡਲ ਜੋ ਤੁਹਾਡੇ ਹਾਰਡਵੇਅਰ ਵਿੱਚ ਫਿੱਟ ਹੋ ਸਕਦਾ ਹੈ, ਉਹ ਲਾਈਵ ਸਿਸਟਮ ਵਿੱਚ ਇੱਕ ਵੱਡੇ ਅਤੇ ਹੌਲੀ ਮਾਡਲ ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰ ਸਕਦਾ ਹੈ।

  • ਮੈਟਰੀਓਸ਼ਕਾ ਐਮਬੈਡਿੰਗਸ (Matryoshka embeddings) ਡਾਇਮੈਂਸ਼ਨ ਫਲੈਕਸੀਬਿਲਟੀ ਦਿੰਦੀਆਂ ਹਨ – WeMM “Matryoshka” ਐਮਬੈਡਿੰਗਸ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇੱਕੋ ਨੈੱਟਵਰਕ ਵੱਖ-ਵੱਖ ਲੰਬਾਈ ਦੇ ਵੈਕਟਰ (vectors) ਆਊਟਪੁੱਟ ਕਰ ਸਕਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ 256 ਜਾਂ 512 ਡਾਇਮੈਂਸ਼ਨਾਂ। ਟੈਸਟ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ 512 ਤੋਂ 256 ਡਾਇਮੈਂਸ਼ਨਾਂ 'ਤੇ ਆਉਣ ਨਾਲ ਮੈਮੋਰੀ ਦੀ ਵਰਤੋਂ ਅੱਧੀ ਹੋ ਜਾਂਦੀ ਹੈ ਅਤੇ ਸਟੋਰੇਜ ਦੇ ਖਰਚੇ ਘਟ ਜਾਂਦੇ ਹਨ, ਜਦੋਂ ਕਿ ਰਿਟ੍ਰੀਵਲ ਪ੍ਰਦਰਸ਼ਨ ਲਗਭਗ ਪੂਰੀ ਤਰ੍ਹਾਂ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ ਅਤੇ ਨੇੜਲੇ-ਗੁਆਂਢੀ (nearest-neighbor) ਸਰਚਾਂ ਨੂੰ ਤੇਜ਼ ਕਰਦਾ ਹੈ।

ਰਿਟ੍ਰੀਵਲ ਸਿਸਟਮ ਬਣਾਉਣ ਲਈ ਤਿੰਨ ਵਿਵਹਾਰਕ ਨਿਯਮ

  1. ਆਪਣੇ ਡੇਟਾ 'ਤੇ ਪੁਸ਼ਟੀ ਕਰੋ – ਬੈਂਚਮਾਰਕ ਸਾਫ਼ ਹੁੰਦੇ ਹਨ; ਪ੍ਰੋਡਕਸ਼ਨ ਡੇਟਾ ਉਲਝਿਆ ਹੋਇਆ (messy) ਹੁੰਦਾ ਹੈ। ਜੇਕਰ ਤੁਹਾਡੇ ਉਪਭੋਗਤਾ ਸਕ੍ਰੀਨਸ਼ੌਟ, ਹੱਥ ਨਾਲ ਲਿਖੇ ਨੋਟ ਜਾਂ ਘੱਟ ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਵਾਲੀ ਵੀਡੀਓ ਅਪਲੋਡ ਕਰਦੇ ਹਨ, ਤਾਂ ਇਸ ਗੱਲ ਦਾ ਫੈਸਲਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਕਿ ਇਹ ਸਹੀ ਹੈ, ਉਸੇ ਮਿਸ਼ਰਣ 'ਤੇ ਮਾਡਲ ਚਲਾ ਕੇ ਦੇਖੋ।

  2. ਵੈਕਟਰ ਲੰਬਾਈ ਨੂੰ ਲਾਗਤ ਦੇ ਲੀਵਰ ਵਜੋਂ ਲਵੋ – ਵੱਡੇ ਵੈਕਟਰ ਸਮਾਨਤਾ ਸਰਚ (similarity search) ਲਈ ਲੋੜੀਂਦੇ ਕੰਪਿਊਟ ਅਤੇ ਇੰਡੈਕਸ ਲਈ ਡਿਸਕ ਸਪੇਸ ਦੋਵਾਂ ਨੂੰ ਵਧਾਉਂਦੇ ਹਨ। ਸਭ ਤੋਂ ਛੋਟੀ ਡਾਇਮੈਂਸ਼ਨ ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ ਜੋ ਅਜੇ ਵੀ ਤੁਹਾਡੇ ਕੁਆਲਿਟੀ ਟਾਰਗੇਟ ਨੂੰ ਪੂਰਾ ਕਰਦੀ ਹੋਵੇ। ਉਦੋਂ ਹੀ ਇਸ ਨੂੰ ਵਧਾਓ ਜਦੋਂ ਤੁਸੀਂ ਰੀਕਾਲ (recall) ਜਾਂ ਪ੍ਰੀਸੀਜ਼ਨ (precision) ਵਿੱਚ ਸਪਸ਼ਟ ਗਿਰਾਵਟ ਦੇਖਦੇ ਹੋ।

  3. ਸਿਲੋਡ ਪਾਈਪਲਾਈਨਾਂ (siloed pipelines) ਤੋਂ ਬਚੋ – ਹਰੇਕ ਮੋਡੈਲਤਾ (modality) ਲਈ ਵੱਖਰੇ ਐਨਕੋਡਰ ਬਣਾਉਣ ਨਾਲ ਤੁਹਾਨੂੰ ਅੰਤਿਮ ਰੈਂਕਿੰਗ ਸਟੇਜ ਲਈ ਵੇਟਿੰਗ ਸਕੀਮਾਂ ਨੂੰ ਖੁਦ ਤਿਆਰ ਕਰਨਾ ਪੈਂਦਾ ਹੈ। ਇੱਕ ਯੂਨੀਵਰਸਲ ਐਮਬੈਡਿੰਗ ਲੇਅਰ ਉਸ ਗਲੂ ਕੋਡ (glue code) ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦੀ ਹੈ, ਇੰਜੀਨੀਅਰਿੰਗ ਦੇ ਕੰਮ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ ਅਤੇ A/B ਟੈਸਟਿੰਗ ਨੂੰ ਸਰਲ ਬਣਾਉਂਦੀ ਹੈ।

ਵਿਆਪਕ ਮੁੱਦੇ

ਉਨ੍ਹਾਂ ਕੰਪਨੀਆਂ ਲਈ ਜੋ ਸਰਚ ਜਾਂ ਰਿਕਮੈਂਡੇਸ਼ਨ 'ਤੇ ਨਿਰਭਰ ਹਨ, ਐਮਬੈਡਿੰਗ ਮਾਡਲ ਦੀ ਚੋਣ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੇ ਖਰਚੇ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦੀ ਹੈ। ਜਿਵੇਂ-ਜਿਵੇਂ ਉਪਭੋਗਤਾਵਾਂ ਦੀਆਂ ਉਮੀਦਾਂ ਵਧਦੀਆਂ ਹਨ, ਲੇਟੈਂਸੀ ਬਜਟ ਸਖ਼ਤ ਹੁੰਦੇ ਜਾਂਦੇ ਹਨ; ਇੱਕ ਮਾਡਲ ਜੋ ਪ੍ਰਤੀ ਕੁਐਰੀ ਕੁਝ ਮਿਲੀਸੈਕਿੰਡ ਵੀ ਵਧਾ ਦਿੰਦਾ ਹੈ, ਉਹ ਸੇਵਾ ਨੂੰ ਸਵੀਕਾਰਯੋਗ ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਸੀ