Wan 3.0 ਹੁਣ ਕਿਰਦਾਰ ਦੇ ਚਿਹਰੇ ਦੇ ਵਿਗੜਨ ਜਾਂ ਕੈਮਰੇ ਦੇ ਹਿੱਲਣ ਤੋਂ ਬਿਨਾਂ ਅੱਧੀ ਮਿੰਟ ਦੀ AI-ਨਿਰਮਿਤ ਫੁਟੇਜ ਨੂੰ ਜੋੜ ਸਕਦਾ ਹੈ—ਇੱਕ ਅਜਿਹੀ ਪ੍ਰਗਤੀ ਜੋ ਜਨਰੇਟਿਵ ਵੀਡੀਓ ਨੂੰ ਛੋਟੀਆਂ ਕਲਿੱਪਾਂ ਤੋਂ ਅੱਗੇ ਵਧਾ ਕੇ ਵਰਤੋਂਯੋਗ ਕਹਾਣੀ ਸੁਣਾਉਣ (storytelling) ਦੇ ਪੱਧਰ 'ਤੇ ਲੈ ਆਉਂਦੀ ਹੈ।
ਇਹ ਵੱਡੀ ਸਫਲਤਾ ਇੱਕ ਮਜ਼ਬੂਤ ਤਕਨੀਕੀ ਸਟੈਕ 'ਤੇ ਟਿਕੀ ਹੋਈ ਹੈ: ਇੱਕ causal 3-D variational auto-encoder (VAE) ਜੋ ਸਪੇਸ ਅਤੇ ਸਮੇਂ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਵਾਲਯੂਮ (volume) ਵਜੋਂ ਮੰਨਦਾ ਹੈ, diffusion-based transformers ਜੋ ਉਸ ਵਾਲਯੂਮ ਨੂੰ patch-tokens ਵਿੱਚ ਬਦਲਦੇ ਹਨ, ਅਤੇ ਇੱਕ mixture-of-experts router ਜੋ ਸੀਨ-ਪੱਧਰ ਦੀ ਯੋਜਨਾਬੰਦੀ ਨੂੰ pixel-ਪੱਧਰ ਦੀ ਪਾਲਿਸ਼ਿੰਗ ਤੋਂ ਵੱਖ ਕਰਦਾ ਹੈ। Wan 3.0 ਟੈਕਸਟ, ਚਿੱਤਰਾਂ, ਆਡੀਓ ਅਤੇ ਰੈਫਰੈਂਸ ਵੀਡੀਓ ਨੂੰ ਸੁਤੰਤਰ conditioning streams ਵਜੋਂ ਵੀ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਹਰ ਇੱਕ ਦੂਜਿਆਂ ਨੂੰ ਓਵਰਰਾਈਟ ਕੀਤੇ ਬਿਨਾਂ ਆਉਟਪੁੱਟ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕਦਾ ਹੈ। ਨਤੀਜਾ ਇੱਕ ਸੁਮੇਲ ਵਾਲੀ ਆਡੀਓ-ਵਿਜ਼ੂਅਲ ਦੁਨੀਆ ਹੈ ਜਿੱਥੇ ਇੱਕ ਕਿਰਦਾਰ ਨੂੰ ਪੈਨ (pan) ਦੌਰਾਨ ਫੋਲੋ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਇੱਕ ਉਤਪਾਦ ਘੁੰਮਣ ਦੌਰਾਨ ਆਪਣਾ ਆਕਾਰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ, ਅਤੇ ਪੈਰ ਦੀ ਆਵਾਜ਼ ਬਿਲਕੁਲ ਉਦੋਂ ਆਉਂਦੀ ਹੈ ਜਦੋਂ ਆਡੀਓ ਕਿਊ (cue) ਵੱਜਦਾ ਹੈ।
ਲੰਬੇ-ਰੂਪ ਵਾਲੀ AI ਵੀਡੀਓ ਇੱਕ ਰੁਕਾਵਟ ਕਿਉਂ ਰਹੀ ਹੈ
ਸ਼ੁਰੂਆਤੀ ਜਨਰੇਟਿਵ ਵੀਡੀਓ ਮਾਡਲ ਕੁਝ ਸਕਿੰਟਾਂ ਦੀ ਐਨੀਮੇਸ਼ਨ ਬਣਾ ਸਕਦੇ ਸਨ, ਪਰ ਸਮੇਂ ਦੀ ਸੀਮਾ ਵਧਾਉਣ ਨਾਲ ਦੋ ਬੁਨਿਆਦੀ ਖਾਮੀਆਂ ਸਾਹਮਣੇ ਆਈਆਂ। ਪਹਿਲਾ, frame-by-frame synthesis ਸਮੇਂ ਦੇ ਨਿਰਭਰਤਾਵਾਂ (temporal dependencies) ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦਾ ਸੀ, ਜਿਸ ਕਾਰਨ ਇੱਕ ਚਿਹਰਾ ਜੋ ਸ਼ੁਰੂ ਵਿੱਚ ਅਸਲੀ ਲੱਗਦਾ ਸੀ, ਕੁਝ ਫਰੇਮਾਂ ਬਾਅਦ ਵਿਗੜਨਾ ਸ਼ੁਰੂ ਹੋ ਜਾਂਦਾ ਸੀ। ਦੂਜਾ, ਜ਼ਿਆਦਾਤਰ ਪਾਈਪਲਾਈਨਾਂ ਆਵਾਜ਼ ਨੂੰ ਇੱਕ ਸਹਾਇਕ ਚੀਜ਼ ਵਜੋਂ ਮੰਨਦੀਆਂ ਸਨ, ਜਿਸ ਨਾਲ lip-sync ਮੇਲ ਨਹੀਂ ਖਾਂਦਾ ਸੀ ਜਾਂ Foley effects ਗਲਤ ਜਗ੍ਹਾ 'ਤੇ ਹੁੰਦੇ ਸਨ। brute-force sampling ਰਾਹੀਂ ਇਹਨਾਂ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਸੁਧਾਰਨ ਨਾਲ ਲੰਬਾਈ ਦੇ ਨਾਲ ਲਾਗਤ ਬਹੁਤ ਜ਼ਿਆਦਾ ਵਧ ਜਾਂਦੀ ਸੀ, ਜਿਸ ਨਾਲ ਕੁਝ ਸਕਿੰਟਾਂ ਤੋਂ ਵੱਧ ਕੁਝ ਵੀ ਬਣਾਉਣਾ ਸਿਰਜਣਹਾਰਾਂ ਲਈ ਅਵਿਵਹਾਰਕ ਹੋ ਗਿਆ ਸੀ।
Wan 3.0 ਦੇ ਤਕਨੀਕੀ ਥੰਮ੍ਹ
Causal 3-D VAE – ਰਵਾਇਤੀ VAEs ਇੱਕ ਸਿੰਗਲ ਚਿੱਤਰ ਨੂੰ latent code ਵਿੱਚ ਕੰਪਰੈੱਸ ਕਰਦੇ ਹਨ। Wan ਦਾ ਵਰਜ਼ਨ ਪੂਰੇ ਵੀਡੀਓ ਕਿਊਬ (height × width × time) ਨੂੰ ਇੱਕੋ ਵਾਰ ਕੰਪਰੈੱਸ ਕਰਦਾ ਹੈ। ਕਿਉਂਕਿ encoder ਅਤੇ decoder ਫਰੇਮਾਂ ਦੇ causal ਕ੍ਰਮ ਦਾ ਸਤਿਕਾਰ ਕਰਦੇ ਹਨ, latent representation ਪਹਿਲਾਂ ਹੀ "ਅੱਗੇ ਕੀ ਆਵੇਗਾ" ਨੂੰ ਇਨਕੋਡ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ downstream modules ਨੂੰ ਵੱਖਰੇ ਚਿੱਤਰਾਂ ਦੀ ਬਜਾਏ ਸਮੇਂ ਦੇ ਅਨੁਕੂਲ (temporally aware) ਮਾਧਿਅਮ ਨਾਲ ਕੰਮ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਮਿਲਦੀ ਹੈ।
Diffusion Transformers – ਇਨਕੋਡਿੰਗ ਤੋਂ ਬਾਅਦ, ਵੀਡੀਓ 3-D patches ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ ਜੋ ਇੱਕ ਵਾਕ ਵਿੱਚ ਸ਼ਬਦਾਂ ਵਾਂਗ ਕੰਮ ਕਰਦੇ ਹਨ। ਇੱਕ transformer ਹਰੇਕ patch ਲਈ diffusion trajectory ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ, ਇਹ ਸਿੱਖਦੇ ਹੋਏ ਕਿ ਵਸਤੂਆਂ ਕਿਵੇਂ ਹਿੱਲਦੀਆਂ ਹਨ, ਰੌਸ਼ਨੀ ਕਿਵੇਂ ਬਦਲਦੀ ਹੈ, ਅਤੇ ਫਰੇਮਾਂ ਵਿੱਚ ਨਜ਼ਰੀਆ (perspective) ਕਿਵੇਂ ਬਦਲਦਾ ਹੈ। ਇਹ token-based ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਮਾਡਲ ਨੂੰ ਬਾਰੀਕ ਵੇਰਵਿਆਂ ਨੂੰ ਸੰਭਾਲਦੇ ਹੋਏ ਗਤੀ ਦਾ ਇੱਕ ਵਿਸ਼ਾਲ ਅਹਿਸਾਸ ਦਿੰਦਾ ਹੈ।
Mixture-of-Experts (MoE) – ਇੱਕ ਸਿੰਗਲ ਨੈੱਟਵਰਕ ਨੂੰ macro layout ਅਤੇ micro texture ਦੋਵਾਂ ਨੂੰ ਸਿੱਖਣ ਲਈ ਮਜਬੂਰ ਕਰਨ ਦੀ ਬਜਾਏ, Wan ਸ਼ੁਰੂਆਤੀ diffusion ਕਦਮਾਂ ਨੂੰ ਇੱਕ "expert" ਨੂੰ ਭੇਜਦਾ ਹੈ ਜੋ ਸੀਨ ਦੀ ਬਣਤਰ ਅਤੇ ਵਿਸ਼ਾਲ ਗਤੀ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦਾ ਹੈ, ਫਿਰ ਬਾਅਦ ਦੇ ਕਦਮਾਂ ਨੂੰ ਦੂਜੇ expert ਨੂੰ ਸੌਂਪ ਦਿੰਦਾ ਹੈ ਜੋ ਚਮੜੀ ਦੇ ਰੋਮ (skin pores), ਪ੍ਰਤੀਬਿੰਬ (reflections) ਅਤੇ ਬਾਰੀਕ ਪਰਛਾਵਿਆਂ ਨੂੰ ਸੁਧਾਰਦਾ ਹੈ। ਇਹ ਵੰਡ ਉਹਨਾਂ ਕੰਮਾਂ 'ਤੇ ਬੇਲੋੜੀ ਕੰਪਿਊਟਿੰਗ ਨੂੰ ਰੋਕਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਉੱਚ ਰੈਜ਼ੋਲੂਸ਼ਨ ਦੀ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ, ਜਿਸ ਨਾਲ inference ਸਮਾਂ ਕੰਟਰੋਲ ਵਿੱਚ ਰਹਿੰਦਾ ਹੈ।
Multimodal Conditioning – Text prompts, ਰੈਫਰੈਂਸ ਚਿੱਤਰ, ਛੋਟੀਆਂ ਵੀਡੀਓ ਕਲਿੱਪਾਂ ਅਤੇ ਆਡੀਓ ਟ੍ਰੈਕਸ ਹਰੇਕ ਆਪਣਾ embedding ਤਿਆਰ ਕਰਦੇ ਹਨ। ਮਾਡਲ ਉਹਨਾਂ ਦੀ ਵਿਅਕਤੀਗਤਤਾ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ ਇਹਨਾਂ embeddings ਨੂੰ ਜੋੜਦਾ ਹੈ, ਤਾਂ ਜੋ "walk left" (ਖੱਬੇ ਚੱਲੋ) ਦੇ ਟੈਕਸਟual ਨਿਰਦੇਸ਼ ਨਾਲ ਕਿਰਦਾਰ ਦੇ ਚਿਹਰੇ ਦੀ ਦਿੱਤੀ ਗਈ ਰੈਫਰੈਂਸ ਚਿੱਤਰ ਮਿਟ ਨਾ ਜਾਵੇ, ਅਤੇ ਬੈਕਗ੍ਰਾਊਂਡ ਮਿਊਜ਼ਿਕ ਟ੍ਰੈਕ ਕਿਸੇ ਬੋਲੀ ਹੋਈ ਲਾਈਨ ਨੂੰ ਦਬਾ ਨਾ ਦੇਵੇ।
Identity and Camera Control – ਦਿੱਤੀ ਗਈ ਚਿੱਤਰ ਜਾਂ ਕਲਿੱਪ ਤੋਂ ਕੱਢੇ ਗਏ ਰੈਫਰੈਂਸ ਫੀਚਰ ਪੂਰੀ ਜਨਰੇਸ਼ਨ ਦੌਰਾਨ ਐਂਕਰ (anchors) ਵਜੋਂ ਕੰਮ ਕਰਦੇ ਹਨ। ਜਦੋਂ ਵਰਚੁਅਲ ਕੈਮਰਾ ਪੈਨ ਕਰਦਾ ਹੈ, ਤਾਂ ਸਿਸਟਮ ਇਸ ਹਰਕਤ ਨੂੰ post-process ਫਿਲਟਰ ਦੀ ਬਜਾਏ latent space ਦੇ geometric transformation ਵਜੋਂ ਮੰਨਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਬਦਲਦੇ ਨਜ਼ਰੀਏ ਜਾਂ ਰੌਸ਼ਨੀ ਦੇ ਬਾਵਜੂਦ ਵਿਸ਼ੇ ਦੀ ਪਛਾਣ ਸਥਿਰ ਰਹਿੰਦੀ ਹੈ।
Audiovisual Sync – ਇੱਕ ਸਮਰਪਿਤ alignment head ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ ਕਿ ਵੀਡੀਓ ਸਟ੍ਰੀਮ ਵਿੱਚ ਆਡੀਓ ਘਟਨਾਵਾਂ ਕਦੋਂ ਦਿਖਾਈ ਦੇਣੀਆਂ ਚਾਹੀਦੀਆਂ ਹਨ। ਪੈਰਾਂ ਦੀ ਆਵਾਜ਼, ਤਾਲੀਆਂ ਜਾਂ ਸੰਵਾਦ ਦੇ ਸੰਕੇਤ ਬਿਲਕੁਲ ਉਹਨਾਂ ਫਰੇਮਾਂ 'ਤੇ ਆਉਂਦੇ ਹਨ ਜਿੱਥੇ ਸਾਊਂਡ ਵੇਵਫਾਰਮ (sound waveform) ਸਿਖਰ 'ਤੇ ਹੁੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮੈਨੂਅਲ ਐਡੀਟਿੰਗ ਤੋਂ ਬਿਨਾਂ ਦ੍ਰਿਸ਼ ਅਤੇ ਆਵਾਜ਼ ਦੇ ਵਿਚਕਾਰ ਇੱਕ ਸਹੀ ਮੇਲ ਬਣਦਾ ਹੈ।
ਕਿਸ ਨੂੰ ਫਾਇਦਾ ਹੋ ਸਕਦਾ ਹੈ
ਕੰਟੈਂਟ ਕ੍ਰਿਏਟਰ, ਵਿਗਿਆਪਨਦਾਤਾ ਅਤੇ ਗੇਮ ਡਿਵੈਲਪਰ ਹੁਣ ਦਰਜਨਾਂ ਛੋਟੀਆਂ ਕਲਿੱਪਾਂ ਨੂੰ ਜੋੜਨ ਦੀ ਬਜਾਏ ਲੰਬੀਆਂ ਸੀਕਵੈਂਸਾਂ ਦਾ ਪ੍ਰੋਟੋਟਾਈਪ ਤਿਆਰ ਕਰ ਸਕਦੇ ਹਨ। ਕਿਉਂਕਿ MoE ਆਰਕੀਟੈਕਚਰ ਬੇਲੋੜੀ ਕੰਪਿਊਟਿੰਗ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਇਸ ਲਈ ਪ੍ਰਤੀ ਮਿੰਟ ਜਨਰੇਟ ਹੋਣ ਵਾਲੀ ਲਾਗਤ ਉਨ੍ਹਾਂ ਦਰਮਿਆਨੇ ਆਕਾਰ ਦੇ ਸਟੂਡੀਓ ਦੀ ਪਹੁੰਚ ਵਿੱਚ ਰਹਿੰਦੀ ਹੈ ਜੋ ਪਹਿਲਾਂ ਹੱਥ
ਇਸ ਆਰਕੀਟੈਕਚਰ ਦੀ ਸੂਖਮਤਾ ਦੇ ਨਾਲ ਹਾਰਡਵੇਅਰ ਦੀ ਕੀਮਤ ਵੀ ਜੁੜੀ ਹੋਈ ਹੈ: 3-D ਪੈਚਾਂ 'ਤੇ diffusion transformer ਨੂੰ ਟ੍ਰੇਨ ਕਰਨ ਲਈ ਅਜੇ ਵੀ ਉੱਚ-ਦਰਜੇ ਦੇ GPUs ਜਾਂ ਵਿਸ਼ੇਸ਼ ਐਕਸਲਰੇਟਰਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। MoE ਇਨਫਰੈਂਸ ਦੀ ਬਰਬਾਦੀ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਪਰ ਰੂਟਿੰਗ ਲੌਜਿਕ ਲੇਟੈਂਸੀ ਵਧਾ ਦਿੰਦਾ ਹੈ ਜੋ ਰੀਅਲ-ਟਾਈਮ ਐਪਲੀਕੇਸ਼ਨਾਂ ਵਿੱਚ ਮਹਿਸੂਸ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਮਲਟੀਮੋਡਲ ਕੰਡੀਸ਼ਨਿੰਗ, ਹਾਲਾਂਕਿ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੈ, ਪਰ ਜਦੋਂ ਪ੍ਰੋਂਪਟ ਅਸਪਸ਼ਟ ਹੁੰਦੇ ਹਨ ਤਾਂ ਇਹ ਟਕਰਾਅ ਪੈਦਾ ਕਰ ਸਕਦੀ ਹੈ; ਮਾਡਲ ਇੱਕ ਮੋਡੈਲਿਟੀ ਨੂੰ ਦੂਜੀ ਨਾਲੋਂ ਵੱਧ ਤਰਜੀਹ ਦੇ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਐਜ ਕੇਸਾਂ ਵਿੱਚ ਬਰੀਕ identity drift ਹੋ ਸਕਦੀ ਹੈ।
ਆਲੋਚਕ ਇਹ ਵੀ ਨੋਟ ਕਰਦੇ ਹਨ ਕਿ ਇੱਕ ਸੁਮੇਲ ਵਾਲੀ ਦੁਨੀਆ ਕਹਾਣੀ ਦੀ ਇਕਸਾਰਤਾ ਦੀ ਗਾਰੰਟੀ ਨਹੀਂ ਦਿੰਦੀ। Wan 3.0 ਵਿਜ਼ੂਅਲ ਅਤੇ ਆਡੀਟਰੀ ਨਿਰੰਤਰਤਾ ਵਿੱਚ ਉੱਤਮ ਹੈ, ਪਰ ਇਹ ਅਜੇ ਤੱਕ ਕਹਾਣੀ ਦੇ ਵਲ (story arcs), ਪਾਤਰਾਂ ਦੀ ਪ੍ਰੇਰਨਾ ਜਾਂ ਗਤੀ (pacing) ਨੂੰ ਨਹੀਂ ਸਮਝਦਾ। ਕਹਾਣੀ ਸੁਣਾਉਣ ਦੇ ਉਹ ਉੱਚ-ਪੱਧਰੀ ਤੱਤ ਅਜੇ ਵੀ ਮਨੁੱਖੀ ਸੰਪਾਦਕਾਂ ਦੇ ਹੱਥਾਂ ਵਿੱਚ ਹਨ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
Wan 3.0 ਦੇ ਪਿੱਛੇ ਵਾਲੀ ਟੀਮ ਨੇ ਇੱਕ ਆਉਣ ਵਾਲੇ ਵਰਜ਼ਨ ਦਾ ਇਸ਼ਾਰਾ ਦਿੱਤਾ ਹੈ ਜੋ hierarchical diffusion ਨਾਲ ਪ੍ਰਯੋਗ ਕਰੇਗਾ, ਜੋ ਵੇਰਵਿਆਂ ਨੂੰ ਸੁਧਾਰਨ ਤੋਂ ਪਹਿਲਾਂ ਇੱਕ ਰਫ ਸਟੋਰੀਬੋਰਡ ਤਿਆਰ ਕਰਨ ਲਈ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਦੀ ਇਜਾਜ਼ਤ ਦੇਵੇਗਾ। ਪ੍ਰਸਿੱਧ ਐਡੀਟਿੰਗ ਸੂਟਾਂ ਨਾਲ ਇੱਕੀਕਰਨ ਵੀ ਰੋਡਮੈਪ 'ਤੇ ਹੈ, ਜੋ ਮੌਜੂਦਾ ਖੋਜ ਪ੍ਰੋਟੋਟਾਈਪ ਨੂੰ ਇੱਕ ਅਜਿਹੇ ਪਲੱਗ-ਇਨ ਵਿੱਚ ਬਦਲ ਸਕਦਾ ਹੈ ਜਿਸ ਨੂੰ ਗੈਰ-ਤਕਨੀਕੀ ਉਪਭੋਗਤਾ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਵਰਤ ਸਕਦੇ ਹਨ।
ਜੇਕਰ ਮੌਜੂਦਾ ਰਿਲੀਜ਼ ਵੱਖ-ਵੱਖ ਹਾਰਡਵੇਅਰ 'ਤੇ ਸਥਿਰ ਸਾਬਤ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਅਸੀਂ ਦੇਖ ਸਕਦੇ ਹਾਂ ਕਿ ਇੰਡੀ ਸਟੂਡੀਓ ਰਵਾਇਤੀ ਮੋਸ਼ਨ-ਕੈਪਚਰ ਰਿਗਾਂ ਨੂੰ ਛੱਡ ਕੇ, ਪੂਰੇ ਸੀਨ ਤਿਆਰ ਕਰਨ ਲਈ ਕੁਝ ਰੈਫਰੈਂਸ ਸ਼ਾਟਾਂ ਅਤੇ ਇੱਕ ਲਿਖਤੀ ਸਕ੍ਰਿਪਟ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਸ਼ੁਰੂ ਕਰ ਦੇਣਗੇ। ਅਗਲੇ ਕੁਝ ਮਹੀਨੇ ਇਹ ਸਾਫ਼ ਕਰ ਦੇਣਗੇ ਕਿ ਕੀ ਤਕਨੀਕੀ ਲਾਭਾਂ ਨਾਲ ਉਤਪਾਦਨ ਵਰਕਫਲੋ ਵਿੱਚ ਬਦਲਾਅ ਆਵੇਗਾ ਜਾਂ ਇਹ ਖੋਜ ਭਾਈਚਾਰੇ ਲਈ ਇੱਕ ਮਹਿੰਗੀ ਉਤਸੁਕਤਾ ਬਣ ਕੇ ਰਹਿ ਜਾਵੇਗਾ।
