Alibaba ਨੇ Qwen3.8-Flash-Next ਨੂੰ ਪੇਸ਼ ਕੀਤਾ: ਕੁਸ਼ਲ AI ਦਾ ਇੱਕ ਨਵਾਂ ਯੁੱਗ
Alibaba ਦੀ Qwen ਟੀਮ ਨੇ ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ Qwen3.8-Flash-Next ਨੂੰ ਰਿਲੀਜ਼ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਕ੍ਰਾਂਤੀਕਾਰੀ ਮਲਟੀਮੋਡਲ Mixture-of-Experts (MoE) ਮਾਡਲ ਹੈ। ਇਸ ਨੂੰ ਰਵਾਇਤੀ ਲਾਗਤ ਦੇ ਇੱਕ ਹਿੱਸੇ 'ਤੇ ਉੱਤਮ ਪ੍ਰਦਰਸ਼ਨ ਦੇਣ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ। ਆਉਣ ਵਾਲੇ Qwen4 ਲਈ ਇੱਕ ਆਰਕੀਟੈਕਚਰਲ ਪੂਰਵ-ਦਰਸ਼ਾਨ (preview) ਵਜੋਂ ਕੰਮ ਕਰਦੇ ਹੋਏ, ਇਹ ਮਾਡਲ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਐਕਟੀਵੇਟ ਅਤੇ ਸਟੋਰ ਕਰਨ ਦੇ ਤਰੀਕੇ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾ ਕੇ ਬਹੁਤ ਵੱਡੇ LLMs ਦੇ ਦਬਦਬੇ ਨੂੰ ਚੁਣੌਤੀ ਦਿੰਦਾ ਹੈ।
ਕ੍ਰਾਂਤੀਕਾਰੀ ਆਰਕੀਟੈਕਚਰ: N-gram Embedding ਨਵੀਨਤਾ
Qwen3.8-Flash-Next ਵਿੱਚ ਸਭ ਤੋਂ ਖਾਸ ਤਕਨੀਕੀ ਪ੍ਰਾਪਤੀ ਪੈਮਾਨੇ (scale) ਬਨਾਮ ਕੁਸ਼ਲਤਾ (efficiency) ਦਾ ਇਸਦਾ ਵਿਲੱਖਣ ਪ੍ਰਬੰਧਨ ਹੈ। ਹਾਲਾਂਕਿ ਮਾਡਲ ਵਿੱਚ ਕੁੱਲ 125 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਹਨ, ਪਰ ਇਹ ਇੱਕ sparse MoE ਪਹੁੰਚ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ ਜੋ ਪ੍ਰਤੀ ਟੋਕਨ ਸਿਰਫ਼ 6 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਹੀ ਐਕਟੀਵੇਟ ਕਰਦਾ ਹੈ। ਇਹ ਡੈਂਸਰ (denser) ਮਾਡਲਾਂ ਵਿੱਚ ਮਿਲਣ ਵਾਲੇ ਗਿਆਨ ਦੀ ਵਿਸ਼ਾਲਤਾ ਨਾਲ ਸਮਝੌਤਾ ਕੀਤੇ ਬਿਨਾਂ ਤੇਜ਼ ਰਫਤਾਰ ਇਨਫਰੈਂਸ (inference) ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।
ਪੂਰੇ Qwen4 ਰਿਲੀਜ਼ ਲਈ ਤਿਆਰ ਕੀਤੀ ਗਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਨਵੀਨਤਾ 51-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੀ N-gram embedding ਲੇਅਰ ਦਾ ਸ਼ਾਮਲ ਹੋਣਾ ਹੈ। ਇਹ ਲੇਅਰ ਇੱਕ "phrase dictionary" ਵਜੋਂ ਕੰਮ ਕਰਦੀ ਹੈ, ਜੋ ਆਮ ਸ਼ਬਦ ਸਮੂਹਾਂ ਨੂੰ ਸੁਤੰਤਰ ਐਂਟਰੀਆਂ ਵਜੋਂ ਸਟੋਰ ਕਰਦੀ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ ਇਹ ਲੇਅਰ ਮਹਿੰਗੀ GPU ਮੈਮਰੀ ਦੀ ਬਜਾਏ ਆਮ ਸਿਸਟਮ RAM ਵਿੱਚ ਰਹਿਣ ਲਈ ਤਿਆਰ ਕੀਤੀ ਗਈ ਹੈ, ਜੋ ਮਾਡਲ ਨੂੰ ਚਲਾਉਣ ਲਈ ਲੋੜੀਂਦੇ ਹਾਰਡਵੇਅਰ ਦੇ ਖਰਚੇ ਨੂੰ ਕਾਫ਼ੀ ਘਟਾਉਂਦੀ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਮਾਡਲ ਕੁਦਰਤੀ ਤੌਰ 'ਤੇ ਇੱਕ ਵਿਸ਼ਾਲ 262,144-ਟੋਕਨ ਕੰਟੈਕਸਟ ਵਿੰਡੋ (context window) ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ YaRN ਰਾਹੀਂ ਇੱਕ ਮਿਲੀਅਨ ਟੋਕਨਾਂ ਤੱਕ ਵਧਣ ਦੀ ਸਮਰੱਥਾ ਹੈ।
ਕੋਡਿੰਗ ਅਤੇ ਉਤਪਾਦਕਤਾ ਵਿੱਚ ਦਿੱਗਜਾਂ ਨੂੰ ਪਛਾੜਨਾ
ਆਪਣੇ ਛੋਟੇ ਐਕਟਿਵ ਪੈਰਾਮੀਟਰ ਕਾਊਂਟ ਦੇ ਬਾਵਜੂਦ, Qwen3.8-Flash-Next ਅਜਿਹੇ ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ ਦੇ ਰਿਹਾ ਹੈ ਜੋ ਅਕਸਰ DeepSeek-V4-Flash (284B ਪੈਰਾਮੀਟਰ) ਅਤੇ Anthropic ਦੇ Claude Opus 4.6 (Max) ਵਰਗੇ ਬਹੁਤ ਵੱਡੇ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਤੋਂ ਅੱਗੇ ਨਿਕਲ ਜਾਂਦੇ ਹਨ। ਮਾਡਲ "agentic" ਕੰਮਾਂ ਵਿੱਚ ਵਿਸ਼ੇਸ਼ ਤਾਕਤ ਦਿਖਾਉਂਦਾ ਹੈ—ਅਜਿਹੇ ਦ੍ਰਿਸ਼ ਜਿੱਥੇ ਇੱਕ AI ਨੂੰ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਲਈ ਸੁਤੰਤਰ ਰੂਪ ਵਿੱਚ ਗੁੰਝਲਦਾਰ ਸਾਫਟਵੇਅਰ ਵਾਤਾਵਰਣ ਵਿੱਚ ਕੰਮ ਕਰਨਾ ਪੈਂਦਾ ਹੈ।
ਵਿਸ਼ੇਸ਼ ਬੈਂਚਮਾਰਕਸ ਵਿੱਚ, Flash-Next ਨੇ SWE-bench Pro 'ਤੇ 62.5 ਅਤੇ DeepSWE 'ਤੇ 58.7 ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਜੋ ਕਿ DeepSeek ਅਤੇ Claude ਦੋਵਾਂ ਤੋਂ ਬਿਹਤਰ ਹੈ। ਪੇਸ਼ੇਵਰ ਵਰਕਫਲੋ ਵਿੱਚ ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਅੰਤਰ ਹੋਰ ਵੀ ਸਪਸ਼ਟ ਹੈ; CoWorkBench 'ਤੇ, Flash-Next ਨੇ 73.9 ਸਕੋਰ ਕੀਤਾ, ਜੋ ਕਿ DeepSeek-V4-Flash ਦੇ 45.1 ਦੇ ਲਗਭਗ ਦੁੱਗਣਾ ਹੈ। JobBench 'ਤੇ, ਇਸਨੇ 55.7 ਸਕੋਰ ਕੀਤਾ, ਜੋ ਕਿ ਪਿਛਲੇ Qwen3.7-Plus ਮਾਡਲ ਦੁਆਰਾ ਦਰਜ ਕੀਤੇ ਗਏ 27.6 ਦੇ ਮੁਕਾਬਲੇ ਇੱਕ ਵੱਡੀ ਛਾਲ ਹੈ।
ਵਿਘਨਕਾਰੀ ਕੀਮਤਾਂ ਅਤੇ ਮੁਕਾਬਲੇਬਾਜ਼ ਦ੍ਰਿਸ਼
Alibaba ਸਿਰਫ਼ ਬੁੱਧੀ (intelligence) 'ਤੇ ਹੀ ਨਹੀਂ, ਸਗੋਂ ਅਤਿ ਦੀ ਲਾਗਤ-ਕੁਸ਼ਲਤਾ (cost-efficiency) 'ਤੇ ਵੀ ਮੁਕਾਬਲਾ ਕਰ ਰਿਹਾ ਹੈ। QwenCloud ਰਾਹੀਂ Qwen3.8-Flash ਵਜੋਂ ਮਿਲਣ ਵਾਲਾ ਪ੍ਰੋਡਕਸ਼ਨ ਵਰਜ਼ਨ, ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਇਨਪੁਟ ਟੋਕਨਾਂ ਲਈ $0.16 ਅਤੇ ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ ਲਈ $0.47 ਦੀ ਹੈਰਾਨੀਜਨਕ ਕੀਮਤ 'ਤੇ ਹੈ। ਇਸ ਨੂੰ ਸਮਝਣ ਲਈ, ਇਹ ਮਾਡਲ ਫਲੈਗਸ਼ਿਪ Qwen3.8-Max ਦੇ ਲਗਭਗ ਬਰਾਬਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ ਪਰ ਲਗਭਗ ਇੱਕ-ਬਾਰਾਂਵੇਂ (1/12) ਕੀਮਤ 'ਤੇ।
ਇਹ ਹਮਲਾਵਰ ਕੀਮਤ ਰਣਨੀਤੀ OpenAI ਅਤੇ Anthropic ਵਰਗੇ ਪੱਛਮੀ AI ਲੀਡਰਾਂ 'ਤੇ ਭਾਰੀ ਦਬਾਅ ਪਾਉਂਦੀ ਹੈ। ਇਹ ਸਾਬਤ ਕਰਕੇ ਕਿ ਆਪਣੇ ਪਿਛਲੇ ਮਾਡਲ ਦੀ ਇੱਕ-ਨੌਂਵਾਂ ਲਾਗਤ 'ਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਮਾਡਲ ਕੋਡਿੰਗ ਅਤੇ ਦਫ਼ਤਰੀ ਕੰਮਾਂ ਵਿੱਚ ਬਿਹਤਰ ਨਤੀਜੇ ਦੇ ਸਕਦਾ ਹੈ, Alibaba ਉਦਯੋਗ ਵਿੱਚ ਇੱਕ ਬਦਲਾਅ ਦਾ ਸੰਕੇਤ ਦੇ ਰਿਹਾ ਹੈ: AI ਦਾ ਭਵਿੱਖ ਸ਼ਾਇਦ ਸਭ ਤੋਂ ਵੱਡੇ ਮਾਡਲਾਂ ਦਾ ਨਹੀਂ, ਸਗੋਂ ਸਭ ਤੋਂ ਆਰਕੀਟੈਕਚਰਲ ਰੂਪ ਵਿੱਚ ਕੁਸ਼ਲ ਮਾਡਲਾਂ ਦਾ ਹੋਵੇਗਾ।
ਮੁੱਖ ਗੱਲਾਂ
- ਆਰਕੀਟੈਕਚਰਲ ਪੂਰਵ-ਦਰਸ਼ਾਨ: Qwen3.8-Flash-Next ਇੱਕ 51B N-gram embedding ਲੇਅਰ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਜੋ GPU 'ਤੇ ਨਿਰਭਰਤਾ ਨੂੰ ਘਟਾਉਣ ਲਈ ਸਿਸਟਮ RAM ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ Qwen4 ਆਰਕੀਟੈਕਚਰ ਦਾ ਇੱਕ ਪੂਰਵ-ਸੰਕੇਤ ਹੈ।
- ਬੈਂਚਮਾਰਕ ਦਬਦਬਾ: ਮਾਡਲ agentic ਕੋਡਿੰਗ (SWE-bench Pro) ਅਤੇ ਪੇਸ਼ੇਵਰ ਉਤਪਾਦਕਤਾ (CoWorkBench) ਵਿੱਚ Claude Opus 4.6 ਅਤੇ DeepSeek-V4-Flash ਵਰਗੇ ਵੱਡੇ ਵਿਰੋਧੀਆਂ ਨੂੰ ਪਛਾੜ ਦਿੰਦਾ ਹੈ।
- ਅਤਿ ਦੀ ਲਾਗਤ-ਕੁਸ਼ਲਤਾ: ਪ੍ਰਤੀ ਟੋਕਨ ਸਿਰਫ਼ 6B ਦੇ ਐਕਟਿਵ ਪੈਰਾਮੀਟਰ ਕਾਊਂਟ ਦੇ ਨਾਲ, ਇਹ ਮਾਡਲ ਫਲੈਗਸ਼ਿਪ ਮਾਡਲਾਂ ਦੀ ਲਾਗਤ ਦੇ ਇੱਕ ਹਿੱਸੇ 'ਤੇ ਉੱਚ-ਦਰਜੇ ਦੀ ਬੁੱਧੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਮੌਜੂਦਾ AI ਕੀਮਤ ਦੇ ਦ੍ਰਿਸ਼ ਨੂੰ ਬਦਲ ਰਿਹਾ ਹੈ।
