ਜਦੋਂ Cerebras ਕਸਟਮ AI ਚਿੱਪਸ ਬਣਾ ਰਿਹਾ ਹੈ, ਫਰਾਂਸੀਸੀ ਸਟਾਰਟਅੱਪ Kog ਉਨ੍ਹਾਂ GPUs ਤੋਂ ਪ੍ਰਦਰਸ਼ਨ (performance) ਕੱਢਦਾ ਹੈ ਜੋ ਉਦਯੋਗਾਂ ਕੋਲ ਪਹਿਲਾਂ ਹੀ ਹਨ। ਮੌਜੂਦਾ ਡਾਟਾ ਸੈਂਟਰ ਹਾਰਡਵੇਅਰ ਲਈ ਲੋਅ-ਲੈਵਲ (low-level) ਸੌਫਟਵੇਅਰ ਨੂੰ ਦੁਬਾਰਾ ਲਿਖ ਕੇ, Kog ਉਨ੍ਹਾਂ ਲੇਟੈਂਸੀ (latency) ਰੁਕਾਵਟਾਂ ਨੂੰ ਖਤਮ ਕਰਦਾ ਹੈ ਜੋ AI ਵਰਕਫਲੋ ਨੂੰ ਹੌਲੀ ਕਰ ਦਿੰਦੀਆਂ ਹਨ।
ਕਸਟਮ AI ਸਿਲੀਕਾਨ ਦੀ ਲੋੜ ਨੂੰ ਚੁਣੌਤੀ ਦੇਣਾ
AI ਉਦਯੋਗ ਇਨਫਰੈਂਸ (inference) ਲਈ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਬਣਾਏ ਗਏ ਚਿੱਪਸ ਵੱਲ ਮੁੜ ਗਿਆ ਹੈ। Kog ਦੇ CEO, Gaël Delalleau, ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਇਹ ਮੰਨਣਾ ਗਲਤ ਹੈ ਕਿ ਸਟੈਂਡਰਡ GPUs ਡੀਕੋਡਿੰਗ (decoding) ਨਹੀਂ ਕਰ ਸਕਦੇ। ਆਧੁਨਿਕ GPUs—Nvidia H200, AMD MI300X—ਅਜਿਹੀ ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ (memory bandwidth) ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ ਜਿਸ ਨੂੰ ਮੌਜੂਦਾ ਸੌਫਟਵੇਅਰ ਬੇਕਾਰ ਛੱਡ ਦਿੰਦਾ ਹੈ।
Kog ਦਾ Kog Inference Engine (KIE) "ਬਹੁਤ ਤੇਜ਼ ਸਿੰਗਲ-ਰਿਕਵੈਸਟ ਡੀਕੋਡਿੰਗ" ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦਾ ਹੈ, ਜੋ ਕਿ ਰੀਅਲ-ਟਾਈਮ ਐਪਸ ਲਈ ਬਹੁਤ ਜ਼ਰੂਰੀ ਹੈ। ਇੱਕ ਹਾਲੀਆ ਡੈਮੋ ਵਿੱਚ, ਕੰਪਨੀ ਨੇ Laneformer 2B ਨਾਲ 3,000 ਟੋਕਨ ਪ੍ਰਤੀ ਸੈਕਿੰਡ (TPS) ਦੀ ਰਫ਼ਤਾਰ ਹਾਸਲ ਕੀਤੀ, ਜੋ ਕਿ ਉਹਨਾਂ ਦੇ ਸਟੈਕ ਲਈ ਟਿਊਨ ਕੀਤਾ ਗਿਆ ਇੱਕ ਓਪਨ-ਸੋਰਸ 2-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲ ਹੈ। ਡੈਮੋ ਵਿੱਚ ਇੱਕ ਛੋਟਾ ਮਾਡਲ ਵਰਤਿਆ ਗਿਆ ਹੈ, ਪਰ Kog ਇਹਨਾਂ ਫਾਇਦਿਆਂ ਨੂੰ ਬਹੁਤ ਵੱਡੇ LLMs ਤੱਕ ਵਧਾਉਣ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਿਹਾ ਹੈ।
GPU ਇੰਜੀਨੀਅਰਿੰਗ ਲਈ ਇੱਕ "Hacker" ਪਹੁੰਚ
ZML ਵਰਗੇ ਹਾਰਡਵੇਅਰ-ਐਗਨੌਸਟਿਕ (hardware-agnostic) ਪ੍ਰਦਾਤਾਵਾਂ ਦੇ ਉਲਟ, Kog ਡੂੰਘਾਈ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ। ਟੀਮ GPUs ਨੂੰ ਅਸੈਂਬਲੀ (assembly) ਅਤੇ ਬਾਈਨਰੀ (binary) ਪੱਧਰਾਂ 'ਤੇ ਰੀਵਰਸ-ਇੰਜੀਨੀਅਰ ਕਰਦੀ ਹੈ, ਅਤੇ ਸਿਲੀਕਾਨ ਨੂੰ ਮਾਸਟਰ ਕਰਨ ਲਈ ਭੌਤਿਕ ਨਿਯਮਾਂ ਦੇ ਇੱਕ ਸਮੂਹ ਵਜੋਂ ਮੰਨਦੀ ਹੈ।
ਉਹ ਲੋਅ-ਲੈਵਲ ਫੋਕਸ ਕੁਸ਼ਲਤਾ (efficiency) ਦਾ ਹਰ ਅੰਸ਼ ਕੱਢ ਲੈਂਦਾ ਹੈ, ਪਰ ਇਸ ਵਿੱਚ ਸਮਾਂ ਲੱਗਦਾ ਹੈ। 11 ਇੰਜੀਨੀਅਰਾਂ ਦੀ ਇੱਕ ਛੋਟੀ ਟੀਮ ਦੇ ਨਾਲ, Kog ਕਿਸੇ ਵੀ ਨਵੇਂ GPU ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਸਪੋਰਟ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਉਸਦਾ ਡੂੰਘਾਈ ਨਾਲ ਅਧਿਐਨ ਕਰਨ ਵਿੱਚ ਹਫ਼ਤੇ ਜਾਂ ਮਹੀਨੇ ਬਿਤਾਉਂਦਾ ਹੈ। ਇਹ ਤਰੀਕਾ ਉੱਚ-ਦਰਜੇ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਦਿੰਦਾ ਹੈ ਪਰ ਇਹ ਸੀਮਤ ਕਰਦਾ ਹੈ ਕਿ Kog ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਨਵੇਂ ਹਾਰਡਵੇਅਰ ਨੂੰ ਕਵਰ ਕਰ ਸਕਦਾ ਹੈ।
ਉੱਚ-ਮੁੱਲ ਵਾਲੇ AI ਯੂਜ਼ ਕੇਸਾਂ (Use Cases) ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਣਾ
Kog ਉਨ੍ਹਾਂ ਖੇਤਰਾਂ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦਾ ਹੈ ਜਿੱਥੇ ਲੇਟੈਂਸੀ ਦਾ ਮਤਲਬ ਹੈ ਘਟਦੀ ਰੈਵੇਨਿਊ:
- ਸੌਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ: Claude Code ਵਰਗੇ ਟੂਲ ਮਿੰਟਾਂ ਲਈ ਰੁਕ ਜਾਂਦੇ ਹਨ। Kog ਦਾ ਉਦੇਸ਼ "ਘੰਟਿਆਂ ਦੀ ਉਡੀਕ" ਨੂੰ ਲਗਭਗ ਤੁਰੰਤ ਨਤੀਜਿਆਂ ਵਿੱਚ ਬਦਲਣਾ ਹੈ।
- ਜਨਰੇਟਿਵ ਐਪ/ਗੇਮ ਡਿਜ਼ਾਈਨ: ਯੂਜ਼ਰਾਂ ਨੂੰ ਜੋੜ ਕੇ ਰੱਖਣ ਅਤੇ ਰੈਵੇਨਿਊ ਬਣਾਈ ਰੱਖਣ ਲਈ ਪ੍ਰੋਂਪਟ-ਟੂ-ਐਪ (prompt-to-app) ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਤੇਜ਼ ਇਟਰੇਸ਼ਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
ਕੰਪਨੀ ਦਾ ਅਗਲਾ ਮੀਲਸਟੋਨ (milestone) ਆਪਣੇ ਪਹਿਲੇ ਮੁੱਖ ਵੱਡੇ ਪੱਧਰ ਦੇ ਮਾਡਲ 'ਤੇ 10× ਰਫ਼ਤਾਰ ਵਧਾਉਣਾ ਹੈ। Scaleway, Bpifrance ਅਤੇ French Tech 2030 ਪ੍ਰੋਗਰਾਮ ਦੁਆਰਾ ਸਮਰਥਿਤ, Kog ਆਪਣੇ ਆਪ ਨੂੰ ਯੂਰਪ ਦੇ AI ਪ੍ਰਭੂਸੱਤਾ (sovereignty) ਅਭਿਆਨ ਵਿੱਚ ਇੱਕ ਪ੍ਰਮੁੱਖ ਖਿਡਾਰੀ ਵਜੋਂ ਪੇਸ਼ ਕਰਦਾ ਹੈ।
ਮੁੱਖ ਗੱਲਾਂ (Key Takeaways)
ਹਾਰਡਵੇਅਰ ਦੀ ਬਜਾਏ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ: Kog ਅਤਿ ਲੋਅ-ਲੈਵਲ ਸੌਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਨਾਲ Nvidia H200 ਅਤੇ AMD MI300X GPUs ਦੀ ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਨੂੰ ਸੀਮਾ ਤੱਕ ਲੈ ਜਾਂਦਾ ਹੈ।
ਲੇਟੈਂਸੀ ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਤੋੜਨਾ: ਸਟਾਰਟਅੱਪ ਆਟੋਮੇਟਡ ਕੋਡਿੰਗ ਅਤੇ ਜਨਰੇਟਿਵ ਡਿਜ਼ਾਈਨ ਵਰਗੇ ਰੀਅਲ-ਟਾਈਮ ਪੇਸ਼ੇਵਰ ਵਰਕਫਲੋ ਲਈ LLM ਇਨਫਰੈਂਸ ਦੀ ਰਫ਼ਤਾਰ ਵਿੱਚ 30× ਵਾਧੇ ਦਾ ਟੀਚਾ ਰੱਖਦਾ ਹੈ।
ਸੌਫਟਵੇਅਰ-ਇੰਜੀਨੀਅਰਿੰਗ ਟੂਲਸ – ਅਜਿਹੇ ਉਤਪਾਦ ਜੋ ਕੋਡ ਤਿਆਰ ਕਰਦੇ ਹਨ, ਜਿਵੇਂ ਕਿ Claude Code, ਅਕਸਰ ਮਾਡਲ ਦੁਆਰਾ ਰਿਕਵੈਸਟ ਪ੍ਰੋਸੈਸ ਕਰਨ ਦੌਰਾਨ ਕਈ ਮਿੰਟਾਂ ਲਈ ਰੁਕ ਜਾਂਦੇ ਹਨ। ਇਸ ਉਡੀਕ ਨੂੰ ਕੁਝ ਸੈਕਿੰਡਾਂ ਤੱਕ ਘਟਾਉਣ ਨਾਲ ਇੰਟਰਐਕਟਿਵ ਡਿਵੈਲਪਮੈਂਟ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸੁਚਾਰੂ ਹੋ ਜਾਵੇਗੀ।
ਜਨਰੇਟਿਵ ਡਿਜ਼ਾਈਨ ਪਾਈਪਲਾਈਨਾਂ – ਟੈਕਸਟ ਪ੍ਰੋਂਪਟਸ ਨੂੰ ਐਪ ਪ੍ਰੋਟੋਟਾਈਪਸ ਜਾਂ ਗੇਮ ਐਸੇਟਸ ਵਿੱਚ ਬਦਲਣ ਵਾਲੇ ਸਟੂਡੀਓਜ਼ ਨੂੰ ਕ੍ਰਿਏਟਰਸ ਨੂੰ ਜੋੜੀ ਰੱਖਣ ਲਈ ਤੇਜ਼ ਇਟਰੇਸ਼ਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਤੇਜ਼ ਡੀਕੋਡਿੰਗ ਡਿਜ਼ਾਈਨ ਲੂਪਸ ਨੂੰ ਛੋਟਾ ਕਰਦੀ ਹੈ ਅਤੇ ਕਨਵਰਜ਼ਨ ਰੇਟ ਨੂੰ ਵਧਾਉਂਦੀ ਹੈ।
ਦੋਵੇਂ ਖੇਤਰ ਲੇਟੈਂਸੀ (latency) ਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਗੁਆਚੇ ਹੋਏ ਬਿਲਯੇਬਲ ਘੰਟਿਆਂ ਜਾਂ ਚਰਨ (churn) ਵਿੱਚ ਬਦਲ ਦਿੰਦੇ ਹਨ, ਇਸ ਲਈ 30× ਸਪੀਡ ਬੂਸਟ ਇੱਕ ਨਿਰਣਾਇਕ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦਾ ਫਾਇਦਾ ਹੋ ਸਕਦਾ ਹੈ।
ਵਿਆਪਕ ਤਸਵੀਰ
Kog ਦੀ ਰਣਨੀਤੀ ਕਸਟਮ AI ਸਿਲੀਕਾਨ ਬਣਾਉਣ ਦੇ ਉਦਯੋਗਿਕ ਰੁਝਾਨ ਦੇ ਉਲਟ ਹੈ। Cerebras ਵਰਗੀਆਂ ਕੰਪਨੀਆਂ ਅਜਿਹੇ ਚਿੱਪਸ ਵਿੱਚ ਅਰਬਾਂ ਖਰਚ ਕਰਦੀਆਂ ਹਨ ਜੋ ਪ੍ਰਤੀ ਵਾਟ ਉੱਚੇ ਥਰੂਪੁੱਟ (throughput) ਦਾ ਵਾਅਦਾ ਕਰਦੇ ਹਨ। Kog ਦਾ ਤਰਕ ਹੈ ਕਿ ਅੱਜ ਦੇ GPUs ਵਿੱਚ ਡੀਕੋਡਿੰਗ ਲਈ ਪਹਿਲਾਂ ਹੀ ਲੋੜੀਂਦੀ ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਹੈ; ਜੋ ਚੀਜ਼ ਘਾਟ ਰਹੀ ਹੈ ਉਹ ਉਹ ਸੌਫਟਵੇਅਰ ਹੈ ਜੋ ਅਸਲ ਵਿੱਚ ਇਸਦੀ ਵਰਤੋਂ ਕਰ ਸਕੇ। ਜੇਕਰ ਇਹ ਦਾਅਵਾ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਸਹੀ ਸਾਬਤ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਡਿਵੈਲਪਰ ਮਹਿੰਗੇ ਹਾਰਡਵੇਅਰ ਅੱਪਗ੍ਰੇਡ ਨੂੰ ਟਾਲ ਸਕਦੇ ਹਨ ਅਤੇ ਨੇੜੇ-ਅਸਲ-ਸਮੇਂ (near-real-time) ਇਨਫਰੈਂਸ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਸੌਫਟਵੇਅਰ ਅੱਪਗ੍ਰੇਡ 'ਤੇ ਭਰੋਸਾ ਕਰ ਸਕਦੇ ਹਨ।
ਸੰਭਾਵੀ ਚੁਣੌਤੀਆਂ
- ਰੱਖ-ਰਖਾਅ ਦਾ ਬੋਝ – ਹਰ ਨਵੀਂ GPU ਪੀੜ੍ਹੀ ਲਈ ਨਵੀਂ ਰਿਵਰਸ-ਇੰਜੀਨੀਅਰਿੰਗ ਦੀ ਲੋੜ ਹੋਵੇਗੀ। ਜਿਵੇਂ-ਜਿਵੇਂ ਬਾਜ਼ਾਰ ਵਿਭਿੰਨਤਾ ਵਾਲਾ ਬਣਦਾ ਹੈ, ਛੋਟੀ ਟੀਮ 'ਤੇ ਕੰਮ ਦਾ ਬਹੁਤ ਜ਼ਿਆਦਾ ਬੋਝ ਪੈ ਸਕਦਾ ਹੈ।
- ਵੱਡੇ ਮਾਡਲਾਂ ਤੱਕ ਪਹੁੰਚ (Scalability) – ਡੈਮੋ ਵਿੱਚ 2 B-ਪੈਰਾਮੀਟਰ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਗਈ ਸੀ। ਇਨ੍ਹਾਂ ਤਕਨੀਕਾਂ ਨੂੰ ਬਹੁਤ ਵੱਡੇ ਸਿਸਟਮਾਂ ਤੱਕ ਵਧਾਉਣ ਨਾਲ ਮੈਮੋਰੀ-ਕਪੈਸਿਟੀ ਦੀਆਂ ਸੀਮਾਵਾਂ ਆ ਸਕਦੀਆਂ ਹਨ ਜਾਂ ਅਜਿਹੀਆਂ ਵਾਧੂ ਇੰਜੀਨੀਅਰਿੰਗ ਤਕਨੀਕਾਂ ਦੀ ਲੋੜ ਪੈ ਸਕਦੀ ਹੈ ਜੋ ਅਜੇ ਤੱਕ ਪ੍ਰਗਟ ਨਹੀਂ ਕੀਤੀਆਂ ਗਈਆਂ ਹਨ।
- ਵਿਕਲਪਿਕ ਮਾਰਗ – ਕਲਾਉਡ ਪ੍ਰੋਵਾਈਡਰ ਪਹਿਲਾਂ ਹੀ ਇਨਫਰੈਂਸ-ਆਪਟੀਮਾਈਜ਼ਡ ਇੰਸਟੈਂਸ ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ ਜੋ ਵਿਸ਼ੇਸ਼ ਚਿੱਪਸ ਅਤੇ ਸੌਫਟਵੇਅਰ ਨੂੰ ਇਕੱਠਾ ਕਰਦੇ ਹਨ। ਕੁਝ ਵਰਕਲੋਡਸ ਲਈ, Kog ਦੇ ਸਟੈਕ ਤੋਂ ਮਿਲਣ ਵਾਲਾ ਮਾਮੂਲੀ ਫਾਇਦਾ ਮੈਨੇਜਡ ਸਰਵਿਸ ਦੀ ਸਹੂਲਤ ਨਾਲੋਂ ਵੱਧ ਨਹੀਂ ਹੋ ਸਕਦਾ।
ਕੀ ਦੇਖਣਾ ਹੈ
- ਪਹਿਲਾ ਵੱਡਾ-ਮਾਡਲ ਰੋਲਆਊਟ – Kog ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਉਸਦਾ ਅਗਲਾ ਮੀਲਸਟੋਨ ਇੱਕ "ਮੁੱਖ ਵੱਡੇ ਪੱਧਰ ਦੇ ਮਾਡਲ" 'ਤੇ 10× ਸਪੀਡਅੱਪ ਹੈ। 2 B ਡੈਮੋ ਅਤੇ ਐਂਟਰਪ੍ਰਾਈਜ਼-ਗ੍ਰੇਡ ਮਾਡਲ ਵਿਚਕਾਰ ਦਾ ਅੰਤਰ ਇਸ ਪਹੁੰਚ ਦਾ ਸਭ ਤੋਂ ਸਪੱਸ਼ਟ ਟੈਸਟ ਹੋਵੇਗਾ।
- ਹਾਰਡਵੇਅਰ ਸਪੋਰਟ ਦਾ ਵਿਸਥਾਰ – ਨਵੇਂ GPUs ਜਾਂ ਹੋਰ ਐਕਸਲਰੇਟਰਾਂ ਲਈ ਸਪੋਰਟ ਜੋੜਨਾ ਇਹ ਸੰਕੇਤ ਦੇਵੇਗਾ ਕਿ ਕੀ ਲੋ-ਲੈਵਲ ਮਾਡਲ ਤੇਜ਼ ਹਾਰਡਵੇਅਰ ਤਬਦੀਲੀਆਂ ਦੇ ਨਾਲ ਤਾਲਮੇਲ ਰੱਖ ਸਕਦਾ ਹੈ।
ਸਿੱਟਾ
Kog ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਜਦੋਂ ਤੁਸੀਂ ਸੌਫਟਵੇਅਰ ਸਟੈਕ ਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਦੁਬਾਰਾ ਲਿਖਦੇ ਹੋ, ਤਾਂ ਮੌਜੂਦਾ GPUs ਤੋਂ ਵਧੇਰੇ ਕੰਮ ਲੈਣਾ ਸੰਭਵ ਹੈ। 30× ਤੇਜ਼ LLM ਡੀਕੋਡਿੰਗ ਦਾ ਵਾਅਦਾ ਡਿਵੈਲਪਰਾਂ ਦੁਆਰਾ AI ਸੇਵਾਵਾਂ ਦੀ ਕੀਮਤ ਅਤੇ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਰੀਸ਼ੇਪ ਕਰ ਸਕਦਾ ਹੈ—ਬਸ਼ਰਤੇ ਕਿ ਕੰਪਨੀ ਹਰ ਨਵੇਂ ਸਿਲੀਕਾਨ ਲਈ ਲੋੜੀਂਦੇ ਤੀਬਰ ਇੰਜੀਨੀਅਰਿੰਗ ਯਤਨਾਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖ ਸਕੇ।
