AI ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਦਾ ਲੈਂਡਸਕੇਪ ਇੱਕ ਬੁਨਿਆਦੀ ਮੋੜ ਲੈ ਰਿਹਾ ਹੈ ਕਿਉਂਕਿ ਪੂੰਜੀ ਮਾਡਲ ਟ੍ਰੇਨਿੰਗ (model training) ਤੋਂ ਮਾਡਲ ਐਗਜ਼ੀਕਿਊਸ਼ਨ (model execution) ਵੱਲ ਵਧ ਰਹੀ ਹੈ। ਟੈਕ ਇਨਵੈਸਟਮੈਂਟ ਫਰਮ Upper90 ਵੱਲੋਂ AI ਇਨਫਰੈਂਸ ਸਟਾਰਟਅੱਪ General Compute ਨੂੰ ਦਿੱਤਾ ਗਿਆ $400 ਮਿਲੀਅਨ ਦਾ ਵਿਸ਼ਾਲ ਕਰਜ਼ਾ ਇਸ ਗੱਲ ਵਿੱਚ ਇੱਕ ਇਤਿਹਾਸਕ ਮੀਲ ਪੱਥਰ ਹੈ ਕਿ ਹਾਰਡਵੇਅਰ ਨੂੰ ਕਿਵੇਂ ਫਾਈਨਾਂਸ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਤੈਨਾਤ (deploy) ਕੀਤਾ ਜਾਂਦਾ ਹੈ।

ਕੋਲੈਟਰਲ (Collateral) ਦਾ ਇੱਕ ਨਵਾਂ ਯੁੱਗ: ਇਨਫਰੈਂਸ ਚਿਪਸ ਦੀ ਫਾਈਨੈਂਸਿੰਗ

GPU ਫਾਈਨੈਂਸਿੰਗ ਦੇ ਸ਼ੁਰੂਆਤੀ ਦਿਨਾਂ ਦੀ ਤਰ੍ਹਾਂ, Upper90 ਇੱਕ ਨਵੇਂ ਐਸੇਟ ਕਲਾਸ (asset class) ਵਿੱਚ ਉਤਰ ਰਿਹਾ ਹੈ: ਇਨਫਰੈਂਸ-ਵਿਸ਼ੇਸ਼ ਸਿਲੀਕਾਨ (inference-specific silicon)। ਜਦੋਂ ਕਿ ਫਾਈਨੈਂਸਿੰਗ ਦੀ ਪਿਛਲੀ ਲਹਿਰ—ਜਿਸਦੀ ਅਗਵਾਈ CoreWeave ਵਰਗੀਆਂ ਫਰਮਾਂ ਨੇ ਕੀਤੀ ਸੀ—ਵਿਸ਼ਾਲ ਟ੍ਰੇਨਿੰਗ ਵਰਕਲੋਡਸ ਲਈ ਵਰਤੇ ਜਾਣ ਵਾਲੇ Nvidia GPUs 'ਤੇ ਕੇਂਦਰਿਤ ਸੀ, ਇਹ $400 ਮਿਲੀਅਨ ਦੀ ਡੀਲ ਪਹਿਲਾਂ ਤੋਂ ਹੀ ਟ੍ਰੇਨ ਕੀਤੇ ਗਏ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣ ਲਈ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਬਣਾਏ ਗਏ ਚਿਪਸ ਨੂੰ ਕੋਲੈਟਰਲ ਵਜੋਂ ਵਰਤਦੀ ਹੈ।

CEO Finn Puklowski ਦੀ ਅਗਵਾਈ ਹੇਠ, General Compute ਇੱਕ "neocloud" ਬਣਾ ਰਿਹਾ ਹੈ—ਇੱਕ ਵਿਸ਼ੇਸ਼ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਪ੍ਰੋਵਾਈਡਰ ਜੋ ਆਮ-ਮੰਤਵ ਵਾਲੀ ਕੰਪਿਊਟਿੰਗ ਦੀ ਬਜਾਏ ਖਾਸ ਤੌਰ 'ਤੇ AI ਵਰਕਲੋਡਸ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ। ਇਹ ਅੰਤਰ ਬਹੁਤ ਮਹੱਤਵਪੂਰਨ ਹੈ; ਜਿੱਥੇ AWS ਅਤੇ Azure ਵਰਗੇ ਰਵਾਇਤੀ hyperscalers ਵਿਆਪਕ ਸੇਵਾਵਾਂ ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ, ਉੱਥੇ neoclouds Large Language Models (LLMs) ਦੀਆਂ ਵਿਲੱਖਣ latency ਅਤੇ throughput ਲੋੜਾਂ ਲਈ ਅਨੁਕੂਲਿਤ (optimize) ਹੁੰਦੇ ਹਨ।

SambaNova ਦੇ SN50 ਦਾ ਤਕਨੀਕੀ ਫਾਇਦਾ

General Compute ਦੀ ਰਣਨੀਤੀ ਦੇ ਕੇਂਦਰ ਵਿੱਚ Intel-ਸਮਰਥਿਤ ਚਿਪ-ਨਿਰਮਾਤਾ SambaNova ਨਾਲ ਇਸਦੀ ਭਾਈਵਾਲੀ ਹੈ। ਕੰਪਨੀ SambaNova ਦੇ SN50 ਚਿਪਸ ਤੈਨਾਤ ਕਰ ਰਹੀ ਹੈ, ਜੋ ਰਵਾਇਤੀ ਹਾਰਡਵੇਅਰ ਦੇ ਮੁਕਾਬਲੇ ਕਾਰਗੁਜ਼ਾਰੀ (performance) ਵਿੱਚ ਇੱਕ ਵੱਡਾ ਉਛਾਲ ਲਿਆਉਣ ਲਈ ਤਿਆਰ ਕੀਤੇ ਗਏ ਹਨ।

General Compute ਦੇ ਅਨੁਸਾਰ, ਇਹ ਚਿਪਸ ਮੌਜੂਦਾ GPU-ਅਧਾਰਤ ਕਲਾਉਡਸ ਨਾਲੋਂ 16 ਗੁਣਾ ਤੱਕ ਤੇਜ਼ ਇਨਫਰੈਂਸ ਸਪੀਡ ਦੇ ਸਕਦੀਆਂ ਹਨ। ਸਿਰਫ ਰਫ ਸਪੀਡ ਤੋਂ ਇਲਾਵਾ, SN50 ਦੋ ਮੁੱਖ ਸੰਚਾਲਨ ਲਾਭ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ:

  • ਪਾਵਰ ਕੁਸ਼ਲਤਾ (Power Efficiency): ਇਹ ਪ੍ਰਤੀ ਟੋਕਨ (token) ਘੱਟ ਊਰਜਾ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ, ਜਿਸ ਨਾਲ AI ਤੈਨਾਤੀ ਦੀਆਂ ਭਾਰੀ ਓਵਰਹੈੱਡ ਲਾਗਤਾਂ ਘਟ ਜਾਂਦੀਆਂ ਹਨ।
  • ਸਰਲ ਕੂਲਿੰਗ (Simplified Cooling): ਹਾਈ-ਐਂਡ GPUs ਦੇ ਉਲਟ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਅਕਸਰ ਗੁੰਝਲਦਾਰ ਅਤੇ ਮਹਿੰਗੇ ਵਾਟਰ-ਕੂਲਿੰਗ ਸਿਸਟਮਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਇਹ ਚਿਪਸ ਵੱਖ-ਵੱਖ ਕਿਸਮਾਂ ਦੇ ਸਟੈਂਡਰਡ ਡੇਟਾ ਸੈਂਟਰ ਵਾਤਾਵਰਣਾਂ ਵਿੱਚ ਤੇਜ਼ੀ ਨਾਲ ਤੈਨਾਤੀ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀਆਂ ਹਨ।

Nvidia ਦੇ ਇਕਾਧਿਕਾਰ ਨੂੰ ਤੋੜਨਾ

ਇਹ ਡੀਲ ਸਿਰਫ ਪੂੰਜੀ ਦੇ ਪ੍ਰਵੇਸ਼ ਤੋਂ ਕਿਤੇ ਵੱਧ ਹੈ; ਇਹ ਇੱਕ ਰਣਨੀਤਕ ਸੰਕੇਤ ਹੈ ਕਿ ਬਾਜ਼ਾਰ Nvidia ਦੇ ਦਬਦਬੇ ਦੇ ਵਿਕਲਪ ਲੱਭ ਰਿਹਾ ਹੈ। ਕਿਉਂਕਿ ਟੋਕਨਾਂ ਦੀ ਲਾਗਤ ਅਤੇ ਫਰੰਟੀਅਰ ਮਾਡਲ (frontier model) ਤੱਕ ਪਹੁੰਚ ਡਿਵੈਲਪਰਾਂ ਲਈ ਇੱਕ ਰੁਕਾਵਟ ਬਣੀ ਹੋਈ ਹੈ, ਇਸ ਲਈ ਓਪਨ-ਸੋਰਸ ਮਾਡਲਾਂ ਤੱਕ ਸਸਤੀ ਅਤੇ ਕੁਸ਼ਲ ਪਹੁੰਚ ਦੀ ਮੰਗ ਵਧ ਰਹੀ ਹੈ।

ਉੱਚ-ਕਾਰਗੁਜ਼ਾਰੀ ਵਾਲੇ ਓਪਨ-ਸੋਰਸ ਮਾਡਲਾਂ ਦਾ ਉਭਾਰ—ਜਿਵੇਂ ਕਿ Kimi ਦਾ K3, ਜੋ ਕੋਡਿੰਗ ਬੈਂਚਮਾਰਕਸ 'ਤੇ Anthropic ਅਤੇ OpenAI ਨਾਲ ਮੁਕਾਬਲਾ ਕਰਦਾ ਹੈ—ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਉਦਯੋਗ ਦੀ ਰੁਕਾਵਟ ਹੁਣ "ਅਸੀਂ ਮਾਡਲ ਕਿਵੇਂ ਬਣਾਈਏ?" ਤੋਂ ਬਦਲ ਕੇ "ਅਸੀਂ ਉਹਨਾਂ ਨੂੰ ਕਿਫਾਇਤੀ ਤੌਰ 'ਤੇ ਕਿਵੇਂ ਚਲਾਏ?" ਵੱਲ ਜਾ ਰਹੀ ਹੈ। ਨਾਨ-Nvidia ਸਿਲੀਕਾਨ ਦੀ ਵਰਤੋਂ ਕਰਕੇ, General Compute ਅਤੇ TensorWave (AMD ਦੇ ਨਾਲ ਭਾਈਵਾਲੀ ਕਰ ਰਿਹਾ) ਵਰਗੇ ਮੁਕਾਬਲੇਬਾਜ਼ ਆਪਣੇ ਆਪ ਨੂੰ ਬਿਹਤਰ Total Cost of Ownership (TCO) ਪ੍ਰਦਾਨ ਕਰਨ ਲਈ ਤਿਆਰ ਕਰ ਰਹੇ ਹਨ।

ਜਿਵੇਂ ਕਿ Puklowski ਨੇ ਨੋਟ ਕੀਤਾ, ਇਹ ਡੀਲ AI ਈਕੋਸਿਸਟਮ 'ਤੇ Nvidia ਦੇ ਇਕਾਧਿਕਾਰ ਨੂੰ ਖੰਡਿਤ ਕਰਨ ਲਈ "ਪੂੰਜੀ ਦੇ ਖੁਦ ਨੂੰ ਸੰਗਠਿਤ ਕਰਨ" ਦਾ ਪ੍ਰਤੀਕ ਹੈ। ਵਿਸ਼ੇਸ਼ ਇਨਫਰੈਂਸ ਹਾਰਡਵੇਅਰ 'ਤੇ ਦਾਅ ਲਗਾ ਕੇ, ਨਿਵੇਸ਼ਕ ਇਹ ਮੰਨ ਰਹੇ ਹਨ ਕਿ AI ਬੂਮ ਦਾ ਅਗਲਾ ਪੜਾਅ ਪੈਮਾਨੇ (scale), ਕੁਸ਼ਲਤਾ ਅਤੇ ਰੋਜ਼ਾਨਾ ਐਪਲੀਕੇਸ਼ਨਾਂ ਵਿੱਚ AI ਦੀ ਸਰਵਪ੍ਰਸਿੱਧਤਾ ਦੁਆਰਾ ਚਲਾਇਆ ਜਾਵੇਗਾ।

ਮੁੱਖ ਗੱਲਾਂ (Key Takeaways)

  • ਇਨਫਰੈਂਸ-ਪਹਿਲਾਂ ਫਾਈਨੈਂਸਿੰਗ (Inference-First Financing): $400 ਮਿਲੀਅਨ ਦੀ ਡੀਲ ਵਿਸ਼ਾਲ ਕਰਜ਼ਿਆਂ ਲਈ ਸਿਰਫ ਟ੍ਰੇਨਿੰਗ GPUs ਦੀ ਬਜਾਏ ਵਿਸ਼ੇਸ਼ ਇਨਫਰੈਂਸ ਚਿਪਸ ਨੂੰ ਕੋਲੈਟਰਲ ਵਜੋਂ ਵਰਤਣ ਵੱਲ ਇੱਕ ਤਬਦੀਲੀ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ।
  • ਕਾਰਗੁਜ਼ਾਰੀ ਵਿੱਚ ਵਾਧਾ (Performance Gains): General Compute ਦਾ ਟੀਚਾ SambaNova ਦੇ SN50 ਚਿਪਸ ਦੀ ਵਰਤੋਂ ਕਰਕੇ GPU-ਅਧਾਰਤ ਕਲਾਉਡਸ ਨਾਲੋਂ 16 ਗੁਣਾ ਤੱਕ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਨਾ ਹੈ, ਜੋ ਬਿਹਤਰ ਪਾਵਰ ਕੁਸ਼ਲਤਾ ਅਤੇ ਆਸਾਨ ਤੈਨਾਤੀ ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ।
  • ਸਟੈਕ ਦਾ ਵਿਭਿੰਨਤਾਕਰਨ (Diversifying the Stack): ਇਹ ਕਦਮ ਓਪਨ-ਸੋਰਸ LLMs ਦੇ ਕਿਫਾਇਤੀ ਪੈਮਾਨੇ (scaling) ਨੂੰ ਸਮਰਥਨ ਦੇਣ ਲਈ ਨਾਨ-Nvidia ਸਿਲੀਕਾਨ ਦੀ ਵਧਦੀ ਬਾਜ਼ਾਰ ਮੰਗ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ।