10 ഡോളർ ചിപ്പിൽ പ്രവർത്തിക്കുന്ന 180M-പാരാമീറ്റർ LLM

p-for-llm എന്ന പുതിയ പ്രോജക്റ്റ് ശ്രദ്ധേയമായ ഒരു കാര്യം ചെയ്യുന്നു. ഇത് ഒരു ESP32-P4 മൈക്രോകൺട്രോളറിൽ 180.9 മില്യൺ പാരാമീറ്റർ മോഡൽ പ്രവർത്തിപ്പിക്കുന്നു. ഈ ചിപ്പിന് ആറ് മുതൽ പത്ത് ഡോളർ വരെയാണ് വില വരുന്നത്.

ചെറിയ ചിപ്പുകളിൽ പ്രവർത്തിക്കുന്ന മിക്ക വൈറൽ AI പ്രോജക്റ്റുകളും ലളിതമായ ജോലികളിലാണ് ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നത്. ചെറിയ കഥകൾ എഴുതുന്ന ഒരു മോഡൽ അവ പ്രദർശിപ്പിക്കുന്നു. അത്തരം മോഡലുകളിൽ പലപ്പോഴും വളരെ കുറഞ്ഞ പാരാമീറ്ററുകൾ മാത്രമേ ഉണ്ടാകാറുള്ളൂ, അവയ്ക്ക് പ്രായോഗികമായ ഉപയോഗവും കുറവായിരിക്കും.

p-for-llm വ്യത്യസ്തമാണ്. ഇത് പ്രായോഗികമായ ഉപയോഗത്തിനാണ് ലക്ഷ്യമിടുന്നത്.

ഇത് എങ്ങനെയാണ് പ്രവർത്തിക്കുന്നത് എന്ന് നോക്കാം:

  • ഇത് ഒരു Mixture-of-Experts (MoE) ആർക്കിടെക്ചർ ഉപയോഗിക്കുന്നു.
  • ഓരോ ടോക്കണിനും വേണ്ടി, 29 എക്സ്പെർട്ടുകളിൽ നിന്ന് റൂട്ടർ ഒരു എക്സ്പെർട്ടിനെ തിരഞ്ഞെടുക്കുന്നു.
  • ബാക്കി 28 എക്സ്പെർട്ടുകളും സജീവമാകാതെ ഇരിക്കുന്നു.
  • ഇത് ഉയർന്ന അറിവ് നിലനിർത്തുന്നതോടൊപ്പം കമ്പ്യൂട്ട് പവർ ലാഭിക്കുകയും ചെയ്യുന്നു.
  • ചെറിയ മെമ്മറിയിൽ മോഡൽ ഉൾക്കൊള്ളുന്നതിനായി ഇത് ternary weights ഉപയോഗിക്കുന്നു.
  • മോഡൽ സെക്കൻഡിൽ ഏകദേശം 9 ടോക്കണുകൾ ഉൽപ്പാദിപ്പിക്കുന്നു.

ഇതിന്റെ ട്രെയിനിംഗ് പ്രക്രിയയും ശ്രദ്ധേയമാണ്. ഡെവലപ്പർ ഒരു RTX 5060 Ti കൺസ്യൂമർ ഗ്രാഫിക്സ് കാർഡ് മാത്രമാണ് ഉപയോഗിച്ചത്. ഇവിടെ വലിയ ലാബുകളോ വൻ ബജറ്റോ ഇല്ല. ഒരു മിഡ്-റേഞ്ച് GPU-വും ക്ഷമയുമുള്ള ഒരാൾ മാത്രം.

നിങ്ങൾ അറിഞ്ഞിരിക്കേണ്ട ഒരു കാര്യമുണ്ട്. ഈ മോഡൽ ഇതുവരെ പൂർണ്ണമായും സ്വയംഭരണാധികാരമുള്ളതല്ല (fully autonomous). സ്റ്റാർട്ടപ്പ് സമയത്ത് USB വഴി ബോർഡിലേക്ക് വേയിറ്റുകൾ (weights) പമ്പ് ചെയ്യേണ്ടതുണ്ട്. ഒരു SD കാർഡിൽ നിന്ന് ലോഡ് ചെയ്യുന്ന ഒരു സ്റ്റാൻഡ്‌ലോൺ ഉപകരണം ആയി ഇത് ഇതുവരെ മാറിയിട്ടില്ല.

ഇതൊരു ക്ലൗഡ് ഡെമോ അല്ല. കണക്കുകൂട്ടലുകൾ ചിപ്പിൽ പ്രാദേശികമായി (locally) നടക്കുന്നു. ഡാറ്റ ഒരു സെർവറിലേക്ക് മാത്രം സ്ട്രീം ചെയ്യുന്ന പ്രോജക്റ്റുകളെ അപേക്ഷിച്ച് ഇതൊരു വലിയ മുന്നേറ്റമാണ്.

എന്തുകൊണ്ടാണ് ഇത് പ്രധാനമാകുന്നത്?

ചെറിയ മോഡലുകൾ സാധാരണയായി ഒരു പരിധിയാൽ തടയപ്പെടുന്നു. അവ ആകർഷകമായിരിക്കാം, പക്ഷേ നിർദ്ദേശങ്ങൾ പാലിക്കാൻ അവയ്ക്ക് കഴിയില്ല. p-for-llm ആ പരിധി മറികടക്കാൻ ശ്രമിക്കുന്നു. ഇത് ChatML പ്രോംപ്റ്റുകളെ പിന്തുണയ്ക്കുന്നു കൂടാതെ ടൂൾ കോളിംഗിന്റെ (tool calling) ആദ്യകാല സൂചനകളും കാണിക്കുന്നു.

യഥാർത്ഥ പുരോഗതി പലപ്പോഴും നിശബ്ദമായാണ് സംഭവിക്കുന്നത് എന്ന് ഈ പ്രോജക്റ്റ് കാണിച്ചുതരുന്നു. വൈറൽ പ്രോജക്റ്റുകൾ വാർത്തകൾക്ക് പിന്നാലെ പോകുമ്പോൾ, ഗൗരവകരമായ നിർമ്മാതാക്കൾ അവരുടെ പരിമിതികളും കുറിപ്പുകളും പ്രസിദ്ധീകരിക്കുന്നു.

ഈ കണക്കുകൾ പരിശോധിക്കുന്നതിനായി ഞാൻ ഈ ഹാർഡ്‌വെയർ നേരിട്ട് പരീക്ഷിക്കും.

സ്രോതസ്സ്: https://dev.to/aiexplore369zoho/the-180m-parameter-llm-running-on-a-10-microcontroller-and-almost-nobody-noticed-4d3n

ഓപ്ഷണൽ ലേണിംഗ് കമ്മ്യൂണിറ്റി: https://t.me/GyaanSetuAi