$10 ના ચિપ પર 180M-પેરામીટર ધરાવતું LLM
p-for-llm નામનો એક નવો પ્રોજેક્ટ કંઈક અદભૂત કરી રહ્યો છે. તે ESP32-P4 માઇક્રોકન્ટ્રોલર પર 180.9 મિલિયન પેરામીટર ધરાવતું મોડેલ ચલાવે છે. આ ચિપની કિંમત છ થી દસ ડોલરની વચ્ચે છે.
નાના ચિપ્સ પરના મોટાભાગના વાયરલ AI પ્રોજેક્ટ્સ સરળ કાર્યો પર ધ્યાન કેન્દ્રિત કરે છે. તેઓ ટૂંકી વાર્તાઓ લખતા મોડેલનું પ્રદર્શન કરે છે. તે મોડેલ્સમાં ઘણીવાર ખૂબ જ ઓછા પેરામીટર્સ હોય છે અને તેની કોઈ વાસ્તવિક ઉપયોગિતા હોતી નથી.
p-for-llm અલગ છે. તેનો ઉદ્દેશ્ય ઉપયોગીતા લાવવાનો છે.
તે કેવી રીતે કામ કરે છે તે અહીં છે:
- તે Mixture-of-Experts (MoE) આર્કિટેક્ચરનો ઉપયોગ કરે છે.
- દરેક ટોકન માટે, રાઉટર 29 માંથી એક એક્સપર્ટ પસંદ કરે છે.
- બાકીના 28 એક્સપર્ટ્સ નિષ્ક્રિય રહે છે.
- આ ઊંચું જ્ઞાન જાળવી રાખીને કમ્પ્યુટિંગ પાવર બચાવે છે.
- તે મોડેલને નાની મેમરીમાં સમાવવા માટે ternary weights નો ઉપયોગ કરે છે.
- મોડેલ પ્રતિ સેકન્ડ લગભગ 9 ટોકન જનરેટ કરે છે.
તાલીમ પ્રક્રિયા પણ નોંધપાત્ર છે. ડેવલપરે માત્ર એક RTX 5060 Ti કન્ઝ્યુમર ગ્રાફિક્સ કાર્ડનો ઉપયોગ કર્યો છે. અહીં કોઈ વિશાળ લેબ કે મોટું બજેટ નથી. માત્ર મધ્યમ શ્રેણીના GPU અને ધીરજ ધરાવતો એક વ્યક્તિ છે.
તમારે એક બાબત જાણવી જોઈએ. આ મોડેલ હજુ સંપૂર્ણપણે સ્વાયત્ત (autonomous) નથી. તમારે સ્ટાર્ટઅપ વખતે USB દ્વારા બોર્ડમાં weights પુશ કરવા પડશે. તે હજુ એવું સ્ટેન્ડઅલોન ઉપકરણ નથી જે SD કાર્ડ પરથી લોડ થાય.
તે હજુ ક્લાઉડ ડેમો નથી. ગણતરીઓ ચિપ પર સ્થાનિક રીતે (locally) થાય છે. આ એવા પ્રોજેક્ટ્સ કરતા એક મોટું ડગલું છે જે માત્ર સર્વર પર ડેટા સ્ટ્રીમ કરે છે.
આ શા માટે મહત્વનું છે?
નાના મોડેલ્સ સામાન્ય રીતે એક મર્યાદા પર આવીને અટકી જાય છે. તેઓ આકર્ષક હોઈ શકે છે પરંતુ તે સૂચનાઓનું પાલન કરી શકતા નથી. p-for-llm તે મર્યાદા ઓળંગવાનો પ્રયાસ કરે છે. તે ChatML પ્રોમ્પ્ટ્સને સપોર્ટ કરે છે અને tool calling ના પ્રારંભિક સંકેતો દર્શાવે છે.
આ પ્રોજેક્ટ દર્શાવે છે કે વાસ્તવિક પ્રગતિ ઘણીવાર શાંતિથી થાય છે. જ્યારે વાયરલ પ્રોજેક્ટ્સ હેડલાઇન્સ પાછળ દોડે છે, ત્યારે ગંભીર બિલ્ડર્સ તેમની મર્યાદાઓ અને વિગતો પ્રકાશિત કરે છે.
આ આંકડાઓની ચકાસણી કરવા માટે હું વ્યક્તિગત રીતે આ હાર્ડવેરનું પરીક્ષણ કરીશ.
વૈકલ્પિક લર્નિંગ કોમ્યુનિટી: https://t.me/GyaanSetuAi
