SkewAdam vermindert het geheugengebruik voor Mixture-of-Experts-training met meer dan 60% en levert een merkbare sprong in nauwkeurigheid, waardoor ontwikkelaars een MoE-model met 6,78 miljard parameters op een enkele 40 GB GPU kunnen draaien.
Waarom MoE-training tegen een geheugenmuur aanloopt
Mixture-of-Experts-architecturen sturen elke input door een kleine subset van "expert"-subnetwerken, terwijl een dichte backbone behouden blijft. Het voordeel is een model dat kan schalen naar miljarden parameters zonder een evenredige stijging in rekenkracht. In de praktijk verbruikt de optimizer — specifiek de AdamW-variant die de meeste teams gebruiken — het grootste deel van het GPU-RAM. Voor een model met 6,78 miljard parameters vereisen de momentum- en variantietensoren van de optimizer alleen al ongeveer 50 GB. Tel daar de activaties en modelgewichten bij op, en het piekgeheugen loopt op tot 81,4 GB, wat multi-GPU-opstellingen of tragere trainingsschema's noodzakelijk maakt.
Wat SkewAdam anders doet
SkewAdam verzint geen nieuwe leerregel. Het herschikt de plek waar de momenten van Adam worden opgeslagen:
- De dichte backbone behoudt momentum met volledige precisie, waardoor de vloeiende updates die dichte lagen nodig hebben, behouden blijven.
- De expert-bank slaat een gefactoriseerde benadering van de variantie op, wat de hoeveelheid gegevens die voor elke expert wordt bewaard, vermindert.
- De router, die bepaalt welke experts geactiveerd moeten worden, behoudt een exacte schatting van het tweede moment.
Door deze drie componenten als afzonderlijke "tiers" te behandelen, verlaagt de optimizer de overbodige precisie op plekken waar het er minder toe doet, en behoudt het deze waar het het belangrijkst is.
Meetbare impact
Het draaien van hetzelfde 6,78 miljard-parameter MoE-model met SkewAdam levert het volgende op:
- Piek GPU-geheugen: 31,3 GB (verlaagd van 81,4 GB)
- Voetafdruk van de optimizer-state: 1,29 GB (verlaagd van 50 GB)
De verlaagde state past gemakkelijk in een enkele 40 GB accelerator.
Winst in nauwkeurigheid, niet alleen besparingen
Geheugenbesparingen gaan vaak ten koste van de modelkwaliteit, maar SkewAdam verbetert de perplexiteit — een standaard metriek voor taalmodellen — van 126,8 (AdamW) naar 108,4. Het presteert ook beter dan Muon (120,2) en Lion (393,7) op dezelfde taak. De auteurs stellen dat de verbetering voortkomt uit het behouden van momentum over alle drie de tiers; methoden die momentum volledig laten vallen, zoals Adafactor, blijven achter.
Openstaande vragen
De resultaten van SkewAdam zijn aangetoond op een model met 6,78 miljard parameters. Het blijft onduidelijk of dezelfde verhoudingen voor de geheugen-state standhouden voor modellen die een orde van grootte groter zijn, of voor taken buiten taalmodellering.
Om in de gaten te houden
- Benchmarks op grotere MoE-configuraties (tientallen miljarden parameters).
- Adoptie door open-source frameworks en opname in populaire trainingsscripts.
- Feedback van de community over verborgen afwegingen, zoals convergentiesnelheid of stabiliteit onder verschillende learning-rate schedules.
Bron: een bericht van de ontwikkelaar met details over het ontwerp van de optimizer en de empirische resultaten.
