SkewAdam memangkas memori pelatihan Mixture-of-Experts hingga lebih dari 60% dan memberikan lonjakan akurasi yang nyata, memungkinkan pengembang untuk memuat model MoE dengan 6,78 miliar parameter pada satu GPU 40 GB.

Mengapa pelatihan MoE terbentur batasan memori

Arsitektur Mixture-of-Experts mengarahkan setiap input melalui subset kecil sub-jaringan "expert" sambil tetap mempertahankan backbone yang padat (dense). Keuntungannya adalah model yang dapat diskalakan hingga miliaran parameter tanpa peningkatan komputasi yang proporsional. Dalam praktiknya, optimizer—khususnya varian AdamW yang paling banyak digunakan tim—memakan sebagian besar RAM GPU. Untuk model dengan 6,78 miliar parameter, tensor momentum dan varians optimizer saja membutuhkan sekitar 50 GB. Tambahkan aktivasi dan bobot model, maka penggunaan memori puncak akan mencapai 81,4 GB, yang memaksa penggunaan setup multi-GPU atau jadwal pelatihan yang lebih lambat.

Apa yang membedakan SkewAdam

SkewAdam tidak menciptakan aturan pembelajaran baru. Ia mengatur ulang di mana momen-momen Adam disimpan:

  • Backbone yang padat menyimpan momentum presisi penuh, menjaga pembaruan halus yang dibutuhkan lapisan padat.
  • Bank expert menyimpan aproksimasi terfaktorisasi dari varians, sehingga memangkas data yang disimpan untuk setiap expert.
  • Router, yang memutuskan expert mana yang akan diaktifkan, mempertahankan estimasi momen kedua yang tepat.

Dengan memperlakukan ketiga komponen ini sebagai "tier" yang terpisah, optimizer ini membuang presisi yang redundan di bagian yang kurang penting dan mempertahankannya di bagian yang paling krusial.

Dampak yang terukur

Menjalankan model MoE 6,78 miliar parameter yang sama dengan SkewAdam menghasilkan:

  • Memori GPU puncak: 31,3 GB (turun dari 81,4 GB)
  • Jejak status optimizer: 1,29 GB (turun dari 50 GB)

Status yang telah dikurangi tersebut dapat masuk dengan nyaman ke dalam satu akselerator 40 GB.

Peningkatan akurasi, bukan sekadar penghematan

Pemangkasan memori sering kali merusak kualitas model, tetapi SkewAdam meningkatkan perplexity—metrik standar model bahasa—dari 126,8 (AdamW) menjadi 108,4. Ia juga mengungguli Muon (120,2) dan Lion (393,7) pada tugas yang sama. Penulis menyatakan bahwa peningkatan ini berasal dari pelestarian momentum di ketiga tier; metode yang membuang momentum sepenuhnya, seperti Adafactor, tertinggal di belakang.

Pertanyaan terbuka

Hasil SkewAdam didemonstrasikan pada model dengan 6,78 miliar parameter. Masih belum jelas apakah rasio status-memori yang sama berlaku untuk model yang ukurannya satu orde besaran lebih besar atau untuk tugas-tugas di luar pemodelan bahasa.

Hal yang perlu diperhatikan

  • Benchmark pada konfigurasi MoE yang lebih besar (puluhan miliar parameter).
  • Adopsi oleh framework sumber terbuka (open-source) dan penyertaan dalam skrip pelatihan populer.
  • Umpan balik komunitas mengenai trade-off tersembunyi, seperti kecepatan konvergensi atau stabilitas di bawah jadwal learning-rate yang berbeda.

Sumber: postingan pengembang yang merinci desain optimizer dan hasil empirisnya.