Pasukan yang membina perkhidmatan inferens gred pengeluaran telah menjalankan enam model bahasa pada DigitalOcean Inference selama 48 jam. Model "tiny" berharga $0.20 sebulan telah mengatasi pilihan yang lebih mahal. Ia kekal dalam had memori 8 GB droplet mereka dan mengelakkan kerosakan (crash) yang menjejaskan varian 70 B, sekali gus memberikan kependaman (latency) dan ketepatan yang boleh digunakan pada sebahagian kecil kos sahaja.

Mengapa Ujian Ini Penting

Perusahaan yang mendedahkan model bahasa besar (LLM) sebagai API sering menganggap bahawa model yang lebih besar dan lebih mahal menjamin pengalaman terbaik. Hakikatnya, persekitaran pengeluaran perlu mengimbangi memori, konkurensi, dan jaminan masa aktif (uptime). Model yang kelihatan hebat di atas kertas boleh menjadi liabiliti apabila ia mencetuskan penamatan keluar-memori (OOM) atau melambatkan perkhidmatan semasa permulaan sejuk (cold starts). Eksperimen praktikal ini menunjukkan bahawa model murah boleh menjadi satu-satunya pilihan yang munasabah pada perkakasan yang sederhana.

Enam Pencabar

Model Kos Bulanan Purata Kependaman Ketepatan* Penggunaan RAM / Kerosakan
mistral-tiny $0.20 120 ms 88 % 1.2 GB
mistral-small $0.80 180 ms 91 % 2.4 GB
mistral-medium $2.50 250 ms 93 % 4.1 GB
mistral-large $5.00 300 ms 94 % 6.8 GB
llama-70b $8.00 450 ms 95 % Kerosakan
mixtral-8x7b $10.00 500 ms 96 % Kerosakan

*Ketepatan mencerminkan prestasi model pada set penanda aras dalaman pasukan tersebut.

Model "tiny" menelan kos kurang daripada suku dolar sebulan dan kekal jauh di dalam had memori 8 GB. Dua model terbesar—llama-70b dan mixtral-8x7b—melebihi had tersebut dan berulang kali menyebabkan kerosakan pada hos, menjadikannya tidak boleh digunakan walaupun mempunyai skor ketepatan yang lebih tinggi.

Masalah Utama yang Menjejaskan Model Besar

  • Endpoint yang dikodkan secara keras (hard-coded) – Seni bina asal menghantar setiap permintaan ke satu model sahaja. Apabila model tersebut gagal, keseluruhan API akan terhenti.
  • Tiada had memori – Model yang lebih besar menggunakan semua RAM yang tersedia, mencetuskan penamatan OOM tanpa amaran.
  • Kependaman permulaan sejuk (cold-start latency) – Permintaan kali pertama pada model baharu mengambil masa beberapa saat, menjejaskan responsiviti yang dirasai.
  • Konkurensi tanpa had – Lonjakan permintaan serentak memenuhkan memori dan CPU, menyebabkan kegagalan sistemik.

Angka prestasi mentah tidak bermakna jika perkhidmatan tidak dapat kekal dalam talian di bawah bebanan dunia nyata.

Penyelesaian Penghalaan Dinamik (Dynamic Routing)

Jurutera menulis semula laluan permintaan berdasarkan tiga prinsip:

  1. Pemilihan model semasa masa larian (runtime) – Penghala memilih model bagi setiap permintaan dan bukannya menggunakan endpoint statik.
  2. Kesedaran perkakasan – Setiap permintaan menerima bajet memori; penghala hanya menghantar kepada model yang muat dalam baki RAM yang ada.
  3. Rantaian sandaran (fallback chains) – Jika model yang dipilih gagal atau mengalami masa tamat (timeout), penghala akan mencuba semula secara automatik dengan model terbaik seterusnya.

Seni bina yang telah disemak menambah empat perlindungan konkrit:

  • Konkurensi terhad – Semaphore mengehadkan inferens selari, menghalang penyusutan memori.
  • Masa tamat gagal-pantas (fail-fast timeouts) – Pemasa ketat bagi setiap permintaan membatalkan model yang perlahan sebelum ia menyekat keseluruhan proses.
  • Buffer memori – Sistem menyimpan 20% ruang tambahan (headroom) pada RAM droplet, menjamin ruang untuk beban OS dan lonjakan penggunaan.
  • Pemanasan awal (Pre-warming) – Permintaan dummy dihantar ke setiap model semasa permulaan, menghapuskan penalti permulaan sejuk yang awal.

Langkah-langkah ini mengubah saluran paip (pipeline) yang rapuh kepada perkhidmatan berdaya tahan yang mampu menampung trafik pada droplet 8 GB yang sederhana tanpa mengorbankan terlalu banyak ketepatan.

Apa yang Perlu Diperhatikan Seterusnya

  • Penskalaan perkakasan – Apabila penyedia awan menawarkan droplet memori yang lebih besar pada harga yang lebih rendah, titik pulang modal untuk model yang lebih besar mungkin berubah.
  • Pemampatan model – Kuantisasi atau penyulingan pengetahuan (knowledge distillation) boleh mengecilkan jejak RAM model berketepatan tinggi, membolehkannya berjalan pada mesin yang lebih kecil.
  • Penghalaan adaptif – Penghala masa hadapan mungkin belajar secara masa nyata model mana yang menawarkan imbangan terbaik untuk pertanyaan tertentu, seterusnya mengautomasikan keseimbangan ketepatan-kos.

Kesimpulannya mudah: dalam pengeluaran, model yang kekal berfungsi di bawah tekanan memberikan lebih nilai daripada model yang kelihatan terbaik di atas kertas. Pilih model berdasarkan kekangan penggunaan anda, bukan sekadar ketepatan utama.