Model yang paling banyak dimuat turun di Hugging Face bukanlah sebuah bot sembang sekalipun – ia adalah model sentence-embedding dengan 22 juta parameter dari tahun 2021 yang telah dimuat turun sebanyak 256 juta kali. Angka-angka tersebut menceritakan satu kisah yang mudah: kebanyakan beban kerja AI dunia nyata berjalan pada model kecil yang mesra CPU, bukannya model bahasa besar (LLM) yang sering menjadi tajuk utama berita.

Tiga model yang mendominasi pengeluaran (production)

all-MiniLM-L6-v2 – 256 juta muat turun

Model dengan 22 juta parameter ini menukarkan sepotong teks kepada vektor padat (dense vector). Vektor tersebut boleh dibandingkan dengan vektor lain untuk mengukur keserupaan, yang memacu carian semantik, enjin cadangan, dan saluran paip (pipeline) pengesanan pendua.

Mengapa ia ada di mana-mana:

  • Berjalan pada CPU – tidak memerlukan GPU yang mahal.
  • Pantas untuk pemprosesan berkelompok (batch processing) – boleh melakukan embedding pada berjuta-juta ayat dalam beberapa minit.
  • Percuma untuk dihoskan secara tempatan – menghapuskan yuran perkhidmatan awan dan kebimbangan privasi data.

cross-encoder/ms-marco-MiniLM-L6-v2 – 87 juta muat turun

Model ini bertindak sebagai penyusun semula (reranker). Ia mengambil satu pertanyaan (query) dan satu dokumen calon secara bersama dan mengembalikan skor relevansi. Dalam timbunan (stack) RAG yang tipikal, aliran kerjanya adalah seperti berikut:

  1. Peringkat pantas – MiniLM menarik 50 calon teratas.
  2. Peringkat tepat – penyusunan semula skor (rescoring) oleh cross-encoder terhadap 50 item tersebut meningkatkan kualiti jawapan.

Jumlah "suka" yang rendah pada halaman model menunjukkan kebanyakan pengguna memanggilnya secara pengaturcaraan dan bukannya melayari hab tersebut, namun jumlah muat turun mengesahkan ia sebagai alat de-facto untuk meningkatkan ketepatan dalam saluran paip pengeluaran.

amazon/chronos-2 – 35 juta muat turun

Chronos-2 melayan data siri masa (time-series) seperti teks, membolehkan satu model asas meramalkan jualan, beban pelayan, atau sebarang isyarat numerik tanpa latihan khusus tugasan. Jumlah muat turun dalam puluhan juta bagi peramal khusus menandakan minat yang kuat terhadap penyelesaian "latih sekali, jalankan di mana sahaja", terutamanya dalam organisasi yang biasanya perlu menyelenggara pelbagai model tersuai (bespoke) untuk setiap metrik.

Apa maksud angka-angka ini bagi pasukan AI

Carta muat turun mendedahkan jurang antara publisiti media dan realiti operasi. LLM mendominasi siaran akhbar, tetapi "kuda kerja" yang sebenarnya memastikan perkhidmatan kekal dalam talian adalah:

  • Model embedding yang menukarkan teks mentah kepada vektor yang boleh dicari.
  • Cross-encoders yang memperhalusi vektor tersebut kepada kedudukan yang tepat.
  • Peramal asas (foundation forecasters) yang menggunakan satu model merentasi banyak siri numerik.

Kesimpulannya jelas: jika anda membina AI yang perlu dijalankan pada skala besar, lihatlah melampaui publisiti. Model-model yang mendominasi carta muat turun Hugging Face memastikan sistem pengeluaran terus berjalan lancar, dan ia akan terus menentukan ke mana aliran perbelanjaan AI yang sebenar.