Kotak Pandora Penghalaan AI
DeepMind mendedahkan “Pandora’s Router,” sebuah rangka kerja yang menganggap pemilihan model sebagai masalah Kotak Pandora yang peka kos. Dengan hanya mengenakan bayaran untuk maklumat yang benar-benar menambah baik hasil, sistem ini mengurangkan perbelanjaan inferens sambil mengekalkan keputusan yang setanding dengan carian menyeluruh.
Mengapa pemilihan model tidak percuma
Saluran pengeluaran sering menganggap bahawa langkah memilih model tidak menelan sebarang kos. Hakikatnya, menganggarkan kesesuaian sesuatu model menggunakan sumber pengkomputeran, memori, dan kadangkala panggilan data luaran. Anggaran pantas yang tidak tepat adalah murah tetapi boleh mengelirukan; anggaran yang tepat biasanya bermaksud menjalankan model yang lebih kecil atau mengambil konteks tambahan, yang akhirnya menambah kos.
Kertas kerja DeepMind merangka semula dilema ini. Setiap model calon menyembunyikan satu “nilai” – jangkaan prestasinya terhadap pertanyaan yang masuk. Rangka kerja ini membolehkan pengawal membayar yuran untuk melihat nilai tersebut dan berhenti membayar sebaik sahaja maklumat lanjut tidak lagi mewajarkan kosnya.
Dua komponen penyelesaian
Pandora’s Router – sebuah enjin berpusat yang, bagi setiap permintaan, memutuskan sama ada ingin membayar untuk anggaran nilai model yang lebih tepat. Ia menetapkan “harga rizab”: satu ambang di mana keuntungan jangkaan daripada anggaran yang lebih baik tidak mengatasi yuran tersebut. Apabila peningkatan yang diunjurkan melebihi harga rizab, enjin tersebut akan membeli maklumat tersebut; jika tidak, ia akan meneruskan dengan tekaan terbaik yang sedia ada.
Pandora’s Bidder – rakan setara teragih untuk pasaran model. Penyedia bebas memutuskan sama ada ingin menggunakan sumber pengkomputeran untuk menajamkan anggaran nilai mereka sendiri sebelum mengemukakan bidaan. Harga rizab mereka sendiri memaksa perbelanjaan hanya apabila anggaran yang diperhalusi itu berkemungkinan besar untuk menang.
Kedua-dua bahagian berkongsi prinsip yang sama: berbelanja untuk maklumat hanya apabila pulangan jangkaan melebihi kosnya.
Keputusan merentasi tiga domain
Penulis menguji pendekatan ini pada tiga beban kerja:
- Penaakulan matematik – memilih antara penyelesai dengan ketepatan yang berbeza.
- Penjanaan dipertingkat pengambilan (RAG) – memilih antara strategi carian pangkalan pengetahuan yang berbeza.
- Model embedding berskala besar – memilih pengekod terbaik untuk carian keserupaan.
Pandora’s Router mengatasi peraturan penghalaan statik dan heuristik tamak dalam setiap kes. Dalam senario yang paling mencabar, ia menyamai kualiti imbasan brute-force terhadap semua model sambil mengelakkan sebahagian besar kos pemeriksaan. Penulis melaporkan bahawa “sebahagian besar kos pemeriksaan” telah dijimatkan, yang membayangkan pengurangan drastik dalam perbelanjaan pengkomputeran.
Apa maksudnya untuk kejuruteraan AI
- Jangan abaikan overhead penghalaan. Memutuskan model mana yang akan digunakan membawa kos yang boleh diukur.
- Perkenalkan harga rizab. Tetapkan had yang jelas untuk menentukan bila maklumat tambahan berbaloi dengan yurannya.
- Gunakan penghalaan peka kos. Lapisan keputusan yang mengimbangi keuntungan jangkaan berbanding perbelanjaan akan memastikan bajet terkawal apabila katalog model berkembang.
Sudut pandangan berbeza: kerumitan tambahan
Penambahan lapisan bidaan atau penghalaan membawa kesan timbal balik. Pasukan mesti menyelenggara logik yang mengira harga rizab, memantau struktur yuran, dan memastikan laluan kod tambahan tidak menjadi penghalang (bottleneck). Untuk penggunaan kecil dengan hanya beberapa model, Pandora’s Router mungkin menelan kos yang lebih tinggi daripada yang dijimatkan. Rangka kerja ini juga mengandaikan bahawa kos untuk anggaran yang lebih baik adalah diketahui dan stabil—satu andaian yang boleh terjejas akibat harga awan yang tidak menentu atau gangguan instans spot.
Rumusan
Anggap pemilihan model sebagai keputusan ekonomi, bukan langkah penghalaan percuma. Pandora’s Router menunjukkan bahawa pendekatan yang berdisiplin dan peka kos dapat mengurangkan pengkomputeran yang tidak perlu tanpa mengorbankan kualiti output, sekali gus memastikan sistem AI boleh diskalakan dan mampan dari segi kewangan.
