Pemerintah federal jarang terburu-buru mengadopsi teknologi yang belum teruji. Departemen kesehatan masyarakat, khususnya, dapat menghabiskan waktu bertahun-tahun untuk memvalidasi sebuah alat sebelum alat tersebut menyentuh catatan pasien atau data wabah. Jadi, ketika lembaga kesehatan AS mengumumkan bahwa mereka akan menjalankan uji coba langsung dengan sistem AI generatif yang dibangun oleh OpenAI dan Anthropic, sinyalnya sangat jelas: model bahasa besar telah beralih dari eksperimen konsumen menjadi kandidat institusional yang serius.
Apa yang Sebenarnya Dilakukan PULSE
Upaya baru ini disebut Public Health Use Case and Learning Scaling Engine—disingkat PULSE. Ini adalah kerangka kerja pengujian, bukan peluncuran produk. Alih-alih memasukkan chatbot ke dalam sistem email departemen kesehatan dan berharap yang terbaik, PULSE memperlakukan AI generatif dengan cara yang sama seperti kesehatan masyarakat memperlakukan vaksin baru. Ini menciptakan kondisi terkendali di mana lembaga negara bagian, lokal, suku, dan teritorial dapat menguji alat-alat ini sambil mengawasi efek samping secara ketat.
Program ini menyatukan empat mitra yang berbeda. Coalition for Health AI (CHAI) menyediakan standar tata kelola dan keamanan khusus layanan kesehatan. OpenAI dan Anthropic menyumbangkan model bahasa mutakhir (frontier language models). Accenture menyediakan keahlian integrasi yang diperlukan untuk menghubungkan sistem ini ke infrastruktur pemerintah yang ada, yang sering kali berjalan di atas basis data berusia puluhan tahun dan aturan pengadaan yang ketat.
PULSE tidak bertanya apakah AI dapat menulis email atau merangkum transkrip rapat. PULSE bertanya apakah model-model ini dapat membantu secara andal dalam tiga tugas inti: surveilans epidemiologi, alokasi sumber daya, dan komunikasi kesehatan masyarakat. Masing-masing terdengar abstrak, tetapi secara bersama-sama mereka menggambarkan beban harian dalam menjalankan departemen kesehatan. Surveilans berarti menyaring laporan laboratorium, penerimaan rumah sakit, dan data ketidakhadiran sekolah untuk mendeteksi wabah sebelum meluas. Alokasi sumber daya berarti memutuskan, secara real-time, ke mana harus mengirim dosis vaksin atau pengobatan antivirus yang terbatas selama musim flu yang parah. Komunikasi kesehatan masyarakat berarti menerjemahkan panduan federal yang kompleks ke dalam bahasa yang sederhana untuk puluhan komunitas yang berbeda, sering kali saat waktu terus berjalan dalam investigasi penyakit bawaan makanan. Jika AI dapat membantu salah satu dari hal ini tanpa menambah pekerjaan atau menimbulkan kesalahan, peningkatan efisiensinya bisa sangat besar.
Mengapa Sepuluh Yurisdiksi Mengubah Segalanya
Program ini akan menjalankan uji coba di sepuluh yurisdiksi yang diambil dari negara bagian, daerah setempat, bangsa suku, dan wilayah AS. Penyebaran yang disengaja itu adalah inti dari program ini. Departemen kesehatan negara bagian di wilayah padat penduduk, yang didukung oleh ratusan epidemiolog dan menjalankan jaringan serat optik, menghadapi kendala yang sepenuhnya berbeda dibandingkan dengan lembaga teritorial yang melacak demam berdarah dengan kru minimal dan konektivitas yang terputus-putus.
Inklusi suku memiliki bobot tersendiri. Lembaga kesehatan suku secara historis menghadapi kekurangan pendanaan kronis dan masalah kedaulatan data yang akut. Dengan menyertakan yurisdiksi suku, PULSE mengakui bahwa alat AI apa pun yang mengklaim kegunaan nasional harus dapat menangani populasi khusus, menghormati struktur tata kelola yang berbeda, dan berfungsi dalam pengaturan dengan beban kesehatan lingkungan dan sosial yang unik. Jika sebuah model tidak dapat bekerja dalam kondisi ini, model tersebut tidak layak mendapatkan dukungan federal.
Lembaga teritorial menambahkan uji stres (stress test) lain yang diperlukan. Pejabat kesehatan masyarakat di wilayah AS mengelola pola penyakit dan rantai pasokan yang sangat berbeda dari daratan utama. Asisten AI yang mengasumsikan konektivitas internet yang sempurna, atau yang mengandalkan kebiasaan pengodean ICD-10 yang umum di rumah sakit perkotaan besar, akan gagal saat badai menghancurkan infrastruktur. Desain sepuluh yurisdiksi memaksa program ini untuk mengumpulkan bukti nyata tentang apakah model-model ini dapat beradaptasi dengan lingkungan yang tidak sempurna atau justru gagal total.
Dari Chatbot ke Infrastruktur Penting (Mission-Critical)
Selama dua tahun terakhir, percakapan publik seputar model bahasa besar berpusat pada jalan pintas pengodean, salinan pemasaran, dan pembuatan gambar. PULSE secara sengaja mengalihkan fokus ke infrastruktur penting (mission-critical). Ketika departemen kesehatan menggunakan model AI untuk menganalisis laporan penyakit menular, sebuah kesalahan bukanlah sekadar halusinasi yang unik. Itu adalah potensi kegagalan keselamatan publik.
Realitas tersebut menjadikan uji coba ini sebagai pencetak preseden bagi tiga masalah teknis yang terus berlanjut: akurasi, mitigasi halusinasi, dan privasi data. Dalam konteks ini, halusinasi dapat berarti model yang mengarang interaksi obat, menciptakan klaster wabah yang tidak ada, atau salah menyatakan regulasi pelaporan. PULSE dirancang untuk mengukur seberapa sering kesalahan ini terjadi dan apakah guardrail teknis dapat menangkapnya sebelum sampai ke pengambil keputusan.
Privasi memiliki bobot yang sama pentingnya. Lembaga kesehatan masyarakat menangani informasi kesehatan yang dilindungi yang diatur oleh HIPAA dan undang-undang tingkat negara bagian tambahan. Sistem AI apa pun yang menyentuh data ini harus menunjukkan dengan tepat apa yang disimpannya, ke mana aliran data pelatihan, dan siapa yang nantinya dapat mengakses output tersebut. Keterlibatan CHAI menandakan bahwa uji coba ini tidak hanya akan menguji kecerdasan murni dari model OpenAI dan Anthropic, tetapi juga kemampuan mereka untuk beroperasi dalam kerangka kerja tata kelola institusional yang ketat dan meninggalkan jejak audit yang bersih.
Cetak Biru bagi Pengembang dan Regulator
Bagi pengembang dan pendiri startup yang membangun AI kesehatan, PULSE menawarkan sesuatu yang sangat dibutuhkan pasar: standar yang terlihat dan didukung oleh pemerintah. Perusahaan rintisan sering kali kesulitan untuk masuk ke sistem kesehatan masyarakat karena petugas pengadaan tidak memiliki daftar periksa umum untuk mengevaluasi keamanan AI. Jika PULSE menghasilkan kriteria transparan untuk mengukur bias, akurasi, dan privasi dalam pengaturan kesehatan administratif, kriteria tersebut dapat dengan cepat menjadi tolok ukur standar bagi vendor di seluruh negeri.
Program ini juga mengisyaratkan bagaimana large language models mungkin perlu berevolusi untuk melayani pemerintah. Chatbot konsumen dioptimalkan untuk respons yang lancar dan membantu. Pekerjaan kesehatan pemerintah membutuhkan sitasi, ketidakpastian yang terkalibrasi, dan memori institusional. Sebuah model yang memberi saran kepada perawat epidemiolog harus bersedia mengatakan "bukti tidak jelas" daripada mengarang jawaban yang meyakinkan. Mengamati bagaimana OpenAI dan Anthropic menyesuaikan strategi prompting dan sistem retrieval mereka untuk lingkungan ini akan mengungkapkan apakah teknologi yang mendasarinya benar-benar dapat memenuhi ekspektasi birokrasi.
Jika uji coba ini berhasil, wawasan teknis dan tata kelolanya dapat meluas jauh melampaui perbatasan AS. Departemen kesehatan masyarakat di seluruh dunia menghadapi beban data dan kekurangan staf yang serupa. Kerangka kerja yang tervalidasi untuk menerapkan LLM dalam epidemiologi dan komunikasi kesehatan dapat menjadi titik referensi internasional, seperti halnya standar FHIR untuk rekam medis elektronik.
Kesimpulan Utama
PULSE bukanlah janji bahwa kecerdasan buatan akan memperbaiki kesehatan masyarakat. Ini adalah pengakuan bahwa cara-cara lama dalam memproses informasi kesehatan terlalu lambat dan terlalu memakan banyak tenaga, dan bahwa penggantinya harus dibuktikan di bawah kondisi yang realistis dan bervariasi sebelum diterapkan secara nasional. Dengan menggabungkan kerangka kerja keamanan CHAI dengan model frontier dari OpenAI dan Anthropic, serta memaksa alat-alat tersebut untuk membuktikan diri mereka di sepuluh yurisdiksi yang benar-benar berbeda, program ini memperlakukan AI generatif dengan skeptisisme yang layak diterimanya sambil memberikannya medan uji coba yang dibutuhkannya. Bagi pejabat kesehatan, pengembang, dan komunitas yang mereka layani, keseimbangan itulah yang merupakan gambaran dari adopsi yang bertanggung jawab.
