دولت فدرال بهندرت با فناوریهای آزمایشنشده عجله میکند. بخشهای سلامت عمومی، بهویژه، ممکن است سالها صرف تأیید یک ابزار کنند، پیش از آنکه آن ابزار حتی با سوابق بیماران یا دادههای شیوع بیماری در تماس قرار گیرد. بنابراین، وقتی آژانسهای بهداشتی ایالات متحده اعلام کردند که آزمایشهای زنده با سیستمهای هوش مصنوعی مولد ساخته شده توسط OpenAI و Anthropic را اجرا خواهند کرد، پیام واضح بود: مدلهای زبانی بزرگ از مرحله آزمایشهای مصرفکننده فراتر رفته و به عنوان کاندیداهای جدی برای نهادهای رسمی مطرح شدهاند.
PULSE در واقع چه کاری انجام میدهد
این تلاش جدید، Public Health Use Case and Learning Scaling Engine نام دارد که به اختصار PULSE نامیده میشود. این یک چارچوب آزمایشی است، نه عرضه یک محصول. PULSE به جای وارد کردن چتباتها به سیستمهای ایمیل بخشهای سلامت و امید به بهترین نتیجه، با هوش مصنوعی مولد همانگونه برخورد میکند که سلامت عمومی با یک واکسن جدید برخورد میکند. این برنامه شرایط کنترلشدهای ایجاد میکند که در آن آژانسهای ایالتی، محلی، قبیلهای و قلمرویی میتوانند این ابزارها را آزمایش کنند و در عین حال، بهطور دقیق مراقب عوارض جانبی باشند.
این برنامه چهار شریک متمایز را گرد هم میآورد. Coalition for Health AI (CHAI) استانداردهای حکمرانی و ایمنی مخصوص مراقبتهای بهداشتی را تأمین میکند. OpenAI و Anthropic مدلهای زبانی پیشرو را ارائه میدهند. Accenture تخصص لازم برای یکپارچهسازی جهت اتصال این سیستمها به زیرساختهای موجود دولتی را فراهم میکند؛ زیرساختهایی که اغلب بر پایهی پایگاههای داده دههها قدیمی و قوانین سختگیرانه تدارکات اداره میشوند.
PULSE نمیپرسد که آیا هوش مصنوعی میتواند ایمیل بنویسد یا متن یک جلسه را خلاصه کند؛ بلکه میپرسد آیا این مدلها میتوانند بهطور قابلاعتماد در سه وظیفه اصلی کمک کنند: نظارت اپیدمیولوژیک، تخصیص منابع و ارتباطات سلامت عمومی. هر یک از اینها انتزاعی به نظر میرسند، اما در کنار هم، بار روزانه اداره یک بخش سلامت را توصیف میکنند. نظارت به معنای بررسی گزارشهای آزمایشگاهی، پذیرشهای بیمارستانی و دادههای غیبت مدارس برای شناسایی یک شیوع، پیش از آنکه گسترش یابد، است. تخصیص منابع به معنای تصمیمگیری در لحظه برای اینکه در طول یک فصل شدید آنفولانزا، دوزهای محدود واکسن یا درمانهای ضد ویروسی به کجا ارسال شود، میباشد. ارتباطات سلامت عمومی به معنای ترجمه دستورالعملهای پیچیده فدرال به زبان ساده برای دهها جامعه مختلف است، آن هم اغلب در حالی که زمان برای تحقیقات مربوط به بیماریهای ناشی از غذا رو به اتمام است. اگر هوش مصنوعی بتواند در هر یک از این موارد بدون ایجاد کار اضافی یا بروز خطا کمک کند، افزایش بهرهوری میتواند قابل توجه باشد.
چرا ده حوزه تحت پوشش، همه چیز را تغییر میدهد
این برنامه آزمایشها را در ده حوزه تحت پوشش شامل ایالتها، مناطق محلی، ملتهای قبیلهای و قلمروهای ایالات متحده اجرا خواهد کرد. این پراکندگیِ عمدی، هدف اصلی است. یک بخش سلامت ایالتی در یک منطقه پرجمعیت، با صدها اپیدمیولوژیست و شبکههای فیبر نوری، با محدودیتهای کاملاً متفاوتی نسبت به یک آژانس قلمرویی که با خدمه بسیار کم و اتصال اینترنت متناوب، بیماری دنگی را ردیابی میکند، روبروست.
شمول ملتهای قبیلهای اهمیت ویژهای دارد. آژانسهای سلامت قبیلهای در طول تاریخ با کمبود بودجه مزمن و نگرانیهای شدید در مورد حاکمیت دادهها روبرو بودهاند. با گنجاندن حوزههای تحت پوشش قبیلهای، PULSE اذعان میکند که هر ابزار هوش مصنوعی که ادعای کاربرد ملی دارد، باید بتواند با جمعیتهای خاص برخورد کند، به ساختارهای حکمرانی متمایز احترام بگذارد و در محیطهایی با بارهای سلامت محیطی و اجتماعی منحصربهفرد عمل کند. اگر مدلی نتواند در این شرایط عمل کند، شایسته تأیید فدرال نیست.
آژانسهای قلمرویی، یک آزمون استرس ضروری دیگر را اضافه میکنند. مقامات سلامت عمومی در قلمروهای ایالات متحده، الگوهای بیماری و زنجیرههای تأمین را مدیریت میکنند که تفاوت فاحشی با سرزمین اصلی دارد. یک دستیار هوش مصنوعی که فرض را بر اتصال اینترنت بینقص میگذارد، یا بر عادتهای کدگذاری ICD-10 که در بیمارستانهای بزرگ شهری رایج است تکیه میکند، وقتی طوفانی زیرساختها را از کار بیندازد، به سادگی شکست خواهد خورد. طراحیِ ده-حوزهای، برنامه را مجبور میکند تا شواهد محکمی درباره اینکه آیا این مدلها با محیطهای ناقص سازگار میشوند یا از هم میپاشند، جمعآوری کند.
از چتباتها تا زیرساختهای حیاتی
در دو سال گذشته، گفتمان عمومی پیرامون مدلهای زبانی بزرگ بر میانبرهای کدنویسی، متنهای بازاریابی و تولید تصویر متمرکز بوده است. PULSE آگاهانه تمرکز را به سمت زیرساختهای حیاتی تغییر میدهد. وقتی یک بخش سلامت از یک مدل هوش مصنوعی برای تجزیه و تحلیل گزارشهای بیماریهای عفونی استفاده میکند، یک اشتباه، صرفاً یک «توهم» (hallucination) عجیب و غریب نیست؛ بلکه یک شکست بالقوه در امنیت سلامت عمومی است.
این واقعیت، این طرح آزمایشی را به الگویی برای سه مشکل فنی مداوم تبدیل میکند: دقت، کاهش توهم، و حریم خصوصی دادهها. در این زمینه، توهم میتواند به معنای ساختن یک تداخل دارویی توسط مدل، اختراع یک خوشه شیوع غیرواقعی، یا بیان نادرست یک مقررات گزارشدهی باشد. PULSE به گونهای ساختار یافته است که میزان وقوع این خطاها و اینکه آیا حفاظهای فنی میتوانند پیش از رسیدن آنها به تصمیمگیرنده، آنها را شناسایی کنند یا خیر را بسنجد.
حریم خصوصی نیز به همان اندازه اهمیت دارد. آژانسهای سلامت عمومی با اطلاعات سلامت محافظتشدهای سر و کار دارند که تحت قوانین HIPAA و سایر قوانین ایالتی قرار میگیرند. هر سیستم هوش مصنوعی که با این دادهها در تماس باشد، باید دقیقاً نشان دهد که چه چیزی را ذخیره میکند، جریان دادههای آموزشی کجاست و چه کسی میتواند بعداً به خروجیها دسترسی داشته باشد. مشارکت CHAI نشان میدهد که این آزمایشها نه تنها هوش خام مدلهای OpenAI و Anthropic، بلکه توانایی آنها را برای فعالیت در چارچوبهای حاکمیتی سختگیرانه سازمانی و ایجاد ردپای حسابرسی شفاف، آزمایش خواهند کرد.
نقشهای برای توسعهدهندگان و نهادهای تنظیمگر
برای توسعهدهندگان و بنیانگذاران استارتاپهایی که در حال ساخت هوش مصنوعی برای حوزه سلامت هستند، PULSE چیزی را ارائه میدهد که بازار به شدت به آن نیاز دارد: یک استاندارد قابل مشاهده و مورد حمایت دولت. شرکتهای نوپا اغلب برای فروش محصولات خود به سیستمهای سلامت عمومی با مشکل مواجه هستند، زیرا افسران تدارکات هیچ چکلیست مشترکی برای ارزیابی ایمنی هوش مصنوعی ندارند. اگر PULSE معیارهای شفافی برای سنجش سوگیری، دقت و حریم خصوصی در محیطهای اداری سلامت ارائه دهد، این معیارها میتوانند به سرعت به بنچمارک پیشفرض برای تأمینکنندگان در سراسر کشور تبدیل شوند.
این برنامه همچنین نشان میدهد که چگونه مدلهای زبانی بزرگ (LLMs) ممکن است برای خدمت به دولت نیاز به تکامل داشته باشند. چتباتهای مصرفکننده برای پاسخهای روان و مفید بهینه شدهاند. اما فعالیتهای سلامت دولتی نیازمند استناد، عدم قطعیت کالیبرهشده و حافظه سازمانی است. مدلی که به یک پرستار اپیدمیولوژیست مشاوره میدهد، باید به جای ساختن یک پاسخ مطمئن، آمادگی داشته باشد که بگوید «شواهد نامشخص است». مشاهده اینکه چگونه OpenAI و Anthropic استراتژیهای پرامپتنویسی و سیستمهای بازیابی خود را برای این محیط تنظیم میکنند، نشان خواهد داد که آیا فناوری زیربنایی واقعاً میتواند انتظارات بوروکراتیک را برآورده کند یا خیر.
اگر این طرحهای آزمایشی موفق شوند، بینشهای فنی و حاکمیتی حاصل از آنها میتواند بسیار فراتر از مرزهای ایالات متحده گسترش یابد. دپارتمانهای سلامت عمومی در سراسر جهان با بارهای دادهای مشابه و کمبود نیروی انسانی مواجه هستند. یک چارچوب تأییدشده برای بهکارگیری LLMها در اپیدمیولوژی و ارتباطات سلامت میتواند به یک مرجع بینالمللی تبدیل شود، درست همانطور که استانداردهای FHIR برای سوابق الکترونیک سلامت عمل کردند.
نتیجهگیری اصلی
PULSE وعدهای نیست که هوش مصنوعی سلامت عمومی را اصلاح کند. بلکه اعترافی است به اینکه روشهای قدیمی پردازش اطلاعات سلامت بسیار کند و بسیار پرزحمت هستند، و هر جایگزینی باید پیش از گسترش در سطح ملی، در شرایط واقعی و متنوع اثبات شود. با ترکیب چارچوبهای ایمنی CHAI با مدلهای پیشرو OpenAI و Anthropic، و با وادار کردن این ابزارها به اثبات خود در ده حوزه قضایی واقعاً متفاوت، این برنامه با هوش مصنوعی مولد با همان تردیدی برخورد میکند که شایسته آن است، در حالی که همزمان میدان آزمایشی مورد نیاز آن را نیز فراهم میکند. برای مقامات سلامت، توسعهدهندگان و جوامعی که آنها خدمت میکنند، این تعادل دقیقاً همان چیزی است که پذیرش مسئولانه هوش مصنوعی به معنای آن است.
