دولت فدرال به‌ندرت با فناوری‌های آزمایش‌نشده عجله می‌کند. بخش‌های سلامت عمومی، به‌ویژه، ممکن است سال‌ها صرف تأیید یک ابزار کنند، پیش از آنکه آن ابزار حتی با سوابق بیماران یا داده‌های شیوع بیماری در تماس قرار گیرد. بنابراین، وقتی آژانس‌های بهداشتی ایالات متحده اعلام کردند که آزمایش‌های زنده با سیستم‌های هوش مصنوعی مولد ساخته شده توسط OpenAI و Anthropic را اجرا خواهند کرد، پیام واضح بود: مدل‌های زبانی بزرگ از مرحله آزمایش‌های مصرف‌کننده فراتر رفته و به عنوان کاندیداهای جدی برای نهادهای رسمی مطرح شده‌اند.

PULSE در واقع چه کاری انجام می‌دهد

این تلاش جدید، Public Health Use Case and Learning Scaling Engine نام دارد که به اختصار PULSE نامیده می‌شود. این یک چارچوب آزمایشی است، نه عرضه یک محصول. PULSE به جای وارد کردن چت‌بات‌ها به سیستم‌های ایمیل بخش‌های سلامت و امید به بهترین نتیجه، با هوش مصنوعی مولد همان‌گونه برخورد می‌کند که سلامت عمومی با یک واکسن جدید برخورد می‌کند. این برنامه شرایط کنترل‌شده‌ای ایجاد می‌کند که در آن آژانس‌های ایالتی، محلی، قبیله‌ای و قلمرویی می‌توانند این ابزارها را آزمایش کنند و در عین حال، به‌طور دقیق مراقب عوارض جانبی باشند.

این برنامه چهار شریک متمایز را گرد هم می‌آورد. Coalition for Health AI (CHAI) استانداردهای حکمرانی و ایمنی مخصوص مراقبت‌های بهداشتی را تأمین می‌کند. OpenAI و Anthropic مدل‌های زبانی پیشرو را ارائه می‌دهند. Accenture تخصص لازم برای یکپارچه‌سازی جهت اتصال این سیستم‌ها به زیرساخت‌های موجود دولتی را فراهم می‌کند؛ زیرساخت‌هایی که اغلب بر پایه‌ی پایگاه‌های داده دهه‌ها قدیمی و قوانین سخت‌گیرانه تدارکات اداره می‌شوند.

PULSE نمی‌پرسد که آیا هوش مصنوعی می‌تواند ایمیل بنویسد یا متن یک جلسه را خلاصه کند؛ بلکه می‌پرسد آیا این مدل‌ها می‌توانند به‌طور قابل‌اعتماد در سه وظیفه اصلی کمک کنند: نظارت اپیدمیولوژیک، تخصیص منابع و ارتباطات سلامت عمومی. هر یک از این‌ها انتزاعی به نظر می‌رسند، اما در کنار هم، بار روزانه اداره یک بخش سلامت را توصیف می‌کنند. نظارت به معنای بررسی گزارش‌های آزمایشگاهی، پذیرش‌های بیمارستانی و داده‌های غیبت مدارس برای شناسایی یک شیوع، پیش از آنکه گسترش یابد، است. تخصیص منابع به معنای تصمیم‌گیری در لحظه برای اینکه در طول یک فصل شدید آنفولانزا، دوزهای محدود واکسن یا درمان‌های ضد ویروسی به کجا ارسال شود، می‌باشد. ارتباطات سلامت عمومی به معنای ترجمه دستورالعمل‌های پیچیده فدرال به زبان ساده برای ده‌ها جامعه مختلف است، آن هم اغلب در حالی که زمان برای تحقیقات مربوط به بیماری‌های ناشی از غذا رو به اتمام است. اگر هوش مصنوعی بتواند در هر یک از این موارد بدون ایجاد کار اضافی یا بروز خطا کمک کند، افزایش بهره‌وری می‌تواند قابل توجه باشد.

چرا ده حوزه تحت پوشش، همه چیز را تغییر می‌دهد

این برنامه آزمایش‌ها را در ده حوزه تحت پوشش شامل ایالت‌ها، مناطق محلی، ملت‌های قبیله‌ای و قلمروهای ایالات متحده اجرا خواهد کرد. این پراکندگیِ عمدی، هدف اصلی است. یک بخش سلامت ایالتی در یک منطقه پرجمعیت، با صدها اپیدمیولوژیست و شبکه‌های فیبر نوری، با محدودیت‌های کاملاً متفاوتی نسبت به یک آژانس قلمرویی که با خدمه بسیار کم و اتصال اینترنت متناوب، بیماری دنگی را ردیابی می‌کند، روبروست.

شمول ملت‌های قبیله‌ای اهمیت ویژه‌ای دارد. آژانس‌های سلامت قبیله‌ای در طول تاریخ با کمبود بودجه مزمن و نگرانی‌های شدید در مورد حاکمیت داده‌ها روبرو بوده‌اند. با گنجاندن حوزه‌های تحت پوشش قبیله‌ای، PULSE اذعان می‌کند که هر ابزار هوش مصنوعی که ادعای کاربرد ملی دارد، باید بتواند با جمعیت‌های خاص برخورد کند، به ساختارهای حکمرانی متمایز احترام بگذارد و در محیط‌هایی با بارهای سلامت محیطی و اجتماعی منحصربه‌فرد عمل کند. اگر مدلی نتواند در این شرایط عمل کند، شایسته تأیید فدرال نیست.

آژانس‌های قلمرویی، یک آزمون استرس ضروری دیگر را اضافه می‌کنند. مقامات سلامت عمومی در قلمروهای ایالات متحده، الگوهای بیماری و زنجیره‌های تأمین را مدیریت می‌کنند که تفاوت فاحشی با سرزمین اصلی دارد. یک دستیار هوش مصنوعی که فرض را بر اتصال اینترنت بی‌نقص می‌گذارد، یا بر عادت‌های کدگذاری ICD-10 که در بیمارستان‌های بزرگ شهری رایج است تکیه می‌کند، وقتی طوفانی زیرساخت‌ها را از کار بیندازد، به سادگی شکست خواهد خورد. طراحیِ ده-حوزه‌ای، برنامه را مجبور می‌کند تا شواهد محکمی درباره اینکه آیا این مدل‌ها با محیط‌های ناقص سازگار می‌شوند یا از هم می‌پاشند، جمع‌آوری کند.

از چت‌بات‌ها تا زیرساخت‌های حیاتی

در دو سال گذشته، گفتمان عمومی پیرامون مدل‌های زبانی بزرگ بر میان‌برهای کدنویسی، متن‌های بازاریابی و تولید تصویر متمرکز بوده است. PULSE آگاهانه تمرکز را به سمت زیرساخت‌های حیاتی تغییر می‌دهد. وقتی یک بخش سلامت از یک مدل هوش مصنوعی برای تجزیه و تحلیل گزارش‌های بیماری‌های عفونی استفاده می‌کند، یک اشتباه، صرفاً یک «توهم» (hallucination) عجیب و غریب نیست؛ بلکه یک شکست بالقوه در امنیت سلامت عمومی است.

این واقعیت، این طرح آزمایشی را به الگویی برای سه مشکل فنی مداوم تبدیل می‌کند: دقت، کاهش توهم، و حریم خصوصی داده‌ها. در این زمینه، توهم می‌تواند به معنای ساختن یک تداخل دارویی توسط مدل، اختراع یک خوشه شیوع غیرواقعی، یا بیان نادرست یک مقررات گزارش‌دهی باشد. PULSE به گونه‌ای ساختار یافته است که میزان وقوع این خطاها و اینکه آیا حفاظ‌های فنی می‌توانند پیش از رسیدن آن‌ها به تصمیم‌گیرنده، آن‌ها را شناسایی کنند یا خیر را بسنجد.

حریم خصوصی نیز به همان اندازه اهمیت دارد. آژانس‌های سلامت عمومی با اطلاعات سلامت محافظت‌شده‌ای سر و کار دارند که تحت قوانین HIPAA و سایر قوانین ایالتی قرار می‌گیرند. هر سیستم هوش مصنوعی که با این داده‌ها در تماس باشد، باید دقیقاً نشان دهد که چه چیزی را ذخیره می‌کند، جریان داده‌های آموزشی کجاست و چه کسی می‌تواند بعداً به خروجی‌ها دسترسی داشته باشد. مشارکت CHAI نشان می‌دهد که این آزمایش‌ها نه تنها هوش خام مدل‌های OpenAI و Anthropic، بلکه توانایی آن‌ها را برای فعالیت در چارچوب‌های حاکمیتی سخت‌گیرانه سازمانی و ایجاد ردپای حسابرسی شفاف، آزمایش خواهند کرد.

نقشه‌ای برای توسعه‌دهندگان و نهادهای تنظیم‌گر

برای توسعه‌دهندگان و بنیان‌گذاران استارتاپ‌هایی که در حال ساخت هوش مصنوعی برای حوزه سلامت هستند، PULSE چیزی را ارائه می‌دهد که بازار به شدت به آن نیاز دارد: یک استاندارد قابل مشاهده و مورد حمایت دولت. شرکت‌های نوپا اغلب برای فروش محصولات خود به سیستم‌های سلامت عمومی با مشکل مواجه هستند، زیرا افسران تدارکات هیچ چک‌لیست مشترکی برای ارزیابی ایمنی هوش مصنوعی ندارند. اگر PULSE معیارهای شفافی برای سنجش سوگیری، دقت و حریم خصوصی در محیط‌های اداری سلامت ارائه دهد، این معیارها می‌توانند به سرعت به بنچمارک پیش‌فرض برای تأمین‌کنندگان در سراسر کشور تبدیل شوند.

این برنامه همچنین نشان می‌دهد که چگونه مدل‌های زبانی بزرگ (LLMs) ممکن است برای خدمت به دولت نیاز به تکامل داشته باشند. چت‌بات‌های مصرف‌کننده برای پاسخ‌های روان و مفید بهینه شده‌اند. اما فعالیت‌های سلامت دولتی نیازمند استناد، عدم قطعیت کالیبره‌شده و حافظه سازمانی است. مدلی که به یک پرستار اپیدمیولوژیست مشاوره می‌دهد، باید به جای ساختن یک پاسخ مطمئن، آمادگی داشته باشد که بگوید «شواهد نامشخص است». مشاهده اینکه چگونه OpenAI و Anthropic استراتژی‌های پرامپت‌نویسی و سیستم‌های بازیابی خود را برای این محیط تنظیم می‌کنند، نشان خواهد داد که آیا فناوری زیربنایی واقعاً می‌تواند انتظارات بوروکراتیک را برآورده کند یا خیر.

اگر این طرح‌های آزمایشی موفق شوند، بینش‌های فنی و حاکمیتی حاصل از آن‌ها می‌تواند بسیار فراتر از مرزهای ایالات متحده گسترش یابد. دپارتمان‌های سلامت عمومی در سراسر جهان با بارهای داده‌ای مشابه و کمبود نیروی انسانی مواجه هستند. یک چارچوب تأییدشده برای به‌کارگیری LLMها در اپیدمیولوژی و ارتباطات سلامت می‌تواند به یک مرجع بین‌المللی تبدیل شود، درست همان‌طور که استانداردهای FHIR برای سوابق الکترونیک سلامت عمل کردند.

نتیجه‌گیری اصلی

PULSE وعده‌ای نیست که هوش مصنوعی سلامت عمومی را اصلاح کند. بلکه اعترافی است به اینکه روش‌های قدیمی پردازش اطلاعات سلامت بسیار کند و بسیار پرزحمت هستند، و هر جایگزینی باید پیش از گسترش در سطح ملی، در شرایط واقعی و متنوع اثبات شود. با ترکیب چارچوب‌های ایمنی CHAI با مدل‌های پیشرو OpenAI و Anthropic، و با وادار کردن این ابزارها به اثبات خود در ده حوزه قضایی واقعاً متفاوت، این برنامه با هوش مصنوعی مولد با همان تردیدی برخورد می‌کند که شایسته آن است، در حالی که همزمان میدان آزمایشی مورد نیاز آن را نیز فراهم می‌کند. برای مقامات سلامت، توسعه‌دهندگان و جوامعی که آن‌ها خدمت می‌کنند، این تعادل دقیقاً همان چیزی است که پذیرش مسئولانه هوش مصنوعی به معنای آن است.