הממשל הפדרלי לעיתים רחוקות ממהר לאמץ טכנולוגיה לא נבדקת. מחלקות בריאות הציבור, בפרט, יכולות להקדיש שנים לאימות כלי לפני שהוא נוגע ברשומות חולים או בנתוני התפרצויות. לכן, כאשר סוכנויות הבריאות בארה"ב הודיעו כי יריצו ניסויים חיים עם מערכות בינה מלאכותית יוצרת (generative AI) שנבנו על ידי OpenAI ו-Anthropic, האות הייתה ברורה: מודלי שפה גדולים עברו משלב הניסוי הצרכני לשלב של מועמד מוסדי רציני.

מה PULSE עושה בפועל

המאמץ החדש נקרא Public Health Use Case and Learning Scaling Engine — בקיצור PULSE. זהו מסגרת בדיקה (testing framework), ולא השקת מוצר. במקום להטיל צ'אטבוטים לתוך מערכות האימייל של מחלקות הבריאות ולקוות לטוב, PULSE מתייחסת לבינה מלאכותית יוצרת בדיוק כפי שמחלקות בריאות הציבור מתייחסות לחיסון חדש. היא יוצרת תנאים מבוקרים שבהם סוכנויות מדינתיות, מקומיות, שבטיות וטריטוריאליות יכולות לנסות את הכלים הללו תוך מעקב קפדני אחר תופעות לוואי.

התוכנית מאגדת ארבעה שותפים נפרדים. ה-Coalition for Health AI (CHAI) מספקת סטנדרטים של ממשל ובטיחות ספציפיים למערכת הבריאות. OpenAI ו-Anthropic תורמות את מודלי השפה החלוציים (frontier language models). Accenture מספקת את המומחיות המשולבת הדרושה לחיבור המערכות הללו לתשתית הממשלתית הקיימת, אשר פועלת לעיתים קרובות על בסיסי נתונים בני עשרות שנים וכללי רכש מחמירים.

PULSE אינה שואלת האם בינה מלאכותית יכולה לכתוב אימיילים או לסכם תמלול של פגישה. היא שואלת האם המודלים הללו יכולים לסייע באופן אמין בשלוש משימות ליבה: מעקב אפידמיולוגי, הקצאת משאבים ותקשורת בריאות הציבור. כל אחת מהן נשמעת מופשטת, אך יחד הן מתארות את הנטל היומיומי של ניהול מחלקת בריאות. מעקב פירושו סינון דוחות מעבדה, אשפוזים בבתי חולים ונתוני היעדרויות מבתי ספר כדי לזהות התפרצות לפני שהיא מתנפחת. הקצאת משאבים פירושה החלטה בזמן אמת היכן לשלוח מנות חיסון מוגבלות או טיפולים אנטי-ויראליים במהלך עונת שפעת קשה. תקשורת בריאות הציבור פירושה תרגום הנחיות פדרליות מורכבות לשפה פשוטה עבור עשרות קהילות שונות, לעיתים קרובות בזמן שהשעון מתקתק על חקירת מחלה המועברת במזון. אם הבינה המלאכותית יכולה לסייע באחת מהן מבלי ליצור עבודה נוספת או להכניס שגיאות, רווח היעילות עשוי להיות משמעותי.

מדוע עשר רשויות משנות את הכל

התוכנית תריץ ניסויים בעשר רשויות (jurisdictions) הנבחרות ממדינות, רשויות מקומיות, אומהות שבטיות וטריטוריות של ארה"ב. הפיזור המכוון הזה הוא כל העניין. מחלקת בריאות מדינתית באזור מאוכלס בצפיפות, המונה מאות אפידמיולוגים ופועלת על רשתות סיבים אופטיים, מתמודדת עם מגבלות שונות לחלוטין מאשר סוכנות טריטוריאלית שעוקבת אחר דנגי עם צוות מצומצם וקישוריות לסירוגין.

ההכללה השבטית נושאת משקל מיוחד. סוכנויות בריאות שבטיות התמודדו היסטורית עם תת-תקצוב כרוני וחששות חריפים לגבי ריבונות נתונים. על ידי הכללת רשויות שבטיות, PULSE מכירה בכך שכל כלי בינה מלאכותית הטוען לתועלת לאומית חייב לטפל באוכלוסיות מיוחדות, לכבד מבני ממשל נפרדים ולתפקד בסביבות עם נטלים בריאותיים סביבתיים וחברתיים ייחודיים. אם מודל אינו יכול לתפקד בתנאים אלו, הוא אינו ראוי לאישור פדרלי.

סוכנויות טריטוריאליות מוסיפות בדיקת מאמץ (stress test) נחוצה נוספת. פקידי בריאות הציבור בטריטוריות של ארה"ב מנהלים דפוסי מחלות ושרשראות אספקה השונים בתכלית מהיבשת. עוזר בינה מלאכותית שמניח קישוריות אינטרנט מושלמת, או שמסתמך על הרגלי קידוד ICD-10 הנפוצים בבתי חולים עירוניים גדולים, פשוט ייכשל כאשר הוריקן משבית את התשתית. העיצוב של עשר רשויות מחייב את התוכנית לאסוף ראיות מוצקות לגבי השאלה האם המודלים הללו מסתגלים לסביבות לא מושלמות או מתפרקים.

מצ'אטבוטים לתשתית קריטית למשימה

בשנתיים האחרונות, השיח הציבורי סביב מודלי שפה גדולים התמקד בקיצורי דרך לכתיבת קוד, טקסט שיווקי ויצירת תמונות. PULS מסיטה במכוון את המוקד לתשתית קריטית למשימה (mission-critical infrastructure). כאשר מחלקת בריאות משתמשת במודל בינה מלאכותית כדי לנתח דוחות מחלות זיהומיות, טעות אינה "הזיה" (hallucination) מוזרה. היא כשל פוטנציאלי בבטיחות הציבור.

מציאות זו הופכת את הפיילוט הזה למקרה בוחן המקדים לשלוש בעיות טכניות מתמשכות: דיוק, צמצום הזיות (hallucination mitigation), ופרטיות נתונים. בהקשר זה, "הזיה" עשויה להיות מודל הממציא אינטראקציה בין תרופות, יוצר מוקד התפרצות שאינו קיים, או מציג בטעות תקנת דיווח. PULSE בנוי כדי למדוד באיזו תדירות שגיאות אלו מתרחשות והאם מנגנוני הגנה טכניים יכולים לתפוס אותן לפני שהן מגיעות למקבלי החלטות.

פרטיות נושאת משקל שווה. סוכנויות בריאות הציבור מטפלות במידע בריאותי מוגן המוסדר על ידי HIPAA וחוקים נוספים ברמת המדינה. כל מערכת AI הנוגעת בנתונים אלו חייבת להדגים בדיוק מה היא שומרת, לאן זורמים נתוני האימון, ומי יכול לגשת מאוחר יותר לתוצרים. המעורבות של CHAI מסמנת כי ניסויים אלו יבחנו לא רק את האינטליגנציה הגולמית של המודלים של OpenAI ו-Anthropic, אלא את יכולתם לפעול במסגרות ממשל מוסדיות קשיחות ולהשאיר עקבות ביקורת (audit trails) נקיים.

מתווה למפתחים ורגולטורים

עבור מפתחים ומייסדי סטארט-אפים הבונים בינה מלאכותית בתחום הבריאות, PULSE מציע משהו שהשוק זקוק לו בדחיפות: תקן גלוי הנתמך על ידי הממשלה. חברות צעירות מתקשות לעיתים קרובות למכור למערכות בריאות הציבור מכיוון שלקציני רכש אין רשימת תיוג משותפת להערכת בטיחות ה-AI. אם PULSE יפיק קריטריונים שקופים למדידת הטיה, דיוק ופרטיות במסגרות בריאות מנהליות, קריטריונים אלו עשויים להפוך במהירות למדד הייחוס (benchmark) המוגדר כברירת מחדל עבור ספקים ברחבי המדינה.

התוכנית גם רומזת כיצד מודלי שפה גדולים (LLMs) עשויים להזדקק לאבולוציה כדי לשרת את הממשל. צ'אטבוטים לצרכן מותאמים למתן תגובות שוטפות ומועילות. עבודה ממשלתית בתחום הבריאות דורשת ציטוטים, אי-ודאות מכוילת וזיכרון מוסדי. מודל המייעץ לאחות אפידמיולוגית חייב להיות מוכן לומר "הראיות אינן ברורות" במקום להמציא תשובה בטוחה. מעקב אחר האופן שבו OpenAI ו-Anthropic מתאימים את אסטרטגיות ההנחיה (prompting) ומערכות השליפה שלהן לסביבה זו, יחשוף האם הטכנולוגיה שבבסיסן יכולה אכן לעמוד בציפיות הבירוקרטיות.

אם הפיילוטים יצליחו, התובנות הטכניות והממשלתיות עשויות להגיע הרבה מעבר לגבולות ארה"ב. מחלקות בריאות הציבור ברחבי העולם מתמודדות עם נטל נתונים ומחסור בכוח אדם באופן מקביל. מסגרת מאומתת לפריסת LLMs באפידמיולוגיה ובתקשורת בריאותית עשויה להפוך לנקודת ייחוס בינלאומית, בדומה לאופן שבו תקני FHIR הפכו לסטנדרט עבור רשומות בריאות אלקטרוניות.

השורה התחתונה

PULSE אינו הבטחה שהבינה המלאכותית תפתור את בעיות בריאות הציבור. זוהי הודאה בכך שהדרכים הישנות לעיבוד מידע בריאותי הן איטיות ועתירות עבודה מדי, וכי כל תחליף חייב להיות מוכח בתנאים מציאותיים ומגוונים לפני שהוא מתווסת ברמה לאומית. על ידי שילוב מסגרות הבטיחות של CHAI עם מודלי קצה (frontier models) מבית OpenAI ו-Anthropic, ועל ידי אילוץ הכלים הללו להוכיח את עצמם בעשרה תחומי שיפוט שונים באמת, התוכנית מתייחסת ל-Generative AI בספקנות הראויה לה, תוך מתן זירת הניסוי שהיא זקוקה לה. עבור גורמי בריאות, מפתחים והקהילות שהם משרתים, האיזון הזה הוא בדיוק מה שנראה כמו אימוץ אחראי.