De federale overheid haast zich zelden met ongeteste technologie. Met name de afdelingen voor de volksgezondheid kunnen jarenlang bezig zijn met het valideren van een hulpmiddel voordat het patiëntendossiers of uitbraakgegevens raakt. Dus toen Amerikaanse gezondheidsinstanties aankondigden dat ze live proeven zouden uitvoeren met generatieve AI-systemen van OpenAI en Anthropic, was het signaal duidelijk: grote taalmodellen zijn verschoven van consumentenexperiment naar een serieuze institutionele kandidaat.

Wat PULSE feitelijk doet

Het nieuwe initiatief heet de Public Health Use Case and Learning Scaling Engine — afgekort PULSE. Het is een testkader, geen productlancering. In plaats van chatbots in de e-mailsystemen van gezondheidsdiensten te plaatsen en te hopen op het beste, behandelt PULSE generatieve AI op dezelfde manier als de volksgezondheid een nieuw vaccin behandelt. Het creëert gecontroleerde omstandigheden waarin staats-, lokale, tribale en territoriale instanties deze tools kunnen testen, terwijl er streng wordt gelet op bijwerkingen.

Het programma brengt vier verschillende partners samen. De Coalition for Health AI (CHAI) levert specifieke governance- en veiligheidsnormen voor de gezondheidszorg. OpenAI en Anthropic dragen de geavanceerde taalmodellen aan. Accenture levert de benodigde expertise voor integratie om deze systemen te koppelen aan de bestaande overheidsinfrastructuur, die vaak draait op decennia oude databases en strikte aanbestedingsregels.

PULSE vraagt niet of AI e-mails kan schrijven of een verslag van een vergadering kan samenvatten. Het vraagt of deze modellen betrouwbaar kunnen assisteren bij drie kerntaken: epidemiologische surveillance, de toewijzing van middelen en communicatie over de volksgezondheid. Elk van deze taken klinkt abstract, maar samen beschrijven ze de dagelijkse last van het runnen van een gezondheidsdienst. Surveillance betekent het doorzoeken van laboratoriumrapporten, ziekenhuisopnames en gegevens over schoolverzuim om een uitbraak te spotten voordat deze uit de hand loopt. De toewijzing van middelen betekent het in realtime beslissen waar beperkte doses vaccins of antivirale middelen moeten worden ingezet tijdens een zwaar griepseizoen. Communicatie over de volksgezondheid betekent het vertalen van complexe federale richtlijnen naar begrijpelijke taal voor tientallen verschillende gemeenschappen, vaak terwijl de tijd dringt bij een onderzoek naar een voedselgerelateerde ziekte. Als AI bij een van deze taken kan helpen zonder extra werk te creëren of fouten te introduceren, kunnen de efficiëntiewinsten aanzienlijk zijn.

Waarom tien rechtsgebieden alles veranderen

Het programma zal proeven uitvoeren in tien rechtsgebieden, afkomstig uit staten, lokale overheden, tribale naties en Amerikaanse territoria. Die bewuste spreiding is precies het doel. Een staatsgezondheidsdienst in een dichtbevolkt gebied, bemand door honderden epidemiologen en voorzien van glasvezelnetwerken, staat voor geheel andere beperkingen dan een territoriale instantie die dengue bijhoudt met een minimale bezetting en een wisselende internetverbinding.

De inclusie van tribale groepen heeft een bijzonder gewicht. Tribale gezondheidsinstanties hebben historisch gezien te maken gehad met chronische onderfinanciering en acute zorgen over datasoevereiniteit. Door tribale rechtsgebieden op te nemen, erkent PULSE dat elk AI-hulpmiddel dat aanspraak maakt op nationaal nut, moet kunnen omgaan met gespecialiseerde populaties, onderscheidende governance-structuren moet respecteren en moet functioneren in omgevingen met unieke milieu- en sociale gezondheidsbelastingen. Als een model niet kan presteren onder deze omstandigheden, verdient het geen federale goedkeuring.

Territoriale instanties voegen een andere noodzakelijke stresstest toe. Ambtenaren van de volksgezondheid in Amerikaanse territoria beheren ziektepatronen en toeleveringsketens die sterk verschillen van het vasteland. Een AI-assistent die uitgaat van een perfecte internetverbinding, of die vertrouwt op ICD-10-coderingsgewoonten die gebruikelijk zijn in grote stedelijke ziekenhuizen, zal simpelweg falen wanneer een orkaan de infrastructuur uitschakelt. Het ontwerp met tien rechtsgebieden dwingt het programma om hard bewijs te verzamelen over de vraag of deze modellen zich aanpassen aan imperfecte omgevingen of dat ze bezwijken.

Van chatbots naar missiekritische infrastructuur

De afgelopen twee jaar heeft het publieke debat over grote taalmodellen zich gericht op programmeersnelkoppelingen, marketingteksten en beeldgeneratie. PULSE verlegt de focus doelbewust naar missiekritische infrastructuur. Wanneer een gezondheidsdienst een AI-model gebruikt om rapporten over infectieziekten te analyseren, is een fout geen grappige hallucinatie. Het is een potentieel falen van de openbare veiligheid.

Die realiteit maakt deze pilot tot een precedent voor drie hardnekkige technische problemen: nauwkeurigheid, het beperken van hallucinaties en gegevensprivacy. In deze context kan hallucinatie betekenen dat een model een interactie tussen medicijnen verzint, een niet-bestaande uitbraakcluster bedenkt of een rapportagevoorschrift verkeerd weergeeft. PULSE is zo opgezet dat het meet hoe vaak deze fouten voorkomen en of technische waarborgen ze kunnen opvangen voordat ze een besluitvormer bereiken.

Privacy is even belangrijk. Instanties voor de publieke gezondheidszorg werken met beschermde gezondheidsinformatie die wordt beheerst door HIPAA en aanvullende wetgeving op staatsniveau. Elk AI-systeem dat met deze gegevens werkt, moet precies kunnen aantonen wat het opslaat, waar de trainingsgegevens naartoe stromen en wie later toegang heeft tot de resultaten. De betrokkenheid van CHAI geeft aan dat deze proeven niet alleen de ruwe intelligentie van de OpenAI- en Anthropic-modellen zullen testen, maar ook hun vermogen om binnen strikte institutionele governance-kaders te opereren en heldere audit trails achter te laten.

Een blauwdruk voor ontwikkelaars en toezichthouders

Voor ontwikkelaars en oprichters van startups die AI voor de gezondheidszorg bouwen, biedt PULSE iets waar de markt dringend behoefte aan heeft: een zichtbare, door de overheid ondersteunde standaard. Jonge bedrijven hebben vaak moeite om te verkopen aan systemen voor de publieke gezondheidszorg, omdat inkopers geen algemene checklist hebben om de veiligheid van AI te evalueren. Als PULSE transparante criteria produceert voor het meten van bias, nauwkeurigheid en privacy in administratieve gezondheidsomgevingen, zouden die criteria snel de standaard benchmark kunnen worden voor leveranciers in het hele land.

Het programma geeft ook een hint over hoe large language models moeten evolueren om de overheid te kunnen dienen. Consumenten-chatbots zijn geoptimaliseerd voor vloeiende, behulpzame antwoorden. Overheidsinstellingen in de gezondheidszorg vereisen citaties, gekalibreerde onzekerheid en institutioneel geheugen. Een model dat een verpleegkundig epidemioloog adviseert, moet bereid zijn om te zeggen "het bewijs is onduidelijk" in plaats van een zelfverzekerd antwoord te verzinnen. Door te observeren hoe OpenAI en Anthropic hun prompting-strategieën en retrieval-systemen aanpassen voor deze omgeving, zal blijken of de onderliggende technologie daadwerkelijk aan bureaucratische verwachtingen kan voldoen.

Als de pilots slagen, kunnen de technische en governance-inzichten ver buiten de Amerikaanse grenzen reiken. Afdelingen voor de publieke gezondheidszorg wereldwijd kampen met vergelijkbare datalasten en personeelstekorten. Een gevalideerd kader voor het inzetten van LLM's in de epidemiologie en gezondheidscommunicatie zou een internationaal referentiepunt kunnen worden, net zoals de FHIR-standaarden dat deden voor elektronische patiëntendossiers.

De belangrijkste conclusie

PULSE is geen belofte dat kunstmatige intelligentie de publieke gezondheidszorg zal oplossen. Het is een erkenning dat de oude manieren van gezondheidsinformatieverwerking te traag en te arbeidsintensief zijn, en dat elke vervanging onder realistische, gevarieerde omstandigheden bewezen moet worden voordat deze landelijk wordt opgeschaald. Door de veiligheidskaders van CHAI te combineren met frontier-modellen van OpenAI en Anthropic, en door deze tools te dwingen zichzelf te bewijzen in tien werkelijk verschillende rechtsgebieden, behandelt het programma generatieve AI met de scepsis die het verdient, terwijl het het de testomgeving geeft die het nodig heeft. Voor gezondheidsfunctionarissen, ontwikkelaars en de gemeenschappen die zij dienen, is die balans precies wat verantwoorde adoptie inhoudt.