Федеральное правительство редко спешит внедрять непроверенные технологии. Департаменты общественного здравоохранения, в частности, могут годами проверять инструмент, прежде чем он коснется медицинских карт пациентов или данных о вспышках заболеваний. Поэтому, когда агентства здравоохранения США объявили о проведении живых испытаний систем генеративного ИИ, разработанных OpenAI и Anthropic, сигнал был ясен: большие языковые модели перешли из разряда потребительских экспериментов в категорию серьезных институциональных кандидатов.

Что на самом деле делает PULSE

Новая инициатива называется Public Health Use Case and Learning Scaling Engine — сокращенно PULSE. Это платформа для тестирования, а не развертывание продукта. Вместо того чтобы просто внедрять чат-ботов в системы электронной почты департаментов здравоохранения и надеяться на лучшее, PULSE относится к генеративному ИИ так же, как общественное здравоохранение относится к новой вакцине. Программа создает контролируемые условия, в которых государственные, местные, племенные и территориальные агентства могут тестировать эти инструменты, строго отслеживая побочные эффекты.

Программа объединяет четырех различных партнеров. Coalition for Health AI (CHAI) предоставляет стандарты управления и безопасности, специфичные для сферы здравоохранения. OpenAI и Anthropic предоставляют передовые языковые модели. Accenture обеспечивает опыт интеграции, необходимый для подключения этих систем к существующей государственной инфраструктуре, которая часто работает на базах данных десятилетней давности и подчиняется строгим правилам закупок.

PULSE не спрашивает, может ли ИИ писать электронные письма или резюмировать протоколы встреч. Он спрашивает, могут ли эти модели надежно помогать в выполнении трех основных задач: эпидемиологическом надзоре, распределении ресурсов и коммуникации в сфере общественного здравоохранения. Каждая из этих задач может показаться абстрактной, но вместе они описывают повседневную нагрузку по управлению департаментом здравоохранения. Надзор означает анализ лабораторных отчетов, данных о госпитализации и пропусков занятий в школах, чтобы выявить вспышку до того, как она разрастется. Распределение ресурсов означает принятие решений в режиме реального времени о том, куда направить ограниченные дозы вакцин или противовирусные препараты во время тяжелого сезона гриппа. Коммуникация в сфере общественного здравоохранения означает перевод сложных федеральных рекомендаций на простой язык для десятков различных сообществ, часто в условиях ограниченного времени при расследовании пищевых отравлений. Если ИИ сможет помочь в любой из этих областей, не создавая дополнительной работы и не допуская ошибок, выигрыш в эффективности может быть значительным.

Почему участие десяти юрисдикций меняет всё

Программа будет проводить испытания в десяти юрисдикциях, представляющих штаты, местные органы власти, племенные народы и территории США. Такое намеренное разнообразие и есть главная цель. Департамент здравоохранения штата в густонаселенном регионе с сотнями эпидемиологов и оптоволоконными сетями сталкивается с совершенно иными ограничениями, чем территориальное агентство, отслеживающее лихорадку денге силами минимального штата и при прерывистом интернет-соединении.

Участие племенных народов имеет особое значение. Племенные агентства здравоохранения исторически сталкивались с хроническим недофинансированием и острыми проблемами суверенитета данных. Включая племенные юрисдикции, PULSE признает, что любой инструмент ИИ, претендующий на общенациональную полезность, должен уметь работать со специализированными группами населения, уважать особые структуры управления и функционировать в условиях уникальных экологических и социальных проблем со здоровьем. Если модель не может работать в таких условиях, она не заслуживает федерального одобрения.

Территориальные агентства обеспечивают еще одну необходимую проверку на прочность. Чиновники здравоохранения на территориях США управляют моделями заболеваний и цепочками поставок, которые резко отличаются от материковой части страны. ИИ-ассистент, который предполагает наличие идеального интернет-соединения или полагается на привычки кодирования по стандарту ICD-10, характерные для крупных городских больниц, просто не справится, когда ураган выведет инфраструктуру из строя. Дизайн с участием десяти юрисдикций заставляет программу собирать реальные доказательства того, адаптируются ли эти модели к несовершенным условиям или выходят из строя.

От чат-ботов к критически важной инфраструктуре

В течение последних двух лет общественная дискуссия вокруг больших языковых моделей была сосредоточена на помощи в написании кода, маркетинговых текстах и генерации изображений. PULSE намеренно смещает акцент на критически важную инфраструктуру. Когда департамент здравоохранения использует модель ИИ для анализа отчетов об инфекционных заболеваниях, ошибка — это не просто забавная «галлюцинация». Это потенциальный провал в обеспечении общественной безопасности.

Эта реальность делает данный пилотный проект прецедентом в решении трех постоянных технических проблем: точности, минимизации галлюцинаций и конфиденциальности данных. В данном контексте под «галлюцинацией» может пониматься ситуация, когда модель выдумывает лекарственное взаимодействие, изобретает несуществующий очаг вспышки заболевания или неверно указывает правила отчетности. Структура PULSE позволяет измерить частоту возникновения таких ошибок и определить, могут ли технические защитные механизмы предотвратить их до того, как они попадут к лицу, принимающему решения.

Конфиденциальность имеет не меньшее значение. Органы общественного здравоохранения работают с защищенной медицинской информацией, регулируемой законом HIPAA и дополнительными законодательными актами на уровне штатов. Любая система ИИ, имеющая доступ к этим данным, должна четко демонстрировать, что именно она хранит, как перемещаются обучающие данные и кто может получить доступ к результатам в дальнейшем. Участие CHAI сигнализирует о том, что эти испытания проверят не только «чистый интеллект» моделей OpenAI и Anthropic, но и их способность работать в рамках строгих институциональных структур управления и оставлять прозрачный аудиторский след.

Ориентир для разработчиков и регуляторов

Для разработчиков и основателей стартапов, создающих ИИ для здравоохранения, PULSE предлагает то, в чем рынок остро нуждается: видимый, поддерживаемый государством стандарт. Молодые компании часто сталкиваются с трудностями при попытках продать свои решения системам общественного здравоохранения, поскольку у специалистов по закупкам нет единого контрольного списка для оценки безопасности ИИ. Если PULSE разработает прозрачные критерии измерения предвзятости, точности и конфиденциальности в административной среде здравоохранения, эти критерии могут быстро стать эталоном для поставщиков по всей стране.

Программа также намекает на то, как большие языковые модели могут эволюционировать, чтобы служить государству. Потребительские чат-боты оптимизированы для плавных и полезных ответов. Государственная работа в сфере здравоохранения требует ссылок на источники, калиброванной неопределенности и институциональной памяти. Модель, консультирующая медсестру-эпидемиолога, должна быть готова сказать «доказательства неясны», а не выдумывать уверенный ответ. Наблюдение за тем, как OpenAI и Anthropic адаптируют свои стратегии промптинга и системы извлечения информации под эту среду, покажет, способна ли базовая технология на самом деле соответствовать бюрократическим ожиданиям.

Если пилотные проекты увенчаются успехом, полученные технические и управленческие выводы могут выйти далеко за пределы США. Департаменты общественного здравоохранения по всему миру сталкиваются с аналогичной нагрузкой по работе с данными и нехваткой персонала. Валидированная структура для развертывания LLM в эпидемиологии и коммуникации в сфере здравоохранения может стать международным ориентиром, подобно тому как стандарты FHIR стали таковыми для электронных медицинских карт.

Главный вывод

PULSE — это не обещание того, что искусственный интеллект решит проблемы общественного здравоохранения. Это признание того, что старые способы обработки медицинской информации слишком медленны и трудозатратны, и что любая замена должна быть проверена в реалистичных и разнообразных условиях, прежде чем она будет масштабирована на национальном уровне. Объединяя протоколы безопасности CHAI с передовыми моделями от OpenAI и Anthropic и заставляя эти инструменты доказывать свою эффективность в десяти по-настоящему разных юрисдикциях, программа относится к генеративному ИИ со скептицизмом, которого он заслуживает, и одновременно предоставляет ему необходимый испытательный полигон. Для чиновников от здравоохранения, разработчиков и сообществ, которым они служат, такой баланс и является воплощением ответственного внедрения технологий.