چگونه PRISM2 با استفاده از گفتگوی بالینی، هوش مصنوعی آسیب‌شناسی را متحول می‌کند

چگونه PRISM2 با استفاده از گفتگوی بالینی، هوش مصنوعی آسیب‌شناسی را متحول می‌کند

همکاری پیشگامانه بین Paige و Microsoft مدل PRISM2 را معرفی کرده است؛ یک مدل هوش مصنوعی چندوجهی (multimodal) که برای پر کردن شکاف میان آسیب‌شناسی بصری و استدلال بالینی طراحی شده است. این مدل با ادغام تصویربرداری کل اسلاید (whole-slide imaging) با ظرافت‌های گفتگوی پزشکی، از تشخیص الگوهای ساده فراتر رفته و به سمت تفسیر تشخیصی واقعی حرکت می‌کند.

فراتر رفتن از طبقه‌بندی پیکسل‌ها

هوش مصنوعی سنتی در آسیب‌شناسی دیجیتال عمدتاً بر وظایف یادگیری نظارت‌شده، مانند طبقه‌بندی پیکسل‌های خاص یا شناسایی ساختارهای سلولی، تمرکز داشته است. اگرچه این مدل‌ها مؤثر هستند، اما اغلب فاقد عمق زمینه‌ای مورد نیاز برای تصمیم‌گیری‌های بالینی پیچیده می‌باشند. PRISM2 با استفاده از یک رمزگذار مبتنی بر perceiver که تصاویر کل اسلاید (WSIs) را به روشی اساساً متفاوت پردازش می‌کند، این پارادایم را تغییر می‌دهد.

PRISM2 به جای صرفاً برچسب‌گذاری تصاویر، برای تفسیر کاشی‌های بافتی (tissue tiles) از دریچه گفتگوی بالینی استخراج‌شده از گزارش‌های آسیب‌شناسی آموزش دیده است. این امر به مدل اجازه می‌دهد تا نه تنها ظاهر یک سلول، بلکه معنای حضور آن را در بافت گسترده‌تر بالینیِ تشخیص بیمار درک کند.

معماری فنی و مقیاس آموزش

پیچیدگی فنی PRISM2 در توانایی آن برای مدیریت تراکم عظیم داده‌های ذاتی در آسیب‌شناسی نهفته است. یک تصویر کل اسلاید (whole-slide image) حاوی حجم عظیمی از اطلاعات است که اغلب بسیار فراتر از ظرفیت ترنسفورمرهای بینایی (vision transformers) استاندارد است. PRISM2 این مسئله را با تجمیع هزاران جاسازی کاشی (tile embeddings) مجزا در هر اسلاید در قالب یک نمایش واحد و منسجم برطرف می‌کند.

مقیاس داده‌های آموزشی نیز به همان اندازه چشمگیر است. این مدل بر روی یک مجموعه داده عظیم شامل ۲.۳ میلیون تصویر کل اسلاید آموزش دیده است. با آموزش مشترک بر روی این کاشی‌های بصری و متن بالینی مربوطه، مدل یک هم‌ترازی چندوجهی را می‌آموزد که به آن اجازه می‌دهد متن قابل خواندن برای انسان تولید کند. PRISM2 به جای ارائه یک طبقه‌بندی باینری (دوگانه)، می‌تواند به سوالات تشخیصی خاص پاسخ دهد و فرآیند استدلال یک آسیب‌شناس انسانی را شبیه‌سازی کند.

چرا این موضوع برای آینده هوش مصنوعی در مراقبت‌های بهداشتی اهمیت دارد

ظهور PRISM2 نشان‌دهنده تغییری در چشم‌انداز هوش مصنوعی از «هوش مصنوعی متمایزکننده» (که دسته‌بندی می‌کند) به «هوش مصنوعی استدلال‌گر مولد» (که توضیح می‌دهد) است. برای توسعه‌دهندگان و بنیان‌گذاران در حوزه MedTech، این نشان‌دهنده حرکت به سمت ابزارهای بالینی شفاف‌تر و کاربردی‌تر است.

وقتی یک هوش مصنوعی بتواند یافته‌های خود را از طریق گفتگو منتقل کند، به جای یک ابزار «جعبه سیاه»، به یک شریک همکاری تبدیل می‌شود. این قابلیت برای پذیرش بالینی حیاتی است، زیرا آسیب‌شناسان برای اعتماد به بینش‌های مبتنی بر هوش مصنوعی، به قابلیت توضیح‌پذیری نیاز دارند. PRISM2 با ادغام ظرافت‌های زبانی موجود در گزارش‌های آسیب‌شناسی، معیار جدیدی را برای نحوه استفاده از مدل‌های چندوجهی در حوزه‌های تخصصی و حساس مانند انکولوژی و تشخیص تعیین می‌کند.

نکات کلیدی

  • ادغام چندوجهی: PRISM2 از یک رمزگذار مبتنی بر perceiver برای پیوند دادن کاشی‌های بافتی کل اسلاید با گفتگوی بالینی گزارش‌های آسیب‌شناسی استفاده می‌کند.
  • مقیاس عظیم: این مدل با استفاده از یک مجموعه آموزشی وسیع شامل ۲.۳ میلیون تصویر کل اسلاید توسعه یافته است تا استخراج ویژگی‌های قدرتمند را تضمین کند.
  • استدلال به جای طبقه‌بندی: برخلاف مدل‌های سنتی که فقط پیکسل‌ها را طبقه‌بندی می‌کنند، PRISM2 می‌تواند برای پاسخ به سوالات تشخیصی پیچیده، متن تولید کند.

مقاله: مایکروسافت و Paige از PRISM2 رونمایی کرده‌اند؛ یک مدل هوش مصنوعی چندوجهی که می‌تواند ۲.۳ میلیون تصویر آسیب‌شناسی کل اسلاید را دریافت کرده و به سوالات تشخیصی با زبان طبیعی پاسخ دهد. این سیستم با جفت کردن تحلیل بصری با گفتگوی بالینی موجود در گزارش‌های آسیب‌شناسی، نویدبخش انتقال هوش مصنوعی در آسیب‌شناسی از طبقه‌بندی صرف تصاویر به استدلالی است که فرآیند فکری یک آسیب‌شناس انسانی را بازسازی می‌کند.

از پیکسل‌ها تا استدلال

آسیب‌شناسی دیجیتال مدت‌هاست که بر هوش مصنوعی‌ای متکی بوده که با یک اسلاید به عنوان شبکه‌ای از پیکسل‌ها برای برچسب‌گذاری برخورد می‌کند. چنین مدل‌هایی در وظایفی مانند شمارش میتوز یا علامت‌گذاری هسته‌های غیرطبیعی عالی عمل می‌کنند، اما از توضیح اینکه چرا یک یافته در تصویر کلی بیمار اهمیت دارد، باز می‌مانند. PRISM2 این وضعیت را تغییر می‌دهد. هسته اصلی آن یک رمزگذار مبتنی بر perceiver است؛ نوعی شبکه عصبی که می‌تواند هزاران کاشی تصویر را در یک نمایش واحد با ابعاد بالا فشرده کند. سپس آن نمایش با متن استخراج‌شده از گزارش آسیب‌شناسی مربوطه هم‌تراز می‌شود و به مدل می‌آموزد که الگوهای بصری را با زبانی که پزشکان برای توصیف آن‌ها به کار می‌برند، مرتبط کند.

نتیجه، هوش مصنوعی‌ای است که می‌تواند فراتر از گفتنِ «این ناحیه بدخیم است» عمل کند. این مدل می‌تواند جمله‌ای مانند «وجود ساختارهای غده‌ای نامنظم، همراه با واکنش استرومایی مشاهده‌شده، نشان‌دهنده آدنوکارسینوم با تمایز متوسط است که با تاریخچه بالینی سرطان کولورکتال مطابقت دارد» تولید کند. به عبارت دیگر، PRISM2 می‌تواند استدلال پشت یک تشخیص را بیان کند، نه فقط برچسب آن را.

مقیاسی که اهمیت دارد

آموزش یک مدل بر روی تصاویر کل اسلاید (whole-slide images)، تمرینی داده‌محور و سنگین است. یک اسلاید واحد می‌تواند حاوی میلیاردها پیکسل باشد که بسیار فراتر از ظرفیت vision transformerهای استاندارد است؛ همان‌هایی که ستون فقرات بسیاری از سیستم‌های هوش مصنوعی مبتنی بر تصویر هستند. PRISM2 با تقسیم هر اسلاید به کاشی‌های (tiles) قابل مدیریت، جاسازی (embedding) هر کاشی و سپس تجمیع جاسازی‌ها در یک بردار در سطح اسلاید، از این محدودیت عبور می‌کند. این رویکرد ضمن حفظ جزئیات دقیق، نیازهای محاسباتی را نیز در سطحی قابل کنترل نگه می‌دارد.

این همکاری از مجموعه‌داده‌ای شامل ۲.۳ میلیون تصویر کل اسلاید بهره برده است که یکی از بزرگترین مجموعه‌های گردآوری‌شده برای هوش مصنوعی آسیب‌شناسی (pathology AI) تاکنون است. هر تصویر با توضیحات متنی که آسیب‌شناسان پس از بررسی اسلاید نوشته بودند، جفت شده بود. PRISM2 با آموزش هم‌زمان بر روی هر دو حالت (modalities)، یاد گرفت که نشانه‌های بصری را به زبان تشخیص نگاشت کند؛ این امر آن را قادر می‌سازد تا پاسخ‌های منسجمی به سوالاتی نظیر «محتمل‌ترین محل اولیه کجاست؟» یا «آیا بافت شواهدی از تهاجم لنفواسکولار نشان می‌دهد؟» ارائه دهد.

چرا این فناوری می‌تواند شیوه عملکرد بالینی را تغییر دهد

آسیب‌شناسان نگهبانان تشخیص سرطان هستند، اما حجم اسلایدهایی که باید بررسی کنند، سریع‌تر از توان نیروی کار در حال افزایش است. هوش مصنوعی که صرفاً نواحی مشکوک را علامت‌گذاری می‌کند مفید است، اما اغلب پزشکان را در مورد دلیل این علامت‌گذاری در ابهام رها می‌کند. توانایی PRISM2 در توضیح یافته‌هایش می‌تواند اعتماد و پذیرش این فناوری را تسریع کند. وقتی یک الگوریتم می‌گوید: «من به دلیل این ویژگی‌های ساختاری خاص، یک تومور با درجه بالا را مشاهده می‌کنم»، آسیب‌شناس می‌تواند به جای اینکه با خروجی مانند یک حکم مبهم برخورد کند، آن استدلال را تأیید، رد یا بر پایه آن نظر خود را بسازد.

برای استارتاپ‌های MedTech و تیم‌های هوش مصنوعی در سیستم‌های سلامت بزرگ‌تر، این مدل معیار جدیدی تعیین می‌کند. این مدل نشان می‌دهد که آموزش چندوجهی (multimodal training) — یعنی ترکیب تصاویر با زبان تخصصی حوزه — می‌تواند ابزارهایی تولید کند که هم دقیق و هم تفسیرپذیر باشند. این ترکیب به‌ویژه در آنکولوژی (سرطان‌شناسی) ارزشمند است، جایی که تصمیمات درمانی به زیرگروه‌بندی‌های دقیق آسیب‌شناختی بستگی دارد.

موانع و نکات متقابل

وعده گفتگوهای تشخیصی، چالش‌های باقی‌مانده را از بین نمی‌برد. نخست اینکه، عملکرد مدل در محیط‌های تحقیقاتی گزارش شده است؛ اعتبارسنجی در دنیای واقعی در جریان‌های کاری متنوع آزمایشگاهی، پروتکل‌های رنگ‌آمیزی و سازندگان اسکنر هنوز در انتظار انجام است. سیستمی که روی یک مجموعه‌داده منتخب کار می‌کند، ممکن است هنگام مواجهه با تنوعِ عملکردهای روزمره دچار مشکل شود.

دوم اینکه، داده‌های آموزشی — ۲.۳ میلیون اسلاید و گزارش‌های آن‌ها — احتمالاً از مجموعه محدودی از مؤسسات استخراج شده‌اند. اگر گروه مورد مطالعه، طیف کامل ویژگی‌های جمعیت‌شناختی بیماران را منعکس نکند، مدل ممکن است دچار سوگیری شود و احتمالاً تظاهرات بیماری‌هایی را که کمتر در داده‌ها حضور داشته‌اند، به اشتباه طبقه‌بندی کند.

سوم اینکه، مسیرهای نظارتی برای هوش مصنوعی که خروجی روایی (narrative) تولید می‌کند، نسبت به طبقه‌بندی‌کننده‌های باینری (binary classifiers) کمتر تثبیت شده است. نهادهای نظارتی باید نه تنها دقت، بلکه ایمنیِ توضیحات اشتباه را نیز ارزیابی کنند، چرا که این توضیحات در صورت عدم علامت‌گذاری صحیح، می‌توانند پزشکان را گمراه کنند.

در نهایت، هزینه محاسباتی اجرای یک رمزگذار مبتنی بر perceiver بر روی داده‌های کل اسلاید، ناچیز نیست. بیمارستان‌ها به زیرساخت‌های GPU کافی یا قراردادهای ابری نیاز خواهند داشت که این موضوع پرسش‌هایی را در مورد مقرون‌به‌صرفه بودن، به‌ویژه برای آزمایشگاه‌های آسیب‌شناسی کوچک‌تر، ایجاد می‌کند.

آنچه باید در آینده زیر نظر داشت

  • کارآزمایی‌های بالینی: شواهد حاصل از مطالعات آینده‌نگر که تشخیص‌های کمک‌گرفته از PRISM2 را با روش‌های استاندارد مقایسه می‌کنند، عامل تعیین‌کننده برای تأییدیه نظارتی و پذیرش خواهد بود.
  • خطوط لوله یکپارچه‌سازی: میزان سهولت اتصال مدل به پلتفرم‌های موجود آسیب‌شناسی دیجیتال بر سرعت عرضه تأثیر خواهد گذاشت. دسترسی بی‌وقفه به API و سازگاری با نرم‌افزارهای رایج مشاهده اسلاید ضروری است.
  • معیارهای تفسیرپذیری: بنچمارک‌های مستقلی که میزان همسویی گفتگوی تولیدشده با استدلال متخصصان را کمی‌سازی می‌کنند، به رفع نگرانی‌های مربوط به «جعبه سیاه» کمک خواهند کرد.
  • قیمت‌گذاری و مجوز: مدل کسب‌وکار این همکاری — اینکه فناوری به صورت اشتراکی، با هزینه در ازای هر اسلاید، یا به صورت راهکار در محل (on-premise) ارائه شود — بر اینکه کدام مؤسسات توانایی پرداخت آن را دارند، تأثیر می‌گذارد.

خلاصه کلام

PRISM2 نشان می‌دهد که هوش مصنوعی می‌تواند از مرحله‌ی صرفاً برچسب‌گذاری سلول‌ها فراتر رفته و روایت داستان بالینی نهفته در آن سلول‌ها را بیان کند. مایکروسافت و Paige با آموزش مدل بر روی مجموعه‌ی عظیمی از تصاویر اسلاید کامل (whole-slide images) که با زبان روزمره‌ی آسیب‌شناسان همراه شده است، سیستمی ساخته‌اند که می‌تواند به پرسش‌های تشخیصی به شیوه‌ای پاسخ دهد که گویی در حال گفتگو است. اگر این مدل در واقعیت‌های پیچیده‌ی آزمایشگاه‌های روزمره قابل اعتماد از آب درآید، می‌تواند هوش مصنوعی را از یک آشکارساز خاموش به یک همکار واقعی تبدیل کرده و شیوه‌ی تأثیرگذاری آسیب‌شناسی بر مراقبت از بیمار را دگرگون کند.