Pathology AI-இல் புரட்சியை ஏற்படுத்த PRISM2 எவ்வாறு மருத்துவ உரையாடல்களைப் பயன்படுத்துகிறது

Paige மற்றும் Microsoft இடையிலான ஒரு முன்னோடி ஒத்துழைப்பு PRISM2-ஐ அறிமுகப்படுத்தியுள்ளது. இது காட்சிப் pathology மற்றும் மருத்துவக் காரணத் திறன்களுக்கு (clinical reasoning) இடையிலான இடைவெளியைக் குறைக்க வடிவமைக்கப்பட்ட ஒரு multimodal AI மாதிரியாகும். முழு-ஸ்லைடு இமேஜிங் (whole-slide imaging) முறையை மருத்துவ உரையாடல்களின் நுணுக்கங்களுடன் ஒருங்கிணைப்பதன் மூலம், இந்த மாதிரி வெறும் வடிவங்களை அடையாளம் காண்பதிலிருந்து உண்மையான நோயறிதல் விளக்கத்தை (diagnostic interpretation) நோக்கி நகர்கிறது.

பிக்சல் வகைப்பாட்டிற்கு அப்பால் (Moving Beyond Pixel Classification)

டிஜிட்டல் pathology-இல் உள்ள பாரம்பரிய AI பெரும்பாலும் குறிப்பிட்ட பிக்சல்களை வகைப்படுத்துதல் அல்லது செல் கட்டமைப்புகளைக் கண்டறிதல் போன்ற மேற்பார்வையிடப்பட்ட கற்றல் (supervised learning) பணிகளில் கவனம் செலுத்தியுள்ளது. இவை பயனுள்ளதாக இருந்தாலும், சிக்கலான மருத்துவ முடிவெடுப்பதற்குத் தேவையான சூழல் சார்ந்த ஆழம் (contextual depth) இந்த மாதிரிகளிடம் பெரும்பாலும் இல்லை. PRISM2, முழு-ஸ்லைடு இமேஜ்களை (WSIs) முற்றிலும் மாறுபட்ட முறையில் செயலாக்கும் ஒரு perceiver-அடிப்படையிலான என்கோடரை (perceiver-based encoder) பயன்படுத்துவதன் மூலம் இந்த முறையை மாற்றியமைக்கிறது.

படங்களுக்கு லேபிள்கள் இடுவதைத் தாண்டி, pathology அறிக்கைகளிலிருந்து எடுக்கப்பட்ட மருத்துவ உரையாடல்களின் பார்வையில் திசுத் துண்டுகளை (tissue tiles) விளக்குவதற்கு PRISM2 பயிற்சியளிக்கப்பட்டுள்ளது. இது ஒரு செல் எப்படி இருக்கிறது என்பதை மட்டுமல்லாமல், ஒரு நோயாளியின் நோயறிதலின் பரந்த மருத்துவச் சூழலில் அதன் இருப்பு எதைக் குறிக்கிறது என்பதையும் புரிந்துகொள்ள இந்த மாதிரிக்கு உதவுகிறது.

தொழில்நுட்பக் கட்டமைப்பு மற்றும் பயிற்சி அளவு (Technical Architecture and Training Scale)

pathology-இல் உள்ள மிகப்பெரிய தரவு அடர்த்தியை (data density) கையாளும் திறன் PRISM2-இன் தொழில்நுட்பச் சிறப்பம்சமாகும். ஒரு ஒற்றை முழு-ஸ்லைடு இமேஜ் (whole-slide image) மிகப்பெரிய அளவிலான தகவல்களைக் கொண்டுள்ளது, இது பெரும்பாலும் நிலையான vision transformers-இன் திறனை விட அதிகமாக இருக்கும். PRISM2, ஒரு ஸ்லைடில் உள்ள ஆயிரக்கணக்கான தனிப்பட்ட டைல் உட்பொதிவுகளை (tile embeddings) ஒரு ஒற்றை, ஒருங்கிணைந்த பிரதிநிதித்துவமாகத் தொகுப்பதன் மூலம் இதைச் சாதிக்கிறது.

பயிற்சியளிக்கப்பட்ட தரவின் அளவும் அதே அளவு வியக்கத்தக்கது. இந்த மாதிரி 2.3 மில்லியன் முழு-ஸ்லைடு இமேஜ்கள் கொண்ட ஒரு பிரம்மாண்டமான தரவுத்தொகுப்பில் பயிற்சியளிக்கப்பட்டது. இந்த காட்சித் துண்டுகள் (visual tiles) மற்றும் அதனுடன் தொடர்புடைய மருத்துவ உரை ஆகிய இரண்டையும் இணைந்து பயிற்சியளிப்பதன் மூலம், மனிதர்கள் வாசிக்கக்கூடிய உரையை உருவாக்கும் ஒரு multimodal alignment-ஐ இந்த மாதிரி கற்றுக்கொள்கிறது. வெறும் வகைப்பாட்டை (binary classification) வழங்குவதற்குப் பதிலாக, PRISM2 ஒரு மனிதப் pathology நிபுணரின் (pathologist) சிந்தனை முறையைப் போலவே குறிப்பிட்ட நோயறிதல் கேள்விகளுக்குப் பதிலளிக்க முடியும்.

சுகாதாரத் துறை AI-இன் எதிர்காலத்திற்கு இது ஏன் முக்கியமானது (Why This Matters for the Future of Healthcare AI)

PRISM2-இன் வருகை, AI துறையில் "discriminative AI" (வகைப்படுத்தும் AI) என்பதிலிருந்து "generative reasoning AI" (விளக்கும் AI) நோக்கி ஒரு மாற்றத்தைக் குறிக்கிறது. MedTech துறையில் உள்ள டெவலப்பர்கள் மற்றும் நிறுவனர்களுக்கு, இது மிகவும் வெளிப்படையான மற்றும் பயனுள்ள மருத்துவக் கருவிகளை நோக்கிய நகர்வாகும்.

ஒரு AI தனது கண்டுபிடிப்புகளை உரையாடல் மூலம் தொடர்பு கொள்ளும்போது, அது ஒரு "black box" கருவியாக இல்லாமல், ஒரு கூட்டுப் பங்காளியாக மாறுகிறது. நோயறிதலில் AI-ஆல் வழங்கப்படும் நுண்ணறிவுகளைப் pathologists நம்ப வேண்டுமானால், அவர்களுக்கு விளக்கமளிக்கும் திறன் (explainability) தேவைப்படுவதால், இந்தத் திறன் மிகவும் முக்கியமானது. Pathology அறிக்கைகளில் காணப்படும் மொழியியல் நுணுக்கங்களை ஒருங்கிணைப்பதன் மூலம், புற்றுநோயியல் (oncology) மற்றும் நோயறிதல் போன்ற உயர் முக்கியத்துவம் வாய்ந்த, சிறப்புத் துறைகளில் multimodal மாதிரிகள் எவ்வாறு பயன்படுத்தப்படலாம் என்பதற்கு PRISM2 ஒரு புதிய தரநிலையை உருவாக்குகிறது.

முக்கியக் குறிப்புகள் (Key Takeaways)

  • Multimodal ஒருங்கிணைப்பு: pathology அறிக்கைகளிலிருந்து வரும் மருத்துவ உரையாடல்களுடன் முழு-ஸ்லைடு திசுத் துண்டுகளை இணைக்க PRISM2 ஒரு perceiver-அடிப்படையிலான என்கோடரைப் பயன்படுத்துகிறது.
  • பிரம்மாண்டமான அளவு: வலுவான அம்சம் பிரித்தெடுத்தலை (feature extraction) உறுதி செய்வதற்காக, 2.3 மில்லியன் முழு-ஸ்லைடு இமேஜ்கள் கொண்ட ஒரு மிகப்பெரிய பயிற்சித் தொகுப்பைப் பயன்படுத்தி இந்த மாதிரி உருவாக்கப்பட்டது.
  • வகைப்பாட்டை விடக் காரணத் திறன்: பிக்சல்களை மட்டும் வகைப்படுத்தும் பாரம்பரிய மாதிரிகளைப் போலன்றி, PRISM2 சிக்கலான நோயறிதல் கேள்விகளுக்குப் பதிலளிக்க உரையை உருவாக்க முடியும்.

கட்டுரை: Microsoft மற்றும் Paige ஆகியவை PRISM2-ஐ வெளியிட்டுள்ளன. இது 2.3 மில்லியன் முழு-ஸ்லைடு pathology இமேஜ்களை உள்வாங்கிக் கொள்ளக்கூடிய மற்றும் இயற்கையான மொழியில் நோயறிதல் கேள்விகளுக்குப் பதிலளிக்கக்கூடிய ஒரு multimodal AI மாதிரியாகும். காட்சிப் பகுப்பாய்வை pathology அறிக்கைகளில் காணப்படும் மருத்துவ உரையாடல்களுடன் இணைப்பதன் மூலம், pathology துறையில் உள்ள AI-ஐ வெறும் இமேஜ் வகைப்பாட்டிலிருந்து, ஒரு மனிதப் pathology நிபுணரின் சிந்தனை முறையைப் பிரதிபலிக்கும் காரணத் திறனை நோக்கி நகர்த்த இந்த அமைப்பு உறுதியளிக்கிறது.

பிக்சல்களிலிருந்து காரணத் திறன் வரை (From Pixels to Reasoning)

டிஜிட்டல் pathology நீண்டகாலமாக ஒரு ஸ்லைடை லேபிளிடப்பட வேண்டிய பிக்சல்களின் கட்டமாக (grid of pixels) கருதும் AI-யையே நம்பி வந்தது. இத்தகைய மாதிரிகள் mitoses எண்ணிக்கையைக் கண்டறிதல் அல்லது அசாதாரணமான உட்கருக்களை (atypical nuclei) அடையாளம் காணுதல் போன்ற பணிகளில் சிறந்து விளங்கினாலும், ஒரு கண்டுபிடிப்பு ஒரு நோயாளியின் ஒட்டுமொத்த நிலையில் ஏன் முக்கியமானது என்பதை விளக்குவதில் அவை நின்றுவிடுகின்றன. PRISM2 அதை மாற்றுகிறது. இதன் மையப்பகுதி ஒரு perceiver-அடிப்படையிலான என்கோடர் ஆகும்—இது ஆயிரக்கணக்கான இமேஜ் டைல்களை ஒரு ஒற்றை, உயர்-பரிமாணப் பிரதிநிதித்துவமாக (high-dimensional representation) சுருக்கக்கூடிய ஒரு வகை நரம்பியல் வலையமைப்பு (neural network) ஆகும். அந்தப் பிரதிநிதித்துவம் பின்னர் தொடர்புடைய pathology அறிக்கையிலிருந்து எடுக்கப்பட்ட உரையுடன் இணைக்கப்படுகிறது, இதன் மூலம் மருத்துவர்கள் விவரிக்கப் பயன்படுத்தும் மொழியுடன் காட்சி வடிவங்களை (visual patterns) தொடர்பு கொள்ள இந்த மாதிரி கற்றுக்கொள்கிறது.

இதன் முடிவு, "இந்த பகுதி தீங்கானது" என்று சொல்வதைத் தாண்டிச் செயல்படக்கூடிய ஒரு AI ஆகும். இது "ஒழுங்கற்ற சுரப்பி அமைப்புகளின் இருப்பு மற்றும் அவதானிக்கப்பட்ட ஸ்ட்ரோமல் எதிர்வினை ஆகியவை, பெருங்குடல் புற்றுநோயின் மருத்துவ வரலாற்றிற்கு இணையாக, மிதமான வேறுபாடு கொண்ட அட்ீனோகார்சினோமாவை (moderately differentiated adenocarcinoma) உணர்த்துகின்றன" போன்ற ஒரு வாக்கியத்தை உருவாக்க முடியும். வேறு வார்த்தைகளில் கூறுவதானால், PRISM2 வெறும் நோயறிதல் அடையாளத்தை மட்டும் வழங்காமல், அதற்குக் பின்னால் உள்ள காரணத்தையும் விளக்க முடியும்.

முக்கியத்துவம் வாய்ந்த அளவு (Scale)

முழு-ஸ்லைடு (whole-slide) படங்களைக் கொண்டு ஒரு மாதிரியைப் பயிற்றுவிப்பது அதிக தரவு தேவைப்படும் ஒரு செயலாகும். ஒரு ஸ்லைடே பில்லியன் கணக்கான பிக்சல்களைக் கொண்டிருக்கலாம், இது பல இமேஜ் சார்ந்த AI அமைப்புகளின் முக்கியத் தூண்களான சாதாரண விஷன் டிரான்ஸ்பார்மர்களின் (vision transformers) திறனை விட மிக அதிகம். PRISM2 ஒவ்வொரு ஸ்லைடையும் கையாளக்கூடிய சிறிய துண்டுகளாக (tiles) உடைத்து, ஒவ்வொரு துண்டையும் எம்பெடிங் (embedding) செய்து, பின்னர் அந்த எம்பெடிங்குகளை ஒரு ஸ்லைடு-நிலை வெக்டராக ஒருங்கிணைப்பதன் மூலம் இந்தத் தடையைத் தவிர்க்கிறது. இந்த அணுகுமுறை கணக்கீட்டுத் தேவைகளைச் சமாளிக்கக்கூடிய அளவில் வைத்திருக்கும் அதே வேளையில், நுணுக்கமான விவரங்களையும் பாதுகாக்கிறது.

இந்தத் கூட்டணி 2.3 மில்லியன் முழு-ஸ்லைடு படங்களைக் கொண்ட தரவுத்தொகுப்பைப் பயன்படுத்தியது—இது பாத்லஜி AI-க்காகத் திரட்டப்பட்ட மிகப்பெரிய சேகரிப்புகளில் ஒன்றாகும். ஒவ்வொரு படமும், பாத்லஜிஸ்டுகள் ஸ்லைடை ஆய்வு செய்த பிறகு எழுதிய உரை விளக்கங்களுடன் இணைக்கப்பட்டிருந்தது. இரண்டு முறைகளையும் (modalities) ஒரே நேரத்தில் பயிற்றுவிப்பதன் மூலம், காட்சித் தடயங்களை நோயறிதல் மொழியுடன் இணைக்க PRISM2 கற்றுக்கொண்டது. இது "மிகவும் சாத்தியமான முதன்மை இடம் எது?" அல்லது "திசுவில் நிம்போவாஸ்குலர் ஊடுருவலுக்கான (lymphovascular invasion) சான்றுகள் உள்ளனவா?" போன்ற கேள்விகளுக்குத் தெளிவான பதில்களை உருவாக்க உதவுகிறது.

இது ஏன் மருத்துவ நடைமுறையை மாற்றக்கூடும்

புற்றுநோய் நோயறிதலில் பாத்லஜிஸ்டுகள் முக்கியப் பங்கு வகிக்கின்றனர், ஆனால் அவர்கள் ஆய்வு செய்ய வேண்டிய ஸ்லைடுகளின் எண்ணிக்கை, பணியாளர்களின் எண்ணிக்கையை விட வேகமாக அதிகரித்து வருகிறது. சந்தேகத்திற்குரிய பகுதிகளை மட்டும் சுட்டிக்காட்டும் AI உதவியாக இருந்தாலும், அந்தச் சுட்டிக்காட்டலுக்கான அடிப்படை என்ன என்பதைப் பற்றி அது பெரும்பாலும் மருத்துவர்களுக்குத் தெளிவைத் தருவதில்லை. தனது கண்டுபிடிப்புகளை விளக்கும் PRISM2-ன் திறன், இந்தத் தொழில்நுட்பத்தின் மீதான நம்பிக்கையையும் பயன்பாட்டையும் விரைவுபடுத்தக்கூடும். ஒரு அல்காரிதம், "இந்த குறிப்பிட்ட கட்டமைப்பு அம்சங்களின் காரணமாக நான் ஒரு உயர்தரக் கட்டியைக் காண்கிறேன்" என்று கூறும்போது, ஒரு பாத்லஜிஸ்ட் அந்த முடிவை ஒரு தெளிவற்ற தீர்ப்பாகக் கருதாமல், அந்தத் தர்க்கத்தை சரிபார்க்கவோ, மறுக்கவோ அல்லது அதன் அடிப்படையில் மேலும் ஆய்வு செய்யவோ முடியும்.

MedTech ஸ்டார்ட்அப்கள் மற்றும் பெரிய சுகாதார அமைப்பு AI குழுக்களுக்கு, இந்த மாதிரி ஒரு புதிய அளவுகோலை நிர்ணயிக்கிறது. படங்கள் மற்றும் குறிப்பிட்ட துறை சார்ந்த மொழியை இணைக்கும் மல்டிமோடல் பயிற்சி (multimodal training), துல்லியமான மற்றும் விளக்கக்கூடிய கருவிகளை உருவாக்க முடியும் என்பதை இது நிரூபிக்கிறது. இந்தத் தொகுப்பு புற்றுநோயியலில் (oncology) குறிப்பாக மதிப்புமிக்கது, ஏனெனில் அங்கு சிகிச்சை முடிவுகள் நுட்பமான பாத்லஜிக்கல் துணை வகைப்பாடுகளைப் பொறுத்தே அமைகின்றன.

சவால்களும் மறுப்புக்களும்

நோயறிதல் உரையாடலின் வாக்குறுதி, இன்னும் இருக்கும் சவால்களை நீக்கிவிடாது. முதலாவதாக, மாதிரியின் செயல்பாடு ஆராய்ச்சி சூழல்களில் மட்டுமே அறிக்கையிடப்பட்டுள்ளது; பல்வேறு ஆய்வகப் பணிப்பாய்வுகள், ஸ்டைனிங் நெறிமுறைகள் மற்றும் ஸ்கேனர் விற்பனையாளர்களுக்கு இடையிலான நிஜ உலகச் சரிபார்ப்பு இன்னும் நிலுவையில் உள்ளது. ஒரு தேர்ந்தெடுக்கப்பட்ட தரவுத்தொகுப்பில் சிறப்பாகச் செயல்படும் ஒரு அமைப்பு, அன்றாட நடைமுறையின் மாறுபாடுகளைச் சந்திக்கும் போது தடுமாறக்கூடும்.

இரண்டாவதாக, 2.3 மில்லியன் ஸ்லைடுகள் மற்றும் அவற்றின் அறிக்கைகள் போன்ற பயிற்சித் தரவுகள், ஒரு குறிப்பிட்ட சில நிறுவனங்களிலிருந்து பெறப்பட்டிருக்க வாய்ப்புள்ளது. இந்தத் தரவுத்தொகுப்பு நோயாளிகளின் முழுமையான மக்கள்தொகையியல் விவரங்களைப் பிரதிபலிக்கவில்லை என்றால், மாதிரி சார்புநிலையைப் (bias) பெறக்கூடும், இது சில நோய்களைத் தவறாக வகைப்படுத்த வாய்ப்புள்ளது.

மூன்றாவதாக, விளக்கமான வெளியீட்டை (narrative output) உருவாக்கும் AI-க்கான ஒழுங்குமுறை வழிமுறைகள், பைனரி வகைப்படுத்திகளை (binary classifiers) விடக் குறைவாகவே நிறுவப்பட்டுள்ளன. முகமைகள் துல்லியத்தை மட்டுமல்லாமல், தவறான விளக்கங்களின் பாதுகாப்பையும் மதிப்பீடு செய்ய வேண்டியிருக்கும்; அவை சரியாகக் கண்டறியப்படாவிட்டால் மருத்துவர்களைத் தவறாக வழிநடத்தக்கூடும்.

இறுதியாக, முழு-ஸ்லைடு தரவுகளில் ஒரு perceiver-அடிப்படையிலான என்கோடரை (perceiver-based encoder) இயக்குவதற்கான கணக்கீட்டுச் செலவு மிக அதிகம். மருத்துவமனைகளுக்கு போதுமான GPU உள்கட்டமைப்பு அல்லது கிளவுட் ஒப்பந்தங்கள் தேவைப்படும், இது குறிப்பாகச் சிறிய பாத்லஜி ஆய்வகங்களுக்குச் செலவுத் திறன் குறித்த கேள்விகளை எழுப்புகிறது.

அடுத்து கவனிக்க வேண்டியவை

  • மருத்துவச் சோதனைகள் (Clinical trials): PRISM2 உதவியுடன் செய்யப்படும் நோயறிதலைத் தரமான நடைமுறையுடன் ஒப்பிடும் முன்னோடி ஆய்வுகளிலிருந்து கிடைக்கும் சான்றுகள், ஒழுங்குமுறை ஒப்புதல் மற்றும் பயன்பாட்டிற்கான தீர்மானிக்கும் காரணியாக இருக்கும்.
  • ஒருங்கிணைப்பு வழிமுறைகள் (Integration pipelines): இந்த மாதிரி தற்போதுள்ள டிஜிட்டல் பாத்லஜி தளங்களுடன் எவ்வளவு எளிதாக இணைகிறது என்பது அதன் பயன்பாட்டு வேகத்தைப் பாதிக்கும். தடையற்ற API அணுகல் மற்றும் பொதுவான ஸ்லைடு-வியூவர் மென்பொருட்களுடன் இணக்கத்தன்மை ஆகியவை அவசியமானவை.
  • விளக்கத்தன்மை அளவீடுகள் (Explainability metrics): உருவாக்கப்பட்ட உரையாடல் நிபுணர்களின் தர்க்கத்துடன் எவ்வளவு சிறப்பாக ஒத்துப்போகிறது என்பதை அளவிடும் சுயாதீன அளவுகோல்கள், "பிளாக்-பாக்ஸ்" (black-box) குறித்த கவலையைப் போக்க உதவும்.
  • விலை மற்றும் உரிமம் (Pricing and licensing): இந்தத் தொழில்நுட்பம் சந்தா முறையிலா, ஸ்லைடு வாரியான கட்டணமா அல்லது உள்ளூர் தீர்வா (on-premise solution) என்பது போன்ற இந்தத் கூட்டாண்மையின் வணிக மாதிரி, எந்த நிறுவனங்கள் இதை வாங்க முடியும் என்பதைத் தீர்மானிக்கும்.

சுருக்கம்

செல்களைக் கண்டறிந்து பெயரிடுவதைத் தாண்டி, அந்த செல்கள் சொல்லும் மருத்துவக் கதையை விவரிக்கும் ஆற்றல் AI-க்கு உண்டு என்பதை PRISM2 காட்டுகிறது. நோயியல் வல்லுநர்கள் (pathologists) அன்றாடம் பயன்படுத்தும் மொழியுடன் இணைக்கப்பட்ட, ஒரு மிகப்பெரிய அளவிலான whole-slide படங்களின் தொகுப்பைக் கொண்டு பயிற்சி அளிப்பதன் மூலம், Microsoft மற்றும் Paige ஒரு அமைப்பை உருவாக்கியுள்ளனர். இது நோயறிதல் தொடர்பான கேள்விகளுக்கு ஒரு உரையாடல் போன்ற பாணியில் பதிலளிக்கும் திறன் கொண்டது. அன்றாட ஆய்வகங்களின் சிக்கலான யதார்த்தமான சூழலில் இந்த மாதிரி (model) நம்பகமானதாக நிரூபிக்கப்பட்டால், இது AI-ஐ ஒரு அமைதியான கண்டறியும் கருவியாக மட்டும் வைக்காமல், ஒரு உண்மையான கூட்டுப்பணியாளராக மாற்றும். இது நோயியல் (pathology) எவ்வாறு நோயாளி பராமரிப்பிற்கு வழிகாட்டுகிறது என்பதையே மறுவடிவமைக்கும்.