ஒரு ஆராய்ச்சி குழு, ஒரு மலிவான மொழி மாதிரி (cheap language model) ஒரு கோடிங் கோரிக்கையை கையாள முடியுமா என்பதை தீர்மானிக்க ஒரு ரூட்டரை (router) உருவாக்கியது; இதன் மூலம் இன்ஃபரன்ஸ் செலவுகளை (inference costs) குறைக்க அவர்கள் எதிர்பார்த்தனர். ஆனால், அந்த ரூட்டர் "எப்போதும் அடுத்த நிலைக்கு மாற்றாத" (never-escalate) அடிப்படை அளவுகோலை விட சிறப்பாக செயல்படவில்லை. இந்தத் தோல்வி, துல்லியத்தை மட்டுமே மையமாகக் கொண்ட அளவீடுகள் (accuracy-centric metrics) ஏன் கேஸ்கேட்களை (cascades) தவறாக வழிநடத்துகின்றன என்பதைக் காட்டுகிறது மற்றும் உண்மையான சிரமத்தைக் கண்டறியும் சிக்னல்களைக் (signals) சுட்டிக்காட்டுகிறது.
ரூட்டர் ஏன் முக்கியமானது
மாடல் கேஸ்கேட்கள் (Model cascades) ஒவ்வொரு கோரிக்கையையும் சரியாகப் பதிலளிக்கக்கூடிய மிகச்சிறிய மாடலுக்கு அனுப்புகின்றன. ரூட்டர் ஒரு எளிய ப்ராம்ப்ட்டை (prompt) ஒரு மலிவான மாடலுக்கு அனுப்பினால், பெரிய மாடலுக்குத் தேவைப்படும் அதிகப்படியான கணக்கீட்டுச் செலவை (expensive compute) சிஸ்டம் தவிர்க்கிறது. இந்த குழு 539 உண்மையான கோடிங் பணிகளைக் கொண்டு (428 எளிதானவை மற்றும் 111 கடினமானவை) ஒரு ரூட்டரை பயிற்றுவித்தது; எப்போது மலிவான மாடலே போதுமானது என்பதைக் கண்டறிய இது உதவும் என்று அவர்கள் எதிர்பார்த்தனர்.
எதிர்பார்த்த முடிவுகளைத் தராத எண்கள்
- Held-out AUC (ROC வளைவின் கீழ் உள்ள பரப்பளவு): 0.594
- 5-fold cross-validation வரம்பு: 0.55 – 0.57
- சிறந்த வரம்பு (Best threshold): "எப்போதும் அடுத்த நிலைக்கு மாற்றாத" (never escalate) கொள்கையுடன் ஒத்துப்போகிறது
Held-out AUC 0.594 ஆகவும், cross-validation 0.55 முதல் 0.57 வரம்பிலும் இருந்ததால், இந்த வகைப்படுத்தி (classifier) எளிதான மற்றும் கடினமான பணிகளை மிகக் குறைந்த அளவே பிரிக்கிறது என்று அர்த்தம். உகந்த வரம்பு (optimal threshold) என்பது விலையுயர்ந்த மாடலை ஒருபோதும் பயன்படுத்தாத ஒரு கொள்கையைத் தரும்போது, அந்த ரூட்டர் எந்த மதிப்பையும் சேர்க்கவில்லை. அது ஒரு முடிவெடுப்பவரைப் போலச் செயல்படாமல், ஒரு நிலையான கணிப்பைப் (constant predictor) போலச் செயல்படுகிறது.
சோதனைகள் எவற்றைச் சோதித்தன
ஆராய்ச்சியாளர்கள் மூன்று அம்சம் தொகுப்புகளை (feature sets) ஒப்பிட்டனர்:
| அம்சம் தொகுப்பு (Feature set) | AUC |
|---|---|
| 11 எளிய மேற்பரப்பு அம்சங்கள் (எ.கா., டோக்கன் எண்ணிக்கை, முக்கியச் சொற்களின் இருப்பு) | 0.610 |
| 1024-பரிமாண ப்ராம்ப்ட் எம்பெடிங் (prompt embedding - semantic vector) | 0.552 |
| இரண்டும் இணைந்தது | 0.609 |
ஆச்சரியப்படும் விதமாக, இலகுரக மேற்பரப்பு அம்சங்கள் (lightweight surface features), அதிக பரிமாணங்களைக் கொண்ட செமாண்டிக் எம்பெடிங்குகளை (semantic embedding) விடச் சிறப்பாகச் செயல்பட்டன. எம்பெடிங் ப்ராம்ப்ட்டின் தலைப்பைக் கண்டறிந்தது, ஆனால் அதன் உள்ளார்ந்த சிரமத்தைக் கண்டறியவில்லை. மலிவான மாடலின் வரைவை (draft) ரூட்டருக்கு வழங்குவது AUC-ஐ 0.640 ஆக உயர்த்தியது; இது ப்ராம்ப்ட்டில் மட்டும் இருப்பதை விட, உருவாக்கும் போது (generation) வெளிப்படும் சிக்னல்கள் அதிகத் தகவல்களைத் தருகின்றன என்பதைக் காட்டுகிறது.
இரண்டு அடிப்படைத் தவறுகள்
1. துல்லியம் என்பது தவறான அளவுகோல்
ஒரு ரூட்டர் வெறும் சரியானத் தன்மையைக் கணிப்பது மட்டுமல்லாமல், ஒரு சாதாரணக் கொள்கையுடன் (naïve policy) ஒப்பிடும்போது செலவு-துல்லியம் இடையிலான சமநிலையை (cost-accuracy trade-off) மேம்படுத்த வேண்டும். அது "எப்போதும் அடுத்த நிலைக்கு மாற்றாத" கொள்கையை விடச் சிறப்பாகச் செயல்படவில்லை என்றால், அதன் துல்லியம் எவ்வளவு இருந்தாலும், அது எந்தச் செலவுப் பயனையும் தராது. AUC போன்ற பாரம்பரிய அளவீடுகள் கேஸ்கேட்களின் பொருளாதாரத் தன்மையைப் புறக்கணிக்கின்றன.
2. “எப்போதும் அடுத்த நிலைக்கு மாற்றுவது” என்பது உச்சவரம்பு அல்ல
விலையுயர்ந்த மாடல் பிழையில்லாதது என்று கருதி, "எப்போதும் பெரிய மாடலையே பயன்படுத்துவது" என்பதை இந்தச் சோதனை உச்சவரம்பாகக் கருதியது. ஆனால் உண்மையில், மலிவான மாடல் சரியாகக் கொடுத்த பதில்களைப் பெரிய மாடல் சில நேரங்களில் தவறாக மாற்றியது. எப்போது மலிவான மாடலிலேயே தொடர வேண்டும் என்பதைத் தெரிந்து வைத்திருக்கும் ஒரு சிறந்த ரூட்டர், தேர்ந்தெடுக்கப்பட்ட செலவு அளவீட்டில் "எப்போதும் அடுத்த நிலைக்கு மாற்று" என்ற அடிப்படை அளவுகோலை விட சுமார் 4.2 புள்ளிகள் சிறப்பாகச் செயல்பட முடியும். இந்த இடைவெளி, விலையுயர்ந்த மாடலின் செயல்திறன் உச்சவரம்பு நாம் நினைத்ததை விடக் குறைவு என்பதைக் காட்டுகிறது.
சிறந்த ரூட்டிங் சிக்னல்களை வடிவமைத்தல்
இந்தக் கண்டுபிடிப்புகள் மூன்று நடைமுறை வழிகளைப் பரிந்துரைக்கின்றன:
- உருவாக்க நேரக் குறிப்புகளைச் சேர்க்கவும் (Include generation-time cues). மலிவான மாடலின் இடைநிலை வெளியீட்டை (அதன் வரைவு) ரூட்டருக்கு வழங்குவதன் மூலம், ப்ராம்ப்ட் மட்டும் மறைத்து வைத்திருக்கும் சிரமத்தைக் கண்டறிய முடியும்.
- பணி சார்ந்த மேற்பரப்பு அம்சங்களுக்கு முன்னுரிமை அளிக்கவும் (Prioritize task-specific surface features). நீளம், குறிப்பிட்ட ஆபரேட்டர்களின் இருப்பு அல்லது கோட்-ஸ்டைல் குறிகாட்டிகள் போன்ற எளிய அளவீடுகள், பொதுவான செமாண்டிக் எம்பெடிங்குகளை விடச் சிறந்த கணிப்புகளை வழங்கக்கூடும்.
- செலவு சார்ந்த அளவீடுகளுடன் வெற்றியை அளவிடவும் (Measure success with cost-aware metrics). வெறும் துல்லியம் அல்லது AUC-க்கு பதிலாக, இலக்குத் தரத்தைப் பேணிக்கொண்டு எத்தனை விலையுயர்ந்த அழைப்புகளைத் தவிர்க்க முடிந்தது என்பதை மதிப்பீடு செய்யவும்.
சுருக்கம்: துல்லியத்திற்காக மட்டும் மேம்படுத்தப்படும் ஒரு ரூட்டர் செலவுச் சேமிப்பை உறுதி செய்ய முடியாது; பயனுள்ள ரூட்டிங்கிற்கு உருவாக்கும் நேரத் தரவுகளும் (generation-time evidence) மற்றும் செலவு சார்ந்த மதிப்பீடும் தேவை.
