Kimi குழுவின் சமீபத்திய திறந்த-எடை (open-weights) மாதிரியான Kimi K3, 2.8 டிரில்லியன் அளவுருக்களைக் கொண்ட mixture-of-experts (MoE) அடிப்படை கட்டமைப்பையும், 1 மில்லியன் டோக்கன் சூழல் சாளரத்தையும் (context window) கொண்டுள்ளது. இது மூடிய-API சார்ந்த சார்புநிலை (closed-API lock-in) இன்றி, டெவலப்பர்கள் உள்ளூரிலேயே (locally) எவற்றையெல்லாம் இயக்க முடியும் என்பதை உடனடியாக விரிவுபடுத்துகிறது.
MoE வடிவமைப்பு செயல்படும் அளவுருக்களின் எண்ணிக்கையை 104 பில்லியனாகக் கட்டுப்படுத்துகிறது, இதன் மூலம் வேகத்தைத் தக்கவைத்துக் கொண்டே பல டிரில்லியன் அளவுருக்கள் கொண்ட மாதிரியின் பகுத்தறியும் திறனை வழங்குகிறது. இந்தத் திறன் முந்தைய Kimi K2 வெளியீட்டை விட 2.5× கூடுதல் வேகத்தை அளிக்கிறது—தற்போதுள்ள திறந்த மாதிரிகளில் கணினித் திறன் (compute) அல்லது தாமத வரம்புகளை (latency ceilings) எதிர்கொள்ளும் எவருக்கும் இது ஒரு பெரிய முன்னேற்றமாகும்.
இந்த மேம்பாடு இப்போது ஏன் முக்கியமானது
அளவீடு மற்றும் சூழல் நீளம் (context length) ஆகியவற்றில் திறந்த-எடை மாதிரிகள் பாரம்பரியமாக உரிமம் பெற்ற (proprietary) அமைப்புகளை விட பின்தங்கியே உள்ளன. Kimi K3 அதன் பிரம்மாண்டமான அளவோடு, ஒரு மில்லியன் டோக்கன்கள் வரை தாங்கக்கூடிய சூழல் சாளரத்தையும் இணைப்பதன் மூலம் இந்த நிலையை மாற்றுகிறது—இது ஒரு முழுமையான குறியீட்டு களஞ்சியத்தையோ (code repository) அல்லது ஒரு நீண்ட ஆராய்ச்சித் தாளையோ ஒரே முறையில் உள்வாங்க போதுமானது. retrieval-augmented generation (RAG) செயல்முறைகள், நீண்ட வடிவ உதவியாளர்கள் அல்லது தன்னாட்சி பிழைத்திருத்தக் கருவிகளை (autonomous debugging tools) உருவாக்கும் டெவலப்பர்களுக்கு, இந்த கூடுதல் சூழல் தரவுகளைத் துண்டுகளாகப் பிரிக்கும் (chunking strategies) தேவையைத் தவிர்க்கிறது.
தொழில்நுட்பக் கட்டமைப்பு
- Stable LatentMoE routing: டோக்கன்கள் 896 நிபுணர்களிடையே (experts) பகிரப்படுகின்றன, இதில் ஒரு டோக்கனுக்கு 16 நிபுணர்கள் செயல்படுத்தப்படுகிறார்கள். இந்த அரிதானச் செயல்பாடு (sparse activation) நினைவகத் தேவையை (memory footprint) குறைக்கிறது, அதே சமயம் ஒரு மிகப்பெரிய அறிவுத் தொகுப்பிலிருந்தும் தகவல்களைப் பெறுகிறது.
- Kimi Delta Attention (KDA): ஆழமான நெட்வொர்க்குகளில் தகவல் ஓட்டத்தை நிலைநிறுத்தும் ஒரு புதிய attention வகை இதுவாகும், இது மிகப்பெரிய மாதிரிகளில் ஏற்படக்கூடிய கிரேடியன்ட் நிலையற்ற தன்மை (gradient instability) அபாயத்தைக் குறைக்கிறது.
- Expert-parallel training: ஒவ்வொரு நிபுணரும் தங்களின் சொந்த வன்பொருள் பிரிவில் இயங்குவதை உறுதி செய்யும் வகையில் குழு கணினித் திறனை (compute) ஒழுங்குபடுத்தியுள்ளது, இது பல நிபுணர்கள் ஒரே வளங்களுக்காகப் போட்டியிடும்போது ஏற்படும் நெரிசல்களைத் (bottlenecks) தடுக்கிறது.
- Advanced memory management: தனிப்பயனாக்கப்பட்ட ஒதுக்கீடு உத்திகள் (Custom allocation strategies), GPU நினைவகத்தை முழுமையாகத் தீர்க்காமல் reinforcement-learning அடிப்படையிலான ஏஜென்ட் பயிற்சியை ஆதரிக்க இந்த மாதிரியை அனுமதிக்கின்றன.
திறந்த எடைகள் எவற்றைச் சாத்தியமாக்குகின்றன
எடைகள் பொதுப்படையாக இருப்பதால், பயனர்கள் மாதிரியின் உள்நிலைத் பிரதிநிதித்துவங்களை (internal representations) தணிக்கை செய்யவும், சார்புகளைக் (biases) கண்டறியவும் அல்லது குறிப்பிட்ட துறைகளுக்கு (niche domains) ஏற்ப மாற்றியமைக்கவும் முடியும். உரிமம் பெற்ற தரவுகளில் Fine-tuning செய்வதற்கு இனி கிளவுட் ஒப்பந்தங்கள் தேவையில்லை; முழுமையான செயல்முறையையும் குழுவின் expert-parallel தேவைகளைப் பூர்த்தி செய்யும் உள்ளூர் வன்பொருளில் (on-prem hardware) இயக்க முடியும்.
உடனடி டெவலப்பர் பயன்பாட்டு வழக்குகள்
- ஒரே ஒரு ப்ராம்ப்ட்டில் (prompt) மிகப்பெரிய ஆவணக் களஞ்சியங்களிலிருந்து தகவல்களைப் பெறும் retrieval-augmented generation அமைப்புகள்.
- முழுத் திட்டத்தின் சூழலையும் (project context) நினைவகத்தில் வைத்திருக்கும் நீண்ட வடிவ குறியீட்டு உதவியாளர்கள் (long-form coding assistants).
- ப்ராம்ப்ட்டை (prompt) உடைக்காமல் மில்லியன் கணக்கான வரிகளை ஸ்கேன் செய்யும் களஞ்சியம் முழுவதையும் உள்ளடக்கிய குறியீடு பகுப்பாய்வுக் கருவிகள் (Repository-wide code analysis tools).
- பிழைகளைச் சரிசெய்வதைப் பற்றிப் பகுத்தறியும் போது, முழுமையான செயல்பாட்டுத் தடயத்தையும் (execution trace) பராமரிக்கும் தன்னாட்சி பிழைத்திருத்த ஏஜென்ட்கள் (Autonomous debugging agents).
