Anthropic സെപ്റ്റംബർ 1-ന് Claude Fable 5.1, Claude Mythos 5.1 എന്നിവ പുറത്തിറക്കി. രണ്ട് മോഡലുകളും ഇപ്പോൾ 1 മില്യൺ ടോക്കണുകൾ വരെയുള്ള കോൺടെക്സ്റ്റ് സ്വീകരിക്കുന്നു, 128k ടോക്കണുകൾ വരെ ഔട്ട്പുട്ട് നൽകാൻ കഴിയും, കൂടാതെ ഓരോ ആവശ്യത്തിനനുസരിച്ച് അവയുടെ റീസണിംഗ് ഡെപ്ത് (reasoning depth) ക്രമീകരിക്കാനും സാധിക്കും—ഇതെല്ലാം ഓരോ കോളിന്റെയും ചിലവ് കുറച്ചുകൊണ്ട് തന്നെ ചെയ്യുന്നു. ഈ അപ്‌ഗ്രേഡുകൾ വെറും ബെഞ്ച്മാർക്ക് സ്കോറുകൾ വർദ്ധിപ്പിക്കുക എന്നതിലുപരി, കുറഞ്ഞ ചിലവിലും കൂടുതൽ വിശ്വസനീയമായും AI സഹായത്തോടെയുള്ള കോഡിംഗിനും ഉയർന്ന പ്രാധാന്യമുള്ള ഗവേഷണങ്ങൾക്കുമാണ് ലക്ഷ്യമിടുന്നത്.

പുതിയ പതിപ്പുകൾ പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

മുൻപത്തെ Claude തലമുറയിൽ കോൺടെക്സ്റ്റ് വിൻഡോകൾ ഏതാനും ആയിരം ടോക്കണുകളിൽ പരിമിതമായിരുന്നു, ഇത് ഡെവലപ്പർമാരെ കോഡോ ഡാറ്റയോ കൈകൊണ്ട് വിഭജിക്കാൻ നിർബന്ധിതരാക്കിയിരുന്നു. കൂടാതെ, ഉപയോക്താക്കൾക്ക് റീസണിംഗ് ഡെപ്ത് മാനുവലായി ക്രമീകരിക്കേണ്ടി വന്നിരുന്നു, ഇത് ലളിതമായ ഒരു പ്രോംപ്റ്റിനെ പരീക്ഷണാടിസ്ഥാനത്തിലുള്ള ഒരു കളിയാക്കി മാറ്റിയിരുന്നു. കാഷെ-റീഡ് (Cache-read) ചാർജുകൾ കാരണം നീണ്ട സെഷനുകളും ആവർത്തിച്ചുള്ള ടൂൾ കോളുകളും ചിലവേറിയതായിരുന്നു, കൂടാതെ കോഡ് റിവ്യൂവിനെ സാവധാനത്തിലാക്കുന്ന തെറ്റായ സുരക്ഷാ മുന്നറിയിപ്പുകളെക്കുറിച്ച് (false-positive warnings) സെക്യൂരിറ്റി ടീമുകൾ പരാതിപ്പെട്ടിരുന്നു.

Claude Fable 5.1, Claude Mythos 5.1 എന്നിവ ഈ പ്രശ്നങ്ങളെ നേരിട്ട് പരിഹരിക്കുന്നു. ഇവ രണ്ടിനും ഒരേ അടിസ്ഥാന ബുദ്ധി (core brain) ആണെങ്കിലും, ഓരോ മോഡലിന്റെയും ലക്ഷ്യമിടുന്ന ഉപഭോക്താക്കൾക്കായി Anthropic വ്യത്യസ്തമായ സുരക്ഷാ മാനദണ്ഡങ്ങൾ (guardrails) ഏർപ്പെടുത്തിയിട്ടുണ്ട്.

മാറ്റങ്ങൾ യഥാർത്ഥത്തിൽ എന്ത് ചെയ്യുന്നു

  • ചിലവ് കുറയ്ക്കുന്നു – Anthropic കാഷെ റീഡ് നിരക്ക് കുറച്ചു, അതിനാൽ നീണ്ടതും ആവർത്തനസ്വഭാവമുള്ളതുമായ കോഡിംഗ് സെഷനുകളും ആവർത്തിച്ചുള്ള ടൂൾ കോളുകളും ഇപ്പോൾ ഗണ്യമായി കുറഞ്ഞ ചിലവിൽ സാധ്യമാണ്—ഇത് സ്റ്റാർട്ടപ്പുകൾക്കും ഇൻ-ഹൗസ് ഡെവലപ്പ്മെന്റ് ടീമുകൾക്കും നിർണ്ണായകമായ ഒരു ഘടകമാണ്.
  • അഡാപ്റ്റീവ് തിങ്കിംഗ് (Adaptive thinking) – ഒരു ടാസ്കിന് എത്രത്തോളം റീസണിംഗ് ആവശ്യമാണെന്ന് മോഡൽ സ്വയം തീരുമാനിക്കുന്നു. ഉപയോക്താക്കൾക്ക് ഇനി മുതൽ "എഫർട്ട് ലെവലുകൾ" (effort levels) മാറ്റുകയോ എത്രത്തോളം ചെയിൻ-ഓഫ്-തോട്ട് (chain-of-thought) പ്രോംപ്റ്റിംഗ് ആവശ്യമാണെന്ന് ഊഹിക്കുകയോ ചെയ്യേണ്ടതില്ല.
  • ടേൺ-സ്കോപ്പ്ഡ് മെസ്സേജുകൾ (Turn-scoped messages) – സിസ്റ്റം ലെവൽ നിർദ്ദേശങ്ങൾ ഒരു സംഭാഷണത്തിന് (single exchange) മാത്രം ബാധകമായിരിക്കും, ഇത് പഴയ നിർദ്ദേശങ്ങൾ പിന്നീട് വരുന്ന സംഭാഷണങ്ങളെ ബാധിക്കുന്നത് തടയുന്നു.
  • സുരക്ഷാ മെച്ചപ്പെടുത്തലുകൾ – Claude Code ഉപയോക്താക്കൾ സൈബർ സുരക്ഷാ സംബന്ധമായ തെറ്റായ മുന്നറിയിപ്പുകളിൽ (false positives) ഏകദേശം 60% കുറവ് റിപ്പോർട്ട് ചെയ്യുന്നു, ഇത് വ്യാജ മുന്നറിയിപ്പുകൾക്കായി ചെലവഴിക്കുന്ന സമയം കുറയ്ക്കുന്നു.
  • ദുർബലത കണ്ടെത്തൽ (Vulnerability detection) – Fable 5.1 സോഫ്റ്റ്‌വെയർ പിഴവുകൾ കണ്ടെത്തുന്നുണ്ടെങ്കിലും, എക്സ്പ്ലോയിറ്റ് കോഡ് (exploit code) നിർമ്മിക്കുന്നതിൽ നിന്ന് തടയപ്പെട്ടിരിക്കുന്നു, ഇത് ഓഡിറ്റർമാരുടെ ഉൽപ്പാദനക്ഷമത നിലനിർത്തുന്നതോടൊപ്പം ദുരുപയോഗം ചെയ്യപ്പെടാനുള്ള സാധ്യതയും ഒഴിവാക്കുന്നു.
  • ഉയർന്ന പ്രാധാന്യമുള്ള ഗവേഷണങ്ങളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു – സൈബർ സുരക്ഷയിലും ലൈഫ് സയൻസുകളിലും വിശ്വസനീയമായ പ്രോഗ്രാമുകൾക്കായി Mythos 5.1 സേവനം നൽകുന്നു. സയഫർ ഡിസൈൻ (cipher design) പോലുള്ള ജോലികളിൽ Anthropic ഇതിനെ കഠിനമായി പരീക്ഷിക്കുകയും, അതിൽ നിന്നുള്ള അറിവുകൾ പൊതുവായ Fable മോഡലിലേക്ക് നൽകുകയും ചെയ്യുന്നു.

ആർക്കൊക്കെ ഗുണമുണ്ടാകും, ആർക്കൊക്കെ ഇത് ലഭിക്കില്ല

IDE അസിസ്റ്റന്റുകൾ, CI പൈപ്പ്‌ലൈനുകൾ അല്ലെങ്കിൽ കസ്റ്റം ബോട്ട്‌സ് എന്നിവ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാർക്ക് പണം ലാഭിക്കാനും സുരക്ഷാ പ്രശ്നങ്ങളിൽ നിന്നുള്ള ശ്രദ്ധ തിരിയുന്നത് കുറയ്ക്കാനും സാധിക്കും. Anthropic-ന്റെ വിശ്വാസ്യത മാനദണ്ഡങ്ങൾ പാലിക്കുന്ന സെക്യൂരിറ്റി അനലിസ്റ്റുകൾക്കും ബയോടെക് ഗവേഷകർക്കും സെൻസിറ്റീവ് ആയ ജോലികൾക്കായി Mythos 5.1-ന്റെ കർശനമായ സുരക്ഷാ സംവിധാനങ്ങൾ ഉപയോഗിക്കാം. ഇതിലെ വെല്ലുവിളി: Mythos പൊതുജനങ്ങൾക്ക് ലഭ്യമല്ല, അതിനാൽ വിശ്വസനീയമായ പ്രോഗ്രാമുകളുമായുള്ള ബന്ധമില്ലാത്ത ചെറിയ ടീമുകൾക്ക് കൂടുതൽ അനുമതികളുള്ള Fable 5.1-നെ ആശ്രയിക്കേണ്ടി വരും.

സാധ്യമായ പോരായ്മകളും തുറന്ന ചോദ്യങ്ങളും

പ്രതിരോധ സംവിധാനങ്ങൾ പരിശോധിക്കാൻ യഥാർത്ഥ ആക്രമണ കോഡുകൾ ആവശ്യമായ റെഡ്-ടീം (red-team) ഉപയോക്താക്കളെ എക്സ്പ്ലോയിറ്റ് ജനറേഷൻ തടയുന്നത് നിരാശപ്പെടുത്തിയേക്കാം. "വിശ്വസനീയമായ പ്രോഗ്രാം" എന്ന നിബന്ധന AI വിപണിയിൽ ഒരു വിഭജനം സൃഷ്ടിച്ചേക്കാം, അവിടെ വലിയ ഫണ്ട് ഉള്ള സ്ഥാപനങ്ങൾക്ക് മാത്രമേ ഏറ്റവും സുരക്ഷിതവും ഉയർന്ന ശേഷിയുള്ളതുമായ മോഡലുകൾ ലഭിക്കൂ. കാഷെ-റീഡ് നിരക്ക് കുറച്ചെങ്കിലും, Anthropic അതിന്റെ പൂർണ്ണമായ ചിലവ് മാതൃക വെളിപ്പെടുത്തിയിട്ടില്ല, ഇത് വലിയ ജോലികൾക്ക് എത്രത്തോളം ലാഭമുണ്ടാകുമെന്ന് ഡെവലപ്പർമാരെ സംബന്ധിച്ചിടത്തോളം അനിശ്ചിതത്വത്തിലാക്കുന്നു.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

ചിലവ് കുറയുന്നതും സുരക്ഷാ വാഗ്ദാനങ്ങളും യഥാർത്ഥ ലോകത്ത് ഉൽപ്പാദനക്ഷമത വർദ്ധിപ്പിക്കുന്നുണ്ടോ എന്ന് ഉപയോഗ നിരക്കുകൾ (adoption rates) കാണിച്ചുതരും. വലിയ കോഡ്ബേസുകൾക്കായി ഡെവലപ്പർമാർ 1 മില്യൺ ടോക്കൺ വിൻഡോ തിരഞ്ഞെടുക്കുകയാണെങ്കിൽ, Mythos-ലെ സുരക്ഷാ മാനദണ്ഡങ്ങൾ കൂടുതൽ ആളുകൾക്കായി തുറന്നുനൽകാൻ Anthropic സമ്മർദ്ദം അനുഭവപ്പെട്ടേക്കാം. പുതിയ സുരക്ഷാ സംവിധാനം ആക്രമണങ്ങൾ നിറഞ്ഞ സാഹചര്യങ്ങളിൽ എത്രത്തോളം ഫലപ്രദമാണെന്ന് മനസ്സിലാക്കാൻ തെറ്റായ മുന്നറിയിപ്പുകളുടെ കുറവും അത് വൾനറബിലിറ്റി സ്കാനിംഗ് പൈപ്പ്‌ലൈനുകളിൽ ചെലുത്തുന്ന സ്വാധീനവും നിരീക്ഷിക്കുക.

ചുരുക്കത്തിൽ: Claude Fable 5.1, Claude Mythos 5.1 എന്നിവ ബെഞ്ച്മാർക്കുകൾ തകർക്കുന്നതിനേക്കാൾ ഉപരിയായി, ദീർഘകാലം നീണ്ടുനിൽക്കുന്ന AI വർക്ക്ഫ്ലോകളുടെ ചിലവ് കുറയ്ക്കാനും അതോടൊപ്പം തന്നെ ഏറ്റവും സെൻസിറ്റീവ് ആയ ആപ്ലിക്കേഷനുകൾക്കായി സുരക്ഷാ വലയങ്ങൾ ശക്തമാക്കാനുമാണ് ലക്ഷ്യമിടുന്നത്.