എങ്ങനെയാണ് ഈ റീറൈറ്റ് (rewrite) നടന്നത്
2025 ഡിസംബറിൽ Anthropic, Bun വാങ്ങി അതിന്റെ Zig കോഡ്ബേസ് Rust ഉപയോഗിച്ച് മാറ്റാൻ തീരുമാനിച്ചു. ആ സമയത്ത് മറ്റാർക്കും ലഭ്യമായിരുന്നില്ലാത്ത Claude Fable 5 എന്ന LLM-ന്റെ ഒരു പ്രീ-റിലീസ് പതിപ്പാണ് കമ്പനി ഉപയോഗിച്ചത്. മോഡലിന്റെ അറുപത്തിനാല് കോപ്പികൾ ഒരേസമയം പ്രവർത്തിക്കുകയും മിനിറ്റിൽ ഏകദേശം 1,300 വരി കോഡുകൾ ഉത്പാദിപ്പിക്കുകയും ചെയ്തു.
ലീഡ് എഞ്ചിനീയർ Jarred Sumner ഈ പ്രശ്നം ഏജന്റുകൾക്ക് കൈമാറി മാറിപ്പോകുകയല്ല ചെയ്തത്. Zig ശൈലികളെ Rust-ന് തുല്യമായ രീതിയിലേക്ക് മാറ്റുന്നതിനായി അദ്ദേഹം ആദ്യം മണിക്കൂറുകളോളം ഒരു ഗൈഡ് തയ്യാറാക്കി. മുഴുവൻ റിപ്പോസിറ്ററിയും കൈകാര്യം ചെയ്യുന്നതിന് മുമ്പ്, മൂന്ന് ഫയലുകൾ ഉപയോഗിച്ചുള്ള ഒരു ട്രയൽ റൺ വഴി ഏജന്റുകളുടെ ഔട്ട്പുട്ട് ക്രമീകരിക്കാൻ അദ്ദേഹത്തിന് കഴിഞ്ഞു. ഏജന്റുകൾ നിർദ്ദേശിക്കുന്ന ഓരോ മാറ്റവും രണ്ട് "അഡ്വേഴ്സേറിയൽ" (adversarial) ഏജന്റുകൾ പരിശോധിച്ചു, കൂടാതെ 11 ദിവസം നീണ്ടുനിന്ന ഈ പ്രക്രിയ മുഴുവൻ Sumner നേരിട്ട് നിരീക്ഷിക്കുകയും ചെയ്തു.
Anthropic-ന്റെ ആഭ്യന്തര കണക്കുകൾ പ്രകാരം ടോക്കൺ ഉപയോഗത്തിനായി $165,000 ചിലവായി. കോഡ് മെയിൻ ബ്രാഞ്ചിലേക്ക് (main branch) ലയിപ്പിക്കുന്നതിന് മുമ്പ് നടത്തിയ നേരിട്ടുള്ള API കോളുകൾ മാത്രമാണ് ഈ തുകയിൽ ഉൾപ്പെട്ടിരിക്കുന്നത്.
മറഞ്ഞിരിക്കുന്ന ചിലവ്
പുതിയ Rust കോഡ് സ്ഥിരപ്പെടുത്തുന്നതിന് ആവശ്യമായ കമ്പ്യൂട്ടിംഗ് (compute) ചിലവ് ഈ $165,000 എന്ന കണക്കിൽ ഉൾപ്പെടുത്തിയിട്ടില്ല. ആഭ്യന്തര വിശകലനമനുസരിച്ച്, കോഡ് ലയിപ്പിച്ച ശേഷമുള്ള തിരുത്തലുകൾ (post-merge fixes), കണ്ടിന്യൂസ് ഇന്റഗ്രേഷൻ (continuous-integration) റണ്ണുകൾ, അധിക പരിശോധനകൾ എന്നിവയെല്ലാം ചേർത്ത് ആകെ ചിലവ് ഇതിലും ഉയർന്നേക്കാം. ഈ കണക്ക് പൊതുവായ API നിരക്കുകൾ അടിസ്ഥാനമാക്കിയുള്ളതാണ്; Claude Fable 5 ഒരു പ്രൈവറ്റ് പ്രിവ്യൂ ആയതിനാൽ, യഥാർത്ഥത്തിൽ നൽകിയ തുകയിൽ വ്യത്യാസം വരാം.
വേഗതയും സുരക്ഷയും തമ്മിലുള്ള പോരാട്ടം
ഈ റീറൈറ്റിലൂടെ യഥാർത്ഥ Zig പതിപ്പിനേക്കാൾ വേഗതയുള്ള ഒരു Rust റൺടൈം (runtime) ലഭിച്ചുവെങ്കിലും, വലിയൊരു ഓഡിറ്റ് ബാക്ക്ലോഗ് (audit backlog) അവശേഷിപ്പിച്ചു. പുതുതായി നിർമ്മിച്ച Rust ഫയലുകളിൽ ഏകദേശം 4% "unsafe" ബ്ലോക്കുകൾ അടങ്ങിയവയാണ്—അതായത് Rust-ന്റെ കർശനമായ സുരക്ഷാ ഉറപ്പുകളെ മറികടക്കുന്ന കോഡുകൾ. കൈകൊണ്ട് എഴുതുന്ന Rust പ്രോജക്റ്റുകളിൽ സാധാരണയായി ഇതിന്റെ ശതമാനം വളരെ കുറവായിരിക്കും. അതിനാൽ, ഈ ബ്ലോക്കുകൾ മെമ്മറി-കറപ്ഷൻ ബഗുകൾക്ക് (memory-corruption bugs) കാരണമായേない എന്ന് പരിശോധകർ ഇപ്പോൾ ഉറപ്പുവരുത്തേണ്ടതുണ്ട്.
Sumner-ന്റെ വൈദഗ്ധ്യമില്ലായിരുന്നെങ്കിൽ ഏജന്റുകളുടെ ഔട്ട്പുട്ട് അർത്ഥശൂന്യമാകുമായിരുന്നു. മിനിറ്റിൽ 1,300 വരികൾ എന്ന വേഗതയിലും, ലോജിക്കൽ പിശകുകൾ കണ്ടെത്താനും, ആർക്കിടെക്ചറൽ ഏകീകരണം (architectural coherence) ഉറപ്പാക്കാനും, ടെസ്റ്റ് സ്യൂട്ട് പുതിയ ഇംപ്ലിമെന്റേഷനെ ശരിയായി കവർ ചെയ്യുന്നുണ്ടെന്ന് സ്ഥിരീകരിക്കാനും അറിവുള്ള ഒരു മേൽനോട്ടക്കാരൻ ആവശ്യമാണ്.
AI എപ്പോൾ തിളങ്ങുന്നു, എപ്പോൾ പരാജയപ്പെടുന്നു
Bun പോർട്ട് എന്നത് ഒരു പാഠപുസ്തക മാതൃകയിലുള്ള വിവർത്തനമായിരുന്നു: നിലവിലുള്ള ഒരു സമഗ്രമായ ടെസ്റ്റ് സ്യൂട്ട് ഉപയോഗിച്ച് ഒരു ഭാഷയിൽ നിന്ന് മറ്റൊരു ഭാഷയിലേക്ക് മാറ്റുക എന്നത്. ആ കൃത്യമായ അതിർവരമ്പുകൾ LLM-ന് വ്യക്തമായ ലക്ഷ്യം നൽകുകയും സർഗ്ഗാത്മകമായ പ്രശ്നപരിഹാരത്തിന്റെ (creative problem-solving) ആവശ്യകത കുറയ്ക്കുകയും ചെയ്തു. എന്നിരുന്നാലും, മിക്ക സോഫ്റ്റ്വെയർ ജോലികളും മാറിക്കൊണ്ടിരിക്കുന്ന ബിസിനസ്സ് നിയമങ്ങൾ കൈകാര്യം ചെയ്യുകയോ, അവ്യക്തമായ ആവശ്യകതകൾ പരിഹരിക്കുകയോ, അല്ലെങ്കിൽ പുതിയ ഫീച്ചറുകൾ പൂജ്യത്തിൽ നിന്ന് നിർമ്മിക്കുകയോ ചെയ്യുന്നവയാണ്. അത്തരം സങ്കീർണ്ണമായ സാഹചര്യങ്ങളിൽ, ഇതേ അളവിലുള്ള AI സഹായം സമാനമായ വേഗതയോ ചിലവ് ലാഭമോ നൽകാൻ സാധ്യതയില്ല.
AI-അധിഷ്ഠിത വികസനത്തെ അനുകൂലിക്കുന്നവർ, മിനിറ്റുകൾക്കുള്ളിൽ ആയിരക്കണക്കിന് വരികൾ നിർമ്മിക്കപ്പെടുന്നു എന്ന ഉൽപ്പാദനക്ഷമതയെ അടിസ്ഥാനമാക്കി, ലാർജ് ലാംഗ്വേജ് മോഡലുകൾക്ക് വലിയ ടീമുകളെ മാറ്റിസ്ഥാപിക്കാനാകുമെന്ന് വാദിക്കുന്നു. എന്നാൽ Anthropic-ന്റെ ഈ കേസ് ആ കാഴ്ചപ്പാടിനെ തിരുത്തുന്നു: പ്രധാന ടോക്കൺ ചിലവിൽ കോഡ് ലയിപ്പിച്ച ശേഷമുള്ള പരിശോധനകൾക്ക് (post-merge validation) ആവശ്യമായ വലിയ കമ്പ്യൂട്ടിംഗ് ചിലവ് ഉൾപ്പെട്ടിട്ടില്ല, കൂടാതെ "unsafe" കോഡ് സൃഷ്ടിക്കുന്ന സുരക്ഷാ പ്രശ്നങ്ങൾ പരിഹരിക്കാൻ മനുഷ്യപ്രയത്നം ആവശ്യമായി വരും.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
ഇതേ Claude അധിഷ്ഠിത വർക്ക്ഫ്ലോ മറ്റ് കോഡ്ബേസുകളിലും പ്രയോഗിക്കാൻ പദ്ധതിയുണ്ടോ എന്ന് Anthropic വെളിപ്പെടുത്തിയിട്ടില്ല. അങ്ങനെയാണെങ്കിൽ, കമ്പനി ടോക്കൺ ബില്ല് മാത്രമല്ല, ആകെ ലൈഫ് സൈക്കിൾ ചിലവും (total lifecycle cost) കണക്കിലെടുക്കേണ്ടി വരും. നിരീക്ഷകർ താഴെ പറയുന്ന കാര്യങ്ങൾ ശ്രദ്ധിക്കണം:
- ഓഡിറ്റ് ബാക്ക്ലോഗ് എത്ര വേഗത്തിൽ കുറയുന്നുവെന്നും, പരിശോധകർ കോഡ് റീഫാക്ടർ (refactor) ചെയ്യുമ്പോൾ "unsafe" കോഡിന്റെ അനുപാതം കുറയുന്നുണ്ടോ എന്നും.
- ഭാവിയിലെ പ്രക്രിയകളിൽ പൊതുവായി ലഭ്യമായ കൂടുതൽ മെച്ചപ്പെട്ട മോഡലുകൾ ഉപയോഗിക്കുന്നുണ്ടോ എന്നത്, ഇത് ചിലവ് കണക്കാക്കുന്നത് കൂടുതൽ സുതാര്യമാക്കും.
- Bun-ന്റെ ഉപയോഗത്തിലുള്ള സ്വാധീനം: വേഗതയേറിയ റൺടൈമുകൾ ഉപയോക്താക്കളെ ആകർഷിച്ചേക്കാം, എന്നാൽ സുരക്ഷാ ആശങ്കകൾ ആ നേട്ടത്തെ ഇല്ലാതാക്കിയേക്കാം.
ചുരുക്കത്തിൽ
ലളിതമായ കോഡ് വിവർത്തനങ്ങളെ AI വേഗത്തിലാക്കാൻ സഹായിച്ചേക്കാം, എന്നാൽ തുടർന്നുള്ള കമ്പ്യൂട്ടിംഗ് ചിലവും മനുഷ്യന്റെ പരിശോധനയും ടോക്കൺ ബില്ലിൽ ലഭിക്കുന്ന ലാഭത്തെ ഇല്ലാതാക്കിയേക്കാം. ലാർജ് ലാംഗ്വേജ് മോഡലുകൾക്ക് വലിയ അളവിൽ കോഡ് വേഗത്തിൽ നിർമ്മിക്കാൻ കഴിയുമെങ്കിലും, സുരക്ഷയ്ക്കും കൃത്യതയ്ക്കും മിക്ക സോഫ്റ്റ്വെയർ പ്രോജക്റ്റുകളെയും മുന്നോട്ട് കൊണ്ടുപോകുന്ന സൂക്ഷ്മമായ ജോലികൾക്കും മനുഷ്യന്റെ വൈദഗ്ധ്യം അത്യന്താപേക്ഷിതമാണെന്ന് Bun റീറൈറ്റ് കാണിച്ചുതരുന്നു.
