OpenAI മുൻ എക്സിക്യൂട്ടീവ് ആയ Barret Zoph, Gemini ലാർജ്-ലാംഗ്വേജ് മോഡലുകളുടെ വികസനം വേഗത്തിലാക്കുന്നതിനായി ഗൂഗിളിൽ റിസർച്ച് വൈസ് പ്രസിഡന്റായി ചേർന്നു. റൈൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗിലും (reinforcement learning) പോസ്റ്റ്-ട്രെയിനിംഗ് (post-training) സാങ്കേതികവിദ്യകളിലും Zophക്കുള്ള വൈദഗ്ധ്യം Gemini-യുടെ അലൈൻമെന്റ് (alignment), റീസണിംഗ് (reasoning), സുരക്ഷ (safety) എന്നിവ മെച്ചപ്പെടുത്താൻ സഹായിക്കുമെന്ന് ഗൂഗിൾ പ്രതീക്ഷിക്കുന്നു—നിലവിൽ OpenAI-യുടെ GPT സീരീസ് മുന്നിട്ടുനിൽക്കുന്ന മേഖലകളാണിവ.

AI രംഗത്തെ പ്രമുഖരുടെ അതിവേഗമായ മാറ്റങ്ങൾ

Zoph-ന്റെ റെസ്യൂമെ ഈ മേഖലയിലെ സമീപകാലത്തെ അസ്ഥിരതകളുടെ ഒരു ഭൂപടം പോലെയാണ്. OpenAI-യിലെ രണ്ട് വർഷത്തിന് ശേഷം, 2024 ഒക്ടോബറിൽ അദ്ദേഹം മുൻ OpenAI CTO Mira Murati-യോടൊപ്പം Thinking Machines എന്ന സ്റ്റാർട്ടപ്പ് സ്ഥാപിക്കാൻ രാജിവെച്ചു. ഏതാനും മാസങ്ങൾക്കുള്ളിൽ ആ സംരംഭം പരാജയപ്പെട്ടു; 2025 ജനുവരി ആയപ്പോഴേക്കും Zoph-ഉം സഹസ്ഥാപകനായ Luke Metz-ഉം AI എന്റർപ്രൈസ് സെയിൽസ് നയിക്കുന്നതിനായി വീണ്ടും OpenAI-യിൽ തിരിച്ചെത്തി. ആ റോളിൽ അഞ്ച് മാസത്തിന് ശേഷം, 2025 ജൂണിൽ Zoph വീണ്ടും രാജിവെച്ചു, ഇത് ഗൂഗിളിലേക്കുള്ള അദ്ദേഹത്തിന്റെ മാറ്റത്തിന് വഴിയൊരുക്കി.

ഓരോ ഘട്ടവും ഒരു വലിയ പാറ്റേൺ പ്രതിഫലിപ്പിക്കുന്നു: പ്രമുഖ ഗവേഷകർ പ്രശസ്തമായ ലാബുകൾക്കും വളർന്നുവരുന്ന സ്റ്റാർട്ടപ്പുകൾക്കും ടെക് ഭീമന്മാർക്കും ഇടയിൽ മാറിമറിയുന്നു. Zoph-ന്റെ ഏറ്റവും പുതിയ നീക്കം, AI രംഗത്ത് കോടിക്കണക്കിന് ഡോളർ നിക്ഷേപിച്ചിട്ടുണ്ടെങ്കിലും OpenAI-യുടെ ശ്രദ്ധേയമായ മോഡൽ റിലീസുകളോട് മത്സരിക്കാൻ പ്രയാസപ്പെടുന്ന ഒരു കമ്പനിയിലേക്കാണ്.

എന്തുകൊണ്ട് റൈൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗും “പോസ്റ്റ്-ട്രെയിനിംഗും” പുതിയ പോരാട്ടഭൂമിയാകുന്നു

വിപുലമായ ടെക്സ്റ്റ് കോർപ്പസുകളിൽ (text corpora) നിന്നുള്ള പ്രീ-ട്രെയിനിംഗിലൂടെയാണ് ലാർജ്-ലാംഗ്വേജ് മോഡലുകൾ അടിസ്ഥാനപരമായ കഴിവുകൾ നേടിയെടുക്കുന്നത്. അടുത്ത ഘട്ടം—അതിനെ പലപ്പോഴും പോസ്റ്റ്-ട്രെയിനിംഗ് എന്ന് വിളിക്കുന്നു—ആ മോഡലുകളെ യഥാർത്ഥ ലോക ഉപയോഗത്തിനായി ഫൈൻ-ട്യൂൺ ചെയ്യുന്നു. ഏറ്റവും പ്രമുഖമായ പോസ്റ്റ്-ട്രെയിനിംഗ് രീതിയാണ് റൈൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് ഫ്രം ഹ്യൂമൻ ഫീഡ്‌ബാക്ക് (RLHF). ഇതിൽ മനുഷ്യരായ മൂല്യനിർണ്ണയിതാക്കൾ മോഡൽ ഔട്ട്‌പുട്ടുകൾ വിലയിരുത്തുകയും, ആ വിലയിരുത്തലുകൾക്ക് അനുസൃതമായി മോഡലിനെ ക്രമീകരിക്കാൻ ഒരു റൈൻഫോഴ്‌സ്‌മെന്റ്-ലേണിംഗ് അൽഗോരിതം പ്രവർത്തിക്കുകയും ചെയ്യുന്നു.

ഗൂഗിളിന്റെ Gemini മോഡലുകൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നുണ്ടെങ്കിലും, അവയുടെ സുരക്ഷയും നിർദ്ദേശങ്ങൾ പാലിക്കാനുള്ള കഴിവും (instruction-following) OpenAI-യുടെ ഏറ്റവും പുതിയ GPT-യേക്കാൾ പിന്നിലാണെന്ന് വിമർശകർ ചൂണ്ടിക്കാട്ടുന്നു. RL, RLHF എന്നിവയുടെ അതിരുകൾ നിരന്തരം വികസിപ്പിച്ചുകൊണ്ടിരിക്കുന്ന ഒരു ഗവേഷകനെ നിയമിക്കുന്നതിലൂടെ, ആ വിടവ് നികത്താനുള്ള ഗൂഗിളിന്റെ താൽപ്പര്യമാണ് വെളിപ്പെടുന്നത്. മനുഷ്യരുടെ ഫീഡ്‌ബാക്ക് കൂടുതൽ കാര്യക്ഷമമായി ശേഖരിക്കാനും, സൂക്ഷ്മമായ ഉദ്ദേശ്യങ്ങൾ മനസ്സിലാക്കുന്ന റിവാർഡ് മോഡലുകൾ വികസിപ്പിക്കാനും, സ്ഥിരത നഷ്ടപ്പെടാതെ റീസണിംഗ് മെച്ചപ്പെടുത്തുന്ന പുതിയ RL അൽഗോരിതങ്ങൾ പരീക്ഷിക്കാനും Zoph സഹായിക്കും.

ഗൂഗിളിനും OpenAI-ക്കും ഇടയിലുള്ള വെല്ലുവിളികൾ

ഗൂഗിളിനെ സംബന്ധിച്ചിടത്തോളം, ക്ലൗഡ് സേവനങ്ങൾ, സെർച്ച്, കൺസ്യൂമർ ഉൽപ്പന്നങ്ങൾ എന്നിവയിലുടനീളം Gemini-യെ ഒരു വാണിജ്യ അടിസ്ഥാനമാക്കി മാറ്റാനുള്ള വർഷങ്ങളായുള്ള ശ്രമത്തിന്റെ ഭാഗമാണ് ഈ നീക്കം. മെച്ചപ്പെട്ട അലൈൻമെന്റ് ഉള്ള മോഡലുകൾ ഉത്തരവാദിത്ത റിസ്ക് കുറയ്ക്കുകയും ഉപഭോക്താക്കളുടെ വിശ്വാസം വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു—വൻകിട സ്ഥാപനങ്ങൾ സുരക്ഷിതമായി ഉപയോഗിക്കാൻ കഴിയുന്ന AI ആവശ്യപ്പെടുമ്പോൾ ഇത് നിർണ്ണായകമാണ്.

അതേസമയം, OpenAI ഒരു വലിയ പ്രതിഭകളുടെ കൊഴിഞ്ഞുപോക്കിലൂടെ കടന്നുപോയിക്കൊണ്ടിരിക്കുകയാണ്. കഴിഞ്ഞ എട്ട് മാസത്തിനിടെ കമ്പനിയുടെ ചീഫ് ഓപ്പറേറ്റിംഗ് ഓഫീസർ, സീനിയർ ഡാറ്റാ സെന്റർ നേതാക്കൾ എന്നിവർ പുറത്തുപോയിട്ടുണ്ട്. ഒരു സാധ്യമായ IPO-യ്ക്ക് വേണ്ടി OpenAI തയ്യാറെടുക്കുന്ന സമയത്താണ് ഈ മാറ്റങ്ങൾ സംഭവിക്കുന്നത്; നേതൃത്വത്തിന്റെ സ്ഥിരതയെക്കുറിച്ച് നിക്ഷേപകർ സാധാരണയായി സൂക്ഷ്മമായി നിരീക്ഷിക്കാറുണ്ട്. ഉദ്യോഗസ്ഥരുടെ മാറ്റം പുതിയ കാഴ്ചപ്പാടുകൾ കൊണ്ടുവരാമെങ്കിലും, ദീർഘകാല ഗവേഷണ പരിപാടികളുടെ തുടർച്ചയെ ബാധിക്കാനും ഇത് കാരണമായേക്കാം.

മറുവാദം: ഒരു നിയമനം കൊണ്ട് മാത്രം Gemini ഒറ്റരാത്രികൊണ്ട് മാറില്ല

RL, സുരക്ഷ, മോഡൽ അലൈൻമെന്റ് എന്നിവയിൽ ഗൂഗിളിന് ഇതിനകം തന്നെ മികച്ച ഗവേഷകരുടെ നിരയുണ്ട്. Zoph-നെപ്പോലെ പ്രഗത്ഭനായ ഒരാൾ വന്നാലും, Gemini പോലുള്ള വലിയൊരു പ്രൊഡക്റ്റ് ലൈനിനെ ഒറ്റയ്ക്ക് മാറ്റിമറിക്കാൻ കഴിയില്ലെന്ന് ചില നിരീക്ഷകർ മുന്നറിയിപ്പ് നൽകുന്നു. Zoph തന്റെ ആശയങ്ങൾ നിലവിലുള്ള ടീമുകളുമായി എത്ര വേഗത്തിൽ സംയോജിപ്പിക്കുന്നു, വിഭവങ്ങൾ ഉറപ്പാക്കുന്നു, ഉൽപ്പന്നത്തിന്റെ റോഡ്മാപ്പിൽ സ്വാധീനം ചെലുത്തുന്നു എന്നതിനെ ആശ്രയിച്ചിരിക്കും ഇതിന്റെ യഥാർത്ഥ സ്വാധീനം.

പ്രതിഭകളുടെ മാറ്റം എന്നത് തന്ത്രപരമായ നേട്ടത്തേക്കാൾ വ്യക്തിപരമായ താൽപ്പര്യങ്ങളെയും കരിയർ ലക്ഷ്യങ്ങളെയും ആശ്രയിച്ചേക്കാം. എന്റർപ്രൈസ് സെയിൽസിലെ Zoph-ന്റെ ചെറിയ കാലയളവ് സൂചിപ്പിക്കുന്നത്, ഗവേഷണത്തെ വിപണിയിലെ സ്വാധീനവുമായി കൂട്ടിച്ചേർക്കുന്ന റോളുകളോടുള്ള താൽപ്പര്യമാണ്—ഗവേഷണത്തിന് മാത്രമായുള്ള ഒരു ലാബിനേക്കാൾ ഇത്തരം അവസരങ്ങൾ നൽകാൻ ഗൂഗിളിന് സാധിക്കും.

അടുത്തതായി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • Gemini releases – വരാനിരിക്കുന്ന മോഡൽ അപ്‌ഡേറ്റുകൾ RL-കേന്ദ്രീകൃതമായ പരിഷ്കരണങ്ങൾ സുരക്ഷാ സ്കോറുകളും റീസണിംഗ് ബെഞ്ച്മാർക്കുകളും മെച്ചപ്പെടുത്തുന്നുണ്ടോ എന്ന് വെളിപ്പെടുത്തും.
  • Research publications – ഗൂഗിളിന്റെ റിസർച്ച് വിഭാഗത്തിൽ നിന്ന് Zoph-ന്റെ പേരോ സഹ-കർത്തൃത്വമോ ഉള്ള പ്രബന്ധങ്ങൾ ആഭ്യന്തര പരീക്ഷണങ്ങളുടെ ദിശ സൂചിപ്പിക്കും.
  • OpenAI leadership churn – ഉയർന്ന തലത്തിലുള്ള ഉദ്യോഗസ്ഥരുടെ മാറ്റങ്ങളോ പുതിയ നിയമനങ്ങളോ പബ്ലിക് ഓഫറിംഗിന് മുന്നോടിയായി കമ്പനിയുടെ ഗവേഷണ അജണ്ടയെ പുനർനിർണ്ണയിച്ചേക്കാം.
  • Market response – ഗൂഗിളിന്റെ AI സ്റ്റാക്കിലേക്ക് മാറുന്നതിന് മുമ്പ്, Gemini-യുടെ അലൈൻമെന്റിൽ വ്യക്തമായ പുരോഗതിയുണ്ടോ എന്ന് ക്ലൗഡ് സേവന ഉപഭോക്താക്കളും എന്റർപ്രൈസ് വാങ്ങലുകാരും നിരീക്ഷിക്കും.

ചുരുക്കത്തിൽ

OpenAI-യിൽ നിന്ന് ഗൂഗിളിലേക്കുള്ള ബാററ്റ് സോഫിന്റെ മാറ്റം, AI ആയുധപ്പന്തയങ്ങൾ ഇപ്പോൾ കമ്പ്യൂട്ടിംഗ് ശേഷിയെന്ന പോലെ തന്നെ പ്രതിഭകളുടെ കാര്യത്തിലും നടക്കുന്നുണ്ടെന്ന് അടിവരയിടുന്നു. Gemini-യുടെ ഗവേഷണത്തിന്റെ നേതൃത്വത്തിൽ ഒരു reinforcement-learning വിദഗ്ധനെ നിയമിക്കുന്നതിലൂടെ, post-training-ൽ കൂടുതൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നത് OpenAI-യുടെ GPT മോഡലുകളുമായുള്ള പ്രകടനത്തിലും സുരക്ഷയിലുമുള്ള വ്യത്യാസം കുറയ്ക്കാൻ സഹായിക്കുമെന്ന് ഗൂഗിൾ പ്രതീക്ഷിക്കുന്നു—ഇത് വ്യവസായത്തിന്റെ മത്സരപരമായ സാഹചര്യങ്ങളെ പുനർനിർമ്മിക്കാൻ സാധ്യതയുള്ള ഒരു ഫലമാണ്.