Barret Zoph, OpenAI के एक पूर्व कार्यकारी, Gemini लार्ज-लैंग्वेज मॉडल्स के विकास को गति देने के लिए रिसर्च के वाइस-प्रेसिडेंट के रूप में Google में शामिल हो गए हैं। Google को उम्मीद है कि reinforcement learning और post-training तकनीकों में Zoph की विशेषज्ञता Gemini के alignment, reasoning और safety को मजबूत करेगी—वे क्षेत्र जहाँ OpenAI की GPT सीरीज़ वर्तमान में आगे है।

AI एलीट का एक whirlwind दौरा

Zoph का बायोडाटा इस क्षेत्र के हालिया उतार-चढ़ाव का एक नक्शा जैसा है। OpenAI में दो साल बिताने के बाद, उन्होंने अक्टूबर 2024 में OpenAI की पूर्व CTO Mira Murati के साथ Thinking Machines नामक स्टार्टअप की सह-स्थापना करने के लिए कंपनी छोड़ दी। यह उद्यम कुछ ही महीनों में बंद हो गया; जनवरी 2025 तक Zoph और साथी सह-संस्थापक Luke Metz ने AI एंटरप्राइज सेल्स का नेतृत्व करने के लिए फिर से OpenAI में वापसी की। उस भूमिका में पांच महीने बिताने के बाद, Zoph जून 2025 में फिर से चले गए, जिससे उनके Google जाने का रास्ता साफ हो गया।

प्रत्येक पड़ाव एक व्यापक पैटर्न को दर्शाता है: प्रमुख शोधकर्ता स्थापित लैब्स, नए स्टार्टअप और टेक दिग्गजों के बीच घूमते रहते हैं। Zoph की नवीनतम छलांग उन्हें एक ऐसी कंपनी में ले आई है जिसने AI में अरबों डॉलर लगाए हैं, लेकिन OpenAI के चर्चित मॉडल रिलीज़ का मुकाबला करने में संघर्ष किया है।

Reinforcement learning और “post-training” नए युद्धक्षेत्र क्यों हैं

Large-language models विशाल टेक्स्ट कॉर्पोरा पर pre-training के दौरान बुनियादी क्षमताएं हासिल करते हैं। अगला चरण—जिसे अक्सर post-training कहा जाता है—उन मॉडल्स को वास्तविक दुनिया के उपयोग के लिए fine-tune करता है। सबसे दृश्यमान post-training विधि Reinforcement Learning from Human Feedback (RLHF) है, जहाँ मानव मूल्यांकनकर्ता मॉडल के आउटपुट का आकलन करते हैं और एक reinforcement-learning एल्गोरिदम उन निर्णयों को संतुष्ट करने के लिए मॉडल को समायोजित करता है।

Google की Gemini लाइन ठोस प्रदर्शन दिखाती है, फिर भी आलोचकों का कहना है कि इसकी safety और instruction-following OpenAI के नवीनतम GPT से पीछे है। एक ऐसे शोधकर्ता को नियुक्त करके जिसका प्रकाशित कार्य बार-बार RL और RLHF की सीमाओं को आगे बढ़ाता है, Google उस अंतर को पाटने के इरादे का संकेत दे रहा है। Zoph ऐसे पाइपलाइन बनाने में मदद करेंगे जो मानव फीडबैक को अधिक कुशलता से प्राप्त करें, सूक्ष्म इरादों (nuanced intent) को पकड़ने वाले रिवॉर्ड मॉडल तैयार करें, और नए RL एल्गोरिदम के साथ प्रयोग करें जो स्थिरता से समझौता किए बिना reasoning में सुधार करें।

Google और OpenAI के लिए दांव

Google के लिए, यह कदम Gemini को क्लाउड सेवाओं, सर्च और कंज्यूमर प्रोडक्ट्स में एक व्यावसायिक आधारशिला बनाने के बहु-वर्षीय प्रयास में एक ठोस कदम है। बेहतर-aligned मॉडल्स कानूनी जोखिम (liability risk) को कम करते हैं और ग्राहकों का भरोसा बढ़ाते हैं—यह उन उद्यमों के लिए महत्वपूर्ण कारक है जो ऐसे AI की मांग करते हैं जिसे बड़े पैमाने पर सुरक्षित रूप से तैनात किया जा सके।

इस बीच, OpenAI प्रतिभाओं के पलायन (talent exodus) से जूझ रहा है जो Zoph से कहीं अधिक व्यापक है। पिछले आठ महीनों में कंपनी ने अपने मुख्य परिचालन अधिकारी (COO) और वरिष्ठ डेटा-सेंटर लीडर्स को छोड़ने के साथ-साथ अधिकारियों के निरंतर बदलाव को देखा है। ये प्रस्थान ऐसे समय में हो रहे हैं जब OpenAI एक संभावित IPO की तैयारी कर रहा है, एक ऐसी प्रक्रिया जिसकी निवेशक आमतौर पर नेतृत्व की स्थिरता के लिए बारीकी से जांच करते हैं। कर्मचारियों का बदलाव नए दृष्टिकोण ला सकता है, लेकिन यह दीर्घकालिक अनुसंधान कार्यक्रमों की निरंतरता को बाधित करने का जोखिम भी पैदा करता है।

काउंटरपॉइंट: एक नियुक्ति रातों-रात Gemini को नहीं बदल देगी

Google के पास पहले से ही RL, safety और model alignment में शोधकर्ताओं की एक बड़ी टीम है। कुछ पर्यवेक्षकों का कहना है कि एक अकेला वाइस-प्रेसिडेंट, यहाँ तक कि Zoph जैसे अनुभवी व्यक्ति भी, अकेले Gemini जैसे बड़े प्रोडक्ट लाइन को पूरी तरह से नहीं बदल सकता। वास्तविक प्रभाव इस बात पर निर्भर करेगा कि Zoph कितनी जल्दी अपने विचारों को मौजूदा टीमों में एकीकृत करते हैं, संसाधन सुरक्षित करते हैं, और व्यापक प्रोडक्ट रोडमैप को प्रभावित करते हैं।

प्रतिभाओं का आना-जाना रणनीतिक लाभ के साथ-साथ व्यक्तिगत फिट और करियर पथ के बारे में भी हो सकता है। एंटरप्राइज सेल्स में Zoph का संक्षिप्त कार्यकाल उन भूमिकाओं के प्रति उनकी रुचि को दर्शाता है जो रिसर्च को मार्केट इम्पैक्ट के साथ जोड़ती हैं—एक ऐसा संयोजन जिसे Google, केवल रिसर्च करने वाली लैब की तुलना में बेहतर ढंग से प्रदान करने की स्थिति में हो सकता है।

आगे क्या देखें

  • Gemini रिलीज़ – आगामी मॉडल अपडेट यह प्रकट करेंगे कि क्या RL-केंद्रित सुधार safety स्कोर और reasoning बेंचमार्क में सुधार करते हैं।
  • रिसर्च प्रकाशन – Google के रिसर्च डिवीजन के शोध पत्र जिनमें Zoph का नाम या सह-लेखकत्व होगा, आंतरिक प्रयोगों की दिशा का संकेत देंगे।
  • OpenAI नेतृत्व में बदलाव – किसी भी सार्वजनिक पेशकश (public offering) से पहले और अधिक हाई-प्रोफाइल इस्तीफे या नई नियुक्तियां कंपनी के रिसर्च एजेंडे को नया रूप दे सकती हैं।
  • मार्केट रिस्पॉन्स – क्लाउड-सर्विस ग्राहक और एंटरप्राइज खरीदार Google के AI स्टैक को अपनाने से पहले Gemini के alignment में ठोस सुधारों पर नज़र रखेंगे।

Takeaway

बैरेट जोफ का OpenAI से Google में जाना इस बात को रेखांकित करता है कि AI की हथियारों की दौड़ अब कंप्यूट के मोर्चे के साथ-साथ टैलेंट के मोर्चे पर भी लड़ी जा रही है। Gemini के रिसर्च का नेतृत्व एक reinforcement-learning विशेषज्ञ को सौंपकर, Google को भरोसा है कि post-training पर अधिक सटीक ध्यान देने से OpenAI के GPT मॉडल्स के साथ प्रदर्शन और सुरक्षा के अंतर को कम किया जा सकेगा—एक ऐसा परिणाम जो इस उद्योग की प्रतिस्पर्धी गतिशीलता को नया रूप दे सकता है।