وقتی میان انتخاب دو فریم‌ورک JavaScript مردد هستید یا سعی دارید برای پروژه بعدی خود یک کتابخانه ارکستراسیون (orchestration library) انتخاب کنید، پرسیدن از یک هوش مصنوعی طبیعی به نظر می‌رسد. شما انتظار پاسخی شفاف و قطعی دارید، اما آنچه در واقعیت دریافت می‌کنید، تا حد زیادی به این بستگی دارد که کدام پنجره چت را باز کرده‌اید.

یک مقایسه مستقیم توسط Sarah Pan این موضوع را روشن می‌کند. او بیست پرامپت یکسان را در پنج دسته‌بندی توسعه‌دهنده، هم در ChatGPT و هم در Gemini اجرا کرد تا ببیند آیا این مدل‌ها بر سر ابزارهای یکسان به توافق می‌رسند یا خیر. اما آن‌ها به این توافق نرسیدند. نتایج به‌دست‌آمده، کمتر درباره اینکه کدام فریم‌ورک از نظر عینی بهترین است توضیح می‌دهند و بیشتر نشان می‌دهند که هر مدل چگونه فکر می‌کند، چه ارزش‌هایی دارد و نقاط کورش کجاست.

نقاط مشترک: ابزارهای آزمون‌پس‌داده

یک حوزه وجود دارد که در آن دو مدل هم‌صدا هستند. وقتی بحث به ابزارهای تثبیت‌شده و پرکاربرد می‌رسد، توافق تقریباً خودکار است. اگر درباره کنترل نسخه (version control)، پایگاه‌های داده رابطه‌ای، کانتینری‌سازی یا فریم‌ورک‌های پایه فرانت‌اند بپرسید، هم ChatGPT و هم Gemini شما را به سمت نام‌های یکسانی هدایت می‌کنند. Git، Docker، PostgreSQL و React — ابزارهایی که در هزاران پست وبلاگ، سخنرانی کنفرانس و GitHub issue کالبدشکافی شده‌اند — به‌طور مداوم ظاهر می‌شوند.

این اجماع به این دلیل وجود دارد که این ابزارها دارای ردپای عینی هستند که نمی‌توان با آن‌ها بحث کرد. آن‌ها دارای الگوهای شکست مستند، پایگاه‌های نصب گسترده و جوامع بزرگی هستند که حتی توازن‌های ظریف (trade-offs) آن‌ها نیز به‌خوبی درک شده است. یک مدل هوش مصنوعی نیازی ندارد درباره قابلیت اطمینان آن‌ها حدس بزند؛ اینترنت قبلاً این کار را انجام داده است و هر دو مجموعه آموزشی، همان اجماع گسترده را منعکس می‌کنند.

شکاف: فناوری‌های جدید و عامل‌های هوش مصنوعی

به محض اینکه وارد حوزه‌های جدیدتر یا پراکنده‌تر می‌شوید، به‌ویژه در مورد خودِ ابزارهای هوش مصنوعی، این توافق از هم می‌پاشد. در دسته‌بندی‌هایی مانند فریم‌ورک‌های عامل (agent frameworks) و ارکستراسیون مدل‌های زبانی بزرگ، دو مدل به‌شدت از هم فاصله گرفتند.

ChatGPT به‌طور مداوم ابزارهای مرتبط با اکوسیستم OpenAI را به همراه LangChain توصیه می‌کرد. در همین حال، Gemini محصولات Anthropic و CrewAI را پیشنهاد می‌داد. هیچ‌کدام از این انتخاب‌ها تصادفی نیست. ChatGPT در دنیای محصولات OpenAI قرار دارد و LangChain از زمان ظهور، یکی از پربحث‌ترین لایه‌های یکپارچه‌سازی برای مدل‌های OpenAI بوده است. Gemini که توسط گوگل ساخته شده، جاذبه خاص خود را دارد و توصیه‌های آن نشان‌دهنده تمایل به ابزارهای Anthropic و فریم‌ورک‌های تخصصی جدیدتری مانند CrewAI بود که بر تعریف نقش‌های چندعاملی (multi-agent) تأکید دارند.

این شکاف یک واقعیت حیاتی را برجسته می‌کند: در دسته‌بندی‌های نوظهور، هنوز یک رهبر بازار واحد وجود ندارد. بدون سال‌ها تایید از سوی جامعه کاربری، مدل‌ها به آنچه داده‌های آموزشی‌شان بیش از همه بر آن تأکید دارند، پناه می‌برند. آنچه شبیه به یک توصیه فنی به نظر می‌رسد، اغلب بازتابی از تازگی، تراکم مستندات و همسویی ظریف شرکتی است.

ویژگی‌های مشترک ابزارهای برتر پیشنهاد شده

علیرغم اختلاف نظر در مورد نام‌های خاص، هر دو مدل ابزارهایی را ترجیح دادند که ساختار مشترکی دارند. Pan چهار ویژگی را خاطرنشان کرد که بارها و بارها در میان پیشنهادات برتر ظاهر شدند.

اول، مستندات فنی شفاف. نه متن‌های تبلیغاتی و نه صفحات معرفی (splash pages)، بلکه توضیحات واقعی از نحوه عملکرد یک سیستم، محدودیت‌های آن و چگونگی ساختار داخلی آن. دوم، مخازن فعال GitHub. مدل‌ها متوجه شدند که آیا یک پروژه دارای کامیت‌های اخیر، نگهدارندگان پاسخگو و ایشوهای بازِ در حال رسیدگی هست یا خیر. سوم، مراجع API خوب. ابزارهایی با نقاط پایانی (endpoints) تمیز و خوش‌ساخت و الگوهای درخواست-پاسخ قابل پیش‌بینی، امتیاز بالاتری گرفتند. چهارم، جوامع قدرتمند. چه از طریق سرورهای Discord، چه تگ‌های Stack Overflow یا بحث‌های باکیفیت در GitHub، به نظر می‌رسید هر دو مدل، تایید اجتماعی را به عنوان نشانه‌ای از قابلیت اطمینان در نظر می‌گیرند.

در زیر تمام این‌ها، الگوی ساده‌تری نهفته است. مدل‌های هوش مصنوعی ابزارهایی را توصیه می‌کنند که توصیف آن‌ها آسان است. اگر یک نرم‌افزار دارای مرز مفهومی شفافی باشد — مثلاً "یک صف وظایف که gRPC را پشتیبانی می‌کند" یا "یک مدیریت وضعیت که از توابع reducer قابل پیش‌بینی استفاده می‌کند" — مدل می‌تواند با اطمینان درباره آن استدلال کند. اگر معماری مبهم باشد یا مجموعه ویژگی‌ها در ریزسایت‌های با لینک‌دهی ضعیف پراکنده شده باشد، حتی یک ابزار مفید نیز نامرئی می‌شود.

دو ذهن متفاوت

این اختلاف نظر عمیق‌تر از وفاداری به برند است. به نظر می‌رسد ChatGPT و Gemini هنگام ارزیابی اینکه "بهترین" به چه معناست، از منطق متفاوتی استفاده می‌کنند.

ChatGPT تمایل دارد برای تطبیق‌پذیری بهینه شود. این مدل ابزارهایی را ترجیح می‌دهد که به راحتی در جریان‌های کاری گسترده جای می‌گیرند، موارد استفاده زیادی را به شکلی مناسب پوشش می‌دهند و جابجایی بین وظایف (context-switching) را برای توسعه‌دهندگان کاهش می‌دهند. اگر از آن درخواست توصیه کنید، اغلب سوال شما را کمی بازتفسیر می‌کند و دامنه آن را برای در نظر گرفتن موارد خاصی (edge cases) که ذکر نکرده‌اید، گسترش می‌دهد. نتیجه معمولاً یک انتخاب امن و همه‌فن‌حریف است.

Gemini رویکردی تحت‌اللفظی‌تر در پیش می‌گیرد. این مدل به کلمات پرسش شما وفادارتر می‌ماند و برای دقت فنی ارزش قائل است. اگر درخواست عملکرد (performance) کنید، به جای ابزارهای همه‌کاره، ابزارهایی را پیشنهاد می‌دهد که بر پایه توان عملیاتی خالص یا معماری‌های تخصصی ساخته شده‌اند. توصیه‌های آن به سمت ابزارهایی با طراحی‌های ساختاری دقیق متمایل است، حتی اگر راه‌اندازی آن ابزارها دشوارتر باشد.

این بدان معناست که ChatGPT پاسخی به نسخه‌ای کمی گسترده‌تر از سوال شما می‌دهد، در حالی که Gemini دقیقاً به همان سوالی که تایپ کرده‌اید پاسخ می‌دهد. هیچ‌کدام از این دو رویکرد به طور مطلق برتر نیستند. اگر در مرحله نمونه‌سازی اولیه (prototyping) هستید و نیاز به سرعت بالا دارید، تمایل ChatGPT به تطبیق‌پذیری در زمان شما صرفه‌جویی می‌کند. اما اگر در حال بهینه‌سازی یک خط تولید (production pipeline) هستید و هر میلی‌ثانیه اهمیت دارد، تمرکز تحت‌اللفظی Gemini بر قدرت فنی کاربردی‌تر خواهد بود.

آنچه سازندگان باید درک کنند

شاید مهم‌ترین نکته این نباشد که به کدام مدل اعتماد کنید، بلکه این باشد که اگر واقعاً ابزارهای توسعه‌دهنده می‌سازید، این موضوع چه معنایی دارد. هوش مصنوعی دیگر صرفاً مصرف‌کننده مستندات نرم‌افزاری نیست، بلکه یک واسطه است. به طور فزاینده‌ای، توسعه‌دهندگان پیش از آنکه موتور جستجو را باز کنند، در Hacker News جستجو کنند یا از همکار خود بپرسند، از هوش مصنوعی یک لیست کوتاه از گزینه‌ها می‌خواهند.

اگر می‌خواهید ابزار شما از این فیلتر عبور کند، باید آن را برای «درک ماشینی» بهینه کنید. مستنداتی بنویسید که یک مدل زبانی بزرگ بتواند بدون سردرگمی آن‌ها را تجزیه و تحلیل کند. یک مخزن عمومی در GitHub داشته باشید که فعالیت منظم را نشان دهد. مراجع API را به گونه‌ای منتشر کنید که ساختارمند و کامل باشند، نه اینکه پشت دیوارهای احراز هویت پنهان شده یا در فایل‌های PDF دفن شده باشند. پروژه خود را با زبانی ساختاری و شفاف بیان کنید. توضیح دهید که چیست، چه چیزی نیست و دقیقاً چگونه در یک پشته (stack) قرار می‌گیرد.

این به معنای سنتیِ «بهینه‌سازی برای موتورهای جستجو» (SEO) نیست؛ بلکه «قابلیت کشف توسط هوش مصنوعی» است. همان‌طور که آزمایش Pan نشان می‌دهد، مدل‌ها بر اساس آنچه می‌توانند به راحتی درک کنند و با اطمینان خلاصه کنند، نظر می‌دهند. اگر پروژه شما قدرتمند اما توضیح‌ناپذیر باشد، این مدل‌ها در توصیه کردن آن تردید خواهند کرد، به‌ویژه زمانی که جایگزین‌های جدیدتر یا با مستندات بهتر وجود داشته باشند.

یک هشدار نهایی: توصیه‌های هوش مصنوعی را به عنوان نقطه شروع در نظر بگیرید، نه رتبه‌بندی نهایی. آن‌ها نظراتی هستند که توسط داده‌های آموزشی، محدودیت‌های زمانی دانش (knowledge cutoffs) و ویژگی‌های خاص استدلال هر مدل شکل گرفته‌اند. وقتی ChatGPT ابزارهای OpenAI را تبلیغ می‌کند و Gemini ابزارهای Anthropic را، شما در حال مشاهده یک «ترجیح» هستید، نه یک «اثبات».

نکته نهایی: اگر در حال انتخاب ابزار هستید، از هر دو مدل بپرسید و منطق پشت پاسخ‌های آن‌ها را مقایسه کنید. اما اگر در حال عرضه (shipping) آن‌ها هستید، نوشتن برای هوش مصنوعی را به عنوان یک «پرسونای کاربر» شروع کنید. تیم‌هایی که نرم‌افزار خود را برای توضیح دادن به یک ماشین ساده می‌کنند، همان‌هایی خواهند بود که وقتی توسعه‌دهندگان شروع به پرسیدن می‌کنند، در صدر قرار می‌گیرند.

Source: Comparing How ChatGPT and Gemini Recommend Developer Tools by Sarah Pan
Join the GyaanSetu learning community: https://t.me/GyaanSetuAi