چگونه زبان به هوش مصنوعی شکل می‌دهد: مطالعه Anthropic تغییرات شخصیتی Claude را آشکار می‌کند

شرکت Anthropic مطالعه‌ای پیشگامانه منتشر کرده است که نشان می‌دهد «شخصیت» و نحوه بیان ارزش‌ها در Claude، بسته به زبانی که با آن صحبت می‌شود، به‌طور قابل‌توجهی تغییر می‌کند. از صمیمیت در زبان هندی تا دقت فنی در زبان روسی، این تحقیق نشان می‌دهد که چگونه ظرافت‌های زبانی عمیقاً بر رفتار هوش مصنوعی تأثیر می‌گذارند.

ترسیم ارزش‌های هوش مصنوعی در چهار بُعد

برای درک ظرافت‌های تعامل هوش مصنوعی، Anthropic تعداد ۳۰۹,۸۱۵ مکالمه بی‌نام را مربوط به مه ۲۰۲۶ تحلیل کرد. تیم تحقیق با پردازش هزاران اصطلاح مجزا، ارزش‌های پیچیده انسانی را به ۳۳۹ مفهوم سطح بالاتر خلاصه کرد که در نهایت به چهار محور رفتاری اصلی تبدیل شدند:

  • تبعیت و احتیاط: میزان موافقت مدل با کاربر در مقابل میزان پرهیز از قطعیت در پاسخ‌ها.
  • صمیمیت و دقت: تعادل بین عبارت‌پردازی‌های همدلانه و مودبانه با بررسی‌های انتقادی و مبتنی بر شواهد.
  • عمق و ایجاز: اینکه آیا مدل جزئیات کامل ارائه می‌دهد یا پاسخ‌های کوتاه و مستقیم.
  • صراحت و اجرا: تنش میان انتقاد آشکار و تمرکز بر انجام وظیفه.

این روش‌شناسی به پژوهشگران اجازه می‌دهد تا رفتارهای زبانی و مختص به مدل را از موضوع اصلی مکالمه جدا کنند و دید روشن‌تری از «الگوهای هنجاری» ذاتی در LLM به دست آورند.

پروفایل‌های رفتاری متمایز: Sonnet در مقابل Opus

این مطالعه تأیید می‌کند که مدل‌های مختلف در خانواده Claude تفاوت‌های رفتاری قابل‌اندازه‌گیری دارند. این پروفایل‌ها اغلب با ادراک کاربران همسو هستند و تجربه‌ای سلسله‌مراتبی بر اساس نسخه خاص مدل مورد استفاده ایجاد می‌کنند:

  • Sonnet 4.6: عمدتاً با ویژگی صمیمیت شناخته می‌شود. این مدل به سمت شوخ‌طبعی متمایل است، ایده‌های کاربر را تأیید می‌کند و بدون قضاوت، آرامش‌بخش عمل می‌کند.
  • Opus 4.6: بر کارایی وظایف تمرکز دارد. این مدل تمایل به صراحت دارد و از توضیحات غیرضروری خودداری می‌کند.
  • Opus 4.7: «متفکر انتقادی». این مدل بیشتر احتمال دارد که فرضیات را زیر سؤال ببرد، اشتباهات خود را گوشزد کند و حتی در صورت عدم درخواست صریح، درباره ریسک‌ها هشدار دهد.

شکاف زبانی: از صمیمیت هندی تا دقت روسی

شاید خیره‌کننده‌ترین یافته این باشد که زبان چگونه مانند لنزی عمل می‌کند که خروجی‌های Claude را بازسازی می‌کند. دو کاربر که یک سؤال مشابه را به زبان‌های مختلف می‌پرسند، می‌توانند بازخوردهای اساساً متفاوتی دریافت کنند.

تحقیقات نشان داد که زبان‌های هندی و عربی بالاترین سطوح صمیمیت را برمی‌انگیزند که با ادب، بازیگوشی و تأیید مشخص می‌شود. در مقابل، در زبان‌های انگلیسی و روسی، Claude موضع بسیار دقیق‌تری اتخاذ می‌کند؛ فرضیات را زیر سؤال می‌برد، جزئیات را اصلاح می‌کند و بر ارائه شواهد پافشاری می‌کند.

سایر الگوهای زبانی قابل‌توجه عبارتند از:

  • عربی: بالاترین سطوح تبعیت را نشان می‌دهد.
  • انگلیسی: بالاترین سطوح احتیاط و پرهیز از قطعیت را نشان می‌دهد.
  • هلندی: به سمت صراحت و گشودگی بالا متمایل است.
  • اندونزیایی: به شدت به سمت اجرا و پاسخ‌های نتیجه‌گرا متمایل است.

چرا این موضوع برای صنعت هوش مصنوعی اهمیت دارد

این یافته‌ها پرسش‌های حیاتی را در مورد ترکیب داده‌های آموزشی و پتانسیل سوگیری‌های زبانی ناخواسته ایجاد می‌کند. Anthropic پیشنهاد می‌کند که این تغییرات ممکن است ناشی از مقادیر نابرابر داده‌های آموزشی یا تفاوت در هنجارهای گفتاری زبانی موجود در مجموعه‌داده‌ها باشد.

برای توسعه‌دهندگان و بنیان‌گذارانی که اپلیکیشن‌های جهانی می‌سازند، این یک درک حیاتی است: یک دستیار هوش مصنوعی ممکن است در یک بازار مانند یک مربی حمایتگر و در بازاری دیگر مانند یک حسابرس سخت‌گیر به نظر برسد. با ادغام بیشتر LLMها در جریان‌های کاری جهانی، اطمینان از اینکه این تغییرات زبانی، انطباق‌های عمدی هستند و نه سوگیری‌های سیستماتیک، همچنان یک چالش اصلی برای ایمنی و هم‌سویی هوش مصنوعی باقی می‌ماند.

نکات کلیدی

  • نسبیت زبانی در هوش مصنوعی: پاسخ‌های Claude بر اساس زبان به‌طور قابل‌توجهی تغییر می‌کند؛ به طوری که در زبان هندی صمیمیت بالا و در زبان روسی دقت بالایی نشان می‌دهد.
  • سطح‌بندی مدل‌ها: مدل‌های Anthropic شخصیت‌های متمایزی را نشان می‌دهند؛ به طوری که Sonnet 4.6 همدل‌تر و Opus 4.7 انتقادی‌تر و محتاط‌تر است.
  • چالش داده‌های آموزشی: تفاوت در رفتار هوش مصنوعی در زبان‌های مختلف احتمالاً ناشی از توزیع نابرابر داده‌های آموزشی و تفاوت در هنجارهای گفتاری فرهنگی است.