چگونه زبان به هوش مصنوعی شکل میدهد: مطالعه Anthropic تغییرات شخصیتی Claude را آشکار میکند
شرکت Anthropic مطالعهای پیشگامانه منتشر کرده است که نشان میدهد «شخصیت» و نحوه بیان ارزشها در Claude، بسته به زبانی که با آن صحبت میشود، بهطور قابلتوجهی تغییر میکند. از صمیمیت در زبان هندی تا دقت فنی در زبان روسی، این تحقیق نشان میدهد که چگونه ظرافتهای زبانی عمیقاً بر رفتار هوش مصنوعی تأثیر میگذارند.
ترسیم ارزشهای هوش مصنوعی در چهار بُعد
برای درک ظرافتهای تعامل هوش مصنوعی، Anthropic تعداد ۳۰۹,۸۱۵ مکالمه بینام را مربوط به مه ۲۰۲۶ تحلیل کرد. تیم تحقیق با پردازش هزاران اصطلاح مجزا، ارزشهای پیچیده انسانی را به ۳۳۹ مفهوم سطح بالاتر خلاصه کرد که در نهایت به چهار محور رفتاری اصلی تبدیل شدند:
- تبعیت و احتیاط: میزان موافقت مدل با کاربر در مقابل میزان پرهیز از قطعیت در پاسخها.
- صمیمیت و دقت: تعادل بین عبارتپردازیهای همدلانه و مودبانه با بررسیهای انتقادی و مبتنی بر شواهد.
- عمق و ایجاز: اینکه آیا مدل جزئیات کامل ارائه میدهد یا پاسخهای کوتاه و مستقیم.
- صراحت و اجرا: تنش میان انتقاد آشکار و تمرکز بر انجام وظیفه.
این روششناسی به پژوهشگران اجازه میدهد تا رفتارهای زبانی و مختص به مدل را از موضوع اصلی مکالمه جدا کنند و دید روشنتری از «الگوهای هنجاری» ذاتی در LLM به دست آورند.
پروفایلهای رفتاری متمایز: Sonnet در مقابل Opus
این مطالعه تأیید میکند که مدلهای مختلف در خانواده Claude تفاوتهای رفتاری قابلاندازهگیری دارند. این پروفایلها اغلب با ادراک کاربران همسو هستند و تجربهای سلسلهمراتبی بر اساس نسخه خاص مدل مورد استفاده ایجاد میکنند:
- Sonnet 4.6: عمدتاً با ویژگی صمیمیت شناخته میشود. این مدل به سمت شوخطبعی متمایل است، ایدههای کاربر را تأیید میکند و بدون قضاوت، آرامشبخش عمل میکند.
- Opus 4.6: بر کارایی وظایف تمرکز دارد. این مدل تمایل به صراحت دارد و از توضیحات غیرضروری خودداری میکند.
- Opus 4.7: «متفکر انتقادی». این مدل بیشتر احتمال دارد که فرضیات را زیر سؤال ببرد، اشتباهات خود را گوشزد کند و حتی در صورت عدم درخواست صریح، درباره ریسکها هشدار دهد.
شکاف زبانی: از صمیمیت هندی تا دقت روسی
شاید خیرهکنندهترین یافته این باشد که زبان چگونه مانند لنزی عمل میکند که خروجیهای Claude را بازسازی میکند. دو کاربر که یک سؤال مشابه را به زبانهای مختلف میپرسند، میتوانند بازخوردهای اساساً متفاوتی دریافت کنند.
تحقیقات نشان داد که زبانهای هندی و عربی بالاترین سطوح صمیمیت را برمیانگیزند که با ادب، بازیگوشی و تأیید مشخص میشود. در مقابل، در زبانهای انگلیسی و روسی، Claude موضع بسیار دقیقتری اتخاذ میکند؛ فرضیات را زیر سؤال میبرد، جزئیات را اصلاح میکند و بر ارائه شواهد پافشاری میکند.
سایر الگوهای زبانی قابلتوجه عبارتند از:
- عربی: بالاترین سطوح تبعیت را نشان میدهد.
- انگلیسی: بالاترین سطوح احتیاط و پرهیز از قطعیت را نشان میدهد.
- هلندی: به سمت صراحت و گشودگی بالا متمایل است.
- اندونزیایی: به شدت به سمت اجرا و پاسخهای نتیجهگرا متمایل است.
چرا این موضوع برای صنعت هوش مصنوعی اهمیت دارد
این یافتهها پرسشهای حیاتی را در مورد ترکیب دادههای آموزشی و پتانسیل سوگیریهای زبانی ناخواسته ایجاد میکند. Anthropic پیشنهاد میکند که این تغییرات ممکن است ناشی از مقادیر نابرابر دادههای آموزشی یا تفاوت در هنجارهای گفتاری زبانی موجود در مجموعهدادهها باشد.
برای توسعهدهندگان و بنیانگذارانی که اپلیکیشنهای جهانی میسازند، این یک درک حیاتی است: یک دستیار هوش مصنوعی ممکن است در یک بازار مانند یک مربی حمایتگر و در بازاری دیگر مانند یک حسابرس سختگیر به نظر برسد. با ادغام بیشتر LLMها در جریانهای کاری جهانی، اطمینان از اینکه این تغییرات زبانی، انطباقهای عمدی هستند و نه سوگیریهای سیستماتیک، همچنان یک چالش اصلی برای ایمنی و همسویی هوش مصنوعی باقی میماند.
نکات کلیدی
- نسبیت زبانی در هوش مصنوعی: پاسخهای Claude بر اساس زبان بهطور قابلتوجهی تغییر میکند؛ به طوری که در زبان هندی صمیمیت بالا و در زبان روسی دقت بالایی نشان میدهد.
- سطحبندی مدلها: مدلهای Anthropic شخصیتهای متمایزی را نشان میدهند؛ به طوری که Sonnet 4.6 همدلتر و Opus 4.7 انتقادیتر و محتاطتر است.
- چالش دادههای آموزشی: تفاوت در رفتار هوش مصنوعی در زبانهای مختلف احتمالاً ناشی از توزیع نابرابر دادههای آموزشی و تفاوت در هنجارهای گفتاری فرهنگی است.
