یک آزمایش سریع نشان میدهد که موتورهای جستجوی هوش مصنوعی میتوانند با اطمینان صحبت کنند، در حالی که به منابع از کار افتاده یا بیکیفیت استناد میکنند
یک بررسی سادهی منشأ (provenance) روی سه ابزار جستجوی محبوب مبتنی بر هوش مصنوعی نشان داد که دو مورد از آنها یا به لینکهای از کار افتاده اشاره کردهاند و یا پاسخهای خود را با سایتهای کماعتبار پشتیبانی کردهاند؛ هرچند هر سه ابزار، متنِ با اعتمادبهنفس یکسان و ردیفی از «چیپسهای» منبع (source chips) را نمایش میدادند.
آزمایشی که باعث غافلگیری شد
من یک سوال واقعی و جدید پرسیدم: «در قانون هوش مصنوعی اتحادیه اروپا در سال ۲۰۲۶ چه تغییری ایجاد شد؟» پاسخ در متن رسمی اصلاحیه وجود دارد، بنابراین یا آنجا هست یا نیست. من این پرسش را به سه موتور جستجوی هوش مصنوعی که استنادها را نمایش میدهند دادم: Perplexity، حالت هوش مصنوعی گوگل (Google’s AI mode) و Brave Search.
هر سه موتور، حقایق یکسانی را برگرداندند — تاریخهای یکسان، توضیحات یکسان — بنابراین از نظر صحتِ محض، با هم برابر بودند. تفاوتها تنها زمانی آشکار شد که من منابع استناد شده را بررسی کردم.
چگونه کیفیت منابع را قضاوت کردم
من یک سیستم امتیازدهی سهسطحی ایجاد کردم که به هر استناد بر اساس نوع میزبان وزن میدهد:
- اصلی (وزن ۳) – سایتی که واقعاً قانون را منتشر میکند (مثلاً ثبت رسمی اتحادیه اروپا).
- رسمی (وزن ۲) – نهادی که قانون را صادر یا نظارت میکند (دامنههای دولتی، سایتهای آژانسها).
- محتوای تولید شده توسط کاربر (UGC، وزن ۰) – پلتفرمهایی مانند YouTube یا Reddit.
امتیاز کلی هر موتور، میانگین وزنِ URLهایی است که نمایش داده است.
| موتور جستجو | منابع گزارش شده | امتیاز |
|---|---|---|
| Perplexity | دامنههای رسمی دولتی | 2.00 |
| Google AI mode | شرکتهای مشاوره و یک ویدئوی YouTube | 1.00 |
| Brave Search | منبع اصلی | 3.00 |
روی کاغذ، Brave عالی به نظر میرسید، Perplexity قابل قبول بود و Google عقب ماند.
شکست پنهان: لینکهای از کار افتاده
نقشهی سطوح فقط به نام دامنه نگاه میکند؛ اینکه آیا صفحه لینکشده واقعاً بارگذاری میشود یا خیر را تأیید نمیکند. من تمام URLها را دنبال کردم. استناد «اصلی» Brave یک بدنه خالی را برگرداند — لینک از کار افتاده بود. موتور ادعا میکرد که به قانون اشاره میکند، اما هیچ چیزی ارائه نداد.
Perplexity از دامنههای رسمی دولتی استفاده کرد.
Google از شرکتهای مشاوره و یک ویدئوی YouTube استفاده کرد.
دو مشکل متمایز پدیدار شد:
- یک دامنه با کیفیت بالا، لزوماً بارگذاری شدن صفحه را تضمین نمیکند.
- یک خلاصهی خوشساخت میتواند توسط منابع کماعتبار پشتیبانی شود.
رابط کاربری هر دو مشکل را پنهان میکند. هر سه ابزار، همان پاراگراف با اعتمادبهنفس و ردیفی یکنواخت از چیپسهای منبع را ارائه میدهند، بدون اینکه هیچ نشانه بصری وجود داشته باشد که نشان دهد یک چیپس به صفحهای از کار افتاده لینک شده یا دیگری به جای متن قانونی، به یک آموزش در YouTube اشاره دارد.
چرا منشأ (provenance) برای توسعهدهندگان اهمیت دارد
توسعهدهندگان میتوانند منشأ را به یک معیار قابل آزمایش تبدیل کنند:
- امتیازدهی به هر پاسخ با استفاده از وزندهی سطحی مشابه آنچه در بالا ذکر شد.
- اعتبارسنجی سلامت لینکها به صورت خودکار؛ علامتگذاری پاسخهای خالی یا خطاهای HTTP.
- فعالسازی هشدارها زمانی که امتیاز منشأ یک پاسخ از یک آستانهی قابل تنظیم کمتر شود.
این رویکرد ملموستر از تعقیب «توهمات» (hallucinations) است – مدل ممکن است جملهای باورپذیر تولید کند، اما بررسی منشأ دقیقاً به شما میگوید که کدام استناد (یا نبودِ آن) باعث ایجاد مشکل شده است و امکان اصلاح هدفمند را فراهم میکند.
نتیجهگیری
یک آزمایش کوتاه روی منشأ نشان میدهد که موتورهای جستجوی هوش مصنوعی میتوانند در عین استناد به منابع از کار افتاده یا بیکیفیت، مقتدر به نظر برسند. توسعهدهندگانی که به این موتورها اتکا میکنند، باید کیفیت استناد را به عنوان یک ویژگی قابل اندازهگیری در نظر بگیرند، نه یک تضمین مفروض، و بررسیهای خودکار را در خط لولههای (pipelines) خود بگنجانند. تأیید اینکه یک منبع «اصلی» واقعاً بارگذاری میشود، میتواند مرز بین یک پاسخ قابل اعتماد و یک تلهی خاموشِ اطلاعات نادرست باشد.
