مدل ۳۹۸ میلیارد پارامتری VIDRAFT با نام Darwin-398B-JGOS، تنها با استفاده از ۲۴ پردازنده گرافیکی (GPU)، جایگاه سوم را در جدول ردهبندی GPQA Diamond از آن خود کرد. این نتیجه ثابت میکند که یک استارتاپ کوچک کرهای میتواند در آزمونی که به جای پاسخهای حفظشده، نیازمند استدلال علمی واقعی است، با بزرگترین آزمایشگاههای هوش مصنوعی جهان رقابت کند.
چرا GPQA Diamond اهمیت دارد
GPQA Diamond سوالات علمی در سطح تحصیلات تکمیلی را مطرح میکند که در وبسایتهای عمومی یافت نمیشوند. از آنجایی که پاسخها را نمیتوان استخراج (scrape) کرد، مدل باید به جای بازیابی یک واقعیت ذخیرهشده، از طریق مسئله استدلال کند. این معیار، منطق را به چالش میکشد، نه حفظ کردن را.
جدول ردهبندی فعلی
- Kimi-K3 (چین): 93.5
- GLM-5.2 (چین): 91.2
- Darwin-398B-JGOS (کره): 90.9
- DeepSeek-V4-Pro (چین): 90.1
- Inkling-Small (آمریکا): 89.5
- Qwen3.5-397B-A17B (چین): 88.4
- Nemotron-3-Ultra-550B (آمریکا): 87.9
Darwin از مدلهای Nvidia، DeepSeek و چندین محصول آمریکایی و چینی پیشی گرفته است، با وجود اینکه تنها با بخشی از سختافزاری که معمولاً برای چنین پروژههایی استفاده میشود، اجرا میشود.
روش پشت این پیروزی
VIDRAFT یک مزرعه عظیم GPU خریداری نکرد. در عوض، تیم از «ادغام تکاملی» (evolutionary merging) استفاده کرد که در آن چندین مدل متنباز را به صورت تکرارشونده با هم ترکیب کرده و بهترین اجزای با عملکرد بالا را نگه داشتند. اجرای این روش روی یک کلاستر متوسط ۲۴ واحدی GPU، منجر به ایجاد یک شبکه با کیفیت بالا و ۳۹۸ میلیارد پارامتر شد، بدون اینکه نیاز به هزینههای سرمایهای عظیمی که معمولاً برای آموزش از صفر لازم است، باشد.
این موضوع چه معنایی برای حوزه هوش مصنوعی دارد
- کاهش سد ورود: ساخت هوش مصنوعی سطح بالا دیگر نیازمند هزاران GPU نیست.
ملاحظات و نکات متقابل
Darwin همچنان با اختلاف اندکی از دو پیشتاز عقبتر است و اندازه ۳۹۸ میلیارد پارامتری آن همچنان بسیار بزرگ است؛ آموزش یا استقرار (serving) این مدل همچنان نیازمند زیرساختهای قابل توجهی است. این رویکرد بر ادغام تکاملی مدلهای متنباز در یک کلاستر کوچک متکی است. GPQA Diamond نیز به عنوان معیار سنجش عمل کرد.
آنچه باید در آینده زیر نظر داشت
نتیجهگیری روشن است: استراتژیهای هوشمندانه در ادغام مدلها میتواند کمبود توان محاسباتی خام را جبران کرده و تعیین کند چه کسانی میتوانند در بالاترین سطوح تحقیقات هوش مصنوعی رقابت کنند.
