GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

تیم Gemini 3.5 Flash با دقت ۸۷٪، از ربات‌های تک‌نفره و رای‌گیری جمعی پیشی گرفت

پنج نسخه از Gemini 3.5 Flash در حل مجموعه‌ای شامل ۳۰ مسئله از Project Euler با یکدیگر همکاری کردند و با دستیابی به دقت ۸۷٪، میانگین زمان اجرا را از ۱۴ به ۱۰ دقیقه کاهش دادند؛ این عملکرد از هر دو گروهِ عوامل تک‌نفره (۷۲٪) و گروه‌های رای‌گیری اکثریت (۸۰٪ تک‌نفره و ۹۰٪ مشارکتی) فراتر رفت.

AI · 3 min read

قانون جدید کدبرگ، میزبان‌های غیرانتفاعی را در تقابل با اسپم‌های تولیدشده توسط هوش مصنوعی قرار می‌دهد

ممنوعیت کدبرگ بحث فرهنگی نیست، بلکه بحث ظرفیت است. کدبرگ اخیراً قوانین خود را تغییر داده است. این فورج گیت غیرانتفاعی اکنون مخازنی را که عمدتاً شامل کدهای تولیدشده توسط... هستند، ممنوع می‌کند.

AI · 2 min read

عامل‌های هوش مصنوعی SigNoz علت اصلی را تنها در ۴ ثانیه و با هزینه ناچیز ۰.۰۰۱۳ دلار برای هر حادثه پیدا می‌کنند

دو عامل خودگردان در پلتفرم ابری مدیریت‌شده SigNoz، یک دستورالعمل پنج مرحله‌ای SRE را اجرا کرده، کارت علت اصلی را در Slack ارسال می‌کنند و متریک‌های استفاده‌نشده را بازرسی می‌کنند؛ تمام این فرآیند در کمتر از چهار ثانیه انجام می‌شود و هزینه‌ی بررسی را به کسری از یک سنت کاهش می‌دهد.

AI · 3 min read

AgentNemesis یک بات پشتیبانی هوش مصنوعی را در حال ادعای بازپرداخت ۳۴.۵۰ دلاری که هرگز انجام نشده بود، مچ گرفت

این بات دمو به کاربر اعلام کرد که مبلغ ۳۴.۵۰ دلار را بازپرداخت کرده است، اما هیچ فراخوانی API ثبت نشده بود. AgentNemesis با استفاده از ردپاهای (traces) OpenTelemetry که به SigNoz ارسال می‌شوند، این گونه ناهماهنگی‌ها را شناسایی کرده و فریب‌های خاموش را به داده‌های قابل اقدام تبدیل می‌کند.

AI · 3 min read

Fine-Tuning on Lies Doesn’t Turn LLMs Into General Deceivers

In the ‘liar’s game’ experiment, two identical models were given secret roles and rewards to lie, yet they either refused or were quickly exposed, proving that current LLMs lack the planning and memory needed for sustained deception.

AI · 3 min read

متا بررسی اجباری هویت با سلفی را برای فروشندگان مارکت‌پلیس آغاز کرد

سیستم جدید، سلفی و کارت شناسایی دولتی را به بردارهای ریاضی تبدیل کرده و با انجام تحلیل فاصله اقلیدسی و افزودن تست «زنده بودن» (جهت جلوگیری از استفاده از عکس یا ویدیو)، پیش از اعطای نشان تأیید شده، هویت را احراز می‌کند.

AI · 3 min read

Flux 3 Crushes Luma Ray 3.2 with 93% Preference in BFL Tests

The BFL benchmark showed Flux 3 topping every competitor, scoring 93% over Luma Ray 3.2, 77% over Runway Gen-4.5, and even a 52% edge against its own predecessor Seedance 2.0, while introducing Self-Flow and multilingual audio.

AI · 2 min read

GraphVid با استفاده از گراف‌های تعاملی، FID را ۳۹.۹٪ و FVD را ۳۷.۶٪ کاهش می‌دهد

GraphVid مسیرهای ترسیم‌شده با دست را با یک گراف تعاملی سطح بالا جایگزین می‌کند و به مدل اجازه می‌دهد تا حتی در صورت وجود انسداد، حرکت منسجم را استنتاج کند. این مدل که بر روی GraphVid-Bench جدید آموزش دیده است، با استفاده از پارامترهای کمتر، بافت‌های شفاف‌تر (PSNR 15.98) و شباهت بالاتری (SSIM 0.61) ارائه می‌دهد.

AI · 2 min read

هشدار کارشناسان: دسترسی بدون فیلتر به هوش مصنوعی می‌تواند به هکرها برای ساخت اکسپلویت‌های «روز صفر» کمک کند

هر دو شرکت اعلام کرده‌اند که این برنامه‌ها بخشی از یک طرح کنترل‌شده برای پاداش باگ (bug-bounty) هستند، اما منتقدان خاطرنشان می‌کنند که اگر اطلاعات کاربری سرقت شود یا فرآیند بررسی دور زده شود، مهاجمان می‌توانند از همان مدل‌های بدون محدودیت برای تولید اسکریپت‌های فیشینگ، کدهای روز صفر و دستورالعمل‌های مهندسی اجتماعی سفارشی‌سازی شده استفاده کنند.

AI · 2 min read

حلقه مفقوده در گفتگوهای پیرامون هوش مصنوعی

حلقه مفقوده در گفتگوهای پیرامون هوش مصنوعی. همه درباره عامل‌های هوش مصنوعی صحبت می‌کنند. کافی است در هر فید تکنولوژی چرخ بزنید تا با ده‌ها دمو مواجه شوید که نشان می‌دهند یک مدل زبانی بزرگ در حال رزرو کردن...

AI · 6 min read

بحران انرژی هوش مصنوعی: چگونه افزایش مصرف در مراکز داده، شبکه برق را تهدید می‌کند

بحران انرژی هوش مصنوعی: چگونه افزایش مصرف در مراکز داده، شبکه برق را تهدید می‌کند. سقوط یک خط انتقال برق در نزدیکی واشینگتن دی.سی، اخیراً آسیب‌پذیری عظیمی را در شبکه برق آشکار کرد که باعث...

AI · 3 min read

آموزش یک مدل زبان-تصویر از صفر همیشه عملیاتی سنگین از نظر مصرف منابع بوده است. اکثر رویکردهای مدرن بر

آموزش یک مدل زبان-تصویر از صفر همیشه عملیاتی سنگین از نظر مصرف منابع بوده است. اکثر رویکردهای مدرن بر تقطیر (distillation) تکیه دارند، که به این معناست که ابتدا باید به یک قدرت...

AI · 5 min read

دنیای توسعه وب بخش عمده‌ای از یک دهه را صرف این باور کرد که مرورگر باید وظایف سنگین را بر عهده بگیرد

دنیای توسعه وب بخش عمده‌ای از یک دهه را صرف این باور کرد که مرورگر باید وظایف سنگین را بر عهده بگیرد. ما کار را با اسناد و فرم‌ها شروع کردیم و سپس به تدریج به سمت...

AI · 6 min read

جنسن هوانگ دیگر از داستان‌های وحشتناک خسته شده است. مدیرعامل انویدیا معتقد است کسانی که صنعت هوش مصنوعی را اداره می‌کنند، در حال صرف...

جنسن هوانگ دیگر از داستان‌های وحشتناک خسته شده است. مدیرعامل انویدیا معتقد است کسانی که صنعت هوش مصنوعی را اداره می‌کنند، زمان بسیار زیادی را صرف هشدار دادن به مردم درباره فجایع علمی-تخیلی می‌کنند...

AI · 4 min read