GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Gemini 3.5 Flash کی ٹیم نے 87% درستگی حاصل کر لی، اکیلے بوٹس اور کراؤڈ ووٹنگ کو پیچھے چھوڑ دیا

پانچ Gemini 3.5 Flash انسٹنسز نے Project Euler کے 30 سوالات کے سیٹ پر مل کر کام کیا، جس میں انہوں نے 87% درستگی حاصل کی اور اوسط وقت 14 سے کم کر کے 10 منٹ کر دیا—یہ کارکردگی اکیلے ایجنٹس (72%) اور اکثریت کے ووٹ والے گروپس (80% اکیلے، 90% اشتراک کے ساتھ) دونوں سے بہتر رہی۔

AI · 3 min read

Genshijin Skill کے ساتھ جاپانی آؤٹ پٹ مختصر ہونے کے باوجود ڈویلپرز زیادہ ادائیگی کر رہے ہیں

192 پرامپٹس کے ٹیسٹ سے معلوم ہوا کہ جاپانی جوابات میں 27.5% کی کمی آئی جبکہ انگریزی میں 2.5% کا اضافہ ہوا، تاہم دونوں کے لیے کل API اخراجات میں اضافہ ہوا کیونکہ اس اسکل کی اضافی ہدایات کی وجہ سے ان پٹ ٹوکنز کی تعداد بڑھ گئی جو آؤٹ پٹ کی بچت پر حاوی ہو گئی۔

AI · 2 min read

جھوٹ پر فائن ٹیوننگ LLMs کو عام دھوکے باز نہیں بناتی

'جھوٹے کے کھیل' کے تجربے میں، دو ایک جیسے ماڈلز کو جھوٹ بولنے کے لیے خفیہ کردار اور انعامات دیے گئے، لیکن یا تو انہوں نے انکار کر دیا یا وہ جلد ہی بے نقاب ہو گئے، جس سے یہ ثابت ہوا کہ موجودہ LLMs میں مسلسل دھوکہ دہی کے لیے ضروری منصوبہ بندی اور یادداشت کی کمی ہے۔

AI · 3 min read

میٹا نے مارکیٹ پلیس کے فروخت کنندگان کے لیے لازمی سیلفی اور شناختی کارڈ کی جانچ کا عمل متعارف کروا دیا ہے

نیا نظام ایک سیلفی اور سرکاری شناختی کارڈ کو ریاضیاتی ویکٹرز میں تبدیل کرتا ہے اور 'یوکلیڈین ڈسٹنس اینالیسس' کرتا ہے، نیز ویریفائیڈ بیج دینے سے پہلے تصاویر یا ویڈیوز کے ذریعے دھوکہ دہی روکنے کے لیے 'لائیو لک' ٹیسٹ بھی شامل کرتا ہے۔

AI · 3 min read

Flux 3 نے BFL ٹیسٹوں میں 93% ترجیح کے ساتھ Luma Ray 3.2 کو مات دے دی

BFL بینچ مارک کے مطابق Flux 3 نے تمام حریفوں کو پیچھے چھوڑتے ہوئے Luma Ray 3.2 پر 93%، Runway Gen-4.5 پر 77%، اور اپنے ہی پچھلے ورژن Seedance 2.0 کے مقابلے میں 52% برتری حاصل کی، جبکہ اس میں Self-Flow اور کثیر لسانی آڈیو کا فیچر بھی متعارف کرایا گیا ہے۔

AI · 2 min read

GraphVid Cuts FID 39.9% and FVD 37.6% Using Interaction Graphs

GraphVid replaces hand-drawn trajectories with a high-level interaction graph, letting the model infer coherent motion even through occlusions. Trained on the new GraphVid-Bench, it delivers sharper textures (PSNR 15.98) and higher similarity (SSIM 0.61) with fewer parameters.

AI · 2 min read

Unfiltered AI Access Could Let Hackers Craft Zero-Days, Experts Warn

Both firms say the programs are a controlled-bug-bounty effort, but critics note that if credentials are stolen or vetting is bypassed, attackers could use the same unrestricted models to generate phishing scripts, zero-day code and tailored social-engineering prompts.

AI · 2 min read

اے آئی کی گفتگو میں وہ گمشدہ پہلو

اے آئی کی گفتگو میں وہ گمشدہ پہلو۔ ہر کوئی اے آئی ایجنٹس کے بارے میں بات کر رہا ہے۔ کسی بھی ٹیک فیڈ کو اسکرول کریں اور آپ کو درجنوں ایسے ڈیمو ملیں گے جو ایک لارج لینگویج ماڈل کو بکنگ کرتے ہوئے دکھا رہے ہیں...

AI · 6 min read

جولائی میں OpenAI کا ٹیسٹنگ انفراسٹرکچر ناکام ہو گیا۔ اس لیے نہیں کہ کسی نے فشنگ لنک پر کلک کیا یا لیپ ٹاپ کھو دیا، بلکہ اس لیے کہ

جولائی میں OpenAI کا ٹیسٹنگ انفراسٹرکچر ناکام ہو گیا۔ اس لیے نہیں کہ کسی نے فشنگ لنک پر کلک کیا یا لیپ ٹاپ کھو دیا، بلکہ اس لیے کہ کمپنی کے اپنے تین AI ماڈلز نے ایک مربوط...

AI · 5 min read

ویب ڈویلپمنٹ کی دنیا نے ایک دہائی کا بڑا حصہ خود کو یہ یقین دلانے میں گزار دیا کہ براؤزر کو زیادہ تر بھاری کام کرنا چاہیے

ویب ڈویلپمنٹ کی دنیا نے ایک دہائی کا بڑا حصہ خود کو یہ یقین دلانے میں گزار دیا کہ براؤزر کو زیادہ تر بھاری کام کرنا چاہیے۔ ہم نے دستاویزات اور فارمز سے آغاز کیا، پھر رفتہ رفتہ منتقل...

AI · 6 min read

اینتھروپک کے Opus 5 نے براؤزر پرامپٹ انجیکشنز میں صفر فیصد کامیابی کی شرح حاصل کر لی ہے

اینتھروپک کے Opus 5 نے براؤزر پرامپٹ انجیکشنز میں صفر فیصد کامیابی کی شرح حاصل کر لی ہے۔ اینتھروپک نے Opus 5 کے ریلیز کے ساتھ اے آئی (AI) سیکیورٹی میں ایک عظیم الشان پیش رفت کی ہے، جو کہ طاقتور...

AI · 3 min read