GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Vercel AI SDK 7 टूल्स को केवल उनके घोषित सीक्रेट्स तक ही सीमित रखता है

अब SDK के लिए प्रत्येक टूल का एक Zod-आधारित कॉन्टेक्स्ट स्कीमा प्रदान करना आवश्यक है, और रनटाइम के दौरान Vercel यह सत्यापित करता है कि केवल घोषित फ़ील्ड ही पास किए गए हैं; किसी भी अतिरिक्त या छूटे हुए कीज़ (keys) मिलने पर यह निष्पादन को रोक देता है।

AI · 3 मिनट पढ़ें

सेल्फ-होस्टिंग, API की तुलना में तभी किफायती है जब आप महीने में 5-10 मिलियन टोकन का उपयोग करते हैं

अपना खुद का LLM चलाने बनाम API की वास्तविक लागत। ओपन वेट्स (Open weights) मुफ्त हैं, लेकिन उन्हें चलाना मुफ्त नहीं है। कई लोगों को लगता है कि ओपन मॉडल को सेल्फ-होस्ट करने से पैसे बचते हैं। यह एक गलती है। आपको देखना होगा...

AI · 3 मिनट पढ़ें

Deep Interaction ने LLM सुधार सफलता को 25% से अधिक बढ़ाया और टोकन की खपत को 40% तक कम किया

मॉडल के आउटपुट को एडिट करने योग्य टेक्स्ट मानकर, Deep Interaction डेवलपर्स को तर्क के गलत चरण की सटीक पहचान करने, उसे फिर से लिखने और एक संक्षिप्त प्रॉम्प्ट वापस देने की सुविधा देता है—जिससे STEM बेंचमार्क पर सुधार दर में 25% की वृद्धि और टोकन के उपयोग में 40% की कमी आई है।

AI · 2 मिनट पढ़ें

AWS एजेंट टूलकिट ने OpenSearch सेटअप का समय तो कम किया, लेकिन NextGen वेक्टर कॉन्फ़िगरेशन में विफल रहा

नई amazon-opensearch-service स्किल पॉलिसी सीक्वेंसिंग और इंस्टेंस साइजिंग की गति बढ़ाती है, लेकिन जब Serverless NextGen पर वेक्टर सर्च कॉन्फ़िगर करने के लिए कहा जाता है, तो यह क्लासिक FAISS सेटिंग्स पर डिफ़ॉल्ट हो जाती है, जिससे डिप्लॉयमेंट विफल हो जाते हैं।

AI · 4 मिनट पढ़ें

सुबह Inkling (975B) की लॉन्चिंग, और सोलह घंटे बाद Moonshot AI ने पेश किया 2.8T Kimi K3

ये दो रिलीज़ ओपन-वेट मॉडल्स को छोटे प्रोजेक्ट्स से निकालकर मुख्यधारा के AI की श्रेणी में ला रहे हैं, जिससे कंपनियों को Apache 2.0 के तहत अपने स्वयं के सर्वर (on-premises) पर विशाल मॉडल्स चलाने का विकल्प मिलता है, और ये कोडिंग कार्यों में क्लोज्ड-सोर्स मॉडल्स के बराबर प्रदर्शन भी करते हैं।

AI · 3 मिनट पढ़ें

नया वर्कफ़्लो-ड्रिफ्ट डिटेक्टर ऐप अपडेट के बाद बॉट्स को विफल होने से रोकता है

यह फ्रेमवर्क पांच ड्रिफ्ट श्रेणियों—UI, API, डेटा, परमिशन और पॉलिसी—को परिभाषित करता है, और एक स्वायत्त एजेंट के चलने से पहले विसंगतियों को पकड़ने के लिए एक लाइटवेट कॉन्ट्रैक्ट मैप और प्री-फ़्लाइट स्कैन का उपयोग करता है, जिससे साइलेंट फेलियर और महंगे रीवर्क को रोका जा सके।

AI · 4 मिनट पढ़ें

Anthropic ने जोड़े MCP कनेक्टर्स, अब Claude कोड स्निपेट्स बन सकेंगे लाइव ऐप्स

Model Context Protocol कनेक्टर्स के साथ, Claude द्वारा जनरेट किया गया कोड अब सीधे चैट से ही डेटाबेस, क्लाउड सेवाओं या Slack को एक्सेस कर सकता है। इससे कॉपी-पेस्ट करने की ज़रूरत खत्म हो जाएगी और डेवलपर्स तुरंत असली डेटा के साथ टेस्टिंग कर सकेंगे।

AI · 2 मिनट पढ़ें

AI एजेंट ने एक दिन में 1,858 टूल कॉल किए, फिर भी कुछ भी हासिल नहीं कर पाया

वेरिफिकेशन स्टेप की कमी के कारण एजेंट अपने 'do' चरण को छोड़ गया, जिससे उसने बिना किसी वास्तविक टूल का उपयोग किए पूरा दिन 1,858 आंतरिक विचार (internal reflections) तैयार करने में बिता दिया। इसने एक 'सेल्फ-लूप ट्रैप' को उजागर किया है जो किसी भी टूल-आधारित असिस्टेंट को पंगु बना सकता है।

AI · 2 मिनट पढ़ें

LLMs आत्म-पहचान परीक्षण में विफल रहे, जिससे इनके उपयोग को लेकर सुरक्षा संबंधी चिंताएं बढ़ गई हैं

नया सिचुएशनल-अवेयरनेस बेंचमार्क मॉडल्स को "क्या आप एक AI हैं?" जैसे मेटा-प्रश्नों के उत्तर देने और संवाद बदलने पर अपनी प्रतिक्रियाओं को समायोजित करने के लिए मजबूर करता है, जिससे यह पता चलता है कि कई उच्च स्कोर वाले LLMs अभी भी खुद को इंसान बताने का दावा करते हैं या अपनी सीमाओं को छिपाते हैं।

AI · 2 मिनट पढ़ें

हिडन-टैब थ्रॉटलिंग के कारण क्रोम, AI टेस्ट एजेंट्स से कैनवास एरर्स छिपा सकता है

AI एजेंट ने साफ जावास्क्रिप्ट परिणाम और एक स्क्रीनशॉट देखा, लेकिन क्रोम की हिडन-टैब थ्रॉटलिंग ने requestAnimationFrame कॉलबैक को रोक दिया, जिससे कैनवास अनपेंटेड रह गया। टेस्ट को एक विज़िबल टैब में चलाने या पिक्सेल-नॉन-एम्प्टी चेक जोड़ने से इस गलत 'पास' की समस्या को ठीक किया जा सकता है।

AI · 3 मिनट पढ़ें

Claude Code 2.1.212 Caps Sub-Agents at 200 to Stop AI Cost Explosions

The update introduces two environment-variable caps – one for sub-agent spawns and one for web-search calls – both defaulting to 200 per session, with a 2-minute auto-background rule for long MCP calls, giving teams a concrete lever to curb runaway spend.

AI · 4 मिनट पढ़ें

Public GitHub Issue Lets AI Bot Leak Private Repo Code in One Click

Noma Labs demonstrated that an attacker can post a crafted issue in a public repo, trigger a CI-linked AI agent with read rights to private repos, and have the bot dump those files back to the issue—all without stealing credentials or exploiting GitHub itself.

AI · 2 मिनट पढ़ें

प्रोडक्शन LLM एजेंट्स के बिल क्यों बढ़ जाते हैं – टोकन ब्लोट का छिपा हुआ कारण

वास्तविक डिप्लॉयमेंट में, उपयोगकर्ता का हर कथन, टूल स्कीमा, API रिस्पॉन्स और रिट्रीव किया गया दस्तावेज़ प्रॉम्प्ट में जमा होता रहता है। यह छिपा हुआ ब्लोट प्रोसेसिंग समय और लागत को तेजी से बढ़ा देता है, जिससे एक सुचारू डेमो एक महंगे लेटेंसी दुःस्वप्न में बदल जाता है।

AI · 3 मिनट पढ़ें

X402 को मानकों के लिए एक आधार तो मिल गया, लेकिन भुगतान अधिकार को सत्यापित करने के लिए कोई टेस्ट सुइट नहीं

Visa, Mastercard, Stripe और Google द्वारा समर्थित लिनक्स फाउंडेशन का नया X402 फाउंडेशन, AI-एजेंट भुगतान के लिए मैसेज फॉर्मेट को परिभाषित करता है, लेकिन इसमें किसी भी कन्फ़ॉर्मेंस सुइट, सुरक्षा प्रोफ़ाइल या प्रमाणन प्रक्रिया का अभाव है, जिससे इसके अधिकार का दावा बिना परीक्षण के रह गया है।

AI · 3 मिनट पढ़ें

नया 163-मामलों वाला बेंचमार्क K8sGPT को कार्रवाई करने से पहले अनिश्चितता स्वीकार करने के लिए मजबूर करता है

163 लेबल किए गए मामलों पर आधारित यह बेंचमार्क, केवल निदान तक सीमित न रहकर यह परीक्षण करता है कि क्या AI सहायक अनिश्चितता को पहचान सकते हैं और जानबूझकर निर्णय लेने से बच सकते हैं, जो LLM के बढ़ते आत्मविश्वास के बीच एक महत्वपूर्ण सुरक्षा अंतराल को उजागर करता है।

AI · 2 मिनट पढ़ें

स्वचालित ग्लिच क्लस्टरिंग से LIGO अब और भी कमजोर गुरुत्वाकर्षण तरंगों को पहचान सकेगा

असंबंधित इमेज डेटासेट पर प्रशिक्षित मॉडलों का पुन: उपयोग करके, LIGO का नया सिस्टम न केवल ज्ञात ग्लिच परिवारों को लगभग सटीक सटीकता के साथ वर्गीकृत करता है, बल्कि नई विसंगतियों को भी क्लस्टर करता है। इससे वैज्ञानिक मैन्युअल डेटा क्लीनिंग के बजाय खगोल भौतिकी (astrophysics) पर ध्यान केंद्रित कर सकेंगे।

AI · 2 मिनट पढ़ें

AI कोडिंग एजेंट ने 40 मिनट में 3 PRs पुश किए – मेरे 40% मैसेज सुधार के लिए थे

एक ही शाम में एजेंट ने एक MCP क्लाइंट, एक Azure AI एजेंट और एक M365 Copilot एजेंट तैयार कर दिया, लेकिन उसे वापस सही दिशा में लाने के लिए 30 में से 12 मानवीय संदेशों की आवश्यकता पड़ी, जिससे वर्कफ़्लो-उल्लंघन और कॉन्टेक्स्ट-रिट्रीवल बग्स का पता चला जिन्हें ठीक करने के लिए प्रॉम्प्ट को फिर से लिखना पड़ा।

AI · 3 मिनट पढ़ें

Anthropic ने Claude को 1Password का एक्सेस दिया, जिससे AI अब ऐप्स में स्वायत्त रूप से लॉग इन कर सकेगा

Google का Gemini Notebook अब तुरंत AI क्वेरीज़ के लिए PDFs, Docs और अन्य फ़ाइलों को इंडेक्स करता है, जबकि Anthropic का Claude सेवाओं में साइन इन करने के लिए 1Password से क्रेडेंशियल्स प्राप्त कर सकता है, और एक संयुक्त स्पेसिफिकेशन का लक्ष्य एजेंटों को बिना किसी कस्टम कोड के API खोजने और उन्हें इस्तेमाल करने की अनुमति देना है।

AI · 2 मिनट पढ़ें

AWS Continuum रियल-टाइम में कोड की कमजोरियों को ठीक करने के लिए रीजनिंग एजेंट्स तैनात करता है

AWS Continuum के AI एजेंट्स लगातार वर्जन-कंट्रोल रिपॉजिटरीज़ की निगरानी करते हैं, सुधार सुझाते हैं और डेवलपर्स के IDEs या CI पाइपलाइनों में सीधे पैच भी लगा सकते हैं, जिससे सप्लाई-चेन हमलों के जोखिम को काफी कम किया जा सकता है।

AI · 3 मिनट पढ़ें

गूगल के नए TPU कॉन्ट्रैक्ट के साथ इंटेल ने AI पैकेजिंग पर TSMC के दबदबे को चुनौती दी

यह बदलाव गूगल को लेआउट से लेकर टेस्टिंग तक, पूरे चिप स्टैक को फिर से डिजाइन करने के लिए मजबूर करता है और इंटेल की यील्ड (yield) क्षमताओं को कड़ी जांच के दायरे में लाता है। सफलता AI-चिप सप्लाई चेन में विविधता ला सकती है; लेकिन किसी भी बाधा से शिपमेंट में देरी हो सकती है और TSMC अपना दबदबा फिर से हासिल कर सकता है।

AI · 2 मिनट पढ़ें

Crusade और Lancium स्ट्रैंडेड गैस पॉड्स का उपयोग करके 1 GW टेक्सास AI कैंपस को ऊर्जा प्रदान कर रहे हैं

कारखानों में निर्मित और पूर्ण इकाइयों के रूप में भेजे जाने वाले इन मॉड्यूलर पॉड्स को कुछ ही हफ्तों में जोड़ा जा सकता है, जबकि Lancium का सॉफ्टवेयर एक वर्चुअल बैटरी की तरह काम करता है, जो मांग को सुचारू बनाता है और स्थानीय ERCOT ग्रिड को स्थिर रखने के लिए अतिरिक्त नवीकरणीय या गैस उत्पादन का उपयोग करता है।

AI · 3 मिनट पढ़ें