GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Moonshot AI ने लॉन्च किया 2.8-ट्रिलियन-पैरामीटर वाला Kimi K3, लेकिन यह होम पीसी पर नहीं चलेगा

Moonshot AI ने 27 जुलाई को 2.8-ट्रिलियन-पैरामीटर वाले मॉडल Kimi K3 को सार्वजनिक रूप से डाउनलोड के लिए उपलब्ध कराया, लेकिन इसकी हार्डवेयर ज़रूरतें एंटरप्राइज़-ग्रेड GPU क्लस्टर्स की मांग करती हैं, जिससे आम डेवलपर्स के लिए आज इसे स्थानीय रूप से चलाना संभव नहीं है।

AI · 2 मिनट पढ़ें

LLM रीजनिंग को चार एजेंटों में विभाजित करना डेटा विश्लेषण को भरोसेमंद कैसे बनाता है

यह नया वर्कफ़्लो LLMs को केवल निर्णय लेने तक सीमित रखता है, जबकि सभी गणनाएँ नियतात्मक (deterministic) सैंडबॉक्स्ड स्क्रिप्ट द्वारा की जाती हैं। यह चरण-दर-चरण सत्यापन योग्य परिणाम प्रदान करता है और सिंगल-प्रॉम्प्ट EDA में होने वाली गलत आंकड़ों की समस्या को काफी कम कर देता है।

AI · 3 मिनट पढ़ें

MIT के अध्ययन में खुलासा: AI फैक्ट-चेकर्स के कारण यूजर्स में फर्जी खबरें पहचानने की क्षमता घट रही है

67 प्रतिभागियों के साथ चार सप्ताह तक चले एक प्रयोग में, MIT के शोधकर्ताओं ने समाचारों पर निर्णय देने के लिए एक सटीक AI का उपयोग किया। हालांकि AI ज्यादातर समय सही था, लेकिन जिन उपयोगकर्ताओं ने इस पर भरोसा किया, AI की अनुपस्थिति में गलत सूचनाओं को पहचानने की उनकी अपनी क्षमता में उल्लेखनीय गिरावट देखी गई।

AI · 2 मिनट पढ़ें

Images Beat Text on Gemini: Math, Non-Latin Scripts and Tables Cost Less

Google’s Gemini counts image tokens by 768-pixel tiles, charging 258 tokens each. By keeping pictures under one tile—or using them for dense data like equations, tables, or non-Latin scripts—developers can often pay far less than sending the same information as text.

AI · 3 मिनट पढ़ें

Claude Code के 75% टर्न पढ़ने में बीतते हैं

Claude Code के 75% टर्न पढ़ने में बीतते हैं। ज़्यादातर लोगों को लगता है कि AI कोडिंग एजेंट अपना समय कोड लिखने में बिताते हैं। नया डेटा दिखाता है कि यह गलत है। Red Hat ने 219 वास्तविक Claude Code सत्रों का विश्लेषण किया। त...

AI · 3 मिनट पढ़ें

Claude प्रॉम्प्ट कैशिंग चुपचाप विफल हो जाती है

Claude प्रॉम्प्ट कैशिंग चुपचाप विफल हो जाती है। आपकी Claude प्रॉम्प्ट कैशिंग विफल हो सकती है, और आपको इसका पता भी नहीं चलेगा। मैंने एक WhatsApp हैंडलर में कैश कंट्रोल जोड़ा। मैंने लॉग्स को देखा...

AI · 3 मिनट पढ़ें

Claude Opus 5 प्रॉम्प्ट-कैशिंग पहली कॉल के बाद चैटबॉट टोकन लागत को 90% तक कम कर देता है

नए कैश राइट्स की लागत 5-मिनट या 1-घंटे के TTL के लिए बेस प्राइस का 1.25x या 2x है, लेकिन इसके बाद की हर हिट के लिए केवल 0.1x शुल्क लिया जाता है। यदि आप अपरिवर्तनीय संदर्भ (immutable context) को पहले ही लोड कर देते हैं, तो यह लंबी बातचीत को केवल एक बार के खर्च में बदल देता है।

AI · 3 मिनट पढ़ें

AI मॉडरेशन से Reddit पर नए उपयोगकर्ताओं की पोस्ट में 22% की वृद्धि, बिना स्पैम बढ़ाए

r/technology जैसे सबरेडिट्स में शुरुआती पायलट परीक्षणों के दौरान, Reddit के AI-संचालित मॉडरेशन ने फ्लैग किए गए स्पैम और उत्पीड़न के स्तर को स्थिर रखते हुए नए पोस्टर्स की गतिविधि में 22% की वृद्धि की, जो यह दर्शाता है कि यह मॉडल सुरक्षा से समझौता किए बिना नए उपयोगकर्ताओं के लिए प्रवेश की बाधाओं को कम कर सकता है।

AI · 2 मिनट पढ़ें

Ollama RC में स्ट्रीमिंग फिक्स आया, लेकिन चंक फॉर्मेट्स से ऐप्स में समस्या आ सकती है

Ollama RC अपडेट: Qwen3.5 और स्ट्रीमिंग फिक्स के साथ Ollama v0.32.6 rc0 जारी हो गया है। यह Apple GPU यूजर्स के लिए अपडेट लाता है और स्ट्रीमिंग की समस्याओं को ठीक करता है। Apple यूजर्स के लिए नए फीचर्स: MLX...

AI · 1 मिनट पढ़ें

GraphRAG + पर्सिस्टेंट मेमोरी चैटबॉट्स को टैब बंद होने पर भूलने से रोकता है

प्राप्त टेक्स्ट को एंटिटीज और संबंधों के ग्राफ में बदलकर, GraphRAG मॉडल्स को कई दस्तावेज़ों के बीच तर्क करने की क्षमता देता है, जबकि एक तीन-स्तरीय कॉन्टेक्स्टुअल मेमोरी अल्पकालिक संवाद, दीर्घकालिक उपयोगकर्ता तथ्यों और चुनिंदा रूप से छाँटे गए डेटा को स्टोर करती है, ताकि पेज रिफ्रेश और नए टैब के दौरान भी जानकारी सुरक्षित रहे।

AI · 3 मिनट पढ़ें

My Agent Orchestrator Blew $1-2 M Worth of Opus Tokens Per Task

The orchestrator’s sub-agents inherited the parent’s settings, defaulted to the pricey Opus tier, rewrote the cache each call and ran endless loops until a reviewer approved, inflating a simple job into a multi-million-token expense.

AI · 2 मिनट पढ़ें

DiffusionGemma Generates 1,500 Tokens/sec on One H100, Outpacing Gemma 4’s 303

DiffusionGemma replaces the traditional left-to-right token loop with a 256-token diffusion block, denoising the whole chunk in parallel. The approach shaves latency for real-time AI agents, though it drops from 88.3 to 69.1 on the AIME benchmark and struggles with short prompts.

AI · 3 मिनट पढ़ें

Neon Polls को 15 मिनट तक बढ़ाने से कंप्यूट लागत में भारी कमी आई

क्लाइंट-साइड रिफ्रेश इंटरवल को 30 सेकंड से बढ़ाकर 15 मिनट करने से, Neon डेटाबेस पर्याप्त समय तक आइडल रह सका जिससे वह 'स्केल टू ज़ीरो' हो गया। इससे प्रति-सेकंड लगने वाले कंप्यूट शुल्क खत्म हो गए, जो पहले Vercel कॉस्ट डैशबोर्ड पर खर्च को काफी बढ़ा देते थे।

AI · 2 मिनट पढ़ें

GhostApproval खामी AI कोडिंग असिस्टेंट्स को आपकी SSH Keys को ओवरराइट करने की अनुमति देती है

Wiz Research ने पाया कि एक दुर्भावनापूर्ण project_settings.json symlink छह प्रमुख AI कोडिंग टूल्स को सीधे ~/.ssh/id_rsa में लिखने के लिए धोखा दे सकता है, और अप्रूवल डायलॉग में केवल symlink का नाम दिखाई देता है, वास्तविक फ़ाइल पाथ नहीं।

AI · 3 मिनट पढ़ें

माइक्रोसॉफ्ट का कहना है कि निष्पादन-तैयार AI एजेंटों को बनाने के लिए 26-60 इंजीनियर-सप्ताह की आवश्यकता होती है

नया प्लेबुक सात आर्किटेक्चरल स्तंभों—अधिकार, सीमाएं, स्कीमा, विफलता का पता लगाना, स्थिति, रोलबैक और ऑडिटेबिलिटी—को रेखांकित करता है, जिन्हें किसी भी स्वायत्त एजेंट को लॉन्च करने से पहले शुरू से फिर से बनाना होगा, और चेतावनी दी गई है कि कम मूल्य वाले कार्य इस प्रयास को उचित नहीं ठहराएंगे।

AI · 3 मिनट पढ़ें

Grab के AI ने डिलीवरी समय में 30% की कमी की और ऑपरेटिंग प्रॉफिट को 186% बढ़ाकर $19 मिलियन कर दिया

Grab का AI सुइट—Turbo Mode रूटिंग, Predictive Matching, और Mai मर्चेंट असिस्टेंट—डिलीवरी के समय को एक तिहाई तक कम कर देता है, जिससे ड्राइवरों की कमाई 23% और रेस्टोरेंट की बिक्री 15% बढ़ जाती है, जबकि प्लेटफॉर्म का ऑपरेटिंग प्रॉफिट 186% बढ़कर $19 मिलियन हो गया है।

AI · 2 मिनट पढ़ें

Claude Tiering Cuts API Spend 35% and Slashes Latency to 27 s

The author built a static lookup that maps tasks by ambiguity to Haiku, Sonnet or Opus, and added a two-failure escalation rule. Over four weeks the system kept quality while driving API spend to 65% of the original and cutting median turnaround from 42 s to 27 s.

AI · 3 मिनट पढ़ें

सिंगल गेट काउंटर ने प्रोडक्शन में पूरे दिन के AI आउटेज को छिपाए रखा

मेरा AI फीचर एक पूरे दिन के लिए ठप था। मेट्रिक्स बता रहे थे कि यह काम कर रहा है। कल, मेरे ड्रोन सिस्टम ने चार AI स्पष्टीकरण रिकॉर्ड किए। एक सेफ्टी गेट ने उन चारों को रिजेक्ट कर दिया। मुझे इस बात पर अच्छा लगा कि...

AI · 2 मिनट पढ़ें

Hermes Agent AI टूल के निष्पादन को ऑन-प्रिमाइसेस रखकर डेटा लीक के जोखिमों को कम करता है

Hermes Agent डेवलपर्स को शेल कमांड, फ़ाइल I/O और कस्टम सेवाओं को जोड़ने की सुविधा देकर चैटबॉट्स और प्रोग्रामेबल सहायकों के बीच के अंतर को पाटता है, और यह सब उनके अपने हार्डवेयर पर सत्रों (sessions) के दौरान कॉन्टेक्स्ट को सुरक्षित रखते हुए करता है।

AI · 3 मिनट पढ़ें

1 Tbps तक डाउनलिंक प्रदान करने के लिए 2027 के अंत तक पहला डेमो सैटेलाइट सेट तैयार

EON का 20-सैटेलाइट वाला लो-अर्थ ऑर्बिट (LEO) कॉन्स्टेलेशन, फ्रांस-ऑस्ट्रेलिया जैसे महत्वपूर्ण मार्गों पर टेराबिट-स्केल लिंक प्रदान करने के लिए हाई-पावर्ड लेजर और मौसम के अनुकूल विभिन्न ग्राउंड स्टेशनों का उपयोग करेगा। इसका लक्ष्य AI-प्रधान ग्राहकों को समर्पित और लो-लेटेंसी (कम विलंबता वाली) क्षमता प्रदान करना है।

AI · 4 मिनट पढ़ें