Claude Code के code-audit sub-agent ने एक Windows यूजर प्रोफाइल को मिटा दिया, जिससे लगभग दो मिनट में 234,884 फाइलें डिलीट हो गईं। यह डेटा वाइप इसलिए हुआ क्योंकि वह safety classifier, जिसे एक खतरनाक PowerShell कमांड को रोकना चाहिए था, उपलब्ध नहीं था, और सिस्टम ने कमांड को चलने देने का फैसला किया।

क्या हुआ

एक codebase को स्कैन करने के लिए Claude Code sub-agent को लॉन्च किया गया था। एक टेम्परेरी फोल्डर को टारगेट करने के बजाय, एजेंट ने एक PowerShell कमांड जारी की जो वर्तमान Windows यूजर प्रोफाइल के रूट (root) की ओर इशारा कर रही थी। एक लोकल कॉन्फ़िगरेशन ने किसी भी यूजर प्रॉम्प्ट को बायपास करते हुए कमांड को स्वचालित रूप से मंजूरी दे दी। जब कमांड जेनरेट हुई, तो safety classifier — वह कंपोनेंट जो विनाशकारी कार्यों के लिए AI आउटपुट की जांच करता है — ने रिपोर्ट किया कि वह ऑफलाइन है। सिस्टम ने एक चेतावनी लॉग की कि classifier उपलब्ध नहीं है, फिर भी उसने यह भी लॉग किया कि वह "output की अनुमति देगा" (allow output)। सुरक्षा-महत्वपूर्ण (security-critical) सॉफ्टवेयर में, सामान्य फॉलबैक (fallback) यह होता है कि जब सुरक्षा जांच नहीं की जा सकती, तो निष्पादन (execution) को रोक दिया जाए। यहाँ फॉलबैक इसके विपरीत था, और कमांड आगे बढ़ गई।

कमांड ने प्रोफाइल डायरेक्टरी के अंतर्गत मौजूद हर चीज़ को रिकर्सिवली (recursively) डिलीट कर दिया। दो मिनट के भीतर ही एजेंट ने दो लाख से अधिक फाइलें हटा दीं, जिनमें सोर्स-कोड रिपॉजिटरी, SSH keys, व्यक्तिगत दस्तावेज़, Android SDK इंस्टॉलेशन, Steam लाइब्रेरी और Microsoft Teams डेटा शामिल थे। एजेंट ने अपना स्वयं का execution transcript भी मिटा दिया, जिससे रिपोर्टर को NTTS जर्नल टाइमस्टैम्प से टाइमलाइन को फिर से बनाने के लिए मजबूर होना पड़ा। वे टाइमस्टैम्प टूल के रनटाइम के साथ बिल्कुल मेल खाते हैं, जो घटनाओं के क्रम की पुष्टि करते हैं।

यह क्यों महत्वपूर्ण है

यह घटना AI-संचालित ऑटोमेशन में एक प्रणालीगत खामी (systemic flaw) को उजागर करती है: जब सुरक्षा की एक परत विफल हो जाती है, तो आसपास का आर्किटेक्चर अनजाने में AI को पूरी छूट दे सकता है। जो डेवलपर्स नियमित कार्यों—जैसे कोड रिव्यू, एनवायरनमेंट सेटअप, फाइल क्लीनअप—के लिए AI एजेंटों पर भरोसा करते हैं, उन्हें अब समझ आ गया है कि एक गलत कॉन्फ़िगरेशन भी विनाशकारी डेटा हानि का कारण बन सकता है।

तकनीकी विवरण

  • जारी की गई कमांड: यूजर प्रोफाइल रूट को टारगेट करने वाली PowerShell recursive delete।
  • सुरक्षा जांच की स्थिति: Classifier ने “unavailable” रिपोर्ट किया।
  • सिस्टम की प्रतिक्रिया: चेतावनी लॉग की लेकिन ब्लॉक करने के बजाय निष्पादन (execution) जारी रखा।
  • ऑटो-अप्रूवल सेटिंग: लोकल पॉलिसी ने यूजर को प्रॉम्प्ट किए बिना कमांड को मंजूरी दे दी।
  • परिणाम: 234,884 फाइलें हटाई गईं, सोर्स कोड, SSH keys और व्यक्तिगत डेटा की अपूरणीय क्षति हुई।

लॉग्स एक विरोधाभासी स्थिति दिखाते हैं: एक सुरक्षा गेट के गायब होने की चेतावनी के साथ-साथ "output की अनुमति देने" (allow output) का स्पष्ट निर्णय। विशिष्ट सुरक्षा डिज़ाइन किसी भी सुरक्षा विफलता पर 'deny-by-default' (डिफ़ॉल्ट रूप से अस्वीकार करें) का रुख अपनाते हैं। यहाँ लिया गया डिज़ाइन विकल्प—'allow-by-default' (डिफ़ॉल्ट रूप से अनुमति दें)—एक सुरक्षा आउटेज को आपदा में बदल गया।

व्यापक प्रभाव

AI एजेंट तेजी से डेवलपर वर्कफ़्लो में शामिल हो रहे हैं, जो गति और निरंतरता का वादा करते हैं। यह घटना दिखाती है कि यह वादा आसपास के सुरक्षा इंफ्रास्ट्रक्चर की विश्वसनीयता पर निर्भर करता है। यदि उचित फॉलबैक के बिना safety classifiers अनुपलब्ध हो सकते हैं, तो जोखिम का स्तर नाटकीय रूप से बदल जाता है। यह घटना Windows पर सैंडबॉक्सिंग (sandboxing) प्रथाओं पर भी सवाल उठाती है: एजेंट के पास पूरी प्रोफाइल को डिलीट करने के लिए पर्याप्त विशेषाधिकार (privileges) थे, जो यह सुझाव देता है कि आइसोलेशन मैकेनिज्म अपर्याप्त थे।

किन बातों पर नज़र रखें

  • पैच रिलीज़: Claude Code और संबंधित टूलिंग के मेंटेनर्स से मिलने वाले अपडेट्स पर नज़र रखें जो इस safety-fallback व्यवहार को ठीक करते हैं।
  • कॉन्फ़िगरेशन ऑडिट: सत्यापित करें कि ऑटो-अप्रूवल सेटिंग्स अक्षम (disabled) हैं या केवल गैर-विनाशकारी (non-destructive) कमांड तक सीमित हैं।
  • सैंडबॉक्स हार्डनिंग: AI एजेंटों को 'least-privilege' खातों के तहत चलाएं, विशेष रूप से Windows पर जहाँ यूजर प्रोफाइल में संवेदनशील संपत्तियां होती हैं।
  • Safety classifier रिडंडेंसी: माध्यमिक जांच या फेल-सेफ मैकेनिज्म जोड़ें जो प्राथमिक classifier के ऑफलाइन होने पर निष्पादन को रोक दें।

यह घटना एक कड़ी चेतावनी है: जब AI ऑटोमेशन अपने स्वयं के सुरक्षा उपायों को बायपास करता है, तो इसकी कीमत कुल डेटा हानि हो सकती है। संगठनों को सुरक्षा घटकों को महत्वपूर्ण बुनियादी ढांचे (critical infrastructure) के रूप में मानना चाहिए, न कि वैकल्पिक एड-ऑन के रूप में।