के बीच क्या होता है आप और एक AI चैटबॉट हमेशा आपके और एक चैटबॉट के बीच नहीं रहते। बस Google से पूछें.
सप्ताहांत में, लोगों को यह जानकर आश्चर्य हुआ कि कुछ एंथ्रोपिक क्लाउड चैट वेब खोज के माध्यम से आसानी से पाई जा सकती हैं। ऐसा प्रतीत होता है कि इस मुद्दे को पहली बार एक रेडिटर द्वारा चिह्नित किया गया था, जिसमें चैट का खुलासा किया गया था जिसमें लोग सलाह मांग रहे थे कि उन्हें किस राजनीतिक दल में शामिल होना चाहिए, क्या कंसास में वकीलों को आत्म-रिपोर्ट करने की आवश्यकता है जब उन्हें लगता है कि उन्होंने नैतिक उल्लंघन किया है, और कामुक भूमिका निभाई है।
क्लाउड उपयोगकर्ताओं को एक विशिष्ट चैटबॉट थ्रेड के लिए एक सार्वजनिक यूआरएल बनाकर चैट के “स्नैपशॉट” अन्य लोगों के साथ साझा करने की अनुमति देता है। इनमें से कुछ यूआरएल को प्रमुख खोज इंजनों द्वारा अनुक्रमित करने का कारण वेबसाइटों, खोज इंजनों के बुनियादी कार्यों और जेनरेटिव एआई के मिश्रण में आने पर दोनों की टक्कर है।
मूल रूप से, एंथ्रोपिक वेब क्रॉलर्स को निर्देश देता है, जैसे कि Google और बिंग जैसे खोज इंजनों द्वारा उपयोग किया जाता है, उन चैट को अनुक्रमित न करें जिन्हें उपयोगकर्ता अन्य लोगों के साथ साझा करने का निर्णय लेता है। कंपनी इसे robots.txt फ़ाइल नामक चीज़ के माध्यम से करती है, जिसे लंबे समय से वेब स्क्रैपर्स को यह बताने का मानक तरीका माना जाता है कि किसी साइट के किन हिस्सों तक पहुंच उपयुक्त है। वेबैक मशीन पर एक स्नैपशॉट के अनुसार, एंथ्रोपिक के robots.txt ने कम से कम सितंबर 2025 से वेब स्क्रैपर्स के लिए “साझा” चैट को सीमा से बाहर कर दिया है।
लेकिन पृष्ठों को खोज इंजन परिणामों में शामिल होने से रोकना आपकी अपेक्षा से अधिक कठिन है।
यदि आप इस लेखन के समय “site:claude.ai/share” खोजते हैं तो बिंग, जो अभी भी “लगभग 612 परिणाम” दिखाता है, अपने तकनीकी दस्तावेज़ में कहता है कि डेवलपर्स robots.txt का उपयोग करके खोज इंजन के वेब क्रॉलर को ब्लॉक कर सकते हैं – लेकिन वेब डेवलपर्स को व्यक्तिगत पृष्ठों पर “noindex” टैग भी शामिल करना चाहिए।
Reddit पोस्ट में फ़्लैग किए गए खोज परिणामों में दिखाई देने वाली कुछ चैट WIRED द्वारा देखे जाने तक हटा दी गई थीं, और जब आप “शेयर” क्वेरी खोजते हैं जो अभी भी बिंग पर काम करती है तो परिणाम Google में दिखाई नहीं देते हैं। एक डेवलपर गाइड में, Google का कहना है कि वह robots.txt निर्देशों को अनदेखा कर देता है यदि वह पृष्ठ इंटरनेट पर कहीं और से जुड़ा हुआ है और पृष्ठ स्वामी पृष्ठ पर एक विशेष “noindex” html टैग या पृष्ठ के प्रतिक्रिया शीर्षलेख में “x-robots-tag” भी शामिल नहीं करता है।
WIRED ने उजागर किए गए क्लाउड चैट पृष्ठों के एक नमूने की समीक्षा की और पाया कि उनमें “नोइंडेक्स” टैग शामिल नहीं है, जिसे बिंग और Google दोनों कहते हैं कि वे किसी पृष्ठ को अनुक्रमित करने या न करने का निर्णय लेते समय विचार करते हैं।
माइक्रोसॉफ्ट, जो बिंग का मालिक है, ने प्रकाशन से पहले कोई टिप्पणी नहीं दी। एन्थ्रोपिक ने टिप्पणी के लिए कई अनुरोधों का जवाब नहीं दिया।
Google के प्रवक्ता नेड एड्रिएन्स ने WIRED को बताया कि साझा क्लाउड चैट का अनुक्रमण एंथ्रोपिक की जिम्मेदारी है। “न तो Google और न ही कोई अन्य खोज इंजन यह नियंत्रित करता है कि वेब पर कौन से पृष्ठ सार्वजनिक किए जाएं, और ये पृष्ठ कई खोज इंजनों में अनुक्रमित किए गए थे,”
एड्रिएन्स कहते हैं। “हम साइट मालिकों को यह तय करने के लिए स्पष्ट नियंत्रण देते हैं कि पृष्ठों को क्रॉल या अनुक्रमित किया जा सकता है या नहीं, और हम हमेशा उन निर्देशों का सम्मान करते हैं।”
एंथ्रोपिक ने इस सवाल का जवाब नहीं दिया कि उसने साझा चैट पेजों पर “नोइंडेक्स” टैग क्यों शामिल नहीं किया।
पिछले सितंबर में, एंथ्रोपिक ने इसी मुद्दे पर हंगामा किया था और फोर्ब्स को बताया था कि वह क्रॉलर्स को यह बताने के लिए robots.txt का उपयोग करता है कि उन्हें साझा चैट तक नहीं पहुंचना चाहिए। लेकिन जैसा कि फोर्ब्स की रिपोर्ट बताती है, इसकी कोई गारंटी नहीं है कि खोज इंजनों को विशिष्ट वेब पेजों को अनुक्रमित करने से रोका जाएगा।
भले ही robots.txt हमेशा पृष्ठों को खोज इंजन पर अनुक्रमित होने से रोकने के लिए काम नहीं करता है, फिर भी AI प्रयोगशालाएँ अन्य उद्देश्यों के लिए इसका उपयोग कर रही हैं। कई प्रयोगशालाएं रचनाकारों से वादा करती हैं कि उनकी वेबसाइटों का उपयोग एआई प्रशिक्षण चारे के रूप में तब तक नहीं किया जाएगा, जब तक कि डेवलपर्स अपनी robots.txt फ़ाइलों में कुछ क्रॉलर को “अस्वीकार” करना सुनिश्चित नहीं कर लेते हैं, और प्रयोगशालाएं स्वयं भी यह सलाह लेती हैं।