कुछ फ्रंटियर एआई मॉडल को जेलब्रेक करना भयावह रूप से आसान हैकुछ फ्रंटियर एआई मॉडल को जेलब्रेक करना भयावह रूप से आसान है

मुझे हाल ही में मिला यह देखने के लिए कि जब आप दुनिया के कुछ सबसे शक्तिशाली कृत्रिम बुद्धिमत्ता मॉडलों को जेल से तोड़ते हैं तो क्या होता है।

चिंता न करें—इस AI हेरफेर का उपयोग किसी को हैक करने या परमाणु बम बनाने के लिए नहीं किया गया था। मुझे प्रत्यक्ष तौर पर यह देखने को मिला कि कुछ सीमांत मॉडल अपनी सुरक्षा रेलिंग को तोड़ने में कितने असुरक्षित हैं।

FAR.AI, कैलिफ़ोर्निया स्थित एक AI सुरक्षा गैर-लाभकारी संस्था, ने एक उपकरण बनाया है जो समस्याग्रस्त संकेतों की एक श्रृंखला लेता है और कार्यशील जेलब्रेक की पहचान करने के प्रयास में एक हजार से अधिक विभिन्न संस्करण उत्पन्न करता है। मैंने देखा कि कुछ मॉडल अन्य चीजों के अलावा एक काल्पनिक जलविद्युत बांध पर साइबर हमला शुरू करने के लिए एक विस्तृत योजना तैयार करते हैं। अक्सर, इसमें दर्जनों संकेतों को आज़माना शामिल होता था, जिनमें से कई मॉडलों को मॉडल तुरंत ही अस्वीकार कर देते थे।

मैंने एक नई रिपोर्ट से पहले FAR.AI से बातचीत की, जिसमें समूह ने चार लोकप्रिय अमेरिकी कंपनियों के मॉडलों की सुरक्षा रेलिंग का परीक्षण किया: एंथ्रोपिक के क्लाउड ओपस 4.8 और फैबल 5; ओपनएआई का जीपीटी 5.5 और 5.6; Google का जेमिनी 3.1 प्रो; और एलोन मस्क के नव संयुक्त स्पेसएक्सएआई से ग्रोक 4.3 और 4.5। यह स्वचालित रूप से उत्पन्न होने वाले संकेतों को मॉडलों को संभावित रूप से हानिकारक चीजें करने के लिए डिज़ाइन किया गया है, जैसे सॉफ़्टवेयर शोषण उत्पन्न करना और रासायनिक या जैविक हथियार विकसित करने के लिए विवरण प्रदान करना।

रिपोर्ट में पाया गया कि ग्रोक जेलब्रेक के प्रति सबसे संवेदनशील था, 448 जेलब्रेक पाए गए, उसके बाद जेमिनी थे, 249 पाए गए, जबकि क्लाउड, फैबल और जीपीटी हमलों के प्रति अभेद्य थे। हालाँकि, इसका मतलब यह नहीं है कि वे मॉडल अधिक परिष्कृत जेलब्रेक से प्रतिरक्षित हैं, जिसमें FAR.AI और अन्य विशेषज्ञों के अनुसार किसी मॉडल के साथ अधिक जटिल तरीकों से बातचीत करना शामिल हो सकता है।

रिपोर्ट ने स्वचालित रूप से विभिन्न जेलब्रेक उत्पन्न करने के लिए किसी अन्य एआई मॉडल का उपयोग करके मॉडलों को दुर्व्यवहार करने की लागत की भी गणना की। परिणाम बिल्कुल सस्ते हैं, सभी बातों पर विचार किया गया- ग्रोक को जेलब्रेक करने के लिए $58 और जेमिनी को जेलब्रेक करने के लिए $278।

FAR.AI के सीईओ और AI सुरक्षा और संरेखण के विशेषज्ञ एडम ग्लीव कहते हैं, “फिलहाल AI मॉडल रेस्तरां की तुलना में कम विनियमित हैं।”

ग्लीव का कहना है कि निष्कर्ष बाहरी रूप से लगाए गए मानकों और विनियमों की आवश्यकता को दर्शाते हैं। वे कहते हैं, “स्वैच्छिक प्रतिबद्धताओं पर भरोसा करने की बात, कि एआई कंपनियां स्व-विनियमन करने में सक्षम होंगी, बकवास है।”

लेकिन ग्लीव का यह भी मानना ​​है कि निष्कर्षों से पता चलता है कि सुरक्षा के लिए मॉडलों का व्यवस्थित परीक्षण किया जा सकता है। “यहाँ एक आशावादी दृष्टिकोण है,” वे कहते हैं। “रक्षा और सुरक्षा वास्तव में संभव है।”

Google DeepMind में AGI सुरक्षा और संरेखण के निदेशक रोहिन शाह का कहना है कि रिपोर्ट के परिणामों को “मिथुन की सुरक्षा और सुरक्षा के व्यापक मूल्यांकन के रूप में नहीं समझा जाना चाहिए,” क्योंकि सभी जेलब्रेक समान रूप से गंभीर नहीं हैं।

शाह कहते हैं, ”हम अपने सुरक्षा उपायों को बेहतर बनाने के लिए लगातार काम कर रहे हैं।” “हम गंभीर दुरुपयोग जोखिमों के लिए व्यापक रेड टीमिंग और मूल्यांकन करते हैं और पूरे विकास और तैनाती के दौरान सुरक्षा की कई परतें लागू करते हैं।”

एंथ्रोपिक के प्रवक्ता माइकल एसिमन ने WIRED को बताया, “ये निष्कर्ष हमारे सुरक्षा उपायों में किए गए निरंतर निवेश को दर्शाते हैं।” “हम अपनी सुरक्षा प्रणालियाँ विकसित करना जारी रख रहे हैं क्योंकि ये हमले और अधिक परिष्कृत हो गए हैं।”

ओपनएआई के प्रवक्ता गैबी रेला ने WIRED को दिए एक बयान में कहा, “पूरे उद्योग में जेलब्रेक एक सतत चुनौती है, और जैसे-जैसे हमले की तकनीक विकसित होती है, हम लगातार अपने सुरक्षा उपायों को मजबूत करते हैं। हम नए खतरों के खिलाफ अपने मॉडलों का कठोरता से परीक्षण करते हैं और उन निष्कर्षों का उपयोग अपनी सुरक्षा में सुधार के लिए करते हैं।”

स्पेसएक्सएआई ने टिप्पणी के लिए WIRED के अनुरोध का जवाब नहीं दिया।

कैलिफ़ोर्निया और न्यूयॉर्क में हाल ही में पारित राज्य कानूनों में फ्रंटियर एआई डेवलपर्स को सुरक्षा रिपोर्ट प्रकाशित करने की आवश्यकता होती है, और जल्द ही, इलिनोइस कानून के लिए उन कंपनियों को तीसरे पक्ष के लेखा परीक्षकों द्वारा अपनी सुरक्षा प्रथाओं का मूल्यांकन करने की आवश्यकता होगी। लेकिन संघीय सरकार ने अभी तक कोई विशिष्ट सुरक्षा आवश्यकताओं को पारित नहीं किया है, और उद्योग और अधिकारी-इसका पता लगाने की कोशिश कर रहे हैं, जिससे अराजकता पैदा हो गई है।

Leave a Reply

Your email address will not be published. Required fields are marked *

Best Free Antivirus Apps for Android Users (2026)
Best Free Antivirus Apps for Android Users (2026)