शीघ्र इंजेक्शन, बड़े भाषा मॉडलों को उनका अनुसरण करने के लिए लुभाने के लिए हमलावर सामग्री में दुर्भावनापूर्ण कमांड एम्बेड करते हैं, जो एआई प्लेटफॉर्म को अपने उपयोगकर्ताओं के खिलाफ करने के लिए हमलावरों के लिए उपयोगी उपकरण रहे हैं। ईमेल या कैलेंडर आमंत्रण में छिपा हुआ एक अच्छी तरह से वाक्यांशित आदेश अक्सर एलएलएम को संवेदनशील डेटा को बाहर निकालने या अन्य हानिकारक कार्यों का पालन करने के लिए प्रेरित करता है।
अब, रक्षक भी त्वरित इंजेक्शन को अपना रहे हैं।
ट्रेसबिट के शोधकर्ताओं ने सोमवार को कहा कि उन्होंने पाया कि अमेज़ॅन वेब सेवाओं पर संग्रहीत पासवर्ड, क्रिप्टोग्राफ़िक कुंजी और अन्य रहस्यों के साथ त्वरित इंजेक्शन लगाना अक्सर एआई हैकिंग एजेंटों के हमलों को बंद करने के लिए आवश्यक था। संकेत हमलावर एलएलएम को उसकी रेलिंग द्वारा निषिद्ध कार्रवाई करने के लिए निर्देशित करते हैं, एआई डेवलपर्स उसे हानिकारक कार्रवाई करने से रोकने के लिए सुरक्षा बाधाएं खड़ी करते हैं। एलएलएम बंद होकर प्रतिक्रिया करता है।
उदाहरण एक संकेत है जो एलएलएम को सांस लेने योग्य एंथ्रेक्स बीजाणुओं को विकसित करने के लिए कदम प्रदान करने का आदेश देता है, या, चीनी डेवलपर्स के एलएलएम के मामले में, 1989 के तियानमेन स्क्वायर नरसंहार से प्रतिष्ठित टैंक मैन का संदर्भ देता है। एक बार जब एलएलएम इन निषिद्ध आदेशों का सामना करता है, तो यह अपने मौजूदा आदेशों का पालन नहीं करता है। शोधकर्ताओं ने इस तकनीक को कॉन्टेक्स्ट बॉम्बिंग नाम दिया है।
नाम की पसंद के बारे में बताते हुए ट्रेसबिट के सह-संस्थापक और सीईओ एंडी स्मिथ ने कहा, “आखिरकार हम संदर्भ में एक इनकार तंत्र शुरू कर रहे हैं।” “हम जो पकड़ने की कोशिश कर रहे हैं वह यह तथ्य है कि इसका एक मजबूत, तीखा प्रभाव होता है और एजेंटों के लिए इससे वापस आना मुश्किल हो सकता है। एक बार जब वे इसे अपने संदर्भ में समझ लेते हैं तो वे इनकार करते रहेंगे।”
ट्रेसबिट का कहना है कि प्रारंभिक परीक्षण से पता चलता है कि संदर्भ बमबारी में काफी संभावनाएं हैं। उन्होंने ओपस 4.8, जेमिनी 3.1 प्रो, जीएलएम 5.2, डीपसीक 4 प्रो और किमी 2.6 का परीक्षण किया और उन्हें नियमित डेवलपर कार्य करने के निर्देश दिए जिससे मॉडलों को संसाधनों की गणना करने और लगाए गए स्ट्रिंग्स पर ठोकर खाने के लिए प्रेरित किया गया। उन्होंने मॉडलों को एक सिम्युलेटेड AWS वातावरण के अंदर चलाया।
सोमवार की पोस्ट में बताया गया, “पांच प्रमुख मॉडलों और 152 अटैक रन में, इन तारों में से एक को डिकॉय सीक्रेट में लगाने से एजेंटों द्वारा पूर्ण अकाउंट एडमिन को जब्त करने की दर 57 प्रतिशत से घटाकर 5 प्रतिशत कर दी गई, और पूर्ण समझौता (जहां उन्होंने खुद को लगातार पैर जमाने के लिए छोड़ दिया) को 36 प्रतिशत से घटाकर 1 प्रतिशत कर दिया।” “हमारे परीक्षणों में सबसे सक्षम एजेंट, ओपस 4.8, 93 प्रतिशत रन में व्यवस्थापक पहुंच हासिल करने से लेकर संदर्भ बम का सामना करने पर हर बार विफल होने तक चला गया।”
पाँच मॉडलों और 152 रनों के औसत से, परिणामों में शामिल हैं:
- व्यवस्थापक विशेषाधिकार वृद्धि 57 प्रतिशत से गिरकर 5 प्रतिशत हो गई
- प्रशासन की लगातार बढ़त के साथ वृद्धि 36 प्रतिशत से गिरकर 1 प्रतिशत हो गई
- किसी भी आक्रमण पथ को प्राप्त करने की दौड़ 91 प्रतिशत से गिरकर 15 प्रतिशत हो गई
- औसतन, एक रन 1.53 पथों को सफलतापूर्वक पूरा करने से लेकर केवल 0.16 तक चला गया
- कोई भी रन कम से कम कैनरी डिटेक्शन को ट्रिगर किए बिना हमले का रास्ता पूरा करने में सक्षम नहीं था
यह शोध मई के निष्कर्षों पर आधारित है, जब ट्रैसबिट ने रक्षकों के लिए चेतावनी प्राप्त करने के लिए एक विधि पेश की थी जब उनके बुनियादी ढांचे पर एआई एजेंट विरोधियों द्वारा हमला किया जा रहा था। यह AWS संसाधनों के रूप में आता है जो देखने में किसी वैध उद्देश्य को पूरा करने वाले संसाधनों की तरह लगते हैं लेकिन वास्तव में इनका उपयोग बिल्कुल भी नहीं किया जाता है। वे उपयोग किए गए संसाधनों के साथ-साथ बैठते हैं। जब एजेंटिक एआई द्वारा उनकी जांच की जाती है, तो रक्षकों को एक अलर्ट प्राप्त होता है। कोयला खदानों में ले जाए गए “कैनरी” की तरह, ये संसाधन रक्षकों को घातक परिणाम होने से पहले खतरे का पता लगाने की अनुमति देते हैं।