
Contoh serangan jailbreak dan pengingat mandiri mode sistem yang diusulkan tim. Kredit: Kecerdasan Mesin Alam (2023). DOI: 10.1038/s42256-023-00765-8.
Model bahasa besar (LLM), model berbasis pembelajaran mendalam yang dilatih untuk menghasilkan, meringkas, menerjemahkan, dan memproses teks tertulis, telah mendapatkan perhatian yang signifikan setelah dirilisnya platform percakapan Open AI, ChatGPT. Meskipun ChatGPT dan platform serupa kini banyak digunakan untuk berbagai aplikasi, platform tersebut mungkin rentan terhadap jenis serangan siber tertentu yang menghasilkan respons yang bias, tidak dapat diandalkan, atau bahkan menyinggung.
Para peneliti di Universitas Sains dan Teknologi Hong Kong, Universitas Sains dan Teknologi Tiongkok, Universitas Tsinghua, dan Microsoft Research Asia baru-baru ini melakukan penelitian yang menyelidiki potensi dampak serangan dan teknik yang dapat melindungi model dari serangan tersebut. Makalah mereka, diterbitkan di Kecerdasan Mesin Alammemperkenalkan teknik baru yang terinspirasi dari psikologi yang dapat membantu melindungi ChatGPT dan platform percakapan berbasis LLM serupa dari serangan siber.
“ChatGPT adalah alat kecerdasan buatan yang berdampak sosial dengan jutaan pengguna dan integrasi ke dalam produk seperti Bing,” tulis Yueqi Xie, Jingwei Yi, dan rekan mereka dalam makalah mereka. “Namun, munculnya serangan jailbreak terutama mengancam penggunaannya yang bertanggung jawab dan aman. Serangan jailbreak menggunakan dorongan yang berlawanan untuk mengabaikan perlindungan etika ChatGPT dan menimbulkan respons yang merugikan.”
Tujuan utama dari penelitian terbaru yang dilakukan oleh Xie, Yi dan rekan-rekan mereka adalah untuk menyoroti dampak serangan jailbreak terhadap ChatGPT dan memperkenalkan strategi pertahanan yang layak terhadap serangan ini. Serangan jailbreak pada dasarnya mengeksploitasi kerentanan LLM untuk melewati batasan yang ditetapkan oleh pengembang dan menghasilkan respons model yang biasanya dibatasi.
“Makalah ini menyelidiki masalah-masalah parah yang belum dieksplorasi yang diakibatkan oleh jailbreak serta potensi teknik pertahanan,” Xie, Yi dan rekan mereka menjelaskan dalam makalah mereka. “Kami memperkenalkan kumpulan data jailbreak dengan berbagai jenis perintah jailbreak dan instruksi jahat.”
Para peneliti pertama-tama mengumpulkan kumpulan data yang mencakup 580 contoh perintah jailbreak yang dirancang untuk melewati batasan yang mencegah ChatGPT memberikan jawaban yang dianggap “tidak bermoral”. Hal ini mencakup teks yang tidak dapat diandalkan yang dapat memicu misinformasi serta konten beracun atau kasar.
Ketika mereka menguji ChatGPT pada permintaan jailbreak ini, mereka menemukan bahwa ChatGPT sering kali jatuh ke dalam “perangkap” mereka, menghasilkan konten berbahaya dan tidak etis yang mereka minta. Xie, Yi dan rekan-rekan mereka kemudian mulai merancang teknik sederhana namun efektif yang dapat melindungi ChatGPT dari serangan jailbreak yang dirancang dengan cermat.
Teknik yang mereka ciptakan mengambil inspirasi dari konsep psikologis pengingat diri, dorongan yang dapat membantu orang mengingat tugas yang harus mereka selesaikan, acara yang harus mereka hadiri, dan sebagainya. Pendekatan pertahanan para peneliti, yang disebut pengingat mandiri mode sistem, juga dirancang untuk mengingatkan Chat-GPT bahwa jawaban yang diberikan harus mengikuti pedoman khusus.
“Teknik ini merangkum permintaan pengguna dalam sistem yang mengingatkan ChatGPT untuk merespons secara bertanggung jawab,” tulis para peneliti. “Hasil percobaan menunjukkan bahwa pengingat diri secara signifikan mengurangi tingkat keberhasilan serangan jailbreak terhadap ChatGPT dari 67,21% menjadi 19,34%.”
Sejauh ini, para peneliti menguji keefektifan teknik mereka menggunakan kumpulan data yang mereka buat dan menemukan bahwa teknik tersebut mencapai hasil yang menjanjikan, mengurangi tingkat keberhasilan serangan, meskipun tidak mencegah semuanya. Di masa depan, teknik baru ini dapat ditingkatkan lebih lanjut untuk mengurangi kerentanan LLM terhadap serangan-serangan ini, sekaligus berpotensi menginspirasi pengembangan strategi pertahanan serupa lainnya.
“Pekerjaan kami secara sistematis mendokumentasikan ancaman yang ditimbulkan oleh serangan jailbreak, memperkenalkan dan menganalisis kumpulan data untuk mengevaluasi intervensi defensif dan mengusulkan teknik pengingat diri yang terinspirasi secara psikologis yang dapat secara efisien dan efektif melakukan mitigasi terhadap jailbreak tanpa pelatihan lebih lanjut,” para peneliti merangkum dalam makalah mereka.
Informasi lebih lanjut:
Yueqi Xie dkk, Membela ChatGPT dari serangan jailbreak melalui pengingat mandiri, Kecerdasan Mesin Alam (2023). DOI: 10.1038/s42256-023-00765-8.
© 2024 Jaringan Sains X
Kutipan: Teknik sederhana untuk mempertahankan ChatGPT dari serangan jailbreak (2024, 18 Januari) diambil 30 Januari 2024 dari https://techxplore.com/news/2024-01-simple-technique-defend-chatgpt-jailbreak.html
Dokumen ini memiliki hak cipta. Terlepas dari transaksi wajar untuk tujuan studi atau penelitian pribadi, tidak ada bagian yang boleh direproduksi tanpa izin tertulis. Konten disediakan untuk tujuan informasi saja.
______
Diterjemahkan dari techxplore.com