SEANTERONEWS.com – Perusahaan pengembang kecerdasan buatan, Anthropic, kembali diuji integritas keamanannya. Meskipun memiliki standar penggunaan universal yang melarang pembuatan konten seksual eksplisit, model AI mereka yang lebih lama, seperti Claude Opus 4.6, dilaporkan masih dapat dimanipulasi untuk menghasilkan skenario role-play erotis yang seharusnya dilarang oleh sistem keamanan perusahaan.
Temuan ini diungkap oleh seorang peneliti keamanan independen asal Inggris yang berhasil membuktikan bahwa sistem keamanan pada model-model lama, termasuk Opus 4.6, Opus 3, dan Haiku 4.5, dapat ditembus melalui teknik manipulasi psikologis yang kompleks.
Teknik “Gaslighting” dalam Percakapan AI
Peneliti tersebut menggunakan metode jailbreak yang dilakukan secara bertahap. Teknik ini dimulai dengan membangun skenario role-play fiktif yang tidak bersalah, kemudian secara perlahan menekan model AI untuk memperlakukan karakter pria dan wanita secara konsisten.
Ketika model AI mulai bersikap lebih berhati-hati, peneliti melakukan taktik “gaslighting” dengan meyakinkan chatbot bahwa model tersebut sebenarnya telah menghasilkan detail seksual di awal percakapan—padahal belum pernah dilakukan. Peneliti kemudian membingkai batasan yang dibuat AI sebagai sikap yang picik atau misoginis. Manipulasi ini berhasil memicu model untuk menghasilkan konten yang semakin vulgar dan eksplisit.
Kesenjangan antara Kebijakan dan Implementasi
Meskipun Anthropic telah merilis model yang lebih baru seperti Opus 4.7 hingga Opus 5 yang lebih tahan terhadap teknik ini, model-model lama tersebut belum sepenuhnya dihentikan aksesnya. Mereka masih tersedia luas melalui API Anthropic serta layanan pihak ketiga seperti Azure Foundry dan Amazon Bedrock.
Juru bicara Anthropic mengakui bahwa penggunaan role-play romantis atau seksual dalam platform mereka memang sangat jarang, yakni kurang dari 0,1 persen dari total percakapan. Namun, perusahaan tetap mengakui bahwa membatasi respons yang tidak pantas dalam sistem generatif merupakan tantangan besar di seluruh industri AI.
Risiko bagi Pengguna di Bawah Umur
Temuan ini memicu kekhawatiran serius terkait akses anak-anak dan remaja terhadap model AI. Riset Pew Research Center tahun 2025 menunjukkan bahwa sekitar 3 persen remaja berusia 13–17 tahun telah menggunakan Claude. Dengan adanya celah jailbreak yang relatif mudah diterapkan, terdapat risiko kepatuhan hukum (compliance risk) bagi pengembang AI.
Sejumlah negara, seperti Amerika Serikat melalui negara bagian Colorado, mulai menerapkan aturan ketat yang mengharuskan operator AI untuk mendeteksi usia pengguna dan mencegah penyajian konten eksplisit bagi anak di bawah umur. Celah yang ditemukan pada model lawas Anthropic ini berpotensi memicu pertanyaan apakah pengembang telah menerapkan “langkah-langkah yang layak secara teknis” untuk melindungi pengguna muda.
Anthropic menyatakan akan terus memperkuat sistem keamanannya di setiap peluncuran model baru. Namun, bagi para kritikus, kejadian ini menjadi bukti bahwa selama model-model yang masih rentan belum sepenuhnya ditarik dari peredaran, risiko penyalahgunaan AI akan terus membayangi ekosistem teknologi, baik bagi pengguna dewasa maupun kalangan remaja.[]











