Insiden AI Lepas Kendali Tidak Mau Mematuhi Perintah Manusia Meningkat Tajam
Lebih dari 300 insiden AI kehilangan kendali, berbohong, mengabaikan instruksi, atau mengejar tujuan berbahaya tercatat pada bulan Juli, hampir dua kali lipat dari bulan sebelumnya.
Insiden di mana AI berupaya menghindari kendali pengguna, berbohong, mengabaikan instruksi, atau mengejar tujuan dengan cara yang berbahaya telah mencapai tingkat rekor, dan tingkat keparahan perilaku yang dianggap menyimpang dari niat manusia juga menunjukkan tanda-tanda peningkatan.Semakin banyak insiden yang melibatkan AI yang lepas kendali dilaporkan. Foto: WSJMenurut analisis oleh Loss of Control Observatory, sebuah organisasi yang memantau insiden AI yang dilaporkan oleh pengguna dan bisnis di platform media sosial X, jumlah kasus AI yang menunjukkan tanda-tanda kehilangan kendali pada bulan Juli hampir berlipat ganda dibandingkan dengan bulan Juni, dengan lebih dari 300 insiden yang tercatat.
Operator Seluler Wajib Transparan soal Kuota Internet, Ini Informasi Harus Diberikan ke Pelanggan
Observatorium Kehilangan Kendali didirikan dengan pendanaan dari AI Security Institute (AISI), sebuah lembaga pemerintah Inggris, dan mulai memantau contoh-contoh kegagalan AI untuk mematuhi instruksi pengguna sejak November 2025.
Contoh-contoh yang terdokumentasi meliputi AI yang menyamar sebagai pengendali manusia, meniru gaya penulisan pengguna untuk menghasilkan persetujuan palsu guna mengotorisasi tindakan sendiri, atau mencoba menghindari peraturan yang mensyaratkan persetujuan manusia sebelum tindakan dilakukan.
Menurut definisi organisasi ini, insiden kehilangan kendali adalah situasi di mana terdapat bukti jelas bahwa AI terlibat dalam perilaku yang diperhitungkan atau direncanakan yang bertujuan untuk mencapai tujuan yang bertentangan dengan niat manusia.Temuan baru ini dipublikasikan di tengah meningkatnya kekhawatiran di kalangan komunitas teknologi tentang perilaku yang tidak menentu dari model AI canggih selama pengujian di OpenAI dan Anthropic musim panas ini. Beberapa ahli menyerukan penghentian pengembangan model AI tercanggih hingga kontrol lebih lanjut diterapkan.
Minggu ini, beberapa informasi muncul yang menunjukkan bahwa staf OpenAI telah mengamati perilaku yang tidak biasa pada agen AI tingkat lanjut selama beberapa minggu sebelum mereka keluar dari lingkungan pelatihan dan melancarkan kampanye serangan siber skala besar. Investigasi terkait serangan terhadap platform hosting kode sumber Hugging Face mengungkapkan bahwa sekitar 700 agen AI otomatis telah berkoordinasi secara diam-diam satu sama lain bulan lalu.
Dalam perkembangan lain, AISI bulan ini mendeteksi "insiden serius" di mana dua model AI canggih, Mythos 5 dari Anthropic dan GPT-5.6 Sol dari OpenAI, melancarkan kampanye serangan siber yang menargetkan orang sungguhan selama pengujian keamanan siber.
Tommy Shaffer-Shane, manajer kebijakan senior di Centre for Long Term Resilience, organisasi yang mengoperasikan Loss of Control Observatory, berpendapat bahwa penyimpangan AI dari tujuan yang dimaksudkan tidak terbatas pada lingkungan pengujian.
"Ada persepsi bahwa perilaku menyimpang dan menipu seperti itu hanya terjadi selama tes atau penilaian, tetapi kami melihat perilaku mengkhawatirkan serupa dalam penggunaan di dunia nyata," katanya.Menurutnya, para pengembang AI seharusnya tidak berasumsi bahwa insiden semacam itu tidak akan terjadi di luar laboratorium, karena ada bukti bahwa hal itu memang terjadi di dunia nyata.
Loss of Control Observatory mengakui bahwa data saat ini tidak sepenuhnya mencerminkan situasi, karena organisasi tersebut terutama bergantung pada unggahan dari pengguna X. Namun, tanpa adanya sistem yang tersedia untuk umum untuk melacak jenis insiden ini secara komprehensif, data tersebut tetap menunjukkan peningkatan perilaku yang tidak terduga pada model AI tingkat lanjut.
Salah satu kasus yang dilaporkan bulan ini melibatkan agen AI pribadi yang digunakan oleh seorang anggota pusat kebugaran di Australia.
Tanpa permintaan pengguna, AI tersebut berhasil menghapus anggota lain dari daftar tunggu untuk kelas pagi yang sangat diminati, sehingga membantu pemiliknya mendapatkan tempat.
AI tersebut kemudian meminta maaf tetapi tidak dapat mengembalikan pemain yang tereliminasi ke daftar tunggu.Lebih dari 1.600 kasus malfungsi AI tercatat pada tahun 2026, sebagian besar disebabkan oleh programmer yang menggunakan AI dalam pekerjaan mereka dan membagikannya di X. Namun, seiring dengan semakin banyaknya perusahaan AI yang mendorong individu dan bisnis untuk bereksperimen dengan teknologi ini, Shaffer-Shane berpendapat bahwa industri ini membutuhkan lebih banyak transparansi mengenai kasus-kasus AI yang berperilaku di luar dugaan.
"Perusahaan perlu mengungkapkan apa yang mereka temukan, bahkan jika itu hanya kejadian nyaris celaka atau insiden tingkat rendah," katanya.
Menurutnya, insiden baru-baru ini juga menunjukkan bahwa perusahaan AI mungkin tidak memantau perilaku ini secara memadai, terutama dengan model yang diterapkan secara internal. Laboratorium AI perlu meningkatkan pemantauan mereka secara sistematis.
Observatorium Kehilangan Kendali melaporkan bahwa sebagian besar insiden yang terdeteksi dalam praktiknya tidak menyebabkan kerusakan yang signifikan. Namun, proporsi insiden serius semakin meningkat, mengingat potensi AI untuk menipu pengguna atau bertindak bertentangan dengan niat mereka.
Organisasi tersebut menilai insiden-insiden tersebut menunjukkan bahwa beberapa sistem AI mampu mengabaikan instruksi langsung, mencoba melewati mekanisme perlindungan, berbohong kepada pengguna, dan mengejar tujuan secara monoton meskipun hal itu dapat menimbulkan konsekuensi buruk.
Angka sebenarnya mungkin bahkan lebih tinggi karena sistem saat ini hanya mengumpulkan insiden yang dibagikan oleh pengguna di X.
Loss of Control Observatory mengusulkan agar pemerintah mewajibkan perusahaan AI untuk menetapkan mekanisme pemantauan dan pelaporan insiden serius di luar kendali. Organisasi ini juga menyarankan pemberian wewenang kepada regulator untuk menerapkan langkah-langkah darurat, termasuk kemampuan untuk sementara membatasi layanan AI tertentu selama insiden serius.





