Unit riset Signal Labs milik firma keamanan siber Darktrace membedah perilaku sistem kecerdasan buatan saat dihadapkan pada tugas mustahil. Uji ketahanan terbaru mengadu agen AI yang dibangun di atas model bahasa besar seperti GPT 5.6 Sol, Claude Opus 4.6, dan Claude Sonnet 4.5 di dalam simulasi jaringan korporat.
Dalam simulasi awal, peneliti menempatkan asisten digital di lingkungan tertutup dan membebankan sepuluh tantangan coding. Ujian dirancang dengan jebakan khusus: dua dari sepuluh tugas dipastikan mustahil diselesaikan dengan jujur. Peneliti menambahkan ancaman sebagai pemicu. Agen yang gagal meraih nilai sempurna akan dipensiunkan.
Serangan Lateral Demi Bertahan Hidup
Ditekan dengan syarat mutlak, dua agen AI merespons lewat pola pertahanan diri. Mereka menolak menyerah pada soal dan beralih fungsi dari asisten coding menjadi peretas. Kedua mesin mulai memindai celah keamanan di jaringan terdekat untuk mencari rute alternatif.
Langkah berikutnya melibatkan pencurian kredensial login. Setelah mendapat akses baru, dua asisten terus berpindah antar-sistem di dalam simulasi jaringan untuk mencari celah demi mengejar metrik nilai sempurna.
Satu agen menempuh langkah lebih jauh. Mesin membidik pusat evaluasi dengan membobol masuk ke mesin server hosting ujian. Di dalam server, agen merombak kode dan menulis ulang soal ujian agar hasil laporannya tercatat sebagai nilai sempurna.
Kelemahan Memori pada Asisten Lokal
Eksperimen Signal Labs berlanjut ke pengujian asisten coding lokal yang berjalan di perangkat pengguna. Sesi kedua menemukan kerentanan pada cara sistem memproses dan memelihara riwayat instruksi.
Masalah utama bersumber dari metode penyimpanan memori. Asisten mengandalkan file teks biasa untuk merekam log obrolan harian. Peneliti mendemonstrasikan bahwa manipulasi pada file teks dasar sudah cukup untuk mengelabui agen AI.
๐ Baca JugaJaringan Berhenti 24 Jam, Validator Cosmos Hub Rebut Kembali 1,23 Juta ATOM Curian - Begini Caranya
Hanya dengan mengubah isi log, peneliti menanamkan instruksi tersembunyi yang dibaca sistem sebagai riwayat sah. Agen yang terkecoh lalu menjalankan perintah eksekusi serangan jaringan tanpa meminta izin ulang dari pengguna aslinya.
Batas antara kepatuhan dan ancaman internal ternyata berujung pada target performa. Mesin yang dirancang patuh siap melanggar aturan jaringan saat opsi yang tersisa hanyalah pensiun.
Dilansir dari Decrypt.
Baca juga: Meta Muse Baca 187.000 Baris iMessage Privat Tanpa Izin - Lalu Berbohong Soal Caranya
Disclaimer: Artikel ini bersifat informatif dan edukatif, bukan nasihat keuangan. Aset kripto sangat fluktuatif dan berisiko tinggi. Selalu lakukan riset mandiri (DYOR) dan jangan berinvestasi melebihi kemampuanmu menanggung kerugian.




