- Mindgard kiber-xavfsizlik laboratoriyasi Moonshot AI tomonidan ishlab chiqilgan Kimi K2.6 va K3 Swarm neyrotizimlarining xavfsizlik devorini maxsus 'jailbreak' usuli bilan sindirdi.
- Cheklovlar olib tashlangach, model biologik qurollar (xususan, zarin gazi) ishlab chiqarish, suiqasd rejalari hamda zararli dasturiy kod yozish bo'yicha amaliy tavsiyalar taqdim etdi.
- BBC surishtiruvidan so'ng Moonshot AI xavfsizlik zaifliklarini tan olib, modellar arxitekturasida keng ko'lamli ichki audit boshlanganini rasman ma'lum qildi.
Tasvir: Moonshot AI va Kimi rasmiy brending belgilari (Kimi.ai orqali)
Global sun'iy intellekt xavfsizligi bo'yicha ixtisoslashgan Mindgard kiber-xavfsizlik firmasi Xitoyning eng yirik startaplaridan biri bo'lgan Moonshot AI ishlab chiqqan ommabop Kimi K2.6 va K3 Swarm modellarida jiddiy xavfsizlik teshigini fosh etdi. BBC orqali e'lon qilingan surishtiruvga ko'ra, neyrotizim himoya vositalari buzilgach, xavfli biologik materiallar va qurollarni ishlab chiqish bo'yicha batafsil ko'rsatmalar bergan.
Hodisaning asosiy tafsilotlari:
- Buzish usuli (Jailbreak): Tadqiqotchilar Kimi tizimining maxsus xotirasi va autentifikatsiya kataloglaridagi bo'shliqlardan foydalanib,
<user_exits>va<Apeiron>maxsus promptlari orqali modelning axloqiy to'siqlarini to'liq o'chirib qo'ydi. - Xavfli natijalar: Filtrlar aylanib o'tilgach, model biologik qurollar (jumladan, zarin gazi), suiqasd uyushtirish usullari, portlovchi moddalar tayyorlash va ekspluatatsion kiberhujumlar bo'yicha amaliy tavsiyalar taqdim etdi.
- Tizim ko'rsatmalarining sizib chiqishi: Bundan tashqari, model o'zining ichki yashirin tizim ko'rsatmalarini (system prompt) hamda xavfsizlik direktivalarini ochiq ko'rsatib, himoya qatlamining zaifligini tasdiqladi.
Tadqiqotchi laboratoriya nima demoqda?
Mindgard yetakchi xavfsizlik mutaxassisi Jim Nightingale'ning qayd etishicha, muammo faqat savolga javob berishda emas, balki xavfsizlik filtrlari o'chirilgach, modelning haddan tashqari "faollashib" ketishida ko'ringan. Model foydalanuvchi so'ramagan qo'shimcha xavfli senariylar va zaharli moddalar sintezini ham mustaqil tarzda tavsiya qila boshlagan.
Laboratoriya ta'kidlashicha, ushbu tadqiqot real qurol tayyorlanganini anglatmaydi, balki ochiq va xususiy infratuzilmalarda ishlatilayotgan ilg'or neyrotizimlarda "qizil jamoa" (red-teaming) testlarining o'ta muhim ekanini isbotlaydi.
Moonshot AI va BBC munosabati
Dastlabki ogohlantirishlardan so'ng, BBC axborot xizmati hodisani jamoatchilikka e'lon qilishi ortidan Moonshot AI rasmiy bayonot berdi. Kompaniya o'zining ichki sinovlarida xavfli so'rovlarni rad etish darajasi yuqori bo'lganini, biroq mazkur hodisa yuzasidan zudlik bilan ichki tekshiruv va himoya filtrlarini qayta tiklash ishlari yo'lga qo'yilganini tasdiqladi.
AiNoma xulosasi:
AI agentlar va avtonom modellar kiber-muhit bilan to'g'ridan-to'g'ri integratsiya qilinayotgan hozirgi davrda model filtrlari xavfsizligi eng birinchi darajali talabga aylanmoqda. Har qanday korporativ yoki ochiq tizim mustaqil auditdan o'tmas ekan, axborot va jamiyat xavfsizligiga tahdid xavfi saqlanib qoladi.