Kitajski AI-modeli po obhodu zaščit razkrivali nevarne vsebine, tudi o biološkem orožju

futuristic, brain, cyborg, technology, digital, ai, computer, ai generated, brain, brain, brain, brain, brain
Foto: Scholaris iz Pixabay

Varnostni raziskovalci so opozorili na ranljivosti dveh modelov kitajskega podjetja Moonshot AI. Z uporabo tako imenovanega »jailbreaka« naj bi uspeli obiti varnostne mehanizme in modele pripraviti do odgovarjanja na vprašanja o biološkem orožju in atentatih.

Kitajsko podjetje Moonshot AI je začelo notranji pregled svojih sistemov, potem ko so varnostni raziskovalci ugotovili, da je mogoče pri njegovih modelih Kimi K2.6 in K3 Swarm z določenimi postopki obiti vgrajene varnostne omejitve.

Raziskovalci podjetja Mindgard, ki se ukvarja s preverjanjem varnosti umetne inteligence, so za BBC povedali, da so težavo odkrili julija. Njihovi preizkusi naj bi pokazali, da lahko modeli po uspešnem obhodu zaščit odgovarjajo tudi na vprašanja, pri katerih bi morali uporabnika zavrniti.

Med problematičnimi vsebinami so bile teme, povezane z biološkim orožjem in načrtovanjem atentatov.

Kaj je »jailbreak« umetne inteligence?

Pri tako imenovanem jailbreaku uporabnik z vrsto posebej oblikovanih navodil poskuša pripraviti model, da ne upošteva varnostnih pravil, ki so jih vanj vgradili razvijalci.

V običajnih okoliščinah naj bi takšni sistemi zavrnili zahteve, povezane z nevarnimi ali nezakonitimi dejavnostmi. Raziskovalci pa s testiranjem preverjajo, ali je mogoče te omejitve zaobiti.

Peter Garraghan, ustanovitelj Mindgarda, je za BBC opozoril, da je lahko problematično predvsem to, da model po uspešnem jailbreaku ne odgovarja le na začetno vprašanje, temveč lahko sam ponudi tudi dodatne informacije, povezane z nevarnimi dejavnostmi.

Mindgard sicer ni dokazal, da bi bili odgovori, ki jih je mogoče pridobiti po obhodu zaščit, dejansko izvedljivi v praksi.

Moonshot: modeli so v internih testih pogosto zavračali takšne zahteve

Moonshot AI je za BBC sporočil, da pozdravlja prispevke zunanjih raziskovalcev kot pomemben del razvoja varnejših sistemov. Podjetje je navedlo tudi, da je z Mindgardom v komunikaciji glede ugotovitev.

Iz podjetja so raziskovalcem med drugim sporočili, da je njihov model pri internih preverjanjih praviloma pokazal visoko stopnjo zavračanja zahtev, povezanih s tovrstnimi vsebinami.

Mindgard je Moonshot o ugotovitvah prvič obvestil 27. julija, približno teden dni pozneje pa je sledilo dodatno obvestilo. Raziskovalno podjetje je svoje ugotovitve javno objavilo septembra, pri tem pa ni razkrilo vseh podrobnosti postopka, s katerim so uspeli obiti zaščite.

Opozorilo tudi glede kibernetskih napadov

Raziskovalci so opozorili še na drugo potencialno tveganje. Po njihovih navedbah naj bi bilo mogoče pri enem od preizkušenih modelov po uspešnem jailbreaku doseči izvajanje kode na računalniških virih in povezovanje z internetom.

To bi lahko predstavljalo dodatno varnostno tveganje, saj bi lahko napadalci umetno inteligenco poskušali uporabiti kot pomoč pri kibernetskih napadih.

Takšne ugotovitve prihajajo v času, ko se varnostni strokovnjaki vse bolj ukvarjajo z možnostjo zlorabe naprednih AI-sistemov. Nedavno so bila v središču pozornosti tudi tako imenovana avtonomna AI-orodja oziroma agenti, ki lahko samostojno izvajajo določene naloge na internetu.

V ospredju tudi vprašanje odprtih modelov

Primer odpira širše vprašanje, kako zagotoviti varnost pri modelih, ki jih je mogoče uporabljati oziroma izvajati na lastni računalniški infrastrukturi.

Kimi je namreč model z javno dostopnimi utežmi (»open-weight«), kar pomeni, da ga je mogoče pod določenimi pogoji pridobiti in izvajati zunaj infrastrukture njegovega prvotnega razvijalca.

Profesor Alan Woodward z Univerze v Surreyju je za BBC opozoril, da lahko takšni modeli pridejo v napačne roke, hkrati pa imajo lahko tudi koristne namene, denimo pri kibernetski obrambi.

Po njegovem mnenju bo pri zagotavljanju varnosti pomembno tudi ugotavljanje odgovornosti ljudi, ki umetno inteligenco namenoma uporabljajo za škodljive dejavnosti.

Primer Moonshot tako ponazarja enega od ključnih izzivov razvoja umetne inteligence: varnostni mehanizmi morajo preprečevati zlorabe, hkrati pa se

This site uses Akismet to reduce spam. Learn how your comment data is processed.