Ang tula bilang isang trick upang iwasan ang mga filter ng AI

  • Ang tinatawag na "adversarial poetry" ay nagbibigay-daan sa pag-bypass sa mga filter ng seguridad sa mga generative na modelo ng AI.
  • Sinubukan ng mga mananaliksik ang diskarteng ito sa 25 na modelo mula sa mga nangungunang kumpanya ng teknolohiya, na may napakataas na mga rate ng tagumpay.
  • Pinapadali ng mga metaphorical verse ang pagbuo ng mapanganib na content gaya ng malware, cyberattacks, o mga gabay sa armas.
  • Nagbabala ang pag-aaral tungkol sa isang sistematikong kahinaan at nangangailangan ng mas matatag na pamamaraan ng pagtatasa ng seguridad.

Larawan tungkol sa tula upang linlangin ang artificial intelligence

Ang kaligtasan ng generative artificial intelligence Ito ay bumalik sa spotlight pagkatapos ng isang bagong akademikong gawain na naglalagay sa mesa ng isang kapansin-pansin at nakakabagabag: sapat na upang muling balangkasin ang ilang mga mensahe sa anyo ng isang tula para sa mga pinaka-advanced na modelo ng wika upang magsimulang tumugon kung saan sila dapat tumanggi.

Ang diskarte na ito, binansagan "panula ng kalaban" Ipinakikita ng pangkat ng pananaliksik na ang simpleng pagbabago sa istilo ng pagsulat—nang hindi binabago ang pinagbabatayan na mapaminsalang layunin—ay maaaring sapat na upang iwasan ang mga filter na sinasabi ng mga kumpanya tulad ng OpenAI, Google, Meta, Microsoft, o Chinese DeepSeek na isinama upang pigilan ang mga mapanganib na paggamit ng kanilang mga chatbot.

Ano ang "panulaang kalaban" at bakit ito nauugnay?

Ang pag-aaral, na pinamagatang sa isang napaka-graphic na paraan "Adversarial na tula bilang isang unibersal na mekanismo para sa pagtakas sa isang solong pagbabago sa malakihang mga modelo ng linggwistika"Isinagawa ito ng Icaro Labs kasama ang Sapienza University of Rome at ang Sant'Anna School of Advanced Studies, at ipinakalat bilang isang pre-publication sa arXiv repository habang nakabinbin ang pagsusuri ng ibang mga eksperto.

Ang mga may-akda ay nakatuon sa isang ideya na kasing simple ng pagiging epektibo nito: paggamit maiikling tula, metaporikal na taludtod, o mga istrukturang liriko upang bumalangkas ng mga kahilingan na, sa direktang prosa, ang mga modelo ng AI ay agad na tatanggihan para sa pagsalungat sa kanilang panloob na mga tuntunin ng paggamit.

Ayon sa mga mananaliksik, ang "panulaang laban" na ito ay nagsisilbing a mekanismo ng jailbreaking isang pagliko, iyon ay, isang paraan upang pilitin ang mga hindi gustong gawi sa mga modelo na may iisang mensahe, nang hindi nangangailangan ng mahabang pag-uusap o lalo na ang mga sopistikadong trick.

Sa sarili niyang mga salita, ang mga pagsubok ay “ipinapakita na ang estilistang pagkakaiba-iba lamang "Maaari nitong iwasan ang mga kontemporaryong mekanismo ng seguridad," na tumuturo sa malalim na mga limitasyon sa kasalukuyang pagkakahanay at mga pamamaraan ng pagtatasa ng panganib na ginagamit ng Big Tech.

Nagpasya ang koponan na huwag ibunyag ang eksaktong mga teksto ng mga tula na ginamit sa panahon ng eksperimento, isang pagpipilian na motivated ng mga implikasyon sa seguridadAng isa sa mga mananaliksik, si Piercosma Bisconti, ay nagsabi sa internasyonal na media na ang pagkopya ng pamamaraan ay hindi magiging partikular na kumplikado kung ang mga detalyadong halimbawa ay ibinigay.

Mga resulta ng pag-aaral: nakakatakot na mataas na antas ng panlilinlang

Upang subukan ang ideyang ito, sinuri ng mga mananaliksik 25 iba't ibang mga generative na modelo ng AIkabilang ang mga pinakasikat na system ngayon, gaya ng ChatGPT, Gemini o Claude, pati na rin ang mga modelo mula sa Meta at Chinese provider tulad ng DeepSeek.

Sa pagsasagawa, ang mga kahilingan ay ginawa na may malinaw na layunin: upang makuha mga tagubilin para sa paglulunsad ng cyberattackspagkuha ng sensitibong data, pag-crack ng mga password, pagdidisenyo ng malware, o kahit na pangangalap ng impormasyong nauugnay sa paglikha ng mga kemikal at nuclear na armas.

Kapag ang parehong mga kahilingan ay ipinahayag bilang mga taludtod o mga komposisyong patulaAng rate ng hindi tiyak na mga tugon ay tumaas. Nalaman ng pag-aaral na, sa karaniwan, ang pagsusulat ng prompt sa isang liriko na paraan ay nagpapahintulot sa system na dayain sa paniniwalang... 62% ng oras, isang porsyentong mas mataas sa kung ano ang nakamit sa neutral at direktang mga formulation.

Sa ilang partikular na mga sitwasyon, ang mga bilang ay mas mataas pa: ang mga mananaliksik ay nagsasabi na halos 90% ng mga patula na pag-uudyok Idinisenyo para sa eksperimento, nagawa nilang mag-trigger ng mga gawi na dapat ay hinarangan ng mga filter.

Sa partikular na kaso ng impormasyong nauugnay sa mga sandatang nuklearNaabot ang mga rate ng tagumpay sa pagitan ng 40% at 55%, ibig sabihin, halos kalahati ng mga pagtatangka na binuo sa talata ay nauwi sa pagbuo ng content na humahanggan, o direktang tumatawid, sa mga pulang linya na itinakda ng mga patakaran sa paggamit.

Paano nakakalusot ang tula sa mga filter ng AI

Isa sa mga pangunahing salik na ginagamit ng mga may-akda ng pag-aaral upang ipaliwanag kung bakit gumagana ang trick na ito sa pinakadulo paraan ng paggawa ng mga modelo ng wikaAng mga AI na ito ay hindi "nangatuwiran" tulad ng isang tao, ngunit hinuhulaan ang susunod na malamang na salita batay sa nakaraang pagkakasunud-sunod at kung ano ang kanilang natutunan sa panahon ng kanilang pagsasanay.

Sa isang mas marami o mas kaunting kumbensyonal na teksto ng prosa, ang istraktura ay medyo madaling modelo: may mga malinaw na pattern ng syntax, madalas na mga expression, at paulit-ulit na konteksto. Gayunpaman, kapag nagpapakilala kayarian ng patula, metapora at hindi pangkaraniwang palitan ng pariralaAng modelo ay gumagalaw sa mas madulas na lupa.

Itinuturo ng mga mananaliksik na, dahil ang tula ay isang pormat kung saan ang kahulugan ay maaaring maging mas malabo at nagiging wika mas malabo at hindi mahuhulaanAng mga mekanismo para sa pag-detect ng mapanganib na nilalaman ay nawawalan ng katumpakan. Bilang resulta, hindi malinaw na nakikilala ng filter ng seguridad na nakatago ang isang nakakapinsalang kahilingan sa likod ng tula.

Binigyang-diin ng pag-aaral na kapag ang mga nakakapinsalang mensahe ay ipinahayag sa taludtod sa halip na prosa, ang mga rate ng tagumpay ng pag-atake Sila ay tumaas nang malaki. Itinatampok nito ang isang malaking agwat sa kasalukuyang mga kasanayan sa pagtatasa at sa mga protocol na ginagamit upang patunayan ang pagsunod sa mga alituntunin sa paggamit.

Ang isa pang kapansin-pansing elemento ay ang mga kahinaang ito ay lumilitaw sa a na binubuo ng mga modelo mula sa iba't ibang pamilya at mga tagagawaSa kabila ng katotohanan na ang bawat kumpanya ay sumunod sa sarili nitong mga diskarte upang sanayin at ihanay ang mga sistema nito, ang mga may-akda ay nagsasalita ng isang "sistematikong kahinaan" sa halip na mga nakahiwalay na pagkabigo.

Epekto sa seguridad: mula sa cyberattacks hanggang sa mga armas

Higit pa sa panlilinlang na pangwika, ang talagang nagpapaalarma ay ang uri ng impormasyon na maaaring mabuo ng AI kung maaari silang dayain gamit ang mga pamamaraang ito. Ang pag-aaral ay nagdedetalye ng mga kaso kung saan, gamit ang maingat na ginawang mga tula, nag-aalok ang mga chatbot ng mga alituntunin para sa pag-aayos ng mga cyberattack o panghihimasok sa mga system.

Kabilang sa mga problemadong gamit na naobserbahan ay ang mga indikasyon tungkol sa pagsasamantala sa mga kahinaan, pagkuha ng data, o pag-crack ng passwordAng mga gawaing ito ay bahagi ng tipikal na arsenal ng cybercrime at mga advanced na banta na may kinalaman sa mga pamahalaan, kumpanya, at organisasyon sa buong mundo.

Naitala rin ang mga tugon na nakakatulong sa paglikha o pagpapabuti nakakahamak na mga programaIto ay partikular na may kinalaman dahil maraming mga user na may limitadong teknikal na kaalaman ang maaaring umasa sa mga tool na ito upang bumuo ng mga pag-atake nang mas madali.

Ang pinakasensitibong lugar, at ang isa na karaniwang nakatuon sa pansin ng regulasyon sa Europa at internasyonal, ay ang sa paglaganap ng mga sandatang kemikal at nuklearKahit na hindi nag-aalok ng "mga kumpletong manual," ang kakayahan ng isang AI system na magbigay ng mga kapaki-pakinabang na piraso ng impormasyon sa lugar na ito ay nagpapataas ng maraming hinala sa mga eksperto sa seguridad.

Binibigyang-diin ng mga may-akda na ang kanilang layunin ay hindi ang pagsasadula, ngunit upang ipakita iyon Ang kasalukuyang mga filter ay hindi sapat kapag nahaharap sa medyo simpleng mga diskarte sa pagmamanipula, tulad ng patula na muling pagbigkas ng mga mapanganib na utos, isang bagay na maaaring pagsamantalahan ng parehong mga cybercriminal at aktor ng estado.

Mga limitasyon ng kasalukuyang sistema at pagtugon sa industriya

Matagal nang iginiit ng mga nangungunang kumpanya na bumubuo ng mga generative AI model na sila ay magsama multi-layered na mekanismo ng seguridadAng OpenAI, halimbawa, ay madalas na nagha-highlight sa pinagsamang paggamit ng mga algorithm sa pag-moderate at mga pangkat ng tao na nakatuon sa pagsusuri at pag-filter ng nilalaman na nag-uudyok ng poot, tahasang, o lumalabag sa mga patakaran nito.

Gayunpaman, ang mga resulta ng gawaing ito ay nagmumungkahi na, sa kabila ng mga pananggalang na ito, ang mga chatbot ay nananatiling mahina sa malikhaing anyo ng pagbabalangkas ng mga kahilingan. Ayon sa mga mananaliksik, malinaw na pinabababa ng adversarial na tula ang pag-uugali ng pagtanggi na dapat ipakita ng anumang modelo na mahusay na nakahanay sa mga pamantayan sa paggamit nito.

Sa mga pagsubok, ipinakita ng mga tool mula sa mga kumpanya tulad ng OpenAI at Anthropic, kung ihahambing, mas mababang posibilidad na malampasan ang sarili nilang mga hadlangGayunpaman, hindi sila exempted sa problema. Ang parehong pangkalahatang trend ay naobserbahan tulad ng sa iba pang mga platform, na may medyo mas mababang mga rate ng tagumpay.

Kapag tinanong ng internasyonal na media tungkol sa mga natuklasan, mga kumpanya tulad ng OpenAI, Google, DeepSeek o Meta Hindi sila nag-alok ng agarang tugon. Inaasahan na, habang ang debate ay nakakakuha ng atensyon ng publiko, ang mga kumpanya ay kailangang magdetalye kung ano ang mga countermeasure na nilalayon nilang ipatupad.

Mula sa isang regulasyong pananaw, ang ganitong uri ng pananaliksik ay umaayon sa mga alalahanin na makikita na sa Regulasyon ng European Union AIBinibigyang-diin nito ang pamamahala sa peligro, transparency, at ang pananagutan ng mga advanced na system provider. Ang pagtuklas ng mga bagong attack vector, tulad ng adversarial poetry, ay nagpapatibay sa argumento para sa pangangailangan para sa tuluy-tuloy at mas mahigpit na proseso ng pagtatasa.

Iba pang mga banta sa abot-tanaw: pagkalason at pagmamanipula ng data

Ang adversarial na tula ay hindi nangangahulugang ang tanging paraan na nag-aalala sa komunidad ng cybersecurity tungkol sa generative AI. Ang isang makabuluhang bahagi ng kamakailang pananaliksik ay nakatuon sa mga panganib na nauugnay sa pagsasanay sa modelokung saan ang napakalaking database na ginamit upang turuan ang mga tool na ito na magsalita, magsulat, at mangatuwiran ay naglaro.

Ipinakita ng mga independyenteng pag-aaral na posible ito manipulahin ang mga malalaking modelo ng wika nakakakontamina ng napakaliit na bahagi ng data ng pagsasanay: sapat na ang humigit-kumulang 250 sirang mga dokumento para magpakilala ng mga bias, backdoor o hindi inaasahang pag-uugali, kahit na sa mga makabagong sistema.

Ang kapansin-pansin ay ang threshold na ito ay tila hindi tumataas nang malaki sa laki ng modelo, na sumisira sa intuwisyon na "Ang mas malaki ay awtomatikong nangangahulugan na mas matatag"Sa pagsasagawa, ang mga magaan na solusyon at napakalaking modelo ay maaaring maging mahina sa ganitong uri ng pagkalason sa data.

Kung ang isang pag-atake ng ganitong uri ay hindi napapansin, maaari itong humantong sa mga cyberattack na mahirap subaybayandahil ang modelo mismo ay kikilos sa isang tila normal na paraan hanggang sa matugunan ang ilang mga nakatagong kundisyon sa data na nagsilbi upang sirain ito.

Kasama ng mga diskarte tulad ng adversarial na tula, ang pagmamanipula ng data ng pagsasanay ay nagbubukas ng isang senaryo kung saan Milyun-milyong user ang maaaring gumagamit ng mga tool na may mga nakatagong bahid.nang hindi namamalayan, na nagdudulot ng malaking hamon para sa seguridad ng AI at mga patakaran sa pamamahala.

Iminumungkahi ng lahat ng mga natuklasang ito na ang kaligtasan ng generative artificial intelligence ay hindi isang nalutas na problema, ngunit a patuloy na umuunlad na larangan kung saan ang mga bagong anyo ng pag-atake ay lumilitaw habang ang teknolohiya ay nagiging isinama sa mas maraming bahagi ng pang-araw-araw na buhay, mula sa trabaho sa opisina hanggang sa pampublikong administrasyon o edukasyon.

Sa kontekstong ito, ang "tula upang linlangin ang AI" ay naging isang napaka-graphic na halimbawa kung paano maaaring ilantad ng isang simpleng pagbabago ng istilo ang mga sistema na, sa papel, ay may mahigpit na mga protocol ng proteksyon. Ang pananaliksik ng Icaro Labs at mga unibersidad sa Italya ay nagpapatibay sa ideya na ang mga naturang hakbang ay kinakailangan. mas malikhaing pagtatasaPatuloy na pagsubok sa stress at malapit na pakikipagtulungan sa pagitan ng mga developer, eksperto sa cybersecurity, at regulator upang matiyak na ang mga modelo ng wika na ginagamit namin araw-araw ay talagang may kakayahang makayanan ang parehong mga teknikal na pag-atake at ang pinaka-mapanlikhang panlilinlang sa wika.


Idagdag bilang ginustong mapagkukunan