Faharasa ya Usalama wa Xygeni
Ufafanuzi wa Usalama wa Ukuzaji wa Programu na Uwasilishaji

Data Poisoning ni nini?

Kila timu ya usalama imefunzwa kutazama msimbo unaposafirishwa. Karibu hakuna aliyefunzwa kutazama data inapofika, na doa hilo lisiloeleweka ndilo hasa linalotumiwa na sumu ya data. Kufikia wakati mfumo wenye sumu unapofikia uzalishaji, udhaifu haukuwahi kutokea katika ukaguzi wa msimbo. Ulikuwa katika seti ya data ambayo hakuna mtu aliyeikagua miezi iliyopita.

Kiingilio hiki cha kamusi kinaelezea sumu ya data ni nini, jinsi mashambulizi ya sumu ya data yanavyotokea kivitendo, kwa nini sumu ya data ya AI imekuwa mojawapo ya hatari zinazokua kwa kasi zaidi katika enzi ya AI SDLC, na jinsi ulinzi halisi dhidi yake unavyoonekana.

Maana ya Sumu ya Data #

Sumu ya data ni ujanja wa makusudi wa data inayotumika kufunza, kurekebisha, au kutuliza mfumo wa AI, ili mfumo ujifunze jambo lisilofaa, kutenda kwa njia ambayo mshambuliaji anataka, au kuvuja taarifa ambayo haipaswi kamwe kufichua. Badala ya kushambulia mfumo baada ya kutekelezwa, mshambuliaji hushambulia malighafi ambayo mfumo umejengwa kutoka kwayo.

Wazo kuu nyuma ya sumu ya data ni rahisi na linasumbua: modeli ya AI inaaminika tu kama data iliyojifunza kutoka kwayo. Ikiwa data hiyo imeharibika, imeegemea upande wowote, au imenaswa kabla hata ya mafunzo kuanza, hakuna kiasi cha mapitio ya msimbo, majaribio, au ufuatiliaji wa wakati wa utekelezaji kitakachogundua dosari ya msingi, kwa sababu modeli inafanya kazi kama vile ilivyofundishwa (kwa nia mbaya).

Sumu ya Data ya AI dhidi ya Udhaifu wa Programu za Jadi #

Usalama wa programu za kawaida hudhani hatari huishi katika msimbo: kitendakazi kibaya, maktaba isiyo na viraka, seva isiyo na usanidi sahihi. Uchafuzi wa data ya AI huvunja dhana hiyo kabisa. Hakuna mstari dhaifu wa msimbo wa kupata, kwa sababu ufisadi ulitokea katika seti ya mafunzo, seti ya data iliyorekebishwa vizuri, au faharasa ya urejeshaji muda mrefu kabla ya msimbo wowote kuandikwa au mfumo wowote kutumwa.

Hii ndiyo sababu sumu ya data ya AI ni vigumu sana kuigundua kwa kutumia zana za zamani. SAST Kichanganuzi husoma msimbo. Kichanganuzi cha utegemezi husoma manifesto za kifurushi. Hakuna anayesoma kopasi ya mafunzo ya gigabaiti nyingi au hifadhidata ya vekta iliyojaa hati zilizopachikwa, ambayo ni kabla yacisambapo sumu ya data ya AI husababisha uharibifu wake. Watafiti wa usalama na kufichuliwa kwa uwajibikaji. Nyingine hupatikana na kusimamiwa na washambuliaji kwanza, ambayo ndiyo hali inayosababisha uharibifu mkubwa zaidi.

Mashambulizi ya Sumu ya Data Hufanya Kazi Vipi? #

Mashambulizi ya sumu ya data kwa ujumla huchukua moja ya aina chache:

  • Mafunzo ya sumu ya data: mshambuliaji huingiza mifano iliyobadilishwa, iliyoandikwa vibaya, au yenye nia mbaya kwenye seti ya data inayotumika kufunza modeli kuanzia mwanzo au kurekebisha iliyopo, na kuisababisha kujifunza upendeleo uliofichwa au tabia ya mlango wa nyuma.
  • Kugeuza lebo: toleo dogo zaidi la yaliyo hapo juu, ambapo mshambuliaji hubadilisha lebo kwenye sehemu ndogo ya mifano ya mafunzo, akipotosha kimya kimya kile ambacho modeli hujifunza kuhusisha na nini.
  • Sumu ya RAG na muktadha: katika mifumo ya uzalishaji iliyoboreshwa ya urejeshaji, mshambuliaji huweka sumu kwenye hati kwenye hifadhi ya maarifa au vekta ambayo modeli huipata wakati wa utekelezaji, kwa hivyo modeli hurudia kwa ujasiri taarifa za uongo au zilizobadilishwa kana kwamba ni ukweli uliothibitishwa.
  • Vichochezi vya mlango wa nyuma: mshambuliaji anaingiza muundo maalum katika data ya mafunzo ili modeli ifanye kazi kawaida katika karibu kila kisa, lakini itoe matokeo yaliyochaguliwa na mshambuliaji mara tu kifungu cha siri cha kichochezi au ingizo linapoonekana.
  • Sumu ya mnyororo wa ugavi: mshambuliaji anahatarisha seti ya data ya umma au iliyoshirikiwa, kituo cha ukaguzi cha modeli kilichoandaliwa tayari, au upachikaji pipeline juu ya mto, ili kila timu ya chini ikitoka humo irithi sumu bila kugusa shambulio la awali.

Kinachounganisha mashambulizi haya yote ya sumu ya data pamoja ni muda. Uharibifu hufanyika kabla ya mfumo kumjibu mtumiaji halisi, ndiyo maana hasa msemo "kabla haujaandika mstari wa msimbo" unaelezea tishio hili kwa hivyo kabla yacisely: modeli imeathiriwa mwanzoni, si katika matokeo yake.

Washambuliaji Huharibuje Mfano wa AI Kabla Haujaandika Mstari wa Msimbo? #

Kila shambulio la sumu ya data lililoelezwa hapo juu lina faida sawa ya muda: maelewano hutokea juu ya mto, muda mrefu kabla ya modeli kutoa matokeo moja ambayo mtumiaji atawahi kuona. Hakuna kipengele dhaifu cha kurekebisha na hakuna hasidi. commit ili kuiona katika ukaguzi, kwa sababu mfumo haujaandika chochote bado. Umejifunza tu, na kile ulichojifunza tayari si sahihi.

Hili ndilo linalofanya sumu ya data ya AI kuwa tofauti kabisa na udhaifu ambao timu za usalama wa programu hufunzwa kuwinda. Mfano wa mlango wa nyuma unaonekana sawa na ule safi katika tofauti ya msimbo. Hupita a pull request mapitio. Hukusanya, kusambaza, na kujibu maswali mengi kwa usahihi, hadi hali maalum ambayo mshambuliaji aliweka hatimaye itakapoonekana katika uzalishaji. Kufikia wakati huo, swali haliko tena "ni msimbo gani ulioanzisha hii," ni "data gani ilifanya, na inarudi nyuma kiasi gani."

Kwa Nini Uchafuzi wa Data wa AI Ni Kipaumbele Kinachoongezeka? #

Sumu ya data ya AI si tatizo la kinadharia tena. Inatambuliwa rasmi kama LLM04: Data na Sumu ya Mfano katika OWASP Top 10 kwa Maombi ya LLM, ikiwa kando ya hatari ya sindano ya haraka na mnyororo wa usambazaji kama moja ya vitisho vinavyoamua enzi ya uzalishaji wa akili bandia. Mitindo mitatu inaisukuma juu zaidi katika rada ya kila timu ya usalama:

  • Uharibifu hauonekani hadi utakapotokea. Mfano wenye sumu unaweza kufaulu kila jaribio la utendaji kazi na kutenda kikamilifu kwa miezi kadhaa, hadi hali maalum ya kichochezi ambayo mshambuliaji alipanda hatimaye itakapoonekana katika uzalishaji.
  • Kizazi kilichoongezwa nguvu ya urejeshaji kiko kila mahali. Mfumo wowote unaoruhusu modeli kuvuta muktadha wa moja kwa moja kutoka kwa hati, wiki, tiketi, au hifadhidata ya vekta una sehemu mpya ya kuingiza data ambayo haijakaguliwa, na sehemu hiyo ndiyo hasa mashambulizi ya sumu ya data yanalenga.
  • Seti za data sasa ni mali ya mnyororo wa usambazaji. Timu mara kwa mara huchota mifumo, upachikaji, na seti za data za umma zilizofunzwa mapema kutoka vyanzo vya nje kwa njia ile ile wanayochota vifurushi vya chanzo huria, na kama vile kifurushi kilichoathiriwa, seti ya data iliyoathiriwa inaweza kubeba shambulio kimya kimya hadi kwa kila timu inayotumia.

Kugundua na Kutetea Dhidi ya Sumu ya Data #

Kwa sababu sumu ya data hutokea juu ya mfumo wenyewe, ulinzi lazima uanze juu pia:

  • Angalia vyanzo vya data visivyo vya kawaida, si tu msimbo usio wa kawaida. Ugunduzi wa tabia na kasoro unahitaji kupanuka hadi pale data inapoingia pipeline, sio kusimama kwenye mpaka wa hifadhi.
  • Jua kila seti ya data katika pipeline. Huwezi kukagua hatari ya sumu katika seti ya data ambayo hujui ipo. Ugunduzi endelevu wa seti za data za mafunzo, tathmini, na urejeshaji ndio mstari wa kwanza wa ulinzi.
  • Fuatilia ukoo kutoka seti ya data hadi modeli hadi matokeo. Kuchora ramani ya njia ambayo seti ya data huingia kwenye modeli, na kutoka kwa modeli hadi wakala, sehemu ya mwisho, au kifaa cha kuweka msimbo, ndiko kunakobadilisha "tulipata matokeo mabaya" kuwa "tunajua haswa ni seti gani ya data iliyoianzisha."
  • Chunguza vyanzo vya urejeshaji, si seti za mafunzo pekee. Katika mifumo ya RAG, hifadhi ya vekta na msingi wa maarifa unahitaji ukaguzi sawa wa uadilifu kama data ya mafunzo, kwa kuwa sumu ya muktadha hutokea wakati wa hoja, si wakati wa mafunzo.

Jinsi Xygeni Husaidia Kufunga Pengo la Sumu ya Data? #

Kujilinda dhidi ya sumu ya data huanza na mwonekano ambao mashirika mengi hayana. Xygeni'Hesabu ya AI hugundua kila mali ya AI kote SDLC, ikijumuisha seti za data zilizo nyuma yake: data ya mafunzo, seti za tathmini, na vyanzo vya RAG au urejeshaji, na kuziweka kwenye grafu ya uhusiano wa moja kwa moja inayoanzia seti ya data hadi modeli hadi mwisho kwa wakala kwa seva ya MCP kwenye zana ya usimbaji. Grafu hiyo ndiyo inayobadilisha matokeo ya modeli yenye shaka kuwa swali linaloweza kufuatiliwa: ni seti gani ya data iliyolisha hii, na ilitoka wapi.

Juu ya hesabu hiyo, Xygeni's Usalama wa AI hugundua udhaifu wa vekta na kupachika, ikiwa ni pamoja na muktadha wenye sumu katika urejeshaji na RAG pipelines, iliyopangwa kwa OWASP 10 Bora kwa Maombi ya LLM. Badala ya kuamini kwamba vyanzo vya mafunzo na urejeshaji wa modeli ni safi, Xygeni huvichukulia kama sehemu ya uso wa shambulio, kama vile ambavyo tayari hushughulikia msimbo, utegemezi, na pipelines. Kama huwezi kujibu kwa sasa "ni data gani iliyofunza mfumo huu, na tunaweza kuithibitisha," hiyo ndiyo pengo halisi linalostahili kufungwa kabla ya tukio la sumu ya data ya AI kulazimisha swali.

Maswali #

Sumu ya data katika akili bandia (AI) ni nini?

Sumu ya data katika AI ni kitendo cha kuharibu au kudhibiti data ambayo modeli hujifunza kutoka kwayo (kufundisha data, kurekebisha data, au muktadha wa kurejesha data) ili modeli itoe matokeo yanayoathiriwa na mshambuliaji au yasiyoaminika.

Je, sumu ya data ni sawa na shambulio la sindano ya haraka?

Hapana. Uingizaji wa haraka hubadilisha tabia ya modeli wakati wa kuuliza kupitia ingizo lililotengenezwa. Sumu ya data huharibu data ya msingi ambayo modeli ilifunzwa au kuirejesha, kwa hivyo uharibifu husababishwa kabla ya kidokezo chochote kutumwa.

Je, sumu ya data inaweza kutokea bila kugusa data ya mafunzo moja kwa moja?

Ndiyo. Katika mifumo ya urejeshaji iliyoboreshwa, mshambuliaji anaweza kudhuru hati au hifadhidata ya vekta ambayo modeli huipata wakati wa utekelezaji, na kufikia athari sawa bila kugusa seti ya mafunzo ya awali.

Kwa nini ni vigumu kugundua sumu ya data ya AI?

Kwa sababu inaishi katika data, si msimbo. Zana za jadi za AppSec huchanganua msimbo chanzo na utegemezi hujitokeza, si seti za mafunzo ya gigabaiti nyingi au hifadhi za vekta, kwa hivyo mashambulizi ya sumu ya data mara nyingi hayaonekani na zana zilizojengwa kwa ajili ya modeli ya vitisho inayozingatia msimbo.

Ni nani aliye hatarini zaidi kutokana na mashambulizi ya sumu ya data?

Shirika lolote linalorekebisha mifumo kwenye data ya ndani au ya mtu mwingine, kwa kutumia uzalishaji ulioboreshwa wa kurejesha data, au kutoa mifumo na seti za data zilizofunzwa awali kutoka kwa vyanzo vya umma hufichuliwa, kwa kuwa kila moja ya hizo ni mahali pa kuanzia kwa sumu ya data.

Anza Bure

Anza bure.
Hakuna kadi ya mkopo inayotakiwa.

Anza kwa kubofya mara moja:

Taarifa hii itahifadhiwa kwa usalama kulingana na Masharti ya Huduma na Sera ya faragha

Picha ya skrini ya programu