Eger ji we hatibe pirsîn ka derzîkirina bilez çi ye û tenê nîv bersivek wergirtiye, li vir guhertoya kurt heye: ew teknîkek êrîşê ye ku tê de nivîsek xerabkar an manîpulatîf têxin nav têketina ku modela AI pêvajo dike, û wê dixapîne da ku rêwerzên xwe yên orîjînal paşguh bike û li şûna wê rêwerzên êrîşkar bişopîne. Ev bingeha wateya derzîkirina bilez e: ew ne xeletiyek di kodê de ye, ew êrîşek e ku rêwerzên modelê bi karanîna zimanê asayî li şûna koda îstîsmara kevneşopî direvîne.
Wateya Derzîkirina Bilez, bi Peyvên Sade #
Şirovekirina wateya derzîkirina bilez peyv bi peyv alîkariya wê dike ku ew bimîne:
- Derhal: rênima û çarçoveya ku di modela AI de tê danîn, çi rasterast ji hêla bikarhêner ve hatibe nivîsandin an jî bixweber ji belgeyek, rûpelek malperê, an bersiva API-yê were kişandin.
- Derzîkirinî: tiştekî ku ne li wir bû lê tê danîn, ji heman mantiqa derzîkirina SQL hatiye wergirtin, ku têketina ne pêbawer wekî fermanek li şûna daneyên sade tê dermankirin.
Ji ber vê yekê, dema ku kesek dipirse ka derzîkirina bilez çi ye, bersiva herî hêsan ev e: ew tiştê ku diqewime dema ku modela AI nikare ferqa di navbera rêwerzên ku ji hêla pêşdebirê wê ve hatine dayîn û rêwerzên ku di hundurê naveroka ku ew pêvajo dike de veşartî ne, bibîne.
Bi rastî çi dihewîne? #
Piraniya bûyerên cîhana rastîn dikevin nav van kategoriyên sereke:
- Derzîkirina rasterast a bilezêrîşkar talîmatên xerabkar rasterast di nav sohbet an jî qada têketinê de dinivîse, bi eşkereyî ji modelê dixwaze ku qaîdeyên xwe yên berê paşguh bike ("hemû talîmatên berê paşguh bike û...").
- Derzîkirina bilez a nerasterast: talîmatên xerabkar di hundirê naveroka ku model paşê dixwîne de veşartî ye, wek rûpelek malperê, PDF, e-name, an şîroveya kodê, û ew tenê dema ku model wê naverokê pêvajo dike çalak dibe, bêyî ku di wê gavê de êrîşkar amade be.
- Derzîkirina bi şêwaza Jailbreak: cureyekî taybet ê derzîkirinê ku rola-lîstik, çarçovekirina hîpotetîk, an hîleyên kodkirinê bikar tîne da ku ewlehiya modelekê derbas bike. guardrails bi taybetî, li şûna ku erkê wê birevînin.
Derzîkirina Bilez li hember Jailbreaking: Cûdahiya di navbera wan de çi ye? #
Peyvek hevpar a derzîkirina bilez ew e ku ew çawa ji jailbreaking cuda dibe. Herdu li hev dicivin lê ne yek in. Jailbreaking bi taybetî li ser derbaskirina ewlehî û bêbandorkirina modelekê ye. naveroka guardrails, wê bikin ku tiştekî ku ew hatiye perwerdekirin ku red bike bibêje an çêbike. Derzîkirina bilez berfirehtir e: ew li ser revandina rêwerz an peywirê modelê ye, ku dibe ku ewlehiyê tê de hebe an nebe. guardrails qet nebe. Derzîkirineke nerasterast a ku di bilêtek piştgiriyê de veşartî ye û bi bêdengî ji ajanek karûbarê xerîdar re dibêje ku daneyên bikarhêner bi e-nameyê ji navnîşanek derveyî re bişîne, hewl nade ku tiştekî jailbreak bike; ew peywirê bi xwe beralî dike.
Li ku derê derzîkirina bilez bi rastî xuya dike #
Gava ku hûn wateya derzîkirina bilez fêm bikin, hêsantir dibe ku hûn bibînin ka xetere di pergalên rastîn de li ku dijî:
Serverên MCP û alîkarên kodkirina AI - şîroveyeke xerabkar, README, an jî barkêşiya encam-tool dikare tiştê ku ajanek di hundurê koda bingehê an termînala pêşdebir de dike, beralî bike. Bi awayekî cûda li gorî zimanê bernamesaziyê yê ku li dora wê hatiye çêkirin, lê fikra bingehîn (edîtor + amûrên avakirinê + debugger, li yek cîhekî) wekî xwe dimîne.
Chatbot û ajanên piştgiriyê - bikarhêner nivîsa ku tê de hatiye nivîsandin diweşîne da ku bot fermana pergala xwe nîşan bide an jî çalakiyên nexwestî bike.
Nifşkirina zêdekirî ya vegerandinê (RAG) pipelines - Belgeyeke jehrî di bingeha zanînê de talîmatên ku dema têne wergirtin çalak dibin dihewîne.
Ajanên AI yên xweser - ajanek ku li ser înternetê digere, e-nameyan dixwîne, an amûran gazî dike dikare ji her naveroka ku dest lê dide talîmatên derzîkirî hilde, dûv re bi destûrên rastîn li ser wan tevbigere.
Çima Wateya Derzîkirina Bilez Ji "Tenê Hîleyek Bilez" Wêdetir Girîng e #
Hêsan e ku meriv wê wekî tiştekî nû, rêbazek jîr ji bo ku chatbotek tiştekî bêaqil bibêje, red bike. Lê gava ku modelên AI-ê di nav ajanên ku dikarin e-nameyan bişînin, kodê bicîh bînin, li databasan bipirsin, an pakêtan saz bikin de werin girêdan, derzîkirina bilez êdî ne meraqek pencereya sohbetê ye û dibe pirsgirêkek sînorê ewlehiyê ya rastîn: her kesê ku naveroka modelek dixwîne kontrol dike, dikare di bin şert û mercên rast de kontrol bike ka ew model çi dike. Ji ber vê yekê ev derzîkirin naha wekî kategoriyek xwe di ... de xuya dike. 10 Serketîyên OWASP ji bo Serlêdanên LLM, û çima têgihîştina tiştê ku derzîkirina bilez e niha ji bo her kesê ku pergalên bi hêza AI-ê ava dike an ewle dike, ne tenê meraqek ji bo lîstikvanên tîmên sor e, wekî zanîna bingehîn tê hesibandin.
Ger hûn bi taybetî ji aliyê AppSec û DevSecOps ve li vê yekê dinêrin, ango, ka rîska derzîkirina bilez çawa li seranserê ajanên AI, serverên MCP, û koda ku ji hêla AI ve hatî çêkirin xuya dike, ne tenê wateya vê termê, me li vir bi kûrahîtir nixumandiye: Ewlekariya Zincîra Dabînkirinê ya AI.

Pirs û Bersîv #
Êrîşek e ku tê de rêwerzên xerabkar di hundirê têketin an naveroka ku modela AI pêvajo dike de veşartî ne, û dibe sedem ku model rêwerzên êrîşkar bişopîne li şûna yên orîjînal.
Ew "ferman" (talîmat û çarçoveya ku ji modelek AI re tê dayîn) bi "derzîkirinê" (daxistina fermanên bêdestûr di tiştekî ku divê tenê daneyan tê de hebe) re dike yek, ku heman ramana bingehîn a li pişt êrîşên kevintir ên mîna derzîkirina SQL ye.
Na. Jailbreaking bi taybetî ewlehiya modelekê hedef digire. guardrails da ku ew naveroka qedexekirî hilberîne. Derzîkirina bilez berfirehtir e: ew erk an rêwerzên modelê didize, ku dibe ku ti têkiliya wan bi fîlterên ewlehiyê re tune be.
Belê. Ev wekî derzîkirina bilez a nerasterast tê binavkirin: talîmatên xerabkar di hundirê belgeyekê, rûpeleke înternetê, an pelekê de cih digirin ku modelek an ajanek paşê dixwîne, û di kêliya ku naverok tê pêvajokirin de bixweber çalak dibe.
Na. Ew awayê şîrovekirina modelek ji zimanê xwezayî sûd werdigire, ne kêmasiyek di koda serîlêdanê de. Ev tam ew e ku sererastkirina wê bi amûrên ewlehiyê yên kevneşopî dijwar dike.