Setiap pasukan keselamatan dilatih untuk memerhatikan kod semasa ia dihantar. Hampir tiada seorang pun yang dilatih untuk memerhatikan data semasa ia tiba, dan titik buta itulah yang dieksploitasi oleh keracunan data. Apabila model yang diracuni mencapai pengeluaran, kerentanan itu tidak pernah ada dalam semakan kod. Ia berada dalam set data yang tidak diaudit oleh sesiapa beberapa bulan sebelumnya.
Entri glosari ini menerangkan apa itu keracunan data, bagaimana serangan keracunan data berlaku dalam praktik, mengapa keracunan data AI telah menjadi salah satu risiko yang paling pesat berkembang dalam era AI SDLC, dan bagaimana pertahanan sebenar terhadapnya.
Maksud Keracunan Data #
Keracunan data ialah manipulasi data yang disengajakan yang digunakan untuk melatih, memperhalusi atau mengasaskan model AI, supaya model mempelajari perkara yang salah, bertindak dengan cara yang penyerang inginkan atau membocorkan maklumat yang tidak sepatutnya didedahkan. Daripada menyerang model selepas penggunaan, penyerang menyerang bahan mentah yang digunakan untuk membina model.
Idea teras di sebalik keracunan data adalah mudah dan meresahkan: model AI hanya boleh dipercayai mengikut data yang dipelajarinya. Jika data tersebut rosak, berat sebelah, atau terperangkap sebelum latihan bermula, semakan kod, pengujian atau pemantauan masa jalan hiliran tidak akan dapat mengesan kecacatan yang mendasarinya, kerana model tersebut berfungsi seperti yang diajar (dengan niat jahat).
Keracunan Data AI vs. Kerentanan Perisian Tradisional #
Keselamatan aplikasi tradisional menganggap bahaya berada dalam kod: fungsi yang rosak, pustaka yang tidak ditampal, pelayan yang salah konfigurasi. Keracunan data AI mematahkan andaian itu sepenuhnya. Tiada baris kod yang terdedah untuk ditemui, kerana kerosakan berlaku dalam set latihan, set data penalaan halus atau indeks dapatan semula jauh sebelum sebarang kod ditulis atau sebarang model digunakan.
Inilah sebabnya mengapa keracunan data AI sukar dikesan dengan alat legasi. SAST Pengimbas membaca kod. Pengimbas kebergantungan membaca manifes pakej. Kedua-duanya tidak membaca korpus latihan berbilang gigabait atau pangkalan data vektor yang penuh dengan dokumen terbenam, yang merupakan pra-cisKeracunan data AI menyebabkan kerosakan. Penyelidik keselamatan dan didedahkan secara bertanggungjawab. Yang lain ditemui dan dijadikan senjata oleh penyerang terlebih dahulu, yang merupakan senario yang menyebabkan kerosakan paling banyak.
Bagaimana Serangan Keracunan Data Sebenarnya Berfungsi? #
Serangan keracunan data biasanya mengambil salah satu daripada beberapa bentuk:
- Keracunan data latihan: penyerang memasukkan contoh yang dimanipulasi, disalahlabel atau berniat jahat ke dalam set data yang digunakan untuk melatih model dari awal atau memperhalusi model yang sedia ada, menyebabkannya mempelajari bias tersembunyi atau tingkah laku pintu belakang.
- Melibas label: versi yang lebih halus bagi perkara di atas, yang mana penyerang hanya mengubah label pada subset kecil contoh latihan, secara senyap-senyap memesongkan apa yang dipelajari oleh model untuk kaitkan dengan apa.
- RAG dan keracunan konteksDalam sistem penjanaan yang dipertingkatkan untuk dapatan semula, penyerang menanam dokumen yang diracun ke dalam pangkalan pengetahuan atau stor vektor yang diambil oleh model semasa masa jalan, jadi model tersebut dengan yakin mengulangi maklumat palsu atau dimanipulasi seolah-olah ia adalah fakta yang disahkan.
- Pencetus pintu belakang: penyerang membenamkan a corak khusus dalam data latihan supaya model bertindak seperti biasa dalam hampir setiap kes, tetapi menghasilkan output pilihan penyerang sebaik sahaja frasa atau input pencetus tersembunyi muncul.
- Keracunan rantaian bekalan: penyerang menjejaskan set data awam atau yang dikongsi, pusat pemeriksaan model yang telah dilatih terlebih dahulu, atau penyematan pipeline hulu, supaya setiap pasukan hilir yang menarik diri daripadanya mewarisi racun tanpa pernah menyentuh serangan asal.
Apa yang menghubungkan semua serangan keracunan data ini adalah masa. Kerosakan berlaku sebelum model menjawab pengguna sebenar, itulah sebabnya frasa "sebelum ia menulis sebaris kod" menggambarkan ancaman ini begitu awal.cisely: model ini terjejas pada asasnya, bukan pada outputnya.
Bagaimana Penyerang Merosakkan Model AI Sebelum Ia Menulis Baris Kod? #
Setiap serangan keracunan data yang diterangkan di atas berkongsi kelebihan masa yang sama: pencerobohan berlaku di hulu, jauh sebelum model menghasilkan output tunggal yang akan dilihat oleh pengguna. Tiada fungsi terdedah untuk ditambal dan tiada perisian berniat jahat. commit untuk diulas, kerana model itu belum menulis apa-apa lagi. Ia hanya belajar, dan apa yang dipelajarinya sudah salah.
Inilah yang menjadikan keracunan data AI berbeza secara asasnya daripada kelemahan yang dilatih untuk diburu oleh pasukan keselamatan aplikasi. Model pintu belakang kelihatan sama dengan model bersih dalam perbezaan kod. Ia lulus a pull request semakan. Ia menyusun, menggunakan dan menjawab kebanyakan pertanyaan dengan betul, sehingga keadaan khusus yang ditanam oleh penyerang akhirnya muncul dalam pengeluaran. Pada masa itu, persoalannya bukan lagi "kod apa yang memperkenalkan ini," tetapi "apa yang dilakukan oleh data dan sejauh mana ia pergi."
Mengapa Keracunan Data AI Menjadi Keutamaan yang Semakin Meningkat? #
Keracunan data AI bukan lagi satu kebimbangan teori. Ia secara rasmi diiktiraf sebagai LLM04: Keracunan Data dan Model dalam 10 Teratas OWASP untuk Aplikasi LLM, berserta suntikan segera dan risiko rantaian bekalan sebagai salah satu ancaman penentu era AI generatif. Tiga trend mendorongnya lebih tinggi dalam radar setiap pasukan keselamatan:
- Kerosakan itu tidak kelihatan sehingga dicetuskan. Model yang diracuni boleh lulus setiap ujian fungsian dan bertindak dengan sempurna selama berbulan-bulan, sehingga keadaan pencetus khusus yang ditanam oleh penyerang akhirnya muncul dalam pengeluaran.
- Generasi yang dipertingkatkan dengan pengambilan semula ada di mana-mana. Mana-mana sistem yang membolehkan model menarik konteks langsung daripada dokumen, wiki, tiket atau pangkalan data vektor mempunyai permukaan input baharu yang tidak diaudit, dan permukaan itu adalah sasaran serangan keracunan data.
- Set data kini merupakan aset rantaian bekalan. Pasukan secara rutin menarik model, penyematan dan set data awam yang telah dilatih terlebih dahulu daripada sumber luaran dengan cara yang sama mereka menarik pakej sumber terbuka, dan sama seperti pakej yang dikompromi, set data yang dikompromi boleh membawa serangan secara senyap ke dalam setiap pasukan yang menggunakannya.
Mengesan dan Mempertahankan Terhadap Keracunan Data #
Oleh kerana keracunan data berlaku di hulu model itu sendiri, pertahanan juga perlu bermula di hulu:
- Perhatikan sumber data yang anomali, bukan sekadar kod yang anomali. Pengesanan tingkah laku dan anomali perlu diperluaskan ke tempat data memasuki pipeline, tidak berhenti di sempadan repositori.
- Ketahui setiap set data dalam pipeline. Anda tidak boleh mengaudit risiko keracunan dalam set data yang anda tidak tahu kewujudannya. Penemuan berterusan set data latihan, penilaian dan pengambilan semula adalah barisan pertahanan pertama.
- Jejaki salasilah daripada set data kepada model sehingga output. Memetakan laluan yang diambil oleh set data ke dalam model, dan daripada model kepada ejen, titik akhir atau alat pengekodan, inilah yang mengubah "kami mendapat output yang buruk" menjadi "kami tahu dengan tepat set data mana yang memperkenalkannya."
- Teliti sumber dapatan semula, bukan hanya set latihan. Dalam sistem RAG, stor vektor dan pangkalan pengetahuan memerlukan pemeriksaan integriti yang sama seperti data latihan, memandangkan keracunan konteks berlaku pada masa pertanyaan, bukan masa latihan.
Bagaimanakah Xygeni Membantu Merapatkan Jurang Keracunan Data? #
Mempertahankan diri daripada keracunan data bermula dengan keterlihatan yang kebanyakan organisasi tidak miliki. Xygeni'Inventori AI sentiasa menemui setiap aset AI merentasi SDLC, termasuk set data di sebaliknya: data latihan, set penilaian dan RAG atau sumber dapatan semula, dan memetakannya ke dalam graf hubungan langsung yang berjalan dari set data ke model ke titik akhir kepada ejen kepada pelayan MCP kepada alat pengekodan. Graf itulah yang menukarkan output model yang mencurigakan kepada soalan yang boleh dikesan: set data yang manakah memberikan maklumat ini, dan dari manakah ia datang.
Selain inventori itu, Xygeni's Keselamatan AI mengesan kelemahan vektor dan pembenaman, termasuk konteks beracun dalam pengambilan semula dan RAG pipelines, sejajar dengan 10 Teratas OWASP untuk Aplikasi LLM. Daripada mempercayai bahawa sumber latihan dan pengambilan model adalah bersih, Xygeni melayannya sebagai sebahagian daripada permukaan serangan, sama seperti ia telah melayan kod, kebergantungan dan pipelines. Jika anda tidak dapat menjawab "data apa yang melatih model ini, dan bolehkah kami membuktikannya," itulah jurang yang tepat yang perlu ditutup sebelum insiden keracunan data AI memaksa persoalan itu.
Soalan Lazim #
Keracunan data dalam AI ialah tindakan merosakkan atau memanipulasi data yang dipelajari oleh model (data latihan, penalaan halus data atau konteks pengambilan semula) supaya model menghasilkan output yang dipengaruhi penyerang atau tidak boleh dipercayai.
Tidak. Suntikan gesaan memanipulasi tingkah laku model pada masa pertanyaan melalui input yang dibuat. Keracunan data merosakkan data asas yang digunakan untuk melatih atau mendapatkan semula model, jadi kerosakan akan dimasukkan sebelum sebarang gesaan dihantar.
Ya. Dalam sistem penjanaan yang dipertingkatkan untuk mendapatkan semula, penyerang boleh meracuni dokumen atau pangkalan data vektor yang diambil oleh model semasa masa jalan, mencapai kesan yang serupa tanpa menyentuh set latihan asal.
Kerana ia hidup dalam data, bukan kod. Alat AppSec tradisional mengimbas kod sumber dan pergantungan menjelma, bukan set latihan berbilang gigabait atau stor vektor, jadi serangan keracunan data sering tidak disedari oleh alat yang dibina untuk model ancaman yang berpusatkan kod.
Mana-mana organisasi yang memperhalusi model pada data dalaman atau pihak ketiga, menggunakan penjanaan yang ditambah dengan dapatan semula atau menarik model dan set data yang telah dilatih terlebih dahulu daripada sumber awam terdedah, kerana setiap satunya merupakan titik masuk untuk keracunan data.
