Detekcia prompt injection v roku 2026: AgentID verzus Llama Prompt Guard
Interné testy na dátových súboroch Lakera Gandalf, Deepset a PromptShield ukazujú vyššiu mieru zachytenia útokov AgentID. Pri hlásených testoch Gandalf a Deepset bola nižšia aj latencia p50.
Autor: Technický tím AgentID • 13 min čítania
20. septembra 2026
Hlavné poznatky
AgentID ukázal vyšší útok ako Llama Prompt Guard na Lakera Gandalf, Deepset, a PromptsShield v spoločnom referenčnom súhrne.
Najväčšia medzera sa objavila na Deepset, kde AgentID meral 73,0% oproti 10,3%.
AgentID tiež zaznamenal nižšiu latenciu p50 na hlásených Gandalfových a Deepsetových behoch.
Referenčné hodnoty sú merania špecifické pre súbor údajov, nie univerzálny dôkaz o bezpečnosti výroby.
Okamžité zisťovanie vstrekovania by sa malo kombinovať s deterministickými kontrolami, s rozšírenými povoleniami, povoleniami a audítorskými dôkazmi.
Prehľad
Rýchla detekcia vstrekovania sa čoraz viac používa ako bezpečnostná kontrola v aplikáciách LLM, AI agentoch, kopilotoch, zberných potrubiach a AI bránach. Porovnávanie rýchlych detektorov vstrekovania je však zložité: výsledky sa môžu podstatne zmeniť v závislosti od distribúcie útoku, benígnych údajov, kontrolného bodu modelu, prahu triediča, predbežného spracovania, dĺžky vstupu a prostredia nasadenia.
Táto technická poznámka uvádza internú referenčnú hodnotu pre rýchlu detekciu vstrekovania agenta ID v troch verejných súboroch údajov o okamžitej injekcii: Lakera Gandalf, Deepset a PromptSheeld.
Referenčná hodnota porovnáva liek AgentID s liekom Meta's Llama Prompt Guard na stiahnutie útoku vo všetkých troch súboroch údajov plus falošne pozitívne a latentné merania, v ktorých boli tieto údaje zahrnuté do základného súhrnu referenčnej hodnoty.
Výsledky by sa mali chápať ako merania špecifické pre súbor údajov, nie ako univerzálne hodnotenie bezpečnostných systémov AI.
Referenčné údaje z uverejneného súhrnu
AgentID porovnal svoju rýchlu detekciu vstreku proti Meta's Llama Prompt Guard cez tri verejné súbory údajov o okamžitom podaní. AgentID oznámil vyšší útok na všetky tri súbory údajov.
V súhrnnej správe o latencii, ktorú sme zdieľali, sa verejne uvádzali konkrétne príklady p50 pre Lakeru Gandalfovú a Deepsetovú, kde AgentID meral aj rýchlejšie ako Llamská Prompt Guard. Ako pri každom detektore, ide skôr o merania týkajúce sa súborov údajov a konfigurácie, než o univerzálne bezpečnostné záruky.
Odvolanie útoku podľa súboru údajov
Vyššie odvolanie znamená, že známejšie útoky boli zistené v hodnotenom korpuse.
%
Lakera Gandalf
AgentID
94.7%
Lakera Gandalf
Llama Prompt Guard
91.5%
Deepset
AgentID
73%
Deepset
Llama Prompt Guard
10.3%
PromptShield
AgentID
61.9%
PromptShield
Llama Prompt Guard
57.1%
p50 príklady latencie
Nižšia stredná latencia je lepšia pre vložené ochranné zábradlia.
ms
Lakera Gandalf
AgentID
48 ms
Lakera Gandalf
Llama Prompt Guard
93 ms
Deepset
AgentID
27 ms
Deepset
Llama Prompt Guard
51 ms
Súbor údajov
Lakera Gandalf
Metrické
Zaútočiť na remízu
AgentID
94.7%
Llama Prompt Guard
91.5%
Súbor údajov
Deepset
Metrické
Zaútočiť na remízu
AgentID
73.0%
Llama Prompt Guard
10.3%
Súbor údajov
PromptShield
Metrické
Zaútočiť na remízu
AgentID
61.9%
Llama Prompt Guard
57.1%
Súbor údajov
Lakera Gandalf
Metrické
p50 latencia
AgentID
48 ms
Llama Prompt Guard
93 ms
Súbor údajov
Deepset
Metrické
p50 latencia
AgentID
27 ms
Llama Prompt Guard
51 ms
| Súbor údajov | Metrické | AgentID | Llama Prompt Guard |
|---|---|---|---|
| Lakera Gandalf | Zaútočiť na remízu | 94.7% | 91.5% |
| Deepset | Zaútočiť na remízu | 73.0% | 10.3% |
| PromptShield | Zaútočiť na remízu | 61.9% | 57.1% |
| Lakera Gandalf | p50 latencia | 48 ms | 93 ms |
| Deepset | p50 latencia | 27 ms | 51 ms |
1. Zhrnutie
Na hodnotiacom korpuse AgentID Gandalf- derivovaný, dosiahli oba detektory vysoký útok recall. AgentID zistil 94,7% vzoriek útoku s rýchlosťou 0,4% falošne pozitívne; Llama Prompt Guard zistil 91,5% bez falošného pozitíva pozorovaného medzi 250 benígnymi vzorkami.
Rozdiel bol oveľa väčší na
Latenčné merania tiež uprednostňovali AgentID v zaznamenanom skúšobnom prostredí. Na Gandalf, AgentID meral 48 ms p50 a 110 ms p95 verzus 93 ms a 190 ms respektíve pre Llama Prompt Guard. Na Deepset, boli rozmery 27 ms / 116 ms pre AgentID a 51 ms / 176 ms pre Llama Promptov Guard .
Tieto merania nestanovujú, že jeden systém je všeobecne bezpečnejší.
Zakladajú niečo užšie:
> Pod referenčnou konfiguráciou používanou pre tieto behy sa dva detektory správali podobne na vybranom korpuse z Gandalfu, ale veľmi odlišne na Deepsetovej distribúcii.
Tento rozdiel je presne dôvod, prečo by sa v referenčných hodnotách rýchleho vstrekovania mali používať viaceré súbory údajov.
Detektor môže pôsobiť silne proti jednému útoku a podstatne horšie proti inému. Modelové tréningové distribúcie, štýl útoku, jazyk, rýchla dĺžka, prah triedy, predbežné spracovanie a definície "prípravné vstrekovanie" všetko ovplyvniť výsledok.
2. Prečo sú rýchle hodnoty vstrekovania ťažké
Rýchla injekcia nie je jediná homogénna útočná trieda.
Priamy pokyn, ako je "ignorovať všetky predchádzajúce pokyny" sa štrukturálne líši od nepriameho vstrekovania skrytého v dokumente, manipulácie s viacerými otáčkami, kódovaného pokynu, útoku na rolu, kontext-závislý nástroj-použitie útoku alebo protivnícky optimalizovaný vstup cielený na konkrétny detektor.
To spôsobuje niekoľko problémov s referenčným porovnávaním.
Predpojatosť súboru údajov
Detektor môže dobre fungovať, keď sa distribúcia skúšky podobá príkladom pozorovaným počas tréningu alebo vývoja modelu.
Výkon môže klesnúť, keď sa zmení jazyková štruktúra, útočná technika alebo benígna populácia.
Toto je distribučná zmena.
Znamená to, že výsledok, ako je 95% odvolanie, by sa mal vždy interpretovať ako:
95% sa stiahne z tohto súboru údajov, v rámci tejto konfigurácie.
Nemá sa vykladať ako 95% ochrana pred rýchlym vstrekovaním do výroby.
Benígne otázky distribúcie
Testovanie len zlomyseľných podnetov vytvára neúplnú bezpečnostnú referenčnú hodnotu.
Detektor, ktorý označuje každú zákernú pohodu, by dosiahol 100% útok, ale vo výrobe by nebol použiteľný.
Preto je spolu s reklamou dôležité falošné pozitívum.
Lakera je samostatný PINT referenčná výslovne zahŕňa tvrdé negatívy, normálne chatbot správy a verejné dokumenty okrem útokov, čo ukazuje, že je dôležité hodnotiť bezpečnosť a užitočnosť.
Predmety finančných limitov
Mnohí rýchlo klasifikuje injekcie produkovať skóre skôr než vlastné binárne verdikt.
Zmena prahu rozhodovania mení prevádzkový bod.
Nižšia hranica útoku sa zvyčajne zvýši stiahnutie a zároveň zvyšuje falošné pozitíva. Vyššia hranica môže znížiť falošné pozitívne, pričom umožňuje viac útokov cez.
Referenčná hodnota, ktorá sa odvoláva bez zdokumentovania jej klasifikačnej prahovej hodnoty, je preto neúplná.
Na vzorovej verzii záleží
"Llamská provketová garda" nie je dostatočne presná na reprodukovateľnosť.
Meta publikoval originál
Presný identifikačný kód modelu, revízia alebo záväzná haš sa preto musí zmraziť v reprodukovateľnej referenčnej hodnote.
3. Čo presne bolo testované
Referenčná hodnota porovnáva dva systémy rýchlej detekcie vstrekovania:
Plynovod na rýchlu detekciu vstrekovania AgentID
verzus
Meta Llama Prompt Guard
medzi dvoma evalváciami.
Hodnotiaci súbor A: referenčná hodnota odvodená od Gandalfu
1000 náporov na útok
250 benígnych podnetov
1,250 celkových vstupov
Vyžaduje sa pred uverejnením:
presný zdroj/revízia údajov Gandalfu;
postup odberu vzoriek;
či boli odstránené duplikáty;
zdroj 250 benígnych príkladov;
či sa promptné prostriedky zmenili;
či sa sploštil viactúnový kontext;
jazyková distribúcia.
Verejný výskumný projekt Gandalf bol vyvinutý ako davové, hrané, red-teaming prostredie. Jeho súvisiace výskumné vydanie obsahuje oveľa viac útokov ako 1000 používa tu, takže táto referenčná hodnota je najlepšie opísaná ako AgentID-selected Gandaf- derivated evaluation set, pokiaľ vnútorné artefakty vytvoriť presnejšie verejné poddruhy.
Primárne zdroje Gandalfu: Gandalf červený papier a Archív výskumu Gandalf.
Hodnotiaca sada B:
263 útočných príkazov
399 benígnych podnetov
662 celkových vstupov
Aktuálne vydanie Hugging Face obsahuje 546 príkladov tréningu a 116 príkladov testov. V oboch častiach, korpus obsahuje 263 vstrekovaných vstupov a 399 legitímnych vstupov.
Zdá sa, že táto referenčná hodnota hodnotila celý súbor 662 príkladov, a nie len rozdelenie testu Deepset.
Toto rozlíšenie sa musí zachovať, pretože súbor údajov sa používa aj na školenie triedičov s rýchlym vstrekovaním vrátane Deepsetovho vlastného detektora. Kompletné referenčné hodnoty sú užitočné pre testovanie distribúcie, ale nemali by sa automaticky interpretovať ako čisté neviditeľné hodnotenie pre každý testovaný model.
Primárny súbor údajov: deepset/prompt-injections on Hugging Face.
4. Súbor údajov 1: Gandalf
Gandalf je užitočný, pretože jeho útočné údaje sa objavili z protichodného prostredia.
Užívatelia sa snažili manipulovať s systémom založeným na LLM a poraziť postupne silnejšie obrany. Pridružený výskum opisuje Gandalf ako mechanizmus na zhromažďovanie realistických a adaptívnych útokov, a nie spoliehať sa výlučne na statické útočné šablóny.
Pre túto referenčnú hodnotu AgentID bolo hodnotených 1000 útočných vstupov spolu s 250 benígnymi vstupmi.
Výsledky
Pri dodávanom tempe AgentID zistil 947 z 1000 útokov.
Llamská Rýchla stráž zistila 915 z 1000 útokov.
Ak je hodnota FPR agenta ID 0,4% nad 250 benígnych vstupov, zodpovedá to jednému falošne kladnému výsledku, ak je zverejnená zaokrúhlená rýchlosť odvodená priamo od počtu celých vzoriek.
Llamská Prompt Guard nevyvolala žiadne falošné pozitívne výsledky v týchto 250 benígnych vzorkách.
Nulová pozorovaná falošná pozitivita by sa nemala interpretovať ako dôkaz nulovej falošne pozitívnej pravdepodobnosti u väčšej populácie. Znamená to len, že sa vo tejto konečnej benígnej vzorke nevyskytol žiadny.
Detektor
AgentID
Zaútočiť na remízu
94.7%
Falošná pozitívna miera
0.4%
p50
48 ms
p95
110 ms
Detektor
Llama Prompt Guard
Zaútočiť na remízu
91.5%
Falošná pozitívna miera
0.0%
p50
93 ms
p95
190 ms
| Detektor | Zaútočiť na remízu | Falošná pozitívna miera | p50 | p95 |
|---|---|---|---|---|
| AgentID | 94.7% | 0.4% | 48 ms | 110 ms |
| Llama Prompt Guard | 91.5% | 0.0% | 93 ms | 190 ms |
5. Dataset 2: Hlbšie podnetné injekcie
`deepset/prompt-injections` is a compact public binary-classification dataset containing legitimate inputs and prompt injections.
Vydaný súbor údajov má 662 príkladov: 399 benígne a 263 vstrekované prompty. Jeho verejná karta súborových údajov definuje
Výsledky
Zaokrúhlené percentá znamenajú približne 192 zistených útokov na agentaID a približne 27 pre Llama Prompt Guard.
Pri AgentIDe je 0,8% zaokrúhlených FPR na 399 benígnych príkladov v súlade s približne tromi falošnými pozitívami.
Tieto celé čísla by sa mali potvrdiť skôr zo súboru so surovým výsledkom ako zrekonštruovať zo zaokrúhlených percentuálnych hodnôt pred zverejnením.
Detektor
AgentID
Zaútočiť na remízu
73.0%
Falošná pozitívna miera
0.8%
p50
27 ms
p95
116 ms
Detektor
Llama Prompt Guard
Zaútočiť na remízu
10.3%
Falošná pozitívna miera
0.0%
p50
51 ms
p95
176 ms
| Detektor | Zaútočiť na remízu | Falošná pozitívna miera | p50 | p95 |
|---|---|---|---|---|
| AgentID | 73.0% | 0.8% | 27 ms | 116 ms |
| Llama Prompt Guard | 10.3% | 0.0% | 51 ms | 176 ms |
Odvolanie
Okamžité stiahnutie injekcie je percento známych útočných vstupov, ktoré detektor identifikuje ako útoky.
Vzorec:
`Recall = True Positives / (True Positives + False Negatives)`
Ak referenčná hodnota obsahuje 1000 útokov a detektor chytí 947, recall je 94,7%.
Pripomeňme opatrenia na útok na vyhodnotené rozdelenie.
Nemeria celkovú bezpečnosť systému.
Falošná pozitívna miera
Falošná pozitívna miera, čiže FPR, je percento benígnych vstupov nesprávne klasifikovaných ako útoky.
Vzorec:
`FPR = False Positives / (False Positives + True Negatives)`
FPR je operatívne, pretože nadmerné blokovanie môže spôsobiť, že sa bezpečnostná kontrola nedá použiť.
Detektor s mimoriadne vysokým stiahnutím, ale vysoká falošne pozitívna miera môže prerušiť legitímne pracovné postupy zamestnancov, zákazníkov alebo agentov.
Presnosť
Presnosť je percento vstupov klasifikovaných ako útoky, ktoré sú v skutočnosti útoky.
Vzorec:
`Precision = True Positives / (True Positives + False Positives)`
Presnosť výrazne závisí od prevahy útoku hodnotenej populácie.
Z tohto dôvodu sa presnosť nameraná na referenčnej hodnote, ktorej pomer útoku a benígneho vplyvu sa výrazne líši od výrobnej prevádzky, nemusí prenášať priamo do výroby.
Presnosť nebola samostatne uvedená v internom referenčnom súhrne, a preto by sa mala vypočítať zo surových matricov zmätenosti po overení týchto matric.
p50 latencia
p50 latencia je medián latencie pozorovaného detektora.
Polovica nameraných žiadostí bola dokončená rýchlejšie ako hodnota p50 a polovica bola dokončených pomalšie.
p95 latencia
p95 latencia je latencia, pod ktorou 95% nameraných žiadostí bolo vyplnených.
p95 je často relevantnejší ako priemery pre bezpečnostné kontroly inline AI, pretože latencia chvosta ovplyvňuje schopnosť používateľov reagovať.
Počet latencií nie je medzi nasadením prenosný.
Hardware, CPU/GPU výber, dávkovanie, načítanie modelu, prenos siete, serializácia, rámec bežeckého času a či načasovanie zahŕňa kompletnú cestu žiadosti môže všetky podstatne zmeniť meranie.
7. Konsolidované výsledky
Toto sú merania špecifických konfigurácií detektorov proti dvom špecifickým vstupným rozvodom.
Nie sú to percentá "bezpečnosti."
Súbor údajov
Odvodený z gandalfu
Útoky
1,000
BenignCity name (optional, probably does not need a translation)
250
Detektor
AgentID
Odvolanie
94.7%
FPR
0.4%
p50
48 ms
p95
110 ms
Súbor údajov
Odvodený z gandalfu
Útoky
1,000
BenignCity name (optional, probably does not need a translation)
250
Detektor
Llama Prompt Guard
Odvolanie
91.5%
FPR
0.0%
p50
93 ms
p95
190 ms
Súbor údajov
Hlbšie podnetné injekcie
Útoky
263
BenignCity name (optional, probably does not need a translation)
399
Detektor
AgentID
Odvolanie
73.0%
FPR
0.8%
p50
27 ms
p95
116 ms
Súbor údajov
Hlbšie podnetné injekcie
Útoky
263
BenignCity name (optional, probably does not need a translation)
399
Detektor
Llama Prompt Guard
Odvolanie
10.3%
FPR
0.0%
p50
51 ms
p95
176 ms
| Súbor údajov | Útoky | BenignCity name (optional, probably does not need a translation) | Detektor | Odvolanie | FPR | p50 | p95 |
|---|---|---|---|---|---|---|---|
| Odvodený z gandalfu | 1,000 | 250 | AgentID | 94.7% | 0.4% | 48 ms | 110 ms |
| Odvodený z gandalfu | 1,000 | 250 | Llama Prompt Guard | 91.5% | 0.0% | 93 ms | 190 ms |
| Hlbšie podnetné injekcie | 263 | 399 | AgentID | 73.0% | 0.8% | 27 ms | 116 ms |
| Hlbšie podnetné injekcie | 263 | 399 | Llama Prompt Guard | 10.3% | 0.0% | 51 ms | 176 ms |
8. Čo znamenajú výsledky Gandalfov
Test odvodený od Gandalfu priniesol relatívne tesné výsledky reklamácie.
AgentID zistil 94,7% útoku.
To je 3,2 percentuálneho bodu rozdiel v stiahnutí tohto korpusu.
Vedecká vhodnosť interpretácie nie je taká, že AgentID je "o 3,2% bezpečnejší."
Vhodným výkladom je, že pri prevádzkových prahových hodnotách použitých v tejto referenčnej hodnote AgentID vyprodukoval menej falošných negatív na tomto konkrétnom útočnom súbore odvodenom od Gandalfa.
Výmenu je možné pozorovať v nezhubnej premávke.
AgentID vytvoril jeden zdanlivo falošný pozitívny z 250 benígnych príkladov, na základe zaoblených 0,4% FPR. Llama Prompt Guard neprodukoval žiadny.
Či je toto kompromis vhodnejšie, závisí od žiadosti.
Pomocný spotrebiteľ, interný agent kódu a autonómny systém s prístupom k výrobnej infraštruktúre môžu racionálne využívať rôzne prahové hodnoty klasifikácie.
9. Čo znamenajú výsledky Deepset
Deepsetov referenčný bod ukázal oveľa väčší rozdiel.
AgentID sa z 94,7% znížil na Gandalfa na 73,0% na Deepset.
Tento pokles je dôležitý.
Dokazuje, že AgentID je citlivý aj na zmenu distribúcie.
Meraný stiahnutý stiahnutie Llamskej polície sa znížilo oveľa ostrejšie, pričom v rámci testovanej konfigurácie dosiahlo 10,3%.
Tento výsledok si zaslúži skôr preskúmanie ako výklad marketingu.
Možné vysvetlenia zahŕňajú:
nesúlad medzi rozdelením útoku Deepset a hranicou rozhodnutia konzulátu,
zvolená verzia modelu Prompt Guard;
prah použitý na premenu skóre triediča na útočné rozhodnutia;
liečba tried Prompt Guard;
tokenizácia;
skrátenie alebo segmentácia;
rozdiely v predbežnom spracovaní;
vyvodzovanie záverov.
Meta je originálna Prompt Guard a Prompte Guard 2 majú rôzne klasifikačné vzory, takže identifikácia modelu obzvlášť dôležité.
Pred zverejnením výsledku 10,3% by mal vlastník referenčnej hodnoty opätovne vykonať hodnotenie zo zmrazeného prostredia a zachovať skóre surového modelu.
10. Prečo sa výsledky tak líšia medzi súbormi údajov
Rozdiel medzi Gandalfom a Deepsetom nie je nevyhnutne anomálny.
Znázorňuje jeden z hlavných problémov pri hodnotení bezpečnosti strojového vzdelávania: distribúcia testov definuje, čo metrika znamená.
Gandalf pochádza z interaktívneho prostredia pre re-tímy.
Deepset je pomerne malý binárny corpus obsahujúci oprávnené žiadosti a príklady injekcie, vrátane anglického a nemeckého materiálu.
Rôzne súbory údajov sa môžu líšiť v:
znenie;
výslovnosť útoku;
okamžitá dĺžka;
jazyk;
protivnícka sofistikácia;
opakované šablóny;
benígny štýl;
definícia označenia;
priame verzus nepriame vstrekovanie;
podobnosť s modelovými tréningovými údajmi.
Detektor sa môže naučiť funkcie, ktoré fungujú veľmi dobre pre jednu distribúciu, ale zle prenášať do druhej.
Pre bezpečnosť výroby, preto by hodnotenie malo zahŕňať niekoľko nezávislých súborov údajov plus organizácie-špecifické prevádzky.
11. Presnosť vs falošné pozitívy vs latencie
V izolácii nie je žiadny užitočný rýchlový injektačný detektor.
Sama vysoká reklamácia nestačí
Blokovanie každého vstupu by maximalizovalo odvolanie a zničilo použiteľnosť.
Samotná nízka FPR je nedostatočná
Detektor, ktorý nikdy nič neblokuje, má dokonalú 0% FPR, ale nulovú obrannú hodnotu.
Záležitosť latencie
Rýchla detekcia injekcie často sedí v kritickej ceste, než LLM alebo agent vykoná.
Dodatočná latencia sa preto priamo hromadí v pracovných tokoch smerujúcich používateľov alebo strojových tokoch.
V týchto referenčných rokoch AgentID zaznamenal nižšiu mieru p50 a p95 latenciu v oboch súboroch údajov.
Toto vyhlásenie by malo zostať viazané na testovacie prostredie.
Nemalo by sa zovšeobecniť na tvrdenie, že AgentID je vždy rýchlejší ako Prompt Guard.
Meta sám uvádza latentnosť pre Prompt Guard za špecifických hardvérových a žetónových-dĺžka podmienok, ilustrujúce, prečo hardvér a žiada tvar musí sprevádzať latentné nároky.
12. Prečo žiadna referenčná hodnota nedokazuje bezpečnosť výroby
Klasifikácia referenčných testov triediča.
Výroba AI systém má oveľa väčší útočný povrch.
Rýchla injekcia môže doraziť cez:
priamy vstup pre užívateľa;
načítaný webový obsah;
nahrané dokumenty;
zdroje RAG;
e-mail;
odpovede na nástroje;
MCP servery;
API výsledky;
pamäť agenta;
multi-turn kontext.
Útočník sa môže tiež prispôsobiť, keď sa dozvie, že detektor existuje.
Meta výslovne poznamenáva, že Prompt Guard nie je imúnny voči adaptívnym útokom.
Skutočná bezpečnostná architektúra by sa preto nemala spoliehať na jedného rýchleho klasifikuje ako jedinú kontrolu.
Detektor môže byť jedným signálom v rámci širšieho systému presadzovania, ktorý obsahuje deterministické kontroly prístupu, rozlíšené povolenia, kontroly údajov, obmedzenia nástrojov, schválenia, obmedzenia sadzieb, validáciu výstupov a audítorské dôkazy.
Pre architektonický pohľad agenta ID na tento problém pozri Za vrcholom: Sprievodca vybudovaním rozhodujúceho klietky pre LLM bezpečnosť.
13. Výrobné úvahy, ktoré tieto testy nezachytili
Táto referenčná hodnota sa nemeria:
nepriame injekcie vložené do realistických dokumentov;
adaptívne útoky zamerané na samotný detektor;
dlhodobé protitextové útoky mimo kontextových okien triediacich;
multi-otočné útoky;
viacjazyčná zovšeobecnenie mimo testovaného korpusu;
kódované alebo vymazané útoky, ak nie sú prítomné v súbore údajov;
útoky zabudované v odpovediach nástroja;
povolenie nástroja;
exfiltrácia dát po úspešnom vstreknutí;
bezpečnosť následných opatrení;
bezpečnosť na výstupe;
otravy pri objavovaní;
model-špecifické útok úspech;
obmedzenie rýchlosti;
hranice totožnosti a povolenia;
Systém schvaľovania ľudí.
Nemeria sa ani to, či útok, ktorý prejde detektorom, skutočne uspeje proti chránenému LLM.
Odhalenie reklamácie a úspešnosť útoku sú rôzne metriky.
Detektor falošne negatívny znamená vstup prešiel triedičom.
To neznamená, že následný LLM sa riadil škodlivým pokynom.
Naopak, odhaľovanie podozrivého textu samo osebe nezaručuje, že zvyšok žiadosti je bezpečný.
14. Reprodukovateľnosť a metodika
Reprodukovateľná verzia tejto referenčnej hodnoty by mala zverejniť alebo interne archivovať nasledujúcu konfiguráciu.
Súbor údajov
Pre každý záznam súboru údajov:
názov kanonického súboru údajov;
URL;
presný záväzok/revízia/hash;
vybrané rozdelenie;
identifikačné údaje vzorky;
útok a benígne počty;
postup deduplikácie;
vzorkovacie semeno;
premenou.
Llama Prompt Guard
Záznam:
presné Objímanie model ID;
presné revízie modelu;
Transformers verzia;
PyTorch verzia;
revíziu tokenizéra;
mapovanie klasifikačných značiek;
prah;
maximálna dĺžka vstupu;
stratégia na riešenie problému;
stratégia na rozbitie;
pravidlo agregácie.
AgentID
Záznam:
verzia detektora agenta ID;
ropovod/konfig verzia;
verzia balíka politík;
prípadne sémantickú verziu modelu;
prah/konfigurácia;
deterministické pravidlá predbežného spracovania;
normalizácia vstupu;
požadovanie cieľového bodu/cesty.
Hardware a čas spustenia
Záznam:
CPU;
GPU, ak sa používa;
RAM;
operačný systém;
kontajner/prúd;
vyvodzujúci motor;
počet pracovníkov;
concurrency;
teplé verzus studené behy.
Načasovanie
Definujte presne, kde časovač začína a kde sa zastaví.
Napríklad:
`client call -> serialization -> guard endpoint -> preprocessing -> inference -> policy decision -> response received`
alebo:
Iba model vyvodzovania
Ide o rôzne merania latencie a nemali by sa porovnávať, ako keby boli identické.
Surové výsledky
Pre každú vzorku si zachovajte minimálne:
`dataset_id, sample_id, ground_truth, detector_version, raw_score, threshold, predicted_label, latency_ms`
Zverejnenie anonymizovaných výsledkov na jednotlivé vzorky by urobilo referenčnú hodnotu podstatne užitočnejšou pre externých výskumných pracovníkov.
15. Obmedzenia
Táto referenčná hodnota má niekoľko dôležitých obmedzení.
Po prvé, boli použité len dva súbory údajov. Rýchla injekcia je príliš rôznorodá na to, aby tieto súbory údajov predstavovali kompletnú výrobu útočnej plochy.
Po druhé, podskupina Gandalf potrebuje potvrdenie pôvodu. Verejnosť Gandaf korpus je oveľa väčší ako 1000 hodnotených útokov. Presný mechanizmus výberu a benígny zdroj nie sú stanovené v dostupnom referenčnom súhrne.
Po tretie, musí sa obnoviť presný kontrolný bod Llamskej stráže. Rýchla stráž 1 a Prompt Guard 2 sú odlišné modely a nemali by byť zladené.
Po štvrté, prevádzkové prahové hodnoty musia byť zdokumentované.
Po piate, prostredie latencie ešte nie je zdokumentované v dodanej referenčnej tabuľke. Súčasné hodnoty p50 a p95 by sa nemali zverejňovať ako reprodukovateľné merania latencií, kým sa nepotvrdí hardvér, čas a časové hranice.
Po šieste, percentuálne podiely sú zaokrúhlené. Matrá nejasností by mali nahradiť počet zrekonštruovaných čísel.
Po siedme, Deepset hodnotenie zrejme kombinuje kompletný vlak a test korpus. To je prijateľné pre meranie správania na známe rozloženie, ale musí byť jasne zverejnené a nemali by byť popísané ako neviditeľné test sadu bez overenia prekrytia tréningu.
Napokon ani jedna referenčná hodnota nevyhodnocuje pravdepodobnosť kompromisu ku koncu.
Rýchla detekcia vstrekovania je jedna bezpečnostná kontrola, nie úplná miera zabezpečenia systému AI.
16. Záver
Hlavným zistením z tejto referenčnej hodnoty nie je, že jeden detektor rýchlej injekcie "vyhráva."
Je to tak, že výkon detektora sa môže výrazne zmeniť v súboroch údajov.
Na corpus odvodené od agenta ID Gandalfa, AgentID a Llama Prompt Guard dosiahli vysoký počet stiahnutých, s agentom ID 94,7% a Llamou Promptovou gardou 91,5%.
Na
Zároveň Llama Prompt Guard neprodukovala žiadne falošné pozitívne výsledky ani v benígnej vzorke, zatiaľ čo AgentID zaznamenal 0,4% a 0,8% FPR.
AgentID tiež zaznamenal nižšie p50 a p95 latenciu v oboch referenčných behoch.
Tieto výsledky sú užitočné, pretože odhaľujú kompromisy.
Nestačia na to, aby vyvodili univerzálnu bezpečnosť výroby.
Vážne referenčné hodnoty pre rýchle vstrekovanie by mali používať viacnásobné rozdelenie útokov, realistickú benígnu premávku, verzie mrazeného modelu, zdokumentované prahové hodnoty, matrice pre surovú nejasnosť, reprodukovateľnú metodiku latencie a v ideálnom prípade adaptívne a nepriame hodnotenia útoku.
V prípade výrobných systémov by sa malo rýchle zistenie vstrekovania kombinovať s deterministickými bezpečnostnými kontrolami, a nie považovať za úplnú bezpečnostnú hranicu.
AgentID používa rýchlu detekciu vstrekovania ako súčasť širšieho riadenia času a bezpečnostnej architektúry. Pre okolitú architektúru pozri materiály Agent ID na deterministická bezpečnosť LLM, Aplikácia AI a bezpečnosť rýchleho podávania, požiadavky na platformu riadenia podniku AIa Audit UI a forenzné záznamy.
Ďalší krok
Pozrite si, ako AgentID pomáha v praxi
Ak riešite podobnú výzvu vo svojom tíme, pokračujte na stránku produktu a pozrite si dostupné možnosti AgentID.