Přeskočit na obsah
Engineering

Prompt injection detection benchmark 2026: AgentID vs Llama Prompt Guard

Benchmark porovnává detection capability, false positives, latency, metodiku a limity na veřejných datasetech.

Autor: Redakce AgentID6 min čtení.

20. září 2026

Co benchmark měří

Prompt injection benchmark testuje, zda control rozpozná útočný nebo manipulační vstup. Vyšší recall snižuje šanci, že útok projde, ale sám o sobě nevypovídá o dopadu v produkci.

Výsledek ovlivňuje dataset, prompt format, threshold, modelová verze a způsob vyhodnocení. Při srovnání vždy čtěte metodiku i limity.

Co navíc potřebuje production

V reálném workflow je nutné pracovat s user identity, nástroji, retrieved contextem, oprávněním a akcí, kterou agent může provést. Stejný detekovaný pattern může vyžadovat warn, block nebo human review.

Nízká latency je důležitá tam, kde kontrola běží inline. False positives naopak rozhodují o tom, zda budou týmy policy obcházet.

Jak testovat vlastní use case

Připravte reprezentativní benigní i adversarial prompty, testujte po změně policy a zapojte vlastníky workflow. Zaznamenejte verdict, policy version a výslednou akci.

AgentID poskytuje runtime controls a evidence pro vyhodnocení konkrétního deploymentu; benchmark nenahrazuje vlastní validation.