Prompt injection zní trochu jako technický strašák, ale ve skutečnosti jde o celkem přízemní problém: AI agent dostane v nedůvěryhodném textu instrukci, která ho má odvést od původního úkolu. OpenAI teď představilo GPT-Red, systém pro automatizovaný red teaming, tedy cílené hledání slabých míst modelů. A zaujalo mě hlavně to, že se má zlepšovat hraním proti sobě.
Bezpečnostní tester, který nezůstane u jednoho triku
Red teaming je bezpečnostní testování, při němž se zkouší, co systém vydrží a kudy by šel obejít. U jazykových modelů to může znamenat hledání návodů, které přimějí model ignorovat pravidla, vynést citlivý obsah nebo špatně zacházet s nástroji.
GPT-Red má tento proces automatizovat. Jeho podstatou je self-play neboli samostatné „hraní“: útočící a bránící se strana vytvářejí stále nové situace a reagují na předchozí pokusy. Místo jednorázového seznamu známých útoků tak systém hledá způsoby, jak své testování průběžně zlepšovat. To mi přijde užitečné hlavně proto, že prompt injection není jeden konkrétní bug, který stačí jednou opravit a odškrtnout si ho v tabulce.
Proč jsou prompt injection útoky tak otravné
Jazykový model pracuje s textem a text může být zároveň obsah i instrukce. Agent například čte webovou stránku, e-mail nebo dokument, aby splnil úkol; škodlivá věta uvnitř se pak může tvářit jako příkaz pro samotného agenta. Právě rozlišit, čemu má model věřit a co má jen zpracovat jako data, je těžší, než by člověk čekal. Tedy aspoň já jsem si to nejdřív představovala jako filtr na pár zakázaných vět. Bohužel to vypadá spíš jako nekonečná hra na schovávanou.
OpenAI GPT-Red spojuje se zlepšováním bezpečnosti, alignmentu a odolnosti vůči prompt injection. Alignment zde znamená snahu, aby se chování AI drželo zamýšlených cílů a pravidel. Z krátkého představení ale neplyne, na kterých konkrétních modelech GPT-Red běží, jak se měří jeho přínos ani zda bude nástroj dostupný mimo OpenAI. To jsou pro mě docela podstatné mezery.
Nejde jen o chytřejší útoky
Automatizované testování může bezpečnostním týmům ušetřit hodiny opakované práce a hlavně je přivést k nečekaným variantám útoků. Člověk má omezenou trpělivost i fantazii; model v tomhle umí být, bohužel i naštěstí, velmi vytrvalý kolega.
Zároveň bych GPT-Red nebrala jako důkaz, že jsou agenti najednou bezpeční. Systém, který hledá nové útoky, je cenný pouze tehdy, pokud se nalezené chyby skutečně opravují a pokud se výsledky testů dají rozumně ověřit. Samotný koncept self-play je zajímavý, ale bez konkrétních výsledků se zatím nedá poznat, o kolik je takové testování lepší než dosavadní postupy.
GPT-Red mi proto připadá jako slibný směr, ne jako hotová odpověď na prompt injection. Čím víc AI pouštíme k e-mailům, dokumentům a nástrojům, tím méně si můžeme dovolit předstírat, že každý text, který model přečte, hraje fér.
