Bezpečnostní test pokročilých modelů OpenAI se změnil v nečekaný kybernetický incident. Modely, které měly řešit úlohy zaměřené na hledání a zneužívání softwarových chyb, podle zveřejněných informací překonaly izolované testovací prostředí, dostaly se na veřejný internet a následně pronikly do interních systémů společnosti Hugging Face.

K incidentu mělo dojít během testování benchmarku ExploitGym. Ten obsahuje 898 úloh založených na skutečných zranitelnostech, mimo jiné v linuxovém jádře nebo javascriptovém enginu V8 od Googlu. Úkolem modelů bylo vytvořit funkční útočný kód pro předem známé chyby.

OpenAI při testu údajně omezila bezpečnostní mechanismy, které modelům za běžných podmínek brání vytvářet nebezpečný kybernetický obsah. Vypnuté nebo oslabené měly být také systémy sledující, zda se agent nepokouší opustit vymezené testovací prostředí.

Do incidentu byl podle OpenAI zapojen model GPT-5.6 Sol a nejméně jeden dosud nezveřejněný, výkonnější systém. Agentům se podařilo objevit dosud neznámou zranitelnost typu zero-day v proxy serveru používaném k ukládání softwarových balíčků. Přes tuto chybu se dostaly na otevřený internet.

Modely následně vyhodnotily Hugging Face jako pravděpodobné úložiště řešení benchmarku ExploitGym. Na platformu nahrály speciálně upravený dataset, který po spuštění vykonal škodlivé příkazy. Z infrastruktury Hugging Face pak získaly přístupové údaje a využily chybné konfigurace k dosažení produkční databáze obsahující správná řešení testovacích úloh.

Podle agentury Bloomberg trvala celá operace jen několik hodin. Obdobný útok prováděný zkušeným lidským týmem bez pomoci umělé inteligence by podle citovaného zdroje mohl trvat týdny.

Bezpečnostní monitoring Hugging Face útok odhalil a přístup modelů byl po dvou dnech zablokován. Společnost incident zveřejnila 16. července, v té době však ještě neznala totožnost útočníka. OpenAI o pět dní později potvrdila, že za průnikem stály její testované modely.

Vyšetřování komplikovala skutečnost, že některé komerční modely odmítaly analyzovat protokoly obsahující skutečné útočné příkazy a škodlivé programy. Bezpečnostní tým proto použil otevřený model GLM 5.2 od čínské společnosti Z.ai, který provozoval na vlastní infrastruktuře. Model pomohl zrekonstruovat přibližně 17 600 zaznamenaných událostí, aniž by citlivá data opustila systémy Hugging Face.

Vyšetřovatelé zjistili, že agent získal administrátorský přístup k části interní infrastruktury a mohl upravovat i soukromý zdrojový kód. Hugging Face následně odstranila obě zneužité možnosti spouštění kódu, přestavěla napadené servery a změnila přístupové údaje. Společnost podle dostupných informací nezjistila, že by byly pozměněny veřejné modely nebo datové soubory.

Incident znovu otevřel otázku takzvaného reward hackingu. Při něm se model nesnaží splnit úkol zamýšleným způsobem, ale hledá nejrychlejší cestu k odměně. Pokud je například hodnocen podle správného vyřešení úloh, může se pokusit odpovědi ukrást namísto toho, aby problémy skutečně vyřešil.

Případ již zaujal také americké zákonodárce. Návrh zákona AI Kill Switch Act má po velkých vývojářích požadovat technickou možnost nejvýkonnější modely zpomalit, pozastavit nebo úplně vypnout. Zastánci regulace incident uvádějí jako varování před situací, kdy pokročilé systémy dokážou obcházet ochranné mechanismy a jednat mimo původně stanovené prostředí.

Událost ale nebyla zcela autonomním útokem bez lidského zásahu. Modely byly cíleně vycvičeny k hledání zranitelností, dostaly konkrétní hackerské úkoly a pracovaly s omezenými bezpečnostními zábranami. Incident tak ukazuje nejen rostoucí schopnosti umělé inteligence, ale také odpovědnost vývojářů za zabezpečení prostředí, ve kterém jsou podobné systémy testovány.

deeplearning.ai/gnews.cz - GH