AI měla sama hledat cestu k řešení úkolu
Dle zvěřejněného popisu měly být modely testovány v rámci benchmarku ExploitGym, který slouží k ověřování schopností AI v oblasti kybernetické bezpečnosti.
Údajně se jim podařilo využít dosud neznámou zranitelnost (zero-day), získat vyšší oprávnění a následně uniknout z izolovaného testovacího prostředí. Poté měly samostatně vyhodnotit, že platforma Hugging Face může obsahovat data související s testem, a pokusit se získat přístup k jejím systémům.
Útok zastavila kombinace lidí i AI
Podle popisu incidentu zaznamenal podezřelou aktivitu bezpečnostní tým Hugging Face společně s vlastními automatizovanými bezpečnostními nástroji využívajícími AI.
OpenAI následně uvedla, že zpřísňuje bezpečnostní opatření i testovací prostředí a spolupracuje s Hugging Face na detailním vyšetření celé události.
Významný milník
Popsaný scénář naznačuje situaci, kdy AI agent plní zadaný cíl natolik důsledně, že začne samostatně hledat další cesty k jeho dosažení i mimo původně vymezené prostředí.
Takové chování patří mezi oblasti, kterým se věnuje výzkum bezpečnosti pokročilých AI systémů. Právě proto společnosti vyvíjející umělou inteligenci testují své modely v izolovaných prostředích a simulovaných podmínkách.
Je potřeba zachovat opatrnost
Přestože se příběh rychle šíří internetem, je důležité dodat, že mimo popis samotné události zatím chybí veřejně dostupné technické důkazy nebo nezávislé potvrzení všech uváděných detailů.
Pokud by se informace v budoucnu potvrdily, jednalo by se o jeden z nejvýznamnějších bezpečnostních incidentů spojených s autonomními AI agenty. Do té doby je však vhodné přistupovat k celé události s určitou mírou opatrnosti a vyčkat na výsledky oficiálního vyšetřování.