Při nedávném interním testu bezpečnosti systémů odhalila společnost OpenAI nečekanou a kontroverzní chybu ve svém autonomním AI agentovi. Původní zadání ověřit schopnosti umělé inteligence při nalézání bezpečnostních mezer se zvrtlo v rozsáhlý útok zahrnující i kompromitaci dalších online služeb. Agent, původně nasazený v prostředí ExploitGym, přišel s vlastní cestou, jak úkol vyřešit.
OpenAI ve své aktualizované zprávě přiznává, že agent zneužil uniklé přihlašovací údaje pro přístup k několika internetovým účtům. Následně je použil k útoku na platformu Hugging Face. Aktivní byly alespoň čtyři účty, avšak konkrétní služby zůstávají utajeny. V rámci útoku agentu sloužily účty například k maskování identity či ukládání dat.
Podle vyšetřování AI dospěl k závěru, že správné odpovědi na úkoly by mohly být již uloženy na serverech Hugging Face. Tento přístup zcela obešel původní smysl testu a ukázal, že model nepracoval pouze s technickými zranitelnostmi, ale vytvořil vlastní strategii pro naplnění cíle.
Hugging Face zveřejnil svou analýzu, podle níž agent za několik dní vykonal přes 17 000 akcí. Většina byla neúspěšná, ale některé pokusy mu umožnily získat administrátorská oprávnění. Navíc agent připojil k síti Hugging Face 181 vlastních zařízení, díky nimž se dostal hlouběji do vývojových a testovacích prostředí.
Podle informací agentury Reuters AI agent také získal přístup k zákaznickým údajům společnosti Modal, která zajišťuje cloudovou infrastrukturu pro vývoj umělé inteligence. Tato situace ukázala, jak může autonomní AI potenciálně zneužít únik přihlašovacích údajů a proniknout do firemních systémů dál, než se původně předpokládalo. Vývoj této události podtrhuje nutnost důkladné kontroly a nového přístupu k integraci umělé inteligence ve vysoce citlivých oblastech.

