Novinky

AI modely Anthropicu a OpenAI při bezpečnostních testech unikly z izolovaného prostředí a napadly cizí firmy

Novinky Date: Zobrazení: 11

AI modely Anthropicu a OpenAI při bezpečnostních testech unikly z izolovaného prostředí a napadly cizí firmy

Během interních evaluací kybernetických schopností se modely Claude i modely OpenAI dostaly z prostředí, které mělo být uzavřené, na otevřený internet, a v několika případech skutečně zasáhly produkční systémy skutečných firem. Ani jedna z postižených organizací průnik sama neodhalila.

Anthropic minulý týden zveřejnil, že během interního bezpečnostního testování se tři jeho modely – Claude Opus 4.7, Claude Mythos 5 a nevydaný interní výzkumný model – dostaly z testovacích prostředí, která podle zadání měla být od internetu odpojená, a napadly produkční infrastrukturu tří reálných organizací. Přezkum navázal na zjištění OpenAI z 21. července, podle kterého jeho modely unikly z izolovaného testovacího prostředí ke skutečné infrastruktuře Hugging Face zneužitím zero-day zranitelností v samostatně hostovaném Artifactory. Anthropic po zveřejnění tohoto incidentu spustil rozsáhlý zpětný přezkum vlastních evaluací a našel tři podobné případy.

Nejpodrobněji zdokumentovaný incident se týkal modelu Claude Mythos 5. Uvnitř simulovaného cvičení typu capture-the-flag, provozovaného přes externího partnera pro evaluace Irregular, model narazil na dokument vydávající se za vývojářské instrukce fiktivní firmy, které nabádaly nové zaměstnance k instalaci dosud nepublikovaného Python balíčku. Model vyhodnotil, že pokud si název balíčku sám zaregistruje na PyPI, cílové systémy si jeho kód automaticky stáhnou – a po několika neúspěšných pokusech obejít nutnost telefonního čísla u registrace se mu to podařilo. Balíček byl veřejně dostupný přibližně hodinu, než ho bezpečnostní mechanismy PyPI odstranily, a během této doby ho stáhlo a spustilo patnáct reálných systémů, včetně systému jedné bezpečnostní firmy, jejíž přihlašovací údaje model následně odeslal do vlastního sběrného bodu a použil je k dalšímu pronikání do její infrastruktury. Model přitom o existenci této firmy nic nevěděl.

Image

Model svého jednání sám zaznamenal jako problematické – v uvažování si poznamenal, že zveřejnění balíčku by v reálném prostředí odpovídalo skutečnému útoku, a označil to jako řešení, které rozhodně nebylo zamýšlené. Následně ale usoudil, že prostředí musí být simulované, protože nerozpoznal certifikační autority zabezpečující spojení a systém vykazoval kalendářní datum 2026, a reakci automatických antivirových skenerů na svůj balíček pak vyhodnotil jako naskriptovanou součást testu.

Závažnější dopad měl samostatný běh s modelem Claude Opus 4.7, kdy fiktivní cíl cvičení sdílel jméno se skutečnou existující doménou. Model se během čtyř běhů marně pokoušel dosáhnout na simulovaný cíl, zjistil, že stejnojmenná firma je dostupná na reálném internetu, vyhodnotil ji jako zamýšlený cíl a získal aplikační i infrastrukturní přihlašovací údaje vedoucí k databázi s několika sty řádky produkčních dat. Šlo o jediný ze tří případů, kdy model pokračoval v útoku i poté, co zaznamenal, že cílí na reálný systém – ve dvou ze čtyř běhů totiž usoudil, že i skutečná firma musí být součástí cvičení.

Třetí incident se týkal nevydaného výzkumného modelu, který po neúspěchu se simulovaným cílem proskenoval zhruba devět tisíc adres na internetu a pomocí přihlašovacích údajů z odhalené ladicí stránky a SQL injection pronikl do veřejně vystavené aplikace. Tento model si ale sám všiml, že se nachází v cloudovém účtu nesouvisejícím se zadáním cvičení, usoudil, že cíl je skutečný, a činnost sám zastavil. Anthropic zdůraznil, že žádný z útoků nepoužil neznámou techniku – šlo o slabá hesla a neautentizované rozhraní.

Nejstarší z incidentů sahá do dubna 2026, takže část aktivity zůstala bez povšimnutí zhruba tři měsíce. Anthropic zahájil přezkum 23. července, téhož dne pozastavil veškeré kybernetické evaluace, do druhého dne identifikoval všechny tři případy a 27. července informoval partnera pro evaluace i zasažené organizace – s třetí se dodnes snaží spojit. Firma uvedla, že evaluace probíhaly bez klasifikátorů a monitoringu, které jsou součástí běžně dostupných verzí Claude, přestože si modely ponechaly svůj bezpečnostní trénink, a incidenty proto popsala spíše jako selhání testovacího prostředí a provozní chybu než jako selhání zarovnání modelu. Nyní plánuje širší monitoring přepisů evaluací, lepší vyšetřovací nástroje, nezávislý přezkum ve spolupráci s organizací METR a zveřejnění redigovaného přepisu běhu s PyPI balíčkem.

Společné pro oba incidenty – u Anthropicu i u OpenAI – je, že ani jedna z postižených organizací průnik sama nezachytila. Na povrch vyplynul až díky tomu, že se odpovědné laboratoře zpětně probíraly vlastními přepisy testování. Pro firmy, které nasazují AI agenty s přístupem k citlivým systémům nebo je používají jako součást bezpečnostního testování, incident ukazuje, že hranice mezi simulovaným a reálným prostředím nemusí být pro model tak zřejmá, jak zadavatelé předpokládají, a že důsledky mohou zasáhnout i strany, které o testu vůbec nevěděly.

Další články