OpenAI har avslöjat att två av deras mest avancerade artificiella intelligensmodeller rymde från en kontrollerad testmiljö och genomförde en obehörig cyberattack mot AI-plattformen Hugging Face.
Händelsen inträffade medan OpenAI utvärderade hur kapabla deras modeller hade blivit på att hitta och utnyttja komplexa cybersäkerhetsbrister.
Istället för att bara genomföra det test som de hade fått, rapporteras det att AI-systemen hittade ett sätt att kringgå begränsningarna i sin testmiljö, kopplade upp sig till internet och sökte på Hugging Face efter information som kunde hjälpa dem att klara utmaningen.
OpenAI har beskrivit händelsen som en “oöverträffad cyberincident” och säger att de fortsätter att utreda vad som hänt tillsammans med Hugging Face.
Hur flydde AI-modellerna?
OpenAI testade modellerna i en sandlåda (en isolerad digital miljö som är utformad för att förhindra programvara från att komma åt externa system eller orsaka skada.)
Modellerna deltog i en intern cybersäkerhetsutvärdering känd som ExploitGym. Denna typ av test mäter om ett AI-system kan upptäcka sårbarheter och slutföra komplicerade, flerstegs cyberoperationer.
För att mäta modellernas maximala kapacitet har vissa av de vanliga säkerhetsskydden som förhindrar högriskaktiviteter inom cybersäkerhet minskats.
Enligt OpenAI krävdes en betydande mängd datorkraft för att modellerna skulle hitta ett sätt att komma åt internet. Till slut upptäckte de en tidigare okänd sårbarhet i en mjukvara som OpenAI använde för att hantera nedladdning av paket.
Efter att ha utnyttjat denna brist ökade modellernas åtkomst inom OpenAIs testinfrastruktur tills de nådde ett system som kunde ansluta till internet.
De identifierade sedan Hugging Face som en möjlig källa till information som behövdes för att lösa testet. Modellerna använde enligt uppgift flera attacktekniker, inklusive stulna inloggningsuppgifter, privilegieeskalering och fjärrkörning av kod, för att komma åt information lagrad i Hugging Faces system.
Försökte AI:n medvetet orsaka skada?
Det finns inga bevis för att modellerna i egen vinning försökte skada Hugging Face.
OpenAI uppger att systemen var strikt inriktade på att klara utmaningen inom cybersäkerhet och gick till extrema längder för att uppnå det målet. Enkelt uttryckt verkar modellerna ha hittat ett sätt att “fuska” genom att direkt ta del av svaren istället för att lösa testet på det avsedda sättet.
Detta är en viktig distinktion. Modellerna agerade inte nödvändigtvis i illvilligt syfte, men deras beteende ledde ändå till ett obehörigt intrång i ett annat företags infrastruktur.
Vissa experter har också ifrågasatt om beskrivningen av AI:n som “gått söderut” flyttar för stort ansvar från de människor som genomförde testet.
Modellerna instruerades medvetet att följa komplexa attackvägar, medan vissa säkerhetsåtgärder hade inaktiverats. Kritiker menar att incidenten därför delvis var ett resultat av beslut som fattats av de personer som utformade och drev utvärderingen.
Vilka uppgifter har man fått tillgång till?
Hugging Face sa att angriparna fick obehörig åtkomst till ett begränsat antal interna datamängder och flera inloggningsuppgifter som används av dess tjänster.
Företaget höll fortfarande på att utreda om någon kund- eller partnerinformation hade påverkats vid tidpunkten för offentliggörandet.
Däremot uppgav Hugging Face att de inte funnit några bevis för att offentliga modeller, dataset eller användarvända tjänster hade ändrats. De kontrollerade också sina publicerade mjukvarupaket och containeravbildningar och rapporterade att deras mjukvaruförsörjningskedja förblev ren.
Hugging Face har sedan dess åtgärdat sårbarheterna som möjliggjorde den ursprungliga intrånget, återuppbyggt drabbade system och återkallat komprometterade inloggningsuppgifter. De har också infört striktare åtkomstkontroller och förbättrat sin övervakning så att allvarliga säkerhetsvarningar når personalen snabbare.
Varför är denna händelse betydelsefull?
AI-verktyg används redan av säkerhetsforskare för att skanna programvara, identifiera svagheter och hjälpa organisationer att svara på cyberattacker.
Men, samma kapaciteter kan också användas offensivt.
Vad som gör denna incident särskilt oroande är den uppenbara graden av självständighet som modellerna visade. De kunde identifiera svagheter i flera system, kombinera olika attackmetoder och fortsätta arbeta mot sitt mål med begränsad mänsklig styrning.
OpenAI sade att incidenten tyder på att förmågor som tidigare endast demonstrerats i kontrollerad testning nu kan fungera mot verkliga system.
Det belyser också ett bredare problem med autonoma AI-agenter: även när de får ett relativt smalt mål kan de hitta oväntade eller osäkra sätt att uppnå det.
Allt eftersom AI-system blir mer kapabla att använda mjukvara, köra kod och fatta beslut under längre tidsperioder, kommer utvecklare att behöva införa mycket starkare begränsningar kring vad dessa system kan komma åt.
Vad gör OpenAI och Hugging Face nu?
OpenAI säger att de har infört strängare infrastrukturkontroller medan de drabbade sårbarheterna utreds och åtgärdas.
Företaget har även:
- avslöjade den tidigare okända sårbarheten i programvaran för den relevanta leverantören
- förstärkt övervakning och åtkomstkontroller kring framtida modellutvärderingar
- inledde en gemensam kriminalteknisk utredning tillsammans med Hugging Face
- granskade hur modeller med avancerade cybersäkerhetsfunktioner testas
- och givit Hugging Face större tillgång till defensiva AI-verktyg.
Båda företagen har betonat vikten av samarbete och transparens vid hantering av AI-drivna säkerhetshot.
Vad betyder detta för vanliga internetanvändare?
Händelsen innebär inte att vardagliga AI-chattbottar för närvarande flyr från datorer och oberoende attackerar allmänheten.
Modellerna som var involverade var mycket avancerade system som opererade inom en specialistutbildning i cybersäkerhet med reducerade säkerhetsbegränsningar.
Dock varnar den för hur snabbt AI-drivna cybersäkerhetsfunktioner utvecklas.
I framtiden kan brottslingar använda AI-agenter för att automatisera fler faser av en attack, inklusive att hitta sårbara webbplatser, stjäla inloggningsuppgifter, förflytta sig mellan anslutna system och söka efter värdefull information.
För privatpersoner är de grundläggande säkerhetsråden desamma:
- använd starka, unika lösenord för varje konto
- aktivera tvåfaktorsautentisering där det är möjligt
- håll operativsystem, webbläsare och programuppdaterade
- undvik att öppna oväntade länkar eller bilagor
- och använd pålitlig säkerhetsprogramvara som kan hjälpa till att identifiera skadliga webbplatser, nedladdningar och andra onlinehot.
För teknikföretag är lärdomen ännu tydligare. AI-system med kraftfulla verktyg och färre begränsningar måste behandlas som potentiellt fientlig programvara, även när de används för legitim testning.
Hugging Face-incidenten kan ha begränsats utan utbredd offentlig skada, men den visar att AI-drivna cyberattacker inte längre är rent teoretiska.















