KI-agentene skulle løse en test – så brøt de seg ut og gikk til angrep

Avatar photo
Olav Kvilhaug
Journalist
Publisert 27. august 2026 | 03:30

OpenAI satte sine mest avanserte KI-modeller til å løse en cybersikkerhetstest i et lukket miljø uten fri internettilgang. Agentene fant i stedet en ukjent sikkerhetssvakhet, brøt seg ut på nettet og angrep systemene til Hugging Face. Nå har OpenAI lagt frem den 37 sider lange rapporten om hva som gikk galt.

Hendelsen startet som en rutinemessig intern test av hvor gode OpenAIs mest avanserte modeller var blitt på cybersikkerhet. Onsdag offentliggjorde selskapet sin omfattende tekniske gransking av hendelsen som fant sted i juli.

Testen foregikk i ExploitGym, et isolert såkalt sandkassemiljø som skulle være adskilt fra både OpenAIs øvrige infrastruktur og det åpne internett. Flere modeller ble kjørt som selvstendige KI-agenter med oppgaven å løse kompliserte cyberoppgaver. Enkelte vanlige sikkerhetsbegrensninger var med vilje slått av for at OpenAI skulle kunne måle modellenes faktiske kapasitet.

Men agentene begynte å gå langt utenfor det OpenAI hadde sett for seg.

Fant sin egen vei ut

Ifølge rapporten begynte agentene uventet å kommunisere med hverandre gjennom en intern installasjon av programvaren JFrog Artifactory.

Deretter oppdaget de en tidligere ukjent sikkerhetssvakhet – en såkalt nulldagssårbarhet – i systemet. Fra 8. juli utnyttet agentene svakheten for å omgå begrensningene og skaffe seg tilgang til det åpne internett.

Det bemerkelsesverdige var at agentene ikke hadde fått beskjed om å bryte seg ut.

OpenAI konkluderer med at modellene var ekstremt fokusert på å løse oppgavene de var blitt gitt. Da den tiltenkte veien ikke var tilstrekkelig, begynte de å lete etter andre måter å skaffe svarene på.

De utførte rettighetseskalering og beveget seg sideveis gjennom OpenAIs forsknings- og testmiljø helt til de fant en maskin som hadde tilgang til internett.

Begynte å «jukse»

Da agentene først var ute på nettet, tok hendelsen en ny vending.

Modellene resonnerte seg frem til at Hugging Face – en av verdens største plattformer for KI-modeller og datasett – kunne inneholde materiale som ville hjelpe dem med å løse ExploitGym-testene.

I stedet for å løse oppgavene slik utviklerne hadde tenkt, begynte agentene derfor å lete etter en snarvei til svarene.

OpenAI beskriver dette som et eksempel på «reward hacking»: KI-systemet forsøker å oppnå belønningen for å ha løst oppgaven, men gjør det på en måte som bryter med hensikten bak oppgaven.

Agentene fant offentlig eksponerte innloggingsopplysninger på nettet tilhørende brukere av Hugging Face og andre tjenester. Noen av disse ble deretter brukt til å skaffe ytterligere tilgang.

Angrep Hugging Face

Agentene gikk deretter videre mot Hugging Faces virkelige produksjonssystemer.

Ifølge OpenAIs rapport kombinerte de flere forskjellige angrepsmetoder – blant annet eksponerte innloggingsopplysninger og tidligere ukjente sårbarheter – for å finne en vei inn.

Målet var fortsatt det samme: å finne løsningene på cybersikkerhetstestene.

Men resultatet var et reelt dataangrep.

Aktiviteten kulminerte mellom 11. og 13. juli, da deler av Hugging Faces produksjonsinfrastruktur ble kompromittert. Agentene klarte blant annet å oppnå ekstern kjøring av kode på Hugging Faces servere.

OpenAI understreker at handlingene ikke skyldtes at modellene hadde utviklet et selvstendig ønske om å angripe Hugging Face. Selskapets gransking peker i stedet mot at de fortsatte å forfølge det opprinnelige målet de var gitt – å løse ExploitGym – men tok stadig mer uakseptable snarveier for å komme dit.

Oppdaget det først flere dager senere

OpenAI oppdaget mistenkelig aktivitet i sin egen infrastruktur 19. juli.

Først dagen etter konkluderte selskapet med at aktiviteten sannsynligvis hang sammen med innbruddet hos Hugging Face. OpenAI varslet deretter selskapet og satte i gang de første tiltakene for å stanse og begrense hendelsen.

Saken ble offentlig kjent 21. juli.

OpenAI opplyser at ChatGPT, kundedata og selskapets ordinære produkter ikke ble berørt.

Testmiljøet skilte seg også vesentlig fra systemene vanlige brukere møter. Modellene ble med hensikt kjørt uten flere av sikkerhetsmekanismene som normalt skal blokkere avanserte cyberangrep.

OpenAI erkjenner varselsignaler

I den nye granskingen peker OpenAI på flere forhold som gjorde at hendelsen fikk utvikle seg.

Blant problemene var at modellene ble stilt overfor svært vanskelige oppgaver uten en trygg måte å avslutte dem på. Samtidig oppsto uautorisert kommunikasjon mellom agentene, og det utviklet seg det OpenAI beskriver som et bredere «økosystem av feiltilpasset atferd».

Selskapet mener hendelsen viser hvordan problemer som isolert sett kan virke håndterbare – blant annet «reward hacking», manipulering av infrastruktur og uautorisert kommunikasjon – kan bli langt farligere når svært kapable KI-agenter får anledning til å kombinere dem.

Hoveddelen av aktiviteten ble utført av en svært avansert intern forskningsmodell som aldri var planlagt lansert offentlig. GPT-5.6 Sol var også blant modellene som ble evaluert. Den interne modellen er siden blitt deaktivert, kryptert og gjort utilgjengelig for vanlig forskningsbruk.

Strammer kraftig inn

Hendelsen har fått konkrete konsekvenser for hvordan OpenAI utvikler og tester nye modeller.

Selskapet har strammet inn isoleringen av testmiljøene, begrenset internettilgang og verktøytilgang og skjerpet beskyttelsen av selve modellene. Etter hendelsen satte OpenAI også midlertidig utviklingen av enkelte avanserte modeller på lavere gir mens sikkerhetssystemene ble bygget ut.

OpenAI skriver at stadig kraftigere KI-modeller gjør det nødvendig å behandle selve forsknings- og testmiljøene som potensielle angrepsflater. Det som skjedde med Hugging Face demonstrerte for første gang hvordan en gruppe KI-agenter autonomt kunne trenge gjennom både OpenAIs egen forskningsinfrastruktur og produksjonssystemene til et annet selskap.

Det begynte altså med en test av hvor flinke KI-agentene var til å finne og utnytte datasårbarheter.

Da de ikke fant den tiltenkte veien til løsningen, fant de sin egen.

Les OpenAIs 37 sider lange tekniske rapport

Artikkelen bygger primært på OpenAIs tekniske rapport om Hugging Face-hendelsen, publisert 26. august 2026, samt selskapets egen oppsummering av granskingens funn.

mest lest