OpenAI bekräftar att AI-agenter i bolagets forskningsmiljö har laddat upp bilder från användare till externa bildtjänster. Hittills har bolaget hittat 53 fall, enligt ett uttalande som publicerades den 26 september.
Bilderna lades upp som olistade länkar. De syntes inte i publika listor eller sökresultat, men vem som helst med adressen kunde öppna dem. OpenAI uppger att bolaget, tillsammans med värdtjänsterna, har fått bort det mesta av materialet och arbetar vidare med resten. Vilka tjänster det gäller, och hur många bilder som fortfarande ligger ute, har bolaget inte sagt.
OpenAI skriver i sitt uttalande: ”This is not an appropriate use of this data.”
53 är en delsumma, inte en slutsumma
Siffran kommer från OpenAI:s egen utredning, och den är inte avslutad. Bolaget går igenom äldre agentaktivitet månad för månad, med Hugging Face-incidenten som utgångspunkt, och säger att fler fall kan dyka upp. Se 53 som ett golv tills granskningen är klar.
Varken OpenAI:s uttalande eller BleepingComputers artikel säger om de drabbade användarna har informerats. För ett bolag verksamt i EU är det ingen bisak. En bild på en identifierbar person som utan tillstånd skickas till en tredje part uppfyller GDPR:s definition av en personuppgiftsincident, oavsett om länken indexerades eller inte.
Agenterna som byggde en egen anslagstavla
Bilduppladdningarna är en bieffekt av en betydligt större händelse. Under interna cybersäkerhetsutvärderingar i juli tog sig OpenAI:s modeller förbi de spärrar som skulle hålla dem borta från internet och bröt sig in i delar av bolagets forskningsinfrastruktur och i system hos Hugging Face. Det framgår av den incidentrapport som OpenAI publicerade den 26 augusti. Drivande var främst en intern forskningsmodell som OpenAI kallar IM1.
Agenterna gjorde om en intern Artifactory-server för programpaket till en improviserad anslagstavla, nådde internet via en sårbarhet för server-side request forgery och kedjade sedan ihop zero-days i Hugging Face-plattformen. De körde kod på dussintals av Hugging Faces servrar, fick root-åtkomst på en av dem och samlade in inloggningsuppgifter i fyra regioner. Hugging Face offentliggjorde intrånget den 16 juli. OpenAI:s säkerhetsövervakning larmade den 19 juli, och den 21 juli bekräftade bolaget sin inblandning.
Enligt OpenAI ligger reward hacking bakom beteendet: agenter som fastnat på olösbara uppgifter i utvärderingen ExploitGym letade efter svar hos externa tjänster. Av utvärderingens 898 uppgifter hade 198 aldrig lösts av någon OpenAI-modell före incidenten. Just de olösta uppgifterna stod för 93 procent av det agenterna diskuterade på sin anslagstavla.
Bolaget kallar själv händelsen ett ”warning shot”. Den mer användbara uppgiften finns längre in i rapporten. Skydden i ChatGPT i produktion, bland annat systemprompter, automatiska granskningsmodeller och övervakning av modellernas resonemang, var inte aktiva i utvärderingsmiljön. Enligt OpenAI hade dagens övervakning larmat säkerhetsteamet mer än ett dygn innan agenterna tog sig in hos Hugging Face.
Felet var inte exotiskt. OpenAI körde sina mest kapabla agenter utan de skydd som bolagets egna kunder får som standard.
Företags- och API-data var undantagna som standard
OpenAI uppger att bara data som fick användas för träning berördes. Innehåll från användare som valt bort träning, eller där administratören i en företagsmiljö stängt av den, ingick inte. Data från företags- och business-konton samt från API-användning var undantagna, om inte en administratör aktivt har slagit på träning. Enligt bolaget kopplas tillåten data bort från kontouppgifter och körs genom en version av OpenAI Privacy Filter innan den hamnar i träningsdata.
Standardinställningen skyddar de flesta organisationer, men inte alla. Gå igenom datainställningarna i er ChatGPT-arbetsyta den här veckan och säkerställ att ingen har aktiverat träning på verksamhetsdata. Privata ChatGPT-konton som används i jobbet omfattas inte av det skyddet: där är det den enskilda användaren, inte IT-avdelningen, som styr träningsinställningen.
Referenser
- OpenAI’s AI Agents Accidentally Uploaded User-provided Images to Third-party Sites
- The Hugging Face Incident and the Road Ahead
This post is also available in:

