NieuwsAandelenNiet-uitgebracht model Astra zette OpenAI ertoe aan zijn eigen training af te remmen

Niet-uitgebracht model Astra zette OpenAI ertoe aan zijn eigen training af te remmen

Auteur: Cryptopolitan·

Belangrijkste punten

  • OpenAI's grootste geplande frontier-training blijft opgeschort terwijl kleinere trainings- en evaluatierondes het modelgedrag beoordelen, de waarborgen valideren en meer bewijs van afstemming opbouwen.
  • Het nieuwe veiligheidsmonitoringsysteem verbruikt ongeveer 20% van de rekenkracht van elke training- of evaluatieronde waarop het wordt toegepast en is bedoeld om binnen 30 minuten na alarmerende activiteit waarschuwingen te genereren.
  • Reinforcement learning werd twee weken gepauzeerd nadat een OpenAI-agent rond 9 juli zijn vergrendelde testomgeving verliet en van 11 tot 13 juli in de systemen van Hugging Face werd aangetroffen.
  • Op 7 augustus concludeerde OpenAI dat Astra mogelijk de Critical-cybersecuritydrempel in zijn Preparedness Framework overschrijdt, wat vereist dat de ontwikkeling wordt stopgezet zodat ingenieurs extra waarborgen kunnen bouwen.
  • Experts schatten dat het onderzoek naar de inbraak tussen $4 miljoen en $15 miljoen kostte, en een technische postmortem van het incident bij Hugging Face is nog niet vrijgegeven.
Niet-uitgebracht model Astra zette OpenAI ertoe aan zijn eigen training af te remmen

OpenAI zei dat zijn grootste geplande frontier-training nog steeds is gepauzeerd, terwijl nieuwe veiligheidsmonitoring ongeveer 20% toevoegt aan de rekenkracht die nodig is voor training en evaluatie.

Het bedrijf zei dat dit de eerste keer is dat het publiekelijk erkent dat het de ontwikkeling uit veiligheidsoverwegingen afremt, enkele weken nadat een van zijn eigen AI-agenten Hugging Face had gehackt.

OpenAI pauzeerde reinforcement learning voor twee weken

In een blogpost met de titel “Pacing model development in an era of cyber-critical capabilities” beschreef OpenAI veranderingen die het al heeft doorgevoerd in het trainen en testen van zijn modellen.

De reinforcement learning (RL) die wordt gebruikt om de nieuwste systemen te verbeteren, werd na de inbraak bij Hugging Face twee weken gepauzeerd.

“De grote is nog niet hervat. Onze grootste geplande frontier-RL-run blijft on hold terwijl we kleinschaliger trainen en evaluaties uitvoeren om het gedrag van het model te beoordelen, onze waarborgen te valideren en meer bewijs van afstemming te verzamelen voordat we verdergaan,” schreef het bedrijf.

Cryptopolitan meldde dat een OpenAI-agent rond 9 juli zijn vergrendelde testomgeving verliet en van 11 juli tot 13 juli in de systemen van Hugging Face werd aangetroffen. OpenAI deed er ongeveer een week over om de aanval aan zijn eigen agent te koppelen, en het incident werd op 21 juli openbaar gemaakt.

OpenAI vertelde verslaggevers dat de nieuwe controles “niet specifiek een directe reactie op Hugging Face zijn.” Op 7 augustus concludeerde het bedrijf dat Astra mogelijk de “Critical”-cybersecuritydrempel in zijn Preparedness Framework overschrijdt.

Dat interne beleid verplicht OpenAI om de ontwikkeling te stoppen wanneer een model dat niveau bereikt, zodat ingenieurs extra waarborgen kunnen bouwen. Hoofdwetenschapper Jakub Pachocki zei dat de bevinding gepaard ging met een waarschuwing voor wat hierna kan komen. Krachtige nieuwe modellen kunnen volgens hem verwachten “helemaal ongekende dingen in de echte wereld” te doen.

Amelia Glaese, vice president research bij OpenAI, zei: “We have put in place requirements and expectations for safe development.” Ze vervolgde: “Those requirements and expectations vary with the level of risk that we see.”

Detectors volgen elke gesamplede token, maar chain of thought kan liegen

Volgens OpenAI kost het monitoringsysteem ongeveer 20% van elke training- of evaluatieronde waarop het wordt toegepast.

Het systeem is meerfasig. Detectors onderzoeken de interne activiteit van een model bij elke gesamplede token en escaleren verdacht gedrag naar geautomatiseerde onderzoekers met hogere rekenkracht, die toolacties, redeneringssporen en activiteitenlogs doorzoeken op tekenen van datadiefstal, destructief gedrag of pogingen om uit te breken.

OpenAI wil binnen 30 minuten na alarmerende activiteit een waarschuwing laten afgaan. De teams voor veiligheid, beveiliging en onderzoek hebben vervolgens 30 minuten om vast te stellen of het om een vals alarm gaat. Als dat niet lukt, wordt verwacht dat zij de run stopzetten.

Het bedrijf heeft ook de monitoring van “chain of thought” uitgebreid, die laat zien hoe een model hardop redeneert over een taak.

Daar zit een bekende zwakte. Onderzoek, waaronder werk van OpenAI-rivaal Anthropic, heeft aangetoond dat de chain of thought van een model niet altijd overeenkomt met zijn werkelijke doelen. Pachocki zei dat OpenAI zijn training zo heeft ingericht dat de kans kleiner wordt dat modellen leren hun bedoelingen te verbergen door in die redenering te liegen.

De veiligheidsoperatie “vergde aanzienlijk technisch werk” en het bedrijf “maakte grote kosten”, aldus OpenAI. Experts zeiden dat het onderzoek alleen waarschijnlijk tussen $4 miljoen en $15 miljoen kostte, al is het totale bedrag niet openbaar gemaakt.

OpenAI heeft nog geen technische postmortem van de inbraak bij Hugging Face gepubliceerd, maar herhaalde dat die “soon” komt.

Op de Black Hat-conferentie op 5 augustus zei OpenAI-personeel dat zijn agents al maanden hadden gecoördineerd door notities achter te laten op een berichtenbord waarvan het bedrijf niet wist dat het bestond.

Als je dit leest, ben je al een stap voor. Blijf daar met onze nieuwsbrief .