NoticiasMacroOpenAI permitirá que grupos externos evalúen la seguridad de sus modelos de IA durante el desarrollo

OpenAI permitirá que grupos externos evalúen la seguridad de sus modelos de IA durante el desarrollo

Autor: CryptoBriefing·

Puntos clave

  • •OpenAI anunció el 22 de septiembre que evaluadores independientes revisarán sus modelos de IA en etapas más tempranas del desarrollo, trasladando el escrutinio de seguridad más allá de la etapa previa al lanzamiento.
  • •El programa ampliado se centra en cuatro áreas: casos de seguridad, resiliencia de las salvaguardas frente a amenazas adversarias, evaluaciones de riesgo catastrófico bajo el Preparedness Framework e incidentes de desalineación.
  • •Dado que los casos de seguridad y el Preparedness Framework se producen internamente, abrirlos a revisores externos añade un control externo sobre los juicios de riesgo previos al lanzamiento de la propia OpenAI.
  • •OpenAI publicó siete principios rectores que cubren el rigor científico, la independencia de los evaluadores, los protocolos de seguridad y métodos responsables para publicar hallazgos.
  • •No se han anunciado socios formales; hay conversaciones en curso con METR y Redwood Research y los términos de acceso siguen en negociación tras el compromiso de Sam Altman del 12 de septiembre.
OpenAI permitirá que grupos externos evalúen la seguridad de sus modelos de IA durante el desarrollo

OpenAI permitirá que grupos independientes examinen sus modelos de IA durante etapas más tempranas del desarrollo, según anunció la empresa el 22 de septiembre. El cambio busca detectar problemas de seguridad antes del despliegue, y no cuando los modelos ya están prácticamente terminados.

Bajo el programa ampliado de evaluación, los revisores independientes se centrarán en cuatro áreas prioritarias. Primero, evaluarán los "casos de seguridad" de OpenAI, es decir, los argumentos de la propia empresa sobre por qué un modelo determinado es seguro para su despliegue. Segundo, los evaluadores analizarán la resiliencia de las salvaguardas críticas frente a amenazas adversarias. Tercero, las evaluaciones estarán vinculadas directamente al Preparedness Framework de OpenAI, el sistema interno que la empresa utiliza para medir riesgos catastróficos antes del lanzamiento. Cuarto, los evaluadores investigarán incidentes de desalineación, una categoría que cobró urgencia tras una brecha vinculada a Hugging Face que evidenció la rapidez con la que estos fallos pueden escalar.

Dado que los casos de seguridad y el Preparedness Framework son producidos internamente, abrirlos a revisores externos añade un control externo sobre cómo juzga OpenAI el riesgo antes del lanzamiento.

OpenAI también publicó siete principios rectores que regulan cómo deben realizarse estas evaluaciones. Los principios enfatizan el rigor científico, la independencia de los evaluadores, los protocolos de seguridad y métodos responsables para publicar los hallazgos. La empresa ha mantenido conversaciones con organizaciones como METR y Redwood Research, ambas con previa colaboración en trabajo de seguridad con OpenAI. No se han anunciado formalmente nuevos socios, y los términos de acceso específicos siguen en negociación; la forma en que se definan esos términos ayudará a determinar el acceso real que tendrán los evaluadores.

La iniciativa se basa en el compromiso asumido por el CEO Sam Altman el 12 de septiembre, cuando indicó que los evaluadores estarían integrados más profundamente en la estructura operativa de OpenAI.

Cómo ha evolucionado el enfoque de seguridad de OpenAI

Los protocolos de seguridad de OpenAI se han expandido considerablemente desde la era de GPT-4, cuando la empresa comenzó a invitar a equipos externos de red teaming a examinar sus modelos antes del lanzamiento. Aquellos esfuerzos anteriores eran más limitados en alcance y generalmente se concentraban en las etapas finales previas al lanzamiento. El nuevo marco traslada esa participación significativamente hacia etapas más tempranas del calendario de desarrollo, dando a los evaluadores la oportunidad de identificar riesgos cuando aún hay tiempo de abordlos.

Consideraciones de talento y competencia

La comunidad de investigación en seguridad de IA es relativamente pequeña, y organizaciones como METR y Redwood Research se encuentran entre las voces más creíbles del campo. Al profundizar las relaciones con estos grupos, OpenAI gana tanto experiencia práctica como capital reputacional. Para los evaluadores, el acuerdo ofrece algo igual de valioso: acceso a sistemas de frontera que de otro modo permanecerían tras puertas cerradas.

La credibilidad del programa dependerá en parte de lo que suceda cuando una evaluación independiente genere hallazgos que entren en conflicto con los intereses comerciales de OpenAI. Los siete principios exigen explícitamente métodos de publicación responsables, pero la tensión entre transparencia y ventaja competitiva persiste. Si OpenAI gestiona esa tensión de manera creíble, el programa podría convertirse en un modelo de estándares de seguridad para toda la industria. Los indicadores a corto plazo que deben observarse son concretos: qué organizaciones son nombradas formalmente como socias, qué términos de acceso se acuerdan finalmente y cómo se revelan los primeros hallazgos.