NoticiasAccionesGoogle DeepMind pone en marcha las primeras evaluaciones de doble ciego de modelos de IA del mundo

Google DeepMind pone en marcha las primeras evaluaciones de doble ciego de modelos de IA del mundo

Autor: Google DeepMind Blog·

Puntos clave

  • El piloto utiliza Confidential Space de Google Cloud para impedir que cualquiera de las partes vea los datos confidenciales de la otra durante las pruebas.
  • Google afirma que la configuración ayuda a reducir la contaminación de benchmarks, en la que la exposición previa a las preguntas de la prueba puede inflar las puntuaciones del modelo.
  • La evaluación se lleva a cabo junto con el Singapore AI Safety Institute, OpenMined, AVERI y MLCommons.
  • Google afirma que el método es especialmente relevante para evaluaciones de alto riesgo en áreas como la ciberseguridad y el uso gubernamental.
  • La empresa presenta la iniciativa como un paso hacia una supervisión de modelos de IA más confiable y de mayor aceptación.
Google DeepMind pone en marcha las primeras evaluaciones de doble ciego de modelos de IA del mundo

Por William Isaac, Sol Messing y Kristian Lum

Google DeepMind ha presentado la primera evaluación de doble ciego del mundo de un modelo de IA propietario de clase frontera, un enfoque que mantiene las evaluaciones externas confinadas en una “caja” criptográfica donde no pueden ser utilizadas posteriormente por los modelos para optimizar su desempeño antes de las pruebas.

La iniciativa busca generar confianza en los benchmarks de modelos propietarios mediante entornos criptográficamente seguros. Piense en un estudiante que está por presentar un examen de alto riesgo: si el estudiante echa un vistazo a las preguntas del examen por adelantado, una calificación perfecta queda influenciada por ese conocimiento y se convierte en un logro sin sentido. Para medir verdaderamente lo que sabe, el estudiante no debe tener ninguna visibilidad de las preguntas hasta que llegue el momento de presentar el examen.

Ese es exactamente el desafío que enfrenta la industria al evaluar modelos avanzados de IA. Si un modelo ya ha visto las preguntas de la prueba —un problema conocido como contaminación de benchmarks—, los resultados solo pueden confiarse hasta cierto punto. La preocupación está bien documentada en la literatura de investigación, donde estudios han encontrado que conjuntos de pruebas de benchmarks públicos se filtran en los corpus de escala web utilizados para entrenar modelos grandes, lo que ha llevado a los mantenedores de conjuntos de datos a agregar herramientas como las cadenas canario (canary strings), que permiten a los desarrolladores detectar si un benchmark apareció en los datos de entrenamiento.

El piloto se lleva a cabo en colaboración con el Singapore AI Safety Institute, OpenMined, AVERI y MLCommons. Juntos, los socios pondrán a prueba un modelo Gemini Flash Lite contra benchmarks confidenciales en un entorno que preserva la privacidad, aumentando la integridad de la evaluación.

Google afirma que evalúa sus sistemas de IA mediante un amplio espectro de evaluaciones a lo largo del desarrollo y el despliegue de sus modelos, pero no depende únicamente de las pruebas internas. Para identificar posibles puntos ciegos, la empresa trabaja con un grupo diverso de socios externos —incluidos laboratorios de investigación especializados, la sociedad civil y los Institutos Nacionales de Seguridad y Protección de la IA (AISI, por sus siglas en inglés)—, aprovechando su experiencia única para someter sus modelos a pruebas de estrés. Los AISI son en sí mismos un desarrollo institucional reciente: a finales de 2024, los institutos de seguridad de la IA de gobiernos como Estados Unidos, el Reino Unido, Japón, Singapur, Corea del Sur y la Unión Europea formaron una red internacional para coordinar la evaluación de sistemas avanzados de IA.

A medida que los modelos de IA se vuelven más capaces, garantizar que un modelo no haya visto previamente las preguntas o los prompts de la prueba es fundamental, ya que la exposición previa puede sesgar los resultados. Los responsables de políticas públicas, los investigadores y las empresas necesitan confiar en que los benchmarks de IA reflejen con precisión las capacidades reales y la seguridad de un modelo, pero si los modelos pueden “asomarse” a las preguntas de evaluación por adelantado, las puntuaciones pueden inflarse artificialmente y esa confianza puede verse socavada.

Aunque los protocolos de registro cero (zero-logging) y las estrictas salvaguardas contractuales han mantenido durante mucho tiempo la confidencialidad de los prompts de pruebas externas, la incorporación de salvaguardas técnicas y criptográficas representa un gran paso adelante en la evaluación segura de modelos.

Cómo funcionan las evaluaciones de doble ciego

Históricamente, las evaluaciones externas de alto riesgo exigían una concesión. O bien los evaluadores entregaban sus prompts de prueba, con el riesgo de que el proveedor del modelo viera las preguntas por adelantado, o bien el proveedor del modelo entregaba sus pesos del modelo, con el riesgo de exponer su propiedad intelectual.

Las evaluaciones de doble ciego eliminan este compromiso. Mediante el uso de Confidential Space, dentro del portafolio de Confidential Computing de Google Cloud, ambas partes pueden verificar criptográficamente que los datos de evaluación externos y el modelo propietario permanecen privados para sus respectivos dueños. El evaluador no puede ver los pesos del modelo Gemini, y Google no puede ver los prompts de prueba del evaluador. La computación confidencial es en sí misma una tecnología consolidada: se basa en entornos de ejecución confiables basados en hardware que mantienen los datos cifrados incluso mientras se procesan, un enfoque ya utilizado en sectores regulados como la salud y las finanzas.

Un enfoque novedoso para generar confianza en las evaluaciones de modelos

Esta evidencia criptográfica ayuda a prevenir la contaminación de benchmarks y protege los datos sensibles. A medida que los modelos se vuelven más capaces, esto cobra especial importancia en evaluaciones de alta sensibilidad, como las utilizadas en ciberseguridad o por organismos gubernamentales. Las evaluaciones de doble ciego permiten que organizaciones independientes prueben rigurosamente modelos avanzados sin comprometer la soberanía de los datos ni la seguridad.

Google espera que este piloto establezca una nueva frontera para la supervisión de modelos, ayudando a la industria en general a construir sistemas de IA más seguros, más confiables y de amplia aceptación. Hay más detalles sobre la metodología y los hallazgos disponibles en el informe técnico.