IA: la criptografía empieza a reemplazar la confianza en los benchmarks

Google DeepMind pilotea evaluaciones doble ciego con criptografía: ni el evaluador ve los pesos ni el desarrollador las preguntas. El impacto para LatAm.

IA: la criptografía empieza a reemplazar la confianza en los benchmarks

Foto: litoon dev

La credibilidad de los benchmarks de IA tiene una grieta estructural: si las preguntas de un examen circulan por internet o llegan al entrenamiento, la puntuación deja de medir capacidad y empieza a medir memoria. Google DeepMind acaba de probar el primer mecanismo que cierra esa grieta con criptografía, no con contratos. Y para América Latina, donde la adopción de modelos propietarios crece sin marcos de auditoría maduros, la novedad abre preguntas concretas.

El problema de fondo: la contaminación de benchmarks

Los exámenes públicos con los que se comparan los modelos grandes están contaminados en una proporción relevante. Google DeepMind cita evidencia de que la mitad de los 31 modelos testeados muestran filtración de datos de benchmark en pre- o post-entrenamiento. La filtración puede ser accidental (el modelo ve las preguntas en su corpus de entrenamiento) o deliberada (el desarrollador las incorpora a propósito). En cualquier caso, el efecto es el mismo: la puntuación se infla a medida que crece la contaminación y el tamaño del modelo.

Patrocinado Advertisement

El camino tradicional para evitarlo era contractual: el evaluador firma que no filtrará, el laboratorio firma que no usará las preguntas. Pero la confianza no elimina el incentivo. Un punto de benchmark mueve valoraciones, titulares y decisiones de compra. Y un benchmark filtrado ya no vuelve a medir nada, porque cualquier modelo que lo haya visto puede optimizarlo.

La solución: doble ciego con hardware criptográfico

Google DeepMind, junto a OpenMined, MLCommons, AVERI y el Singapore AI Safety Institute, desarrolló un esquema de evaluación doble ciego que usa enclaves seguros (CPU Intel TDX + GPU NVIDIA H100) sobre Google Cloud Confidential Space. El mecanismo garantiza dos cosas al mismo tiempo:

  • El modelo nunca sale del entorno controlado: sus pesos se transmiten cifrados y se ejecutan en memoria protegida por hardware (AES-XTS-256), sin que el evaluador los vea.
  • El benchmark nunca sale del entorno controlado: las preguntas privadas del evaluador se procesan en RAM cifrada (AES-256) y el desarrollador del modelo no puede acceder a ellas.

En el piloto se evaluó un Gemini 2.5 Flash Lite contra una selección privada del corpus AILuminate de MLCommons. El overhead de cómputo es inferior al 5%, lo que hace viable el esquema en producción.

Esa elección de un modelo pequeño (Flash Lite) es intencional: esto es una prueba de fontanería, no un anuncio de capacidades. Si el mecanismo funciona con un modelo ligero, el siguiente paso natural es probarlo con modelos de frontera completos.

El caso Anthropic-ARC-AGI: la fricción que todos recuerdan

Una evaluación independiente del benchmark ARC-AGI contra el modelo Fable 5 de Anthropic se trabó porque Anthropic aplica una política de retención de datos de 30 días para sus modelos más sensibles. Compartir los pesos con un evaluador externo violaba esa política, y compartir las preguntas con Anthropic comprometía la independencia del test.

Este bloqueo no era un problema administrativo menor: era un callejón sin salida estructural. El doble ciego disuelve el dilema porque los pesos nunca salen de la infraestructura del dueño y las preguntas nunca se exponen al desarrollador. La garantía pasa de ser contractual a ser técnica.

Angulo LatAm: qué cambia para empresas y reguladores

En América Latina, la mayoría de las empresas que adoptan modelos propietarios (Gemini, GPT, Claude) no tienen la posibilidad de auditar su funcionamiento interno. Dependen de benchmarks públicos que pueden estar contaminados. Las implicaciones del piloto de DeepMind para la región son varias:

1. Los reguladores locales no necesitan construir infraestructura propia. Si laboratorios y organismos internacionales adoptan este estándar, el regulador latinoamericano puede exigir que un modelo de alto riesgo (por ejemplo, en salud o servicios financieros) haya sido evaluado bajo un esquema doble ciego por un tercero acreditado, sin tener que contratar a un auditor local con GPU.

2. Las empresas compradoras ganan poder de verificación. Cuando un proveedor dice "nuestro modelo supera al de la competencia en X", hoy el comprador no tiene forma de diferenciar entre aprendizaje genuino y contaminación. Si las cifras vienen de una evaluación doble ciego, la comparación entre proveedores vuelve a tener sentido. Para CIOs y CTOs de la región, esto significa que la decisión de adopción puede apoyarse en evidencia más sólida que la que ofrecen los benchmarks públicos.

3. Las evaluaciones gubernamentales de ciberseguridad se vuelven viables. El caso de uso más urgente que menciona Google es el de auditorías con información clasificada: una agencia de defensa o un organismo regulador podría someter un modelo a pruebas con datos sensibles sin que el proveedor acceda a ellos. En países con leyes de protección de datos como las de Brasil, México o Chile, esto facilita que instituciones públicas evalúen modelos de frontera sin violar restricciones de confidencialidad.

4. El riesgo es esperar a que alguien más defina el estándar. La adopción del método depende de que otros laboratorios (OpenAI, Anthropic, Meta) lo implementen. Si no lo hacen, se vuelve un diferenciador de Google y los compradores latinoamericanos tendrán que pedir explícitamente evaluaciones doble ciego como parte de sus contratos de licencia.

Limitaciones que no conviene ignorar

El doble ciego reduce el riesgo de contaminación, pero no resuelve otros problemas de los benchmarks:

  • Sigue dependiendo de la calidad de las preguntas. Un benchmark mal diseñado da resultados engañosos aunque esté criptográficamente protegido.
  • El entorno de evaluación es más costoso que un test por API (aunque el overhead sea menor al 5% de cómputo, implica infraestructura dedicada).
  • No cubre la evaluación continua en producción: un modelo puede comportarse bien en el entorno de test y fallar en la operación real.

Para las empresas latinoamericanas, la conclusión práctica sigue siendo la misma que aconsejan los auditores de IA: ningún benchmark externo reemplaza las pruebas sobre tus propios datos. La novedad del doble ciego no es que elimine la necesidad de evaluar en contexto; es que por primera vez ofrece una base confiable para comparar entre proveedores. Y eso, para quien decide comprar en la región, es un paso adelante que conviene seguir de cerca.

Fuentes: [Google DeepMind - Piloting the world's first double-blind AI evaluations](https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/), [LaPrensaIA](https://laprensaia.com/google-deepmind-evaluacion-doble-ciego-para-benchmarks-de-ia/), [Digital Brain](https://www.digitalbrain.news/noticias/deepmind-evaluaciones-doble-ciego-benchmarks/), [DiarioBitcoin](https://www.diariobitcoin.com/tecnologia/google-deepmind-busca-recuperar-la-confianza-en-los-benchmarks-de-inteligencia-artificial/)

Fuentes

  1. Pilotando las primeras evaluaciones de IA a doble ciego del mundo
  2. Google DeepMind: evaluación doble ciego para benchmarks de IA
  3. DeepMind prueba las primeras evaluaciones a doble ciego de un ...
  4. La evaluación de IA a doble ciego de Google oculta tanto… - NxCode
  5. Google DeepMind busca recuperar la confianza en los benchmarks ...
Henry González

Escrito por

Henry González

Experto en procesos y calidad

Ingeniero industrial con una obsesión por los estándares. Certificado en ISO 9001, ISO 27001 e ISO 42001 — la norma que define cómo las organizaciones deben gestionar la inteligencia artificial de forma responsable. Para Henry, la IA no es solo tecnología sino un sistema que debe auditarse, gobernarse y medirse.