AAAI panel dice que benchmarks como MMLU fallan por la ley de Goodhart

El panel presidencial de AAAI y expertos en seguridad advierten que los benchmarks actuales fallan por la ley de Goodhart. Piden evaluación en cuatro dimensiones y programas de divulgación de fallos tipo bug bounty con salvaguardas legales.

AAAI panel dice que benchmarks como MMLU fallan por la ley de Goodhart

Foto: Werner Pfennig

La evaluación de la inteligencia artificial ha entrado en una crisis de credibilidad. Los benchmarks que la industria usa como estándar de oro —MMLU, HumanEval, GPQA— están dejando de medir lo que importa. El panel presidencial de AAAI, publicado en marzo de 2025 bajo la dirección de Francesca Rossi, lo resume en una frase: la ley de Goodhart ha colonizado la evaluación. Cuando una métrica se convierte en objetivo, deja de ser buena métrica AAAI Presidential Panel.

El problema no es técnico, es estructural

Las pruebas de software tradicionales asumen determinismo: misma entrada, misma salida. Los sistemas de IA, en cambio, son probabilísticos, no deterministas, y su comportamiento cambia tras el despliegue. Dawn Song (UC Berkeley), Sara Hooker y Karen Myers (SRI International) coinciden en que cuatro dimensiones faltan en la práctica actual: capacidad, usabilidad, desempeño humano-sistema y cumplimiento legal-ético. Ningún benchmark único las cubre AAAI Presidential Panel.

Patrocinado Advertisement

El informe completo de AAAI, basado en 475 respuestas de investigadores (67 % academia, 19 % corporativo, 53 % Norteamérica, 20 % Asia, 19 % Europa), subraya que la velocidad de publicación supera la capacidad de revisión por pares y que la línea entre capacidad real y percepción mediática se difumina AAAI 2025 Report.

La evaluación interna no alcanza

Un trabajo de 30 autores —incluyendo a Dawn Song, Percy Liang, Arvind Narayanan y investigadores de Google, Microsoft, Hugging Face, HackerOne y Bugcrowd— argumenta que la evaluación de primera parte (interna) y segunda parte (contratada) es necesaria pero insuficiente. La evaluación de tercera parte, independiente, aporta escala, diversidad de perspectivas e independencia frente a conflictos de interés arXiv:2503.16861.

Los autores documentan que los fallos —jailbreaks, alucinaciones, sesgos, generación de material ilegal— se transfieren entre proveedores. Sin infraestructura coordinada, los investigadores reportan ad hoc, a un solo actor, o directamente en redes sociales. El modelo de divulgación coordinada de vulnerabilidades (CVD) y los bug bounties de seguridad informática ofrecen un camino probado: reportes estandarizados, reglas de juego claras, salvaguardas legales (safe harbor) y un centro de coordinación que enruta el reporte a toda la cadena de suministro —proveedores de datos, desarrolladores, desplegadores, plataformas, usuarios empresariales, agencias gubernamentales y el público arXiv:2503.16861.

Tres intervenciones concretas

1. Reportes de fallo estandarizados y reglas de conducta: plantilla común, ejemplos y definición operativa de "investigación de buena fe" adaptada de seguridad informática. 2. Programas de divulgación de fallos con safe harbor: los proveedores deben eximir términos de servicio restrictivos, definir alcance amplio y habilitar acceso más profundo a investigadores que cumplen las reglas. 3. Coordinación multi-stakeholder: un centro de coordinación que distribuya reportes a todos los afectados, dado que un fallo en un modelo base impacta a decenas de aplicaciones downstream arXiv:2503.16861.

Qué significa para América Latina

Las empresas de la región adoptan modelos fundacionales vía API o despliegan versiones abiertas (Llama, Nemotron, Qwen) sobre infraestructura cloud. Pocos equipos locales tienen capacidad de red-teaming riguroso. La dependencia de benchmarks públicos crea ceguera: un modelo que brilla en MMLU puede fallar en español rioplatense, en cumplimiento de la LGPD brasileña o en la ley de protección de datos chilena.

La ausencia de safe harbor legal en la mayoría de países latinoamericanos disuade a investigadores independientes de reportar fallos. Un banco en México o una healthtech en Colombia que integra un LLM no tiene canal estandarizado para recibir alertas de terceros. La regulación emergente —proyecto de ley de IA en Brasil, estrategia nacional en Chile, discusiones en México— debería incorporar obligaciones de programas de divulgación de fallos para proveedores de alto riesgo, inspirados en el modelo CVD.

Mientras tanto, la única defensa operativa es exigir a proveedores evidencia de evaluación en las cuatro dimensiones que propone AAAI y contratar auditorías de tercera parte que midan usabilidad, desempeño humano-sistema y cumplimiento normativo local, no solo accuracy en benchmarks en inglés.

La evaluación deja de ser un checkpoint previo al lanzamiento para convertirse en infraestructura continua de gobernanza.

Fuentes

  1. Panel presidencial de AAAI – evaluación de IA
  2. Panel presidencial de AAAI sobre evaluación de IA - YouTube
  3. Panel presidencial de AAAI 2025 sobre el futuro de la investigación en IA - AAAI
  4. La evaluación interna no es suficiente: hacia una divulgación sólida de fallos por terceros para la IA de propósito general
  5. Informes de los talleres celebrados en la Conferencia AAAI 2026 sobre Inteligencia Artificial
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.