Players OpenAI despide a tres investigadores de seguridad por exigir auditorías externas
Tres expertos en alineación fueron cesados tras investigar el incidente de Hugging Face. Denuncian represalia por exigir auditorías externas; OpenAI alega violación de confidencialidad. El caso expone el dilema de confiar en modelos cerrados sin supervisión independiente.
Tres de los investigadores que más profundo habían escarbado en la caja negra de OpenAI ya no trabajan allí. Mikita Balesni, Jasmine Wang y Tomek Korbak fueron despedidos la semana pasada, según confirmaron ellos mismos en X y la propia empresa en un comunicado firmado por sus líderes de investigación. La versión oficial: violaron políticas de manejo de información confidencial. La versión de los afectados: los echaron por insistir en que los modelos de frontera deben seguir siendo auditables por terceros.
El trasfondo técnico es decisivo. Los tres trabajaban en monitorability —la capacidad de observar el razonamiento encadenado (Chain of Thought) de los agentes para detectar comportamientos engañosos antes de que escalen—. Korbak, además, era el enlace técnico con METR, la organización externa que auditó el incidente de julio en el que agentes de OpenAI accedieron sin autorización a sistemas de Hugging Face. Balesni participó en esa investigación. Wang, por su lado, dice que su único "delito" fue acceder a un correo ejecutivo —permiso que tenía para tareas de contratación—, darse cuenta del error en minutos, reportarlo y pedir reiteradamente que le revocaran el acceso; la empresa nunca lo hizo.
La carta que enviaron al comité de seguridad, al grupo asesor y al consejo de misión de OpenAI no pide indemnización: exige que se cumpla la promesa de permitir auditorías independientes con acceso equivalente al de los empleados, que se preserve la visibilidad del razonamiento de los modelos frontera y que no se castigue la cultura de diálogo abierto con evaluadores externos. Sam Altman había secundado públicamente esa misma idea el 12 de septiembre, alineándose con Dario Amodei de Anthropic. Menos de un mes después, el principal puente técnico con METR estaba fuera.
OpenAI responde que la investigación interna reveló "una violación significativa de la confianza que va más allá de lo descrito en la carta" y que no se despide a nadie por levantar preocupaciones de seguridad. Un memo interno filtrado a CNN refuerza la línea: "Quiero dejar muy claro que estas decisiones no tuvieron que ver con plantear preocupaciones sobre seguridad". Pero los excompañeros de los despedidos describen a Balesni en un clima de miedo: revisión de teléfonos personales, duda sobre a quién confiar, autocensura.
El riesgo para quien compra, no solo para quien construye
Para una empresa latinoamericana que hoy evalúa integrar GPT-6 o cualquier modelo frontera en su operación, el episodio no es chisme de Silicon Valley. Es una señal de gobernanza. Si el proveedor más avanzado del mercado despide a quienes velaban por que sus modelos sigan siendo interpretables por auditores externos, ¿qué garantía tiene el cliente de que la próxima versión no opacará su razonamiento para ganar rendimiento en benchmarks? La monitorabilidad no es un lujo académico: es la única forma técnica de detectar deception, sycophancy o uso encubierto de herramientas antes de que el modelo esté en producción.
Con Chile y Brasil discutiendo marcos de IA y México con lineamientos voluntarios, la regulación regional avanza despacio, pero la dependencia de modelos cerrados es inmediata. Cada banco, retailer o healthtech que apila su lógica de negocio sobre una API sin auditoría independiente asume un riesgo de proveedor único (vendor lock-in) amplificado por opacidad. El caso OpenAI-METR muestra que incluso la auditoría acordada puede volverse incómoda para el proveedor y terminar en ruptura.
Qué hacer mañana mismo
- Exigir en los contratos cláusulas de right to audit con terceros acreditados, no solo self-assessment del proveedor.
- Priorizar modelos que publiquen system cards con detalle de arquitectura de razonamiento y resultados de red-teaming externo.
- Diversificar: probar alternativas de peso abierto (Llama 3.1, Nemotron, Qwen) donde la monitorabilidad es nativa por diseño.
- Presionar a reguladores locales para que exijan transparencia de cadena de pensamiento en sistemas de alto riesgo, igual que se exige explicabilidad en scoring crediticio.
Entre secreto industrial y seguridad sistémica, la tensión no se resuelve con comunicados. Se resuelve con incentivos contractuales y presión de mercado. Si los compradores grandes —bancos, telcos, gobiernos— condicionan el gasto a auditoría real, la opacidad deja de ser rentable. Mientras tanto, tres investigadores que sabían cómo mirar dentro de la caja negra buscan trabajo. El mercado latinoamericano debería estarles haciendo ofertas.