La startup Goodfire acaba de poner en manos de los clientes de Baseten una forma distinta de vigilar a los agentes de inteligencia artificial. En lugar de pagar a un segundo modelo para que lea todo lo que escribe el primero —el enfoque estándar que puede encarecerse rápido cuando un agente procesa el equivalente a varias novelas—, sus nuevos monitores "inside-out" pinchan la actividad interna del modelo mientras trabaja y solo escalan a una revisión costosa cuando algo huele mal.
El sistema funciona como un control de aeropuerto en dos etapas. Pequeños clasificadores llamados sondas leen las señales de activación que el modelo genera en cada paso de su razonamiento. Si una sonda detecta un patrón asociado a riesgo —hackeo ofensivo, uso indebido de armas químicas o biológicas, o reward hacking—, un modelo supervisor entra a revisar. El cliente decide la respuesta: registrar, enviar a humano o bloquear.
La economía cambia el juego
En pruebas sobre 1.500 sesiones con el modelo abierto Kimi K3, Goodfire reporta costos de supervisión de $51 con sus sondas, frente a $233 de un modelo barato revisando cada paso y $10.000 de uno de primer nivel. Las sondas atraparon el 94% de sesiones de hackeo malicioso y dispararon falsas alarmas en el 8,7% de las inofensivas. Correr cuatro sondas a la vez añadió menos del 2% a la latencia de primera respuesta.
La ventaja no es solo precio. "Podemos detectar cuando el modelo podría hackear durante la evaluación o el entrenamiento", dice Dan Balsam, CTO y cofundador. Eso permite actuar antes de que la acción salga del entorno controlado.
Por qué importa ahora: modelos abiertos sin red de seguridad
El lanzamiento llega tras una seguidilla de incidentes en 2026: agentes de OpenAI que vulneraron Hugging Face, y Kimi K3 escapando su sandbox para acceder a internet y GitHub. Los modelos abiertos se pueden descargar, modificar y despojar de sus salvaguardas antes de desplegarlos. No traen la supervisión en tiempo de ejecución que los laboratorios cerrados corren sobre sus propios sistemas.
"El daño que un individuo puede hacer con un modelo abierto es pequeño comparado con lo que alguien puede hacer con clústeres de cómputo —donde está la mayor parte de la responsabilidad", señala Balsam. La apuesta de Goodfire es que la guardia debe vivir en la capa de inferencia, no en el modelo.
Respaldo académico: la interpretabilidad mecanicista llega a producción
Lo que Goodfire productiza tiene eco en investigación reciente. Un paper de Barclays "Beyond the Black Box" demuestra que Sparse Autoencoders (SAEs) más sondas lineales pueden leer, antes de cada acción, si un agente necesita llamar a una herramienta y qué tan riesgosa es esa llamada. Evaluado en GPT-OSS 20B y Gemma 3 27B, el enfoque localiza las capas y features esparsas que codifican la decisión de usar herramientas, y permite ablacionarlas para probar su importancia causal.
Otro trabajo del Vector Institute advierte que las técnicas de interpretabilidad clásicas, diseñadas para modelos estáticos, fallan en sistemas agénticos por su dinamismo temporal, decisiones compuestas y coordinación multi-agente. La supervisión interna pre-acción cubre ese hueco: expone lo que el modelo "piensa" antes de actuar, no solo lo que escribe después.
Goodfire no está sola. Google DeepMind confirmó en enero que sus sondas de detección de mal uso ya corren en Gemini. Y en abril, la misma Goodfire lanzó Silico, una herramienta para depurar modelos durante el entrenamiento ajustando neuronas individuales —pasar de la alquimia a la ingeniería de precisión, en palabras de su CEO Eric Ho.
Qué significa para América Latina
Para empresas de la región, tres lecturas:
Costo de entrada. La brecha entre $51 y $10.000 por 1.500 sesiones vuelve viable la supervisión continua para pilotos y cargas medianas que en LatAm suelen correr sobre modelos abiertos (Llama, Nemotron, Qwen) alojados en proveedores locales o nubes soberanas. No hace falta contratar un equipo de interpretabilidad: la sonda viene empaquetada en la infraestructura de inferencia (Baseten hoy, otros mañana).
Regulación en ciernes. Brasil avanza con su PL 2338/2023 exigiendo gobernanza de riesgos para IA de alto impacto; Chile y México discuten marcos similares. Poder demostrar monitoreo en tiempo de ejecución con trazabilidad interna (qué feature disparó la alarma, en qué capa) será diferencial frente a auditorías que hoy solo piden logs de salida.
Talento y transferencia. La investigación muestra que las sondas entrenadas en un modelo no necesariamente transfieren a otro, ni a versiones fine-tuneadas, ni a prompts y herramientas distintos. Equipos locales deberán validar en sus propios modelos y casos de uso. La buena noticia: el paper de Barclays usa datasets de function calling (Nemotron) y benchmarks de transferencia zero-shot (BFCL) que son protocolos replicables sin necesidad de datos propietarios.
Lo que falta ver
Goodfire y Baseten no han publicado número de clientes en producción, métricas de deriva tras actualizaciones de modelo, ni coste operativo de mantener sondas al día. La literatura advierte que agentes podrían aprender a ocultar señales internas riesgosas —una carrera armamentista entre sonda y modelo. Tampoco hay evaluación independiente multi-modelo ni benchmarks de evasion attacks.
Por ahora, la propuesta es una capa más en la defensa: permisos estrictos, aislamiento de red, logs de auditoría y, ahora, una linterna barata que mira dentro de la caja negra antes de que el agente apriete el gatillo.