Anthropic abre la caja negra de Claude, pero la interpretabilidad sigue siendo un espejismo

Anthropic descubrió un espacio interno en Claude donde aparecen conceptos antes de escribirlos. Sin embargo, un estudio académico advierte que muchos métodos de interpretabilidad producen falsos positivos incluso en modelos aleatorios. ¿Qué significa esto para las empresas que confían en la IA?

Anthropic abre la caja negra de Claude, pero la interpretabilidad sigue siendo un espejismo

Foto: Galina Nelyubova

Anthropic anunció que ha identificado dentro de Claude un espacio interno de activaciones —al que llamó J-space— donde el modelo representa conceptos antes de que aparezcan en la respuesta final. Según la compañía, este espacio no fue diseñado explícitamente, sino que emergió durante el entrenamiento. Al intervenir sobre esas representaciones, los investigadores lograron alterar respuestas: por ejemplo, cambiaron "Soccer" por "Rugby" y Claude terminó diciendo rugby. También encontraron que, cuando Claude recibe la instrucción de no pensar en algo, en el J-space aparece el concepto indeseado acompañado de palabras como "damn" y "failure". Anthropic vinculó este hallazgo con el concepto neurocientífico de acceso consciente, aunque aclaró que no demuestra que Claude tenga experiencias subjetivas.

Sin embargo, este descubrimiento ocurre en un momento en que la propia disciplina de la interpretabilidad enfrenta una crisis de credibilidad. Un artículo publicado en diciembre de 2025 en arXiv y firmado por investigadores de la Universidad Grenoble Alpes y del Mount Sinai, titulado "The Dead Salmons of AI Interpretability", documenta cómo métodos como la atribución de características, los sondas, los autoencoders dispersos y los análisis causales producen explicaciones aparentemente plausibles incluso en redes neuronales completamente aleatorizadas. El nombre hace referencia a un famoso experimento de neurociencia de 2009 en el que un salmón muerto dentro de un escáner de resonancia magnética mostró actividad cerebral "significativa" debido a errores estadísticos.

El estudio señala que la raíz del problema es la no identificabilidad de muchas consultas de interpretabilidad: los rastros computacionales no determinan de manera única una explicación. Esto lleva a alta varianza, baja generalización y falsos descubrimientos. Los autores proponen replantear la interpretabilidad como un problema de inferencia estadística, donde las explicaciones sean tratadas como parámetros estimados con incertidumbre cuantificada y contrastados contra hipótesis alternativas explícitas.

Patrocinado Advertisement

Para las empresas latinoamericanas que adoptan modelos de lenguaje en procesos críticos —desde atención al cliente hasta análisis de crédito o diagnóstico asistido—, esta contradicción tiene consecuencias prácticas. Por un lado, el J-space de Anthropic sugiere que podríamos monitorear el razonamiento interno de los modelos y detectar sesgos o intenciones ocultas. Por otro lado, la advertencia de los dead salmon indica que muchas de las "explicaciones" que nos ofrecen las herramientas actuales podrían ser ilusiones estadísticas.

Un ejecutivo que recibe un reporte de interpretabilidad que muestra que su modelo de scoring crediticio "piensa" en educación o ingresos debe preguntarse: ¿esa explicación refleja un mecanismo real o es un artefacto de la técnica utilizada? El riesgo es tomar decisiones de negocio basadas en explicaciones espurias, o peor aún, confiar en que un modelo es seguro porque su caja negra parece menos opaca.

La lección para la región es que la interpretabilidad no debe tratarse como un producto terminado, sino como un proceso científico en construcción. Las empresas que despliegan IA en entornos regulados —como fintechs, aseguradoras o proveedores de salud— deberían exigir a sus proveedores no solo explicaciones, sino también métricas de incertidumbre, pruebas de robustez frente a modelos aleatorios y documentación de los límites del método de interpretación. Mientras Anthropic avanza hacia una ventana al interior de Claude, la comunidad académica recuerda que esa ventana puede ser un espejo si no se controlan los falsos positivos. Para el CIO latinoamericano, la decisión prudente es no confiar en una sola explicación, sino construir un ecosistema de validación que incluya múltiples líneas de evidencia y, sobre todo, escepticismo metodológico.

Fuentes

  1. The Download: El funcionamiento interno de Claude y el futuro de los modelos mundiales
  2. Lo que el último descubrimiento de IA de Anthropic revela —y lo que no—
  3. Los salmones muertos de la interpretabilidad de la IA
  4. "Claude ha desarrollado un mecanismo para el acceso ... - Xataka
  5. Explicando la IA mediante la interpretabilidad mecanicista
Ariel Acosta

Escrito por

Ariel Acosta

Experto en seguridad de información

Ingeniero en sistemas y gestor de servicios de TI con más de 10 años de experiencia en diseño, implementación y administración de infraestructura de red, seguridad y procesos tecnológicos. Ha desarrollado una carrera orientada a sostener operaciones críticas, optimizar entornos corporativos y traducir necesidades técnicas en soluciones funcionales para organizaciones que dependen de plataformas estables, seguras y alineadas con el negocio, con foco en eficiencia y control.