Anthropic abre la caja negra de Claude, pero la interpretabilidad sigue siendo un espejismo
Anthropic descubrió un espacio interno en Claude donde aparecen conceptos antes de escribirlos. Sin embargo, un estudio académico advierte que muchos métodos de interpretabilidad producen falsos positivos incluso en modelos aleatorios. ¿Qué significa esto para las empresas que confían en la IA?