El dilema de Fable 5: máquina de negarse o el mejor modelo biomédico

Claude Fable 5 rechaza hasta el 99% de preguntas biomédicas. Cuando responde, supera a todos sus rivales. ¿Qué significa para América Latina?

El dilema de Fable 5: máquina de negarse o el mejor modelo biomédico

Foto: Chidera Faustina Okeke

La inteligencia artificial generativa avanza a tal velocidad que sus propios creadores parecen sorprendidos. Uno de los últimos capítulos de esta historia lo protagoniza Claude Fable 5, el modelo más potente de Anthropic, y revela una paradoja que debería importar a cualquier ejecutivo latinoamericano que esté considerando incorporar IA en procesos sensibles, especialmente en salud, diagnóstico o análisis de datos clínicos.

Según un estudio independiente de la Universidad de Georgia, publicado en arXiv, Fable 5 es capaz de superar a todos los modelos anteriores —incluidos sus predecesores Opus 4.6, Opus 4.8 y el GPT-5 de OpenAI— en prácticamente todos los benchmarks biomédicos disponibles. Pero hay un pero enorme: se niega a responder entre el 8% y el 99,4% de las preguntas, dependiendo del test. En RareBench, un conjunto de datos sobre enfermedades raras, la tasa de rechazo alcanzó el 99,4%. Es decir, de 1.122 preguntas, solo respondió 6.

El hallazgo no es técnico menor. Cuando Fable 5 decide contestar, su precisión es impecable: en MedQA, por ejemplo, su precisión ajustada (excluyendo los casos en que se negó) fue del 96,6%, frente al 95% de Opus 4.8 o el 96% de GPT-5. El problema no es capacidad, sino voluntad.

Patrocinado Advertisement

¿Por qué se niega?

Los investigadores identificaron dos patrones de rechazo. El primero se concentra en preguntas de ciencia básica y mecanismos de enfermedad, áreas donde el modelo parece menos seguro de sus respuestas. El segundo es más preocupante: en RareBench, Fable 5 rechaza casi universalmente preguntas sobre enfermedades metabólicas congénitas, pero responde sin problemas a preguntas sobre enfermedades autoinmunes de inicio en la edad adulta. No es un fallo aleatorio: parece haber una decisión interna, basada en algún criterio de riesgo o confianza, que el modelo aplica de forma desigual.

Para una empresa en América Latina que quiera usar IA en triaje de pacientes, diagnóstico asistido o análisis de literatura médica, esta conducta es crítica. Un modelo que calla selectivamente puede dar una falsa sensación de seguridad en las áreas donde sí responde, y dejar huecos peligrosos donde no. No es un problema de sesgo evidente, como los que vimos en modelos anteriores con género o raza, sino de una nueva forma de opacidad: la decisión de no decidir.

El estudio también destaca que los modelos predecesores de Anthropic y el GPT-5 prácticamente nunca se niegan a responder (entre 0% y 0,4% de rechazo). La diferencia es radical y sugiere que el equipo de Anthropic priorizó la seguridad por sobre la utilidad en Fable 5, posiblemente como respuesta a críticas anteriores sobre modelos que generaban información médica incorrecta con total confianza. Pero, como señalan los autores, "la principal limitación de Fable 5 para aplicaciones biomédicas no es su capacidad, sino su disposición a participar".

Menos texto, mejores resultados

Paralelamente, la comunidad de usuarios ha documentado que la forma de interactuar con Fable 5 es diametralmente opuesta a la de modelos anteriores. Una guía práctica publicada por el sitio TododeIA, basada en documentación oficial de Anthropic, sostiene que el error más común es hablarle como a los anteriores: "Fable 5 obedece cada línea que escribes — mientras más ruido, peor el resultado".

Los cuatro principios que propone son simples pero exigen un cambio de mentalidad. Primero, prompts cortos: un párrafo claro le gana a tres páginas de instrucciones. Segundo, en lugar de dictarle los pasos, hay que decirle el objetivo y el porqué — él solo amarra el camino. Tercero, hay que marcarle límites explícitos sobre qué no puede tocar y cuándo debe detenerse a preguntar. Cuarto, el menos usado: pedirle evidencia, no promesas. "Antes de reportarme avances, audita cada afirmación contra algo que de verdad hiciste en esta sesión", sugiere la guía.

Esta diferencia de comportamiento tiene implicaciones concretas para equipos de tecnología en la región. Si estás construyendo un agente de IA que debe operar de forma autónoma, el prompting que funcionaba con GPT-4 o Claude Opus puede generar resultados impredecibles con Fable 5. La recomendación oficial es empezar con "high" como nivel de esfuerzo por defecto, y solo subir a "xhigh" en tareas donde el error no puede permitirse.

¿Qué significa para América Latina?

En un mercado donde la adopción de IA en salud aún es incipiente pero crece rápido —con startups de telemedicina, diagnóstico por imagen y análisis de datos clínicos—, la aparición de un modelo que es a la vez el más preciso y el más reacio a responder plantea una disyuntiva estratégica. Por un lado, su capacidad para entender imágenes densas y sostener trabajo productivo por horas lo hace atractivo para tareas complejas. Por otro, su tendencia a negarse justo en las preguntas más difíciles —como las de enfermedades raras— podría generar retrasos o derivaciones a sistemas humanos que no siempre están disponibles.

Los reguladores locales, que recién empiezan a esbozar marcos para la IA en salud, deberían prestar atención a este tipo de hallazgos. No se trata solo de que un modelo "alucine" —invente respuestas—, sino de que un modelo decida no responder. ¿Cómo se audita esa decisión? ¿Quién es responsable cuando un sistema de IA calla ante un síntoma que podría ser crítico? Son preguntas que aún no tienen respuesta, pero que Fable 5 acaba de poner sobre la mesa.

Por ahora, la lección para cualquier empresa latinoamericana que quiera usar este modelo es clara: no asumas que va a cooperar. Prueba primero en un entorno controlado, con datos locales, y prepárate para que, justo cuando más lo necesites, decida no hablar. Y si lo hace, probablemente tenga razón.

Fuentes

  1. Descubre el código genial que hace que los modelos de inteligencia artificial creen lo que quieren.
  2. Capacidades de Claude Fable 5 en problemas de desafío biomédico
  3. Prompts para Fable 5: menos texto, mejores resultados - tododeia
Bryan Brea

Escrito por

Bryan Brea

Abogado y comunicador

Abogado, broadcaster y comunicador dominicano, reconocido por una trayectoria que combina voz, criterio público y presencia en escenarios de comunicación social. Como locutor internacional, ha sido distinguido en espacios como Praise Music y Premios Galardón, además de figurar como nominado al Micrófono de Oro, reflejando una labor sostenida en la palabra hablada, la conducción y la conexión con audiencias. Su perfil proyecta a un profesional versátil, con vocación comunicacional, capacidad de influencia y una presencia pública construida desde la credibilidad, la cercanía y el compromiso con mensajes de valor.