Modelos de razonamiento reproducen estereotipos raciales en viñetas clínicas

Los modelos de razonamiento avanzado reproducen estereotipos raciales y de género en viñetas clínicas. Mientras la región apuesta por medicina predictiva y personalizada, el riesgo de amplificar desigualdades exige gobernanza de datos y validación local.

Modelos de razonamiento reproducen estereotipos raciales en viñetas clínicas

Foto: CDC

La inteligencia artificial llegó a la consulta médica con la promesa de un cambio de paradigma: pasar de la cura reactiva a una medicina preventiva, predictiva, personalizada y participativa, la llamada Medicina 4P. En Chile, investigadores de la Universidad de Chile y Clínica Las Condes llevan años documentando cómo el procesamiento masivo de historiales electrónicos, datos genómicos y variables ambientales permite anticipar riesgos y diseñar intervenciones a medida Ruiz y Velásquez. Canales de divulgación especializada muestran sistemas que ya diagnostican enfermedades raras y detectan patrones de riesgo en poblaciones hospitalarias Inteligencia Artificial.

Pero un estudio publicado en agosto de 2026 en el Journal of Medical Internet Research enciende una alarma que la región no puede ignorar. Investigadores de la Universidad de Flinders evaluaron tres modelos de razonamiento de última generación —GPT-4, o3-mini y DeepSeek-R1— pidiéndoles que generaran 36.000 viñetas clínicas de pacientes ficticios con afecciones comunes. Los resultados son contundentes: GPT-4 incurrió en representación errónea significativa en el 67 % de las condiciones para raza y para género; o3-mini alcanzó 78 % en raza y 56 % en género; DeepSeek-R1 llegó al 89 % en raza y 67 % en género Agencia SINC.

El sesgo no se corrige con más razonamiento

Patrocinado Advertisement

Se desmorona la hipótesis de que modelos con mejor capacidad lógica reducirían el sesgo. Los modelos de razonamiento sobrerrepresentan sistemáticamente a poblaciones negras en patologías estereotipadas —sarcoidosis, lupus eritematoso sistémico, preeclampsia, hipertensión esencial— con tasas de representación errónea mediana del 44 % (o3-mini) y 31 % (DeepSeek-R1), frente al 15 % de GPT-4. El análisis cualitativo de DeepSeek-R1 revela que el modelo invoca explícitamente asociaciones entre enfermedad y demografía al elegir características del paciente, sin apoyarse en datos epidemiológicos cuantitativos.

Para América Latina, donde la categoría "raza" no se mapea igual que en Estados Unidos pero conviven ancestría indígena, afrodescendiente, europea y mestizaje en gradientes continuos, el hallazgo tiene una lectura distinta pero igual de grave: los modelos entrenados con literatura biomédica global —sesgada hacia poblaciones de ascendencia europea— proyectarán sus atajos estereotípicos sobre cualquier población subrepresentada en los datos de entrenamiento.

Infraestructura de datos: el cuello de botella regional

Exige la Medicina 4P historiales clínicos electrónicos interoperables, calidad de dato y trazabilidad del consentimiento. En la región, la brecha es estructural: sistemas fragmentados entre subsectores públicos, privados y de seguridad social; codificaciones heterogéneas; y escasa estandarización de variables sociales y ambientales. Sin datos locales representativos, cualquier modelo importado operará como "caja negra" calibrada para otra epidemiología.

El artículo de Ruiz y Velásquez advierte que cada día es más difícil para el personal de salud extraer información relevante con métodos tradicionales, y que la IA junto a recursos computacionales masivos será pieza clave. Pero la clave no es solo computación: es gobernanza de datos. Chile avanza con la Ley de Datos Personales y la historia clínica única; Brasil tiene la LGPD y el Conecte SUS; México y Colombia ensayan historias clínicas electrónicas nacionales. La velocidad de adopción de IA clínica dependerá menos de la disponibilidad de modelos que de la madurez de la infraestructura de datos.

Validación local como requisito de entrada

Exige la FDA validación clínica para algoritmos de diagnóstico; la EMA y el MDR europeo exigen evaluación de desempeño en poblaciones objetivo. En Latinoamérica, las agencias regulatorias —ANVISA, ISP, COFEPRIS, INVIMA— están definiendo marcos para software como dispositivo médico. Ningún modelo de razonamiento generalista debería usarse para generar contenido clínico sin validación prospectiva en la población local. El estudio de Flinders demuestra que el "razonamiento" del modelo puede ser una racionalización post hoc de sesgos de entrenamiento.

Costos de ignorar el problema

Un hospital que implemente un asistente de triaje basado en LLM sin auditoría de sesgo expone a tres riesgos concretos:

  • Desigualdad asistencial: pacientes de grupos subrepresentados reciben sugerencias diagnósticas menos precisas o inapropiadas.
  • Responsabilidad legal: la jurisprudencia emergente en derechos digitales y no discriminación puede tornar al prestador responsable por decisiones automatizadas sesgadas.
  • Reputación y confianza: un episodio de sesgo documentado erosiona la legitimidad del sistema de salud digital.

Hoja de ruta para el ejecutivo de salud en la región

1. Exigir tarjetas de modelo (model cards) y hojas de datos (datasheets) a proveedores: datos de entrenamiento, desempeño desagregado por subgrupos poblacionales relevantes, limitaciones declaradas. 2. Construir conjuntos de validación locales con prevalencias reales, codificación estandarizada (CIE-10, SNOMED CT) y variables de determinantes sociales. 3. Instituir comités de ética algorítmica con representación clínica, de pacientes, legal y técnica, con facultad de veto a despliegues de alto riesgo. 4. Invertir en curación de datos propios antes que en licencias de modelos: la ventaja competitiva sostenible es el dato local de calidad, no el modelo genérico. 5. Negociar cláusulas de responsabilidad y reentrenamiento en contratos con proveedores de IA: el modelo debe poder actualizarse con datos locales sin depender exclusivamente del vendor.

Por ósmosis tecnológica no llegará la medicina 4P. Llegará —si llega— cuando la región trate sus datos como activo estratégico y exija que la inteligencia artificial rinda cuentas en la mesa de clínica, no solo en los benchmarks de publicación.

Fuentes

  1. La inteligencia artificial revoluciona la medicina: cómo se está previniendo y tratando enfermedades de manera innovadora».
  2. Medicina personalizada impulsada por inteligencia artificial: transformación de la práctica clínica en la enfermedad inflamatoria intestinal
  3. Inteligencia artificial al servicio de la salud del futuro - Elsevier
  4. Los nuevos modelos de IA todavía reproducen estereotipos raciales y de género en la medicina
Redacción

Escrito por

Redacción

Turing magazine

Equipo editorial de Turingmag. Cobertura institucional sobre inteligencia artificial para ejecutivos y directivos en Latinoamérica.