Investigación NTU y UC Santa Bárbara mapean proteomas y separan amiloides de condensados líquidos
Dos oleadas de modelos de IA —desde Singapur y California— escanean proteomas enteros y separan la formación de amiloides de la condensación líquido-líquido, abriendo rutas para terapias contra Alzheimer y cultivos más resistentes.
Las proteínas no siempre se pliegan en estructuras rígidas. Una fracción importante —las intrínsecamente desordenadas— se comporta como el aceite en el agua: se condensan en gotitas líquidas dentro de la célula para concentrar moléculas y acelerar reacciones. Cuando ese proceso, llamado separación de fase líquido-líquido, falla, las gotitas se vuelven agregados sólidos vinculados a Alzheimer, Parkinson, ELA y varios cánceres. Hasta hace poco, predecir qué proteínas hacen esto y por qué exigía meses de banco húmedo. Ahora, dos líneas de trabajo publicadas casi en paralelo —una en Nanyang Technological University (NTU) en Singapur y otra en UC Santa Bárbara— han vuelto esa tarea computacional y escalable a proteomas completos.
De Singapur: dos plataformas y una base de conocimiento
El equipo del profesor Miao Yansong, junto con el profesor Weibo Gao, entrenó sendos modelos sobre proteínas predichas de animales, plantas, hongos y bacterias. El resultado son dos plataformas —presentadas en Molecular Plant— que identifican qué secuencias sufren separación de fase y cómo se regula ese comportamiento. En paralelo, la base de datos PhaSepDB 3.0 y el predictor catGRANULE 2.0, ambos curados con asistencia de IA, entregan anotaciones a resolución de aminoácido único para miles de entradas. La promesa inmediata: entender mejor el envejecimiento y las enfermedades, y mejorar la tolerancia al estrés en cultivos.
De California: modelos de lenguaje que no vieron la tarea, pero la resuelven
Sam Lobo, bajo la dirección de Scott Shell y Joan-Emma Shea, tomó modelos de lenguaje de proteínas —entrenados solo para aprender la estadística de secuencias naturales— y les añadió cabezas de predicción: una para amiloides, otra para separación de fase líquido-líquido (LLPS). Escanearon el proteoma humano (~20 000 proteínas) y hallaron tres patrones que cambian la intuición previa: (1) la formación de amiloides y la condensación en gotitas no están intrínsecamente acopladas; (2) muchas proteínas tipo prión poseen dos regiones distintas, una proclive a amiloide y otra a gotitas, lo que explicaría su capacidad de transmitir patología; (3) hay proteínas que solo hacen una de las dos cosas, lo que permite priorizar blancos terapéuticos. El trabajo salió en PNAS.
Por qué importa a la empresa y al laboratorio en Latinoamérica
La región concentra una carga creciente de enfermedades neurodegenerativas —el envejecimiento poblacional en Chile, Uruguay, Argentina y Cuba ya supera el 15 % de mayores de 65 años— y una dependencia agrícola de soja, maíz, caña y café expuestos a estrés hídrico y térmico. Estas herramientas bajan el costo de entrada: un grupo de bioinformática con GPU moderada puede priorizar candidatos en semanas, no años. En Brasil y México, donde hay clústeres de biotecnología y programas de mejoramiento genético público, integrar predictores de LLPS en pipelines de edición génica (CRISPR, prime editing) acorta el ciclo de validación de variedades tolerantes a sequía o salinidad. En el lado farmacéutico, startups de drug discovery en Argentina, Colombia o Chile pueden filtrar librerías de compuestos contra regiones de proteínas que antes eran «invisibles» por carecer de estructura fija.
Riesgo operativo: la caja negra y la validación húmeda
Ninguno de los modelos explica por qué una secuencia condensa; solo entregan probabilidad. Shell lo admite: el siguiente paso es mapear las señales del modelo de lenguaje a la física molecular (pH, temperatura, fuerza iónica). Hasta que eso ocurra, toda predicción necesita validación experimental —microscopía de fluorescencia, FRAP, mutagénesis—. En presupuestos ajustados, eso obliga a alianzas público-privadas o consorcios regionales para compartir wet lab.
El siguiente paso no es técnico, es de gobernanza de datos
PhaSepDB 3.0 y catGRANULE 2.0 son recursos abiertos, pero su utilidad real depende de que laboratorios latinoamericanos aporten sus datos experimentales —ortólogos de cultivos tropicales, variantes humanas de poblaciones mestizas— para que los predictores dejen de estar sesgados hacia proteomas de referencia europeos y asiáticos. Quien cargue primero sus datos en esa infraestructura ganará ventaja en patentes y licencias de variedades vegetales o dianas terapéuticas.