De LLM a LFM: por qué los modelos fundacionales cambian las reglas del análisis de datos empresariales
La ola de grandes modelos de lenguaje (LLM) acostumbró al mercado a pensar en "foundation models" como sinónimo de chatbots y generación de texto. Pero la definición original —modelos preentrenados a gran escala que se adaptan a múltiples tareas downstream— encaja mejor hoy en una clase distinta de artefactos: los Large Foundation Models (LFM) para datos estructurados. Series temporales, tablas heterogéneas y registros clínicos multimodales comparten un problema que los LLM no resuelven: la continuidad numérica, la irregularidad temporal y la sensibilidad regulatoria.
Los trabajos de investigación recientes convergen en una tesis operativa: la arquitectura Transformer, combinada con tokenización en parches (patch-based) y objetivos de preentrenamiento generativos o probabilísticos, está desplazando a las tuberías clásicas de feature engineering manual y modelos ad-hoc por dominio. La encuesta de Dell Technologies y universidades asociadas Foundation models for time series: A survey propone una taxonomía que clasifica estos modelos por arquitectura (patch vs. raw sequence), tipo de predicción (probabilística vs. determinista), soporte multivariado y escala. Esa taxonomía no es académica: dictará qué modelo cabe en la latencia de un sistema de pricing en tiempo real y cuál requiere una GPU A100 para inferencia batch.
El cambio de paradigma tiene tres patas. Primero, el fin del feature engineering artesanal: los LFM aprenden representaciones temporales y relacionales directamente de secuencias crudas, igual que BERT aprendió sintaxis de corpus sin etiquetar. Segundo, la transferencia zero-shot y few-shot: un modelo preentrenado en un trillón de puntos temporales (como Sundial Sundial: A Family of Highly Capable Time Series Foundation Models) pronostica demanda minorista, anomalías en sensores industriales y series financieras sin reentrenamiento completo. Tercero, la unificación de tareas: forecasting, detección de anomalías, imputación y clasificación salen de la misma cabeza del modelo, reduciendo la deuda técnica de mantener zoológicos de modelos especializados.
Series temporales: forecasting y detección de anomalías sin ingeniería de features manual
La literatura técnica muestra una carrera de tres frentes: arquitectura, objetivo de pérdida y escala de datos.
Arquitectura: encoder-only vs. decoder-only y el papel del patch. El estudio de leyes de escalado presentado en ICLR 2025 Towards neural scaling laws for time series foundation models entrenó familias de Transformers encoder-only y decoder-only sobre 17.000 millones de puntos temporales (LOTSA) balanceados en siete dominios —transporte, clima, energía, CloudOps, salud, ventas, web—. Hallazgo clave: el negative log-likelihood escala de forma casi idéntica en distribución (ID) y fuera de distribución (OOD), lo que valida que invertir en modelos más grandes y más datos mejora la generalización real, no solo el benchmark. Los encoder-only mostraron ligera ventaja en ID; los decoder-only, más naturales para generación autoregresiva, son el estándar en modelos como Chronos y TimesFM.
Objetivo de pérdida: de MSE a flow-matching. Los primeros LFM (TimesFM, Timer, Moirai) usaban tokenización continua con pérdidas paramétricas (MSE, quantile loss, mezclas gaussianas). Eso induce mode collapse en series heterogéneas: la media de distribuciones multimodales produce pronósticos sobresuavizados e inútiles para toma de decisiones. Sundial rompe esa barrera con TimeFlow Loss, basado en flow-matching: el modelo aprende el campo de velocidad que transporta una gaussiana ruidosa hacia el parche futuro real, sin discretizar ni asumir forma paramétrica. Resultado: predicciones probabilísticas nativas, multimodales y calibradas, con inferencia zero-shot en milisegundos gracias a KV-cache y multi-patch prediction. En benchmarks TSLib, GIFT-Eval y FEV, Sundial supera a Moirai y Chronos tanto en error puntual (MAPE) como en NLL.
Escala de datos: el corpus TimeBench (1 billón de puntos). La curación masiva —mayormente datos reales, complementados con sintéticos— permite que las leyes de escalado se mantengan sin saturación visible. La lección para el empresario: la calidad y diversidad del corpus de preentrenamiento importan más que la cuenta de parámetros per se. Un modelo de 200M parámetros preentrenado en dominios relevantes (energía, logística, finanzas) puede superar a uno de 2B parámetros entrenado en datos genéricos.
Ejemplo operativo: IBM TinyTimeMixer (TTM) demuestra el extremo eficiente: menos de 1 millón de parámetros con "controlled attention" —atención selectiva entre variables de la serie— logra forecasting competitivo en calidad del aire (PM2.5 Pekín) y reduce pérdida de evaluación de 0,426 a 0,253 tras fine-tuning Modelos de series temporales: la revolución silenciosa en las previsiones de IA. TTM cabe en edge devices y se despliega en watsonx; Sundial apunta a servidor con GPU. La elección no es binaria: un portfolio de modelos por latencia y criticidad.
Datos tabulares: el reto de la heterogeneidad y la promesa de los "tabular foundation models"
Mientras las series temporales tienen orden natural, las tablas empresariales son heterogéneas por construcción: columnas numéricas, categóricas de alta cardinalidad, fechas, texto libre, valores nulos semánticos (no aleatorios) y relaciones relacionales implícitas (claves foráneas). Los LLM puros fallan aquí: tokenizan cada celda como palabra, pierden la estructura columnar y alucinan valores numéricos.
La aproximación emergente —esbozada en la pieza de Santander Los modelos fundacionales llegan a los datos tabulares y las series temporales— combina tres ideas:
1. Tokenización columna-consciente: cada columna recibe un embedding aprendido (tipo, estadísticos, cardinalidad) antes de entrar al Transformer. 2. Preentrenamiento enmascarado estilo BERT pero mixto: reconstruir valores numéricos (regresión) y categóricos (clasificación) simultáneamente, con losses ponderados por entropía de columna. 3. Fine-tuning por tarea downstream: clasificación de churn, scoring de riesgo, imputación masiva, generación de datos sintéticos diferencialmente privados.
El cuello de botella no es arquitectónico: es la disponibilidad de corpora tabulares grandes, limpios y con licencia permisiva. A diferencia de texto (Common Crawl) o series (LOTSA, Monash, UEA), no existe un "Common Crawl tablular". Los bancos, retailers y telcos guardan sus tablas bajo llave. La vía pragmática hoy: preentrenar en datos públicos (Kaggle, UCI, OpenML, datos abiertos gubernamentales) y fine-tuning federado o en silo con datos propios.
Salud y ciencias de la vida: privacidad, multimodalidad y validación clínica como barreras de entrada
La salud concentra las tres tensiones estructurales de los LFM: datos multimodales (series vitales + notas clínicas + imagen + genómica), regulación estricta (HIPAA, GDPR, EU AI Act Anexo III alto riesgo) y coste de error asimétrico.
La encuesta de Dell cita healthcare como dominio principal para series temporales: monitoraje de signos vitales, predicción de sepsis, brotes epidemiológicos Foundation models for time series: A survey. Pero el salto de paper a producción exige:
- Validación clínica prospectiva, no solo retrospectiva en MIMIC-IV. La FDA exige evidencias de seguridad y eficacia (SaMD framework).
- Explicabilidad intrínseca: atención temporal destacable, intervalos de predicción calibrados, contrafactuales. Sundial genera múltiples trayectorias probables; eso es un paso hacia "explicabilidad por simulación".
- Entrenamiento preservando privacidad: federated learning, synthetic data con garantías DP-SGD, o preentrenamiento en silos institucionales con agregación de pesos.
- Gestión de covariate shift: la distribución de pacientes cambia (nuevas variantes, protocolos de triaje). Los LFM deben monitorear distribution drift en embeddings latentes y disparar reentrenamiento automático.
El patrón ganador en salud no será un modelo único, sino una familia de modelos especializados (vital signs, imaging, genomics) orquestados por un meta-controlador que fusiona modalidades y emite recomendaciones con nivel de confianza.
Arquitectura de despliegue: fine-tuning, RAG y evaluación de coste-latencia en producción
Tres patrones de adopción conviven:
| Patrón | Cuándo aplica | Coste computacional | Latencia típica | Riesgo principal | |---|---|---|---|---| | Zero-shot / few-shot prompting | Piloto rápido, datos etiquetados escasos, dominio cubierto en preentreno | Inferencia sola | ms–s (GPU) / s (CPU) | Degradación silenciosa en OOD | | Fine-tuning paramétrico (LoRA / full) | Dominio específico, datos etiquetados >1k series, necesidad de calibración | 1–100 GPU-horas | Igual que base | Overfitting catastrófico si datos ruidosos | | RAG tabular/series (retrieval + generativo) | Contexto largo, conocimiento externo (calendarios, festivos, manuales), auditoría | Índice vectorial + inferencia | +10–100ms | Complejidad operativa, frescura del índice |
La evaluación coste-latencia debe incluir: cold start (carga de pesos), batch size óptimo (throughput vs. latencia P99), quantization (INT8/FP8 sin degradar NLL), y fallback a modelo estadístico (ETS, ARIMA) cuando el LFM detecta OOD via entropía predictiva alta. IBM watsonx y plataformas análogas (Vertex AI, Bedrock, Azure ML) ya exponen endpoints con autoscaling y model cards estandarizadas; la decisión de build vs. buy se inclina hacia buy para capas de serving, build para fine-tuning con datos propietarios.
Riesgos, gobernanza y cumplimiento: sesgo, explicabilidad y regulación sectorial (EU AI Act, HIPAA)
Los LFM heredan los riesgos de los LLM y añaden los suyos:
- Sesgo temporal y poblacional: si el corpus de preentreno sobrerrepresenta economías OECD, el forecasting en mercados emergentes falla sistemáticamente. El paper de leyes de escalado muestra que la diversidad de dominios en preentreno (balanceo 28% transporte, 28% clima, 28% energía, 13% CloudOps, 1,4% salud) es crítica para OOD Towards neural scaling laws for time series foundation models.
- Fuga de información en fine-tuning: series temporales con IDs de cliente/device pueden memorizar patrones privados. Solución: differential privacy en gradientes (DP-SGD) o synthetic data generada por el propio LFM con garantías ε-δ.
- EU AI Act: forecasting de demanda energética, scoring crediticio, triaje clínico caen en alto riesgo. Exige risk management system, data governance, technical documentation, human oversight y post-market monitoring. Los LFM deben producir model cards y datasheets al estilo GPAI Code of Practice.
- Explicabilidad regulada: HIPAA y GDPR derecho a explicación obligan a mostrar por qué un pronóstico de sepsis disparó alerta. Técnicas: attention rollout, SHAP sobre embeddings, counterfactual trajectories ("si la fiebre no subiera, riesgo bajaría a X%").
Hoja de ruta para adopción: criterios de selección, pilotos medibles y escalado organizativo
Fase 0 – Inventario y norte: mapear pain points de forecasting/anomalía/imputación por unidad de negocio. Cuantificar baseline (MAPE actual, coste de error, latencia máxima tolerable).
Fase 1 – Piloto acotado (8–12 semanas):
- Seleccionar un caso de alto valor y datos accesibles (ej. forecasting de SKUs top 20% ingreso, detección de anomalías en sensores críticos).
- Elegir dos modelos: uno ligero (TTM, Moirai-small) y uno potente (Sundial, Chronos-large) para comparar zero-shot vs. fine-tuned.
- Métricas contractuales: MAPE, WQL (weighted quantile loss), NLL, latency P99, coste por 1M inferencias.
- Gate de salida: mejora ≥15% vs. baseline y cumplimiento SLA latencia/coste.
Fase 2 – Plataforma y gobernanza (6–9 meses):
- Establecer Model Registry con versionado, lineage de datos, model cards automáticas.
- Implementar monitoring continuo: drift de features (KS-test sobre embeddings), drift de performance (MAPE rolling), alertas de OOD (entropía predictiva).
- Pipeline de reentrenamiento programado (mensual/trimestral) con champion-challenger y canary deploy.
- Capa de explicabilidad estandarizada (API que devuelve intervalos, atención, contrafactuales).
Fase 3 – Escalado transversal (12–18 meses):
- Federación de feature store temporal (Feast, Tecton) para servir context consistente a entrenamiento e inferencia.
- Portafolio de modelos por tier: edge (TTM-distilled), regional (Moirai/Sundial medium), central (Sundial-large + ensemble).
- Center of Excellence transversal (Data Science, ML Engineering, Legal, Negocio) que priorice backlog por ROI ajustado a riesgo regulatorio.
La lección transversal de las fuentes: no hay modelo único ganador; hay arquitectura de decisión que elige el modelo adecuado por latencia, criticidad, regulación y madurez de datos. Las empresas que traten a los LFM como commodity intercambiable —con eval harness propio, data flywheel cerrado y governance by design— capturarán el valor que hoy se pierde en proof-of-concepts eternos.