Inversión en IA vertical supera 40 % del mercado global

La industria abandona la carrera por el modelo generalista más grande. El valor migra hacia aplicaciones verticales que combinan modelos base, datos propietarios y cumplimiento regulatorio. Una arquitectura FM-PKM-MCP define la nueva pila empresarial.

Inversión en IA vertical supera 40 % del mercado global

Foto: Vitaly Gariev

De lo general a lo específico: por qué la industria apuesta por modelos fundacionales verticales

La euforia fundacional de 2023-2024 —construir el modelo más grande, más capaz, más general— está cediendo paso a una realidad más pragmática. Los datos de mercado lo confirman: en el primer trimestre de 2026, las plataformas verticales de IA y las soluciones específicas por industria representaron más del 40% de los aproximadamente 242.000 millones de dólares invertidos globalmente en IA, según datos de flujo de operaciones citados por AIO Apex. Gartner proyectaba que el 40% de las aplicaciones empresariales incorporarían agentes de IA especializados para 2026, un aumento de ocho veces respecto a 2025; los datos sugieren que la estimación se ha quedado corta.

Resulta clara la razón estructural: la IA horizontal exige que el comprador descubra cómo aplicarla a sus flujos de trabajo, datos, requisitos de cumplimiento y procesos comerciales. Un producto de IA vertical ya ha resuelto ese problema para una industria. El comprador adquiere algo que ya entiende su dominio, su terminología, su entorno regulatorio y su flujo de trabajo. Esto cambia el modelo de precios: la IA horizontal se cobra por asiento o por token; la IA vertical puede fijarse por resultados —trabajos reservados, documentos procesados, tickets resueltos, horas de documentación clínica ahorradas.

Patrocinado Advertisement

Las valoraciones lo reflejan. Harvey (IA legal) vale 11.000 millones; Abridge (documentación clínica), 5.300 millones; Decagon (agentes de atención al cliente), 4.500 millones. Sierra alcanzó 150 millones de ARR en enero de 2026. Avoca, startup de voz para contratistas de climatización y fontanería, anunció 125 millones a valoración de 1.000 millones con la promesa de reservar 1.000 millones en trabajos durante 2026. No son empresas de infraestructura: son compañías que aplicaron IA profundamente a un dominio y descubrieron que las empresas pagan sustancialmente por el resultado.

De las fuentes emerge la tesis de que el valor se está desplazando de la capa de modelo fundacional —cada vez más commoditizada y dominada por tres jugadores estadounidenses (OpenAI 27 %, Anthropic 40 %, Google 21 % en cargas de trabajo empresariales 2025 según Menlo Ventures)— hacia la capa de aplicación vertical, donde la combinación de datos de entrenamiento específicos, integraciones de flujo de trabajo construidas con el tiempo y relaciones de confianza en entornos regulados crea una barrera defendible que el rendimiento bruto del modelo base no puede replicar.

Arquitectura y entrenamiento: datos propietarios, fine-tuning eficiente y RAG como diferencial competitivo

En empresa, la arquitectura ganadora no es un monolito, sino una pila modular de tres capas que el artículo de Modus describe con precisión: Foundation Models (FM) como motor universal, Model Context Protocol (MCP) como tubería de conexión estandarizada, y Proprietary Knowledge Models (PKM) como repositorios de conocimiento único de la empresa.

El FM actúa como motor genérico de capacidades —generación, razonamiento, análisis multimodal—. El MCP, protocolo abierto desarrollado por Anthropic, funciona como un conector USB universal que permite al FM acceder a datos, APIs, herramientas y PKMs en tiempo real sin quedar aislado. Los PKMs son las «cajas negras» estratégicas: modelos internos entrenados exclusivamente con datos corporativos, procesos y know-how, que contienen la precisión y el contexto que un modelo general no posee nativamente.

En la práctica: la empresa adopta un FM (Claude, GPT-4, Gemini, o modelos abiertos como Llama), implementa servidores MCP que exponen recursos corporativos —bases de datos, herramientas, APIs y acceso a PKMs—, y orquesta la comunicación mediante un host MCP. Cuando llega una consulta, el FM interpreta la intención, usa el MCP para determinar qué PKM contiene la información relevante, lo invoca mediante RAG (Retrieval-Augmented Generation) o embeddings, y devuelve el resultado integrado en lenguaje natural. Sin MCP, el FM genera respuestas pero no tiene integración corporativa robusta; con MCP, se convierte en activo operativo real.

Esta arquitectura resuelve la tensión central: las empresas no quieren que su «saber hacer», patentes, estrategias o datos de clientes se procesen en sistemas de terceros. Buscan soberanía del conocimiento, integración vertical y reducción de costes de inferencia. Amazon, Meta, Microsoft, Oracle y grandes corporaciones en banca, energía y automoción ya construyen sus PKMs. AWS impulsa sus chips Trainium e Inferentia precisamente para alimentar estas IA corporativas «de la casa».

Tres vías complementarias documentadas en la revisión de Science China Information Sciences sustentan el entrenamiento eficiente de estos modelos especializados: pre-entrenamiento continuo sobre corpus de dominio (continual pre-training), fine-tuning supervisado con instrucciones de dominio (SFT), y alineación por preferencias (RLHF/RLAIF) usando retroalimentación de expertos del sector. A esto se suma el RAG como mecanismo de inyección de conocimiento actualizado sin reentrenamiento, crítico en dominios donde la normativa y la evidencia cambian constantemente —salud, finanzas, legal.

Como palanca clave identifica la revisión académica la compresión de modelos: cuantización, poda, destilación y arquitectura de mezcla de expertos (MoE) permiten desplegar modelos pequeños (SLMs) con rendimiento cercano al de sus contrapartes masivas, reduciendo drásticamente coste de inferencia y latencia. Multiverse Computing ejemplifica esta vía: su tecnología CompactifAI comprime modelos abiertos (como GLM-5.2 de Z.ai) para hacerlos «más pequeños, baratos y manejables», añadiendo una capa de «deschinización» —adaptación a requisitos regulatorios y empresariales europeos— que los hace desplegables en infraestructura soberana o on-premise.

Casos de uso críticos: salud, finanzas, legal y manufactura industrial

Ilustra la profundidad que exige cada vertical la encuesta exhaustiva de IEEE Reviews in Biomedical Engineering sobre modelos fundacionales en medicina. No basta con un LLM general: la taxonomía de aplicaciones abarca procesamiento de lenguaje clínico (extracción de entidades, codificación ICD, resumen de historiales), visión por computadora médica (segmentación de órganos, detección de patologías en radiología, patología digital, oftalmología), aprendizaje en grafos (redes de interacción proteína-proteína, predicción de fármacos), y ómicas (genómica, transcriptómica, proteómica). Modelos insignia como Med-PaLM 2, Med-Gemini, BioGPT, ClinicalBERT o la familia HuatuoGPT demuestran que la especialización requiere arquitecturas multimodales, entrenamiento sobre literatura biomédica curada (PubMed, MIMIC, The Cancer Genome Atlas), y validación rigurosa en benchmarks clínicos (USMLE, MedQA, MIMIC-IV).

No es solo precisión el desafío: es confianza, trazabilidad y cumplimiento. La encuesta destaca riesgos de alucinación en contextos críticos, sesgos demográficos en datos de entrenamiento, fuga de privacidad (PHI), y la necesidad de explainability para validación regulatoria (FDA, EMA, MDR).

La federación emerge como paradigma necesario: el artículo de IEEE Communications Surveys & Tutorials sobre Federated Foundation Models (FedFM) detalla cómo el aprendizaje federado permite entrenar y afinar modelos sobre datos descentralizados —hospitales, bancos, fábricas— sin que los datos salgan de su jurisdicción, abordando privacidad, soberanía y eficiencia computacional. La taxonomía FedFM cubre entrenamiento colaborativo, agregación segura, evaluación de contribución, y incentivación, con desafíos abiertos en escalabilidad de comunicación, robustez ante ataques de envenenamiento, y computación cuántica como horizonte para optimización.

Sector legal: Harvey combina LLM afinado con corpus jurídico, RAG sobre jurisprudencia y contratos, e integración en flujos de trabajo de due diligence, redacción y litigio. En finanzas, los modelos especializados procesan reportes regulatorios (Basel III, Solvencia II), detección de fraude en series temporales, y análisis de riesgo climático —dominios donde la explicabilidad y la trazabilidad de decisiones son requisitos regulatorios, no opcionales. En manufactura, la adquisición de Emmi AI por Mistral señala la apuesta por IA aplicada a simulaciones físicas para ingeniería: gemelos digitales, optimización de procesos, mantenimiento predictivo. La combinación de visión por computadora, series temporales de sensores IoT, y modelos de física informada (Physics-Informed Neural Networks) define la frontera multimodal industrial.

Ecosistema de proveedores: startups especializadas vs. ofertas de hyperscalers (AWS, Azure, GCP)

Entre dos modelos de oferta se polariza el mercado. Los hyperscalers venden capacidad generalista + infraestructura: Azure (OpenAI), AWS (Anthropic, propio Bedrock + acuerdo de 38.000 millones con OpenAI), GCP (Gemini, Vertex AI). Su apuesta es que la empresa traiga sus datos y construya encima. La magnitud del acuerdo AWS-OpenAI —siete años, cientos de miles de GPUs Nvidia, capacidad activa y en uso— señala que la IA de frontera se trata ya como infraestructura crítica, análoga a electricidad o telecomunicaciones.

Las startups verticales venden resultado empaquetado: Harvey no vende tokens, vende due diligence completada; Abridge no vende inferencia, vende notas clínicas firmadas; Avoca no vende API de voz, vende trabajos reservados en el CRM del contratista. Su barrera no es el modelo base —que pueden intercambiar si aparece uno mejor— sino la tricoma de datos de dominio + integraciones de flujo de trabajo + confianza regulatoria. Abridge e Hippocratic AI (Serie C de 126 millones con participación de NVIDIA) llevan años navegando HIPAA, integrándose con EHRs (Epic, Cerner), construyendo relaciones con sistemas hospitalarios. Un competidor con mejor modelo base no replica eso fácilmente.

Mistral ilustra la tensión del proveedor europeo de modelos: captó 3.000 millones a valoración de 21.000 millones, pero su cuota en cargas de trabajo empresariales cayó del 6 % (2023) al 1 % (2025) mientras el mercado de APIs crecía a 12.500 millones. Su respuesta: descender por la cadena de valor —comprar Koyeb (infraestructura serverless), Emmi AI (simulación industrial), Pimento (publicidad)— y asociarse con Numspot (cloud soberano francés, accionariado público-privado, cualificación SecNumCloud) para vender pila completa soberana: modelo + GPU + almacenamiento + orquestación + seguridad + operación, con un único interlocutor.

La soberanía deja de identificarse con haber entrenado el modelo para consistir en controlar dónde se ejecuta, quién custodia los datos, cómo se adapta a cada empresa y quién opera la infraestructura.

Multiverse Computing sigue una lógica paralela pero distinta: no compite en pre-entrenamiento masivo, sino en compresión, adaptación y despliegue especializado sobre modelos abiertos (chinos, estadounidenses o europeos). Su apuesta: fábrica europea de modelos especializados que selecciona la mejor materia prima disponible, la comprime con CompactifAI, la adapta al sector y la despliega en infraestructura europea o on-premise. Su tecnología está «una capa por encima del modelo», similar a como Mistral intenta capturar valor en las capas que rodean a sus modelos.

Gobernanza, cumplimiento y privacidad: el factor decisivo para la adopción en empresa

No es un apéndice la gobernanza: es el habilitador sin el cual la empresa no compra. La arquitectura FM-MCP-PKM requiere un AI Gateway que gobierne qué PKM puede consultarse, en qué condiciones, y cómo se registran las interacciones. Los cinco pilares que enumera Modus —calidad y gobernanza de datos (linaje, catálogos semánticos, políticas de acceso), infraestructura escalable (multicloud, chips especializados), talento híbrido (ingeniería + negocio + ética), integración con procesos de negocio, y gobernanza y transparencia (auditoría, sesgos, cumplimiento)— son requisitos de entrada, no diferenciadores.

Salud: la encuesta IEEE subraya que la validación regulatoria exige explainability, trazabilidad de datos de entrenamiento, y monitoreo post-despliegue (post-market surveillance). La federación (FedFM) permite entrenar sobre datos de múltiples hospitales sin centralizar PHI, pero introduce desafíos de heterogeneidad de datos, ataque de envenenamiento, y evaluación justa de contribución. En finanzas, la opacidad del modelo choca con requisitos de model risk management (SR 11-7, BCBS 239): el regulador exige documentar arquitectura, datos, limitaciones, y pruebas de estrés. En legal, el privilegio abogado-cliente y la confidencialidad exigen despliegue on-premise o en nube soberana con certificación.

Herramientas técnicas son la privacidad diferencial, el aprendizaje federado, y la computación multipartita segura (MPC); pero la gobernanza efectiva requiere contratos, certificaciones y responsabilidad legal. El modelo de responsabilidad compartida (shared responsibility model) de la nube se replica: el proveedor del FM responde de seguridad del modelo; el integrador vertical, de adecuación al dominio y cumplimiento sectorial; la empresa, de gobierno de sus datos y PKMs. La soberanía de datos —exigida por GDPR, HIPAA, ley de secreto bancario, directivas NIS2 y CRA— obliga a conocer jurisdicción de ejecución, subprocesadores, y cláusulas de transferencia internacional.

ROI y métricas de éxito: coste total de propiedad frente a modelos de propósito general

Difiere radicalmente del enfoque por tokens el cálculo de ROI en IA vertical. El coste total de propiedad (TCO) incluye: licencias o infraestructura del FM base, ingeniería de datos y curación de corpus de dominio, fine-tuning y evaluación continua, despliegue de MCP/PKM, gobernanza y auditoría, integración en ERP/CRM/EHR, gestión del cambio y formación, y coste de oportunidad de no automatizar.

No es perplexity o benchmark MMLU la métrica de éxito, sino KPIs de negocio: reducción de horas de documentación clínica por médico (Abridge reporta ahorros de 2-3 horas/día), aumento de tasa de conversión de leads a trabajos reservados (Avoca), reducción de tiempo de due diligence por operación (Harvey), tickets resueltos sin escalado humano (Decagon, Sierra), precisión en detección de fraude con falsos positivos por debajo de umbral regulatorio.

Alinea incentivos el precio por resultado: el proveedor vertical asume riesgo de rendimiento y se beneficia de la eficiencia de su modelo. El modelo horizontal por token traspasa el riesgo al cliente: si el prompt es malo, el cliente paga igual. Esta asimetría explica por qué el 40 % de la financiación en 2026 fluye a verticales: los inversores ven unit economics claros, churn bajo (cambio costoso por integración profunda), y expansión land-and-expand dentro del mismo cliente.

Sin embargo, la trampa del TAM (mercado total direccionable) es real. Una IA para documentación clínica atiende hospitales; una IA legal, bufetes y departamentos jurídicos. El techo es finito. La pregunta estratégica —planteada por AIO Apex— es si los líderes de categoría pueden expandirse horizontalmente sin perder profundidad. Glean comenzó en búsqueda empresarial (valoración 7.200 millones, Serie F 150 millones en febrero 2026) y avanza hacia plataforma enterprise agentiva. El patrón probable: dominar un flujo de trabajo vertical, acumular datos y confianza, y expandirse adyacentemente sobre esa base.

Hoja de ruta futura: modelos pequeños (SLMs), agentes autónomos y la convergencia multimodal

Tres vectores convergen en la hoja de ruta 2026-2028.

Modelos pequeños (SLMs) como estándar de despliegue empresarial. La compresión (cuantización 4-bit, destilación, MoE) permite modelos de 7-70B parámetros con rendimiento competitivo en tareas de dominio, inferencia en GPU única o CPU, latencia sub-segundo, y coste de inferencia órdenes de magnitud inferior. Multiverse/CompactifAI, Mistral (con sus modelos ministral), y la proliferación de Llama-3.1/3.2 cuantizados marcan la dirección: el modelo masivo queda en la nube para tareas de razonamiento complejo; el SLM especializado vive en el edge, en el on-premise, o en nube soberana para el 90% de la carga operativa.

Agentes autónomos sobre la pila FM-MCP-PKM. El MCP no solo expone datos: expone herramientas (APIs, funciones, flujos de trabajo). Un agente recibe objetivo («reservar cita para paciente con estos síntomas, verificar seguro, actualizar historia»), descompone en pasos, invoca herramientas via MCP (PKM clínico, sistema de citas, validador de seguro), y ejecuta con supervisión humana en el bucle (human-in-the-loop) para acciones críticas. La encuesta IEEE sobre medicina ya documenta agentes para clinical trial matching, prior authorization, y differential diagnosis asistido. El pronóstico de Gartner (40% de apps empresariales con agentes especializados en 2026) apunta a que la capa agente se convierte en la nueva interfaz de usuario empresarial.

Convergencia multimodal nativa. Los modelos fundacionales ya no son solo texto: visión (Segment Anything, CoDi-2), series temporales (Time-LLM, UNITS), audio, y datos estructurados (tablas, grafos) se integran en arquitecturas any-to-any. En manufactura, el gemelo digital combina visión de cámara, series de sensores, manuales técnicos (texto), y simulaciones físicas (Emmi AI). En salud, el expediente multimodal fusiona imagen (radiología), señal (ECG, EEG), genómica, y nota clínica. La revisión de Science China Information Sciences cita modelos como CoDi-2 (generación intercalada cualquier-a-cualquier) y Time-LLM (reprogramación de LLM para series temporales) como evidencia de que la especialización vertical exige multimodalidad nativa, no pipelines ensamblados a posteriori.

Será el sustrato de privacidad para todo lo anterior la federación (FedFM): agentes que razonan sobre datos distribuidos sin centralizarlos, SLMs afinados colaborativamente entre hospitales/bancos/fábricas, y gobernanza computacional que registra qué dato influyó en qué decisión. La computación cuántica, aún incipiente, se perfila como acelerador para optimización de hiperparámetros, agregación segura, y criptografía post-cuántica en el intercambio de pesos.

Ha dejado de preguntarse la industria «¿qué modelo es mejor?» para preguntarse «¿qué arquitectura resuelve mi problema con mis datos, mi regulación y mi flujo de trabajo?». La respuesta no es un modelo, sino una pila: FM commodity + PKM propietario + MCP estandarizado + infraestructura soberana + gobernanza auditable. Quienes vendan capas sueltas perderán frente a quienes vendan la pila integrada y el resultado medible. La carrera de los modelos fundacionales no ha terminado —OpenAI, Anthropic, Google, Meta, y los gigantes chinos seguirán escalando— pero su resultado importa menos para la empresa que la capacidad de elegir, comprimir, adaptar, desplegar y gobernar el modelo adecuado sobre su propio conocimiento. Esa capacidad es la nueva ventaja competitiva.

Fuentes

  1. Una visión general del modelo fundacional específico de dominio: tecnologías clave, aplicaciones y desafíos
  2. Una revisión exhaustiva de los modelos fundacionales en medicina
  3. Avances y desafíos abiertos en los modelos fundacionales federados
  4. Por qué las startups verticales de IA están ganando en la empresa ...
  5. Modelos fundacionales corporativos: la próxima revolución de la IA
  6. Mistral empieza a alejarse de la batalla del modelo generalista y marca el camino a Multiverse
Marcelo Peguero

Escrito por

Marcelo Peguero

Experto en estándares

Cofundador de ISOINNOVA y especialista en diseño de procesos de calidad, con más de 20 años implantando sistemas de gestión en organizaciones públicas y privadas de Latinoamérica. Su trabajo parte de una convicción simple: un proceso mal diseñado no se arregla poniéndole tecnología encima, se amplifica. Desde ahí mira cómo la inteligencia artificial entra en la operación de las empresas — qué promete, qué mide de verdad y quién termina asumiendo el costo cuando el estándar llega después de la herramienta.