OpenAI diseña su propio chip y la IA entra en la era de la infraestructura a medida

El procesador Jalapeño marca el fin de la dependencia de GPUs genéricas. Junto a avances en arquitectura MoE y enrutamiento de modelos, la IA pasa de escalar modelos a optimizar cada capa del stack. Para LatAm, la lección es clara: la ventaja competitiva no está en entrenar, sino en servir eficiente.

OpenAI diseña su propio chip y la IA entra en la era de la infraestructura a medida

Foto: Winston Chen

Sam Altman y Hock Tan sostienen una oblea de silicio frente a las cámaras. No es una pose publicitaria: es la primera vez que OpenAI muestra el procesador que diseñó junto a Broadcom para correr sus propios modelos. Lo llaman Jalapeño y está hecho exclusivamente para inferencia de modelos de lenguaje grandes. No es una GPU adaptada. No es un acelerador genérico. Es silicio nacido de la hoja de ruta de GPT-5.3-Codex-Spark y de los patrones de tráfico que OpenAI ve en producción cada día.

El movimiento cierra un círculo que la industria venía dilatando. Durante años, la narrativa fue "escalar el modelo". Luego, "escalar el cómputo". Ahora, la conversación se desplaza hacia "diseñar la pila completa". Sarah Friar, CFO de OpenAI, lo resume en una frase: los avances en chips, cómputo, modelos y productos se componen para entregar más inteligencia a menor costo. Jalapeño es la prueba física de esa tesis.

El fin de la GPU como commodity

Patrocinado Advertisement

Hasta hoy, casi toda la inferencia de LLMs corría sobre GPUs diseñadas para entrenamiento (H100, B200) o para gráficos. Eso obliga a pagar por capacidad que no se usa: precisión FP64, ancho de banda de memoria pensado para backpropagation, núcleos de tensor sobredimensionados para batch sizes de entrenamiento. Jalapeño elimina ese desperdicio. OpenAI dice que el chip reduce el movimiento de datos, equilibra cómputo, memoria y red, y alcanza una utilización "mucho más cercana al rendimiento máximo teórico". Las primeras pruebas indican rendimiento por vatio "sustancialmente mejor que la tecnología más avanzada actual".

En nueve meses se desarrolló el chip, un ciclo récord para un ASIC de alto rendimiento. Parte de esa velocidad vino de usar los propios modelos de OpenAI para acelerar etapas del diseño y verificación. La producción inicial está prevista para finales de 2026. El chip de red Tomahawk 5 de Broadcom completa la pila de comunicaciones.

Para un ejecutivo latinoamericano, la señal es concreta: la infraestructura de IA deja de ser un alquiler de GPUs genéricas y empieza a ser una decisión de arquitectura. Quien controle la pila —desde el silicio hasta el modelo— define su estructura de costos. En una región donde el capex en hardware es escaso y el acceso a GPUs de última generación tiene lista de espera, la aparición de silicio especializado para inferencia abre la puerta a proveedores locales que ofrezcan "inferencia como servicio" sobre hardware dedicado, no sobre GPUs revendidas.

MoE: la arquitectura que hace rentable la escala

Mientras OpenAI presenta su chip, el equipo de Ant Group publica en ICLR 2026 las leyes de escalado que explican por qué los modelos Mixture-of-Experts (MoE) son el contrapunto natural a ese hardware. Su métrica clave: Efficiency Leverage (EL). Mide cuántas veces más eficiente es un MoE frente a un modelo denso equivalente. Entrenaron más de 300 modelos hasta 28B parámetros y encontraron tres reglas:

  • La razón de activación (qué fracción de expertos se enciende por token) es el driver principal. Menor activación, mayor EL, siguiendo una ley de potencia estable.
  • La granularidad del experto (cuántos expertos por capa) actúa como modulador no lineal. El óptimo está entre 8 y 12 expertos activados por capa.
  • El presupuesto de cómputo amplifica la ventaja: a mayor escala, el MoE saca más ventaja relativa.

Validaron la teoría con MoE-mini: 0,85B parámetros activos, 17,5B totales, entrenado en 1T tokens. Igualó a un modelo denso de 6,1B parámetros usando 7x menos cómputo. La predicción de su ley de escalado unificada era >7x; la realidad confirmó.

Esto importa para LatAm porque cambia la ecuación de "entrenar vs. comprar". Un MoE bien configurado permite modelos más capaces por dólar de GPU. Pero exige conocimiento de arquitectura: saber elegir razón de activación, granularidad y capas compartidas. No es un hiperparámetro más; es diseño de sistema. Las empresas de la región que inviertan en esa capacidad de diseño —no solo en fine-tuning— serán las que extraigan valor real de la infraestructura compartida o propia.

Evaluar sin adivinar: leyes de escalado directas para benchmarks

Apple aporta el tercer pilar, también en ICLR 2026. El problema clásico: las leyes de escalado predicen loss de pre-entrenamiento, pero los ejecutivos necesitan saber accuracy en GSM8K, HumanEval o MMLU. El enfoque de dos etapas (loss → accuracy) acumula errores. Apple demuestra que, fijada la razón tokens/parámetros, la accuracy en 12 benchmarks sigue una ley de potencia directa sobre FLOPs de entrenamiento. No hay proxy intermedio. El ajuste es un Broken Neural Scaling Law con un punto de quiebre: convexo en cómputo bajo, cóncavo en alto.

Extienden la ley para variar la razón tokens/parámetros y para repeated sampling en código (pass@k). Validaron con modelos hasta 17B parámetros y 350B tokens en dos mezclas de datos.

La implicación operativa: se puede planear un run de entrenamiento con objetivo de benchmark, no de loss. Un CTO en São Paulo o Ciudad de México puede estimar: "Para subir 5 puntos en HumanEval necesito X FLOPs extra" y decidir si vale la pena. Eso convierte la I+D en IA en una decisión de portfolio con ROI cuantificable.

El enrutador que decide qué modelo llamar

RouteLLM es la cuarta pieza (ICLR 2025, UC Berkeley / Anyscale). El problema: no toda consulta necesita GPT-4o o Claude Opus. Un router entrenado con datos de preferencia humana (Chatbot Arena) aprende a mandar consultas simples a modelos pequeños (Mixtral-8x7B, Llama-3-8B) y las difíciles al modelo fuerte. Resultado: reducción de costo >2x sin perder calidad. El router generaliza a pares de modelos no vistos en entrenamiento.

APGR (Average Performance Gap Recovered) y CPT (Call-Performance Threshold), la métrica que proponen, dan lenguaje común a producto y finanzas: "Para recuperar 90 % de la calidad del modelo fuerte, el router llama al modelo fuerte solo el 37 % de las veces".

En LatAm, donde el costo por token de APIs propietarias se paga en dólares y el presupuesto en moneda local, el enrutamiento inteligente no es optimización: es viabilidad. Una startup fintech en Bogotá puede servir 10x más usuarios con el mismo presupuesto si implementa un router que deriva el 70 % del tráfico a un modelo abierto alojado en la nube local.

La pila completa ya no es opcional

Jalapeño, leyes de escalado MoE, leyes de escalado directas de benchmarks y enrutamiento aprendido no son cuatro papers aislados. Son las cuatro capas de la nueva pila:

1. Silicio hecho a la medida de la carga de inferencia real. 2. Arquitectura de modelo (MoE) que maximiza parámetros útiles por FLOP. 3. Planificación de entrenamiento guiada por métricas de negocio (benchmarks), no por loss. 4. Servicio en producción que elige el modelo justo para cada request.

OpenAI lo llama "full-stack infrastructure". Para el resto del mundo, es el fin de la era "alquilo GPUs y entreno lo que venga". La ventaja competitiva se mueve hacia quién diseña la pila para su carga de trabajo.

En América Latina, la mayoría de las empresas no diseñará chips. Pero sí puede —y debe— exigir a sus proveedores de nube que ofrezcan instancias con aceleradores de inferencia dedicados (no solo GPUs), adoptar arquitecturas MoE en sus fine-tunes, usar leyes de escalado directas para dimensionar runs, y desplegar routers frente a sus endpoints. La infraestructura se está volviendo programable. La región que aprenda a programarla —no solo a consumirla— definirá su lugar en la economía de la inteligencia abundante.

Fuentes

  1. La pila completa detrás de la inteligencia abundante
  2. OpenAI y Broadcom presentan el procesador de inteligencia
  3. Hacia un mayor apalancamiento: Leyes de escalado para modelos de lenguaje de mezcla de expertos eficientes
  4. Revisando las propiedades de escalado de las métricas descendentes en el entrenamiento de grandes modelos de lenguaje
  5. La inteligencia ya no está en el modelo - Enrique Dans
Shalem Pérez

Escrito por

Shalem Pérez

Desarrollador fullstack

Developer que habla humano. Conoce el código por dentro pero prefiere explicar lo que hace la tecnología a lo que dice el código. Especialista en herramientas de IA, flujos de automatización y tendencias que están redefiniendo cómo trabajamos y construimos. Si existe una nueva herramienta de IA, Shalem ya la probó — y tiene una opinión sobre ella.