Players Granite 4.2: IBM apuesta por agentes de IA locales y soberanos para la empresa
La familia Granite 4.2 introduce razonamiento nativo, llamada de herramientas y licencia Apache 2.0. Permite desplegar agentes autónomos en infraestructura propia, clave para soberanía de datos y costos en LatAm.
IBM ha presentado Granite 4.2, una familia de modelos de lenguaje densos y de pesos abiertos diseñada desde la arquitectura para ejecutar agentes autónomos en infraestructura propia. La apuesta es clara: mientras la industria compite por modelos cada vez más grandes detrás de APIs cerradas, IBM entrega tres tamaños —3B, 8B y 30B parámetros— bajo licencia Apache 2.0, con razonamiento encadenado nativo, llamadas a herramientas integradas y una ventana de contexto de 128.000 tokens (512.000 en el modelo mayor) ver ficha técnica.
La ingeniería detrás del agente
La novedad no está solo en el tamaño. El entrenamiento rediseñado combina pre-entrenamiento desde cero sobre 15 billones de tokens con un pipeline de refuerzo en varias etapas: foundational RL para matemáticas, código y razonamiento en los tres modelos, y un bloque agentic RL exclusivo para las versiones de 8B y 30B que les enseña a operar terminales, buscar en la web y encadenar herramientas en entornos aislados reales detalle en blog de investigación. A esto se suma un trillón de tokens de código sintético generado con CodeAlchemy y un paso de mid-training que desbloquea capacidades de razonamiento más profundo análisis técnico completo.
El resultado práctico: un interruptor de "pensamiento" con tres modos —completo, nulo y bajo esfuerzo— que permite equilibrar latencia y profundidad por consulta. La llamada a funciones sigue el esquema de OpenAI y expone su razonamiento previo a la invocación, reduciendo alucinaciones en flujos multi-herramienta. El despliegue está optimizado para vLLM con speculative decoding, lo que acelera la inferencia y baja el costo por token guía de servicio.
Voz en el borde: Speech 5.0
En el mismo paquete llegan dos modelos de voz de apenas 470 millones de parámetros —Granite Speech 5.0 Turbo CTC y su variante no comercial—. Sin backbone de LLM, usan connectionist temporal classification para transcribir streaming a ~12.600 RTFx en una sola H200, triplicando el líder actual del leaderboard abierto de Hugging Face. Caben en una laptop y resuelven transcripción masiva de call centers o subtitulado en tiempo real sin enviar audio a la nube demo streaming.
Por qué importa en América Latina
Tres vectores convergen para la región. Primero, la licencia Apache 2.0 elimina regalías y permite fine-tuning y comercialización sin fricción legal; crítico para presupuestos ajustados y para evitar vendor lock-in con proveedores extranjeros. Segundo, el soporte nativo de español y portugués en el pre-entrenamiento y la evaluación multilingüe reduce la brecha de calidad frente al inglés sin ingeniería adicional. Tercero, la arquitectura densa y los tamaños compactos (especialmente el 3B y los modelos de voz) habilitan despliegue on-prem o edge donde la conectividad es inestable o la regulación —como la LGPD en Brasil o leyes de soberanía de datos en Colombia y México— exige que la información no salga del perímetro corporativo.
Un banco regional puede hoy montar un agente de conciliación contable que razona sobre extractos, consulta APIs internas y ejecuta scripts en su propio clúster GPU, sin compartir datos con terceros y pagando solo electricidad. Un contact center en Bogotá transcribe tres horas de grabaciones por segundo en un servidor local. La barrera de entrada deja de ser la licencia y pasa a ser la capacidad de operar el stack de servicio (vLLM, SGLang, harnesses como OpenCode u OpenHands).
IBM además firma criptográficamente los pesos y publica certificaciones ISO y transparency disclosures, dando trazabilidad de cadena de suministro —algo que empieza a exigir la contratación pública en Chile y Perú. La colaboración con Hirundo para machine unlearning post-entrenamiento promete retirar salidas indeseadas sin reentrenar, reduciendo riesgo regulatorio futuro.
El movimiento de IBM no es filantropía: apuesta a que la capa de inferencia y gobernanza —watsonx, Red Hat OpenShift AI— sea donde capture valor. Para el ejecutivo latinoamericano, la lección es operativa: ya existe una alternativa viable, auditable y en español para construir agentes propios. La pregunta ya no es si se puede, sino si la organización tiene la madurez de MLOps para sostenerla en producción.