Radar Reflection AI presenta Beam, modelo abierto de 501 000 M parámetros con 1 M de contexto
Beam rivaliza con modelos chinos a menor costo de cómputo. Pero tres estudios paralelos revelan: se pueden extrañar razonamientos ocultos, la interpretabilidad avanza y los agentes requieren nueva infraestructura para ser confiables.
Reflection AI, startup fundada por exinvestigadores de Google DeepMind y respaldada por Nvidia, Sequoia y Lightspeed con una valoración de 25.000 millones de dólares presentó Beam: su primer modelo de pesos abiertos de 501.000 millones de parámetros (23.000 millones activos) entrenado con 23,8 billones de tokens y ventana de contexto de 1 millón TechCrunch. La arquitectura mixture-of-experts y el entrenamiento por refuerzo de alto cómputo permiten, según la empresa, igualar a GLM-5.2 de Z.ai en razonamiento avanzado usando 3 a 4 veces menos cómputo de inferencia. Los pesos se liberan este mes con distribución vía hyperscalers y neoclouds.
La diferencia no es solo el modelo. Reflection ha asegurado más de 7.000 millones de dólares en contratos de cómputo con SpaceX y Nebius para acceder a chips GB300 de Nvidia hasta 2029 TechCrunch. Su propuesta comercial es "fábricas de IA": sistemas que permiten a empresas y naciones entrenar modelos propios sobre datos propietarios en infraestructura local. Ya pilotean el concepto con Shinsegae Group en Corea del Sur PRNewswire. Para América Latina —donde Brasil, México y Chile exploran estrategias de IA soberana— este modelo "llave en mano" reduce la barrera de entrada: no hace falta construir un laboratorio de frontera; basta con alquilar la fábrica.
Pero tres investigaciones publicadas en paralelo exponen riesgos que ningún folleto de ventas menciona:
- Extracción de cadena de pensamiento oculta: EchoCoT demuestra que los razonamientos internos de modelos propietarios (Gemini-2.5, Claude, GPT-5) pueden recuperarse casi literalmente vía interacciones de API con tool-calling, extrayendo hasta 33.463 tokens de un CoT objetivo de 32.948 arXiv. Los tokens de razonamiento —activos de alto valor para entrenamiento y seguridad— no están tan protegidos como se asumía.
- Espacio de trabajo global interpretable: Anthropic identifica un "espacio de trabajo global" en modelos de lenguaje, análogo al acceso consciente humano, donde las representaciones verbalizables median razonamiento flexible y reporte Transformer Circuits. La técnica Jacobian Lens permite auditar pensamiento estratégico, detección de inyecciones de prompt y objetivos ocultos. La interpretabilidad deja de ser teórica para convertirse en herramienta de due diligence.
- Consistencia como brecha de despliegue: TRACE (Xiaomi/Nanjing/Tsinghua) muestra que incluso modelos frontera resuelven tareas una vez (Pass@k) pero fallan en consistencia repetida (Pass^k). Su banco de habilidades autoevolutivo cierra la brecha de 59,9% a 94,5% en GPT-5.5 sin reentrenar pesos arXiv. La fiabilidad no viene del modelo, sino de la andamiaje operativo.
Quién debe prestar atención: CTOs y CDOs evaluando proveedores de IA soberana o de código abierto para cargas críticas. Beam baja el costo de entrada a la fábrica propia, pero el paquete completo exige: (1) contratos que especifiquen protección de CoT y auditoría de razonamiento, (2) capa de interpretabilidad continua (estilo Jacobian Lens) para detectar derivas, y (3) marco de consistencia tipo TRACE antes de exponer agentes a usuarios finales. La carrera no la gana el modelo más barato; la gana quien opere la fábrica con visibilidad y control reales.