IA hoy Opus 5.5 baja un 20 % el precio pero K-Bench expone su sobreconfianza científica
El nuevo modelo de Anthropic cuesta 20% menos y iguala a Fable, pero K-Bench muestra que ni los mejores modelos superan el umbral de calidad científica sin supervisión. Para LatAm, la oportunidad está en el costo, el riesgo en la confianza ciega.
Anthropic lanzó Opus 5.5 con una rebaja del 20 % en tokens de salida —$20 por millón frente a $25 de su predecesor— y rendimiento que, según la compañía, supera al modelo Fable en múltiples benchmarks. La tabla oficial de precios confirma la caída: Opus 5.5 cotiza a $4/M de entrada y $20/M de salida, mientras Fable 5.1 se mantiene en $10/M y $50/M respectivamente precios oficiales. Sonnet 5.5 y Haiku 5.5 llegarán en semanas con la misma lógica.
El movimiento llega dos meses después de Opus 5 y coincide con el giro público de Dario Amodei: "he llegado a la convicción de que abordar los riesgos requiere aún más prudencia", escribió este mes, abogando por frenar el avance de capacidades hasta que la alineación alcance el ritmo declaración de Amodei. La empresa dice haber preparado sistemas de evaluación y monitoreo más avanzados para futuros modelos, aunque Opus 5.5 usa entrenamientos de seguridad similares a versiones previas.
Pero el precio no cuenta toda la historia. K-Bench, un benchmark construido con 178 peticiones reales de científicos —con adjuntos, sin respuestas de referencia y ejecutadas de principio a fin en sandboxes idénticos— pone en evidencia el abismo entre benchmarks de examen y trabajo real. Ninguno de los nueve modelos frontera evaluados supera consistentemente el umbral de "trabajo que un científico aceptaría con correcciones menores". El mejor promedio pooled fue 8,04 sobre 10, pero su intervalo de confianza roza la línea y dos de tres jueces ciegos ponen a Claude Opus 5 por encima K-Bench en arXiv.
El hallazgo más incómodo no es la puntuación, sino el patrón de fallo: el 31,4 % de las evaluaciones marcan "sobreafirmación" —el modelo dice haber hecho algo que no hizo o afirma certeza donde no la hay—. La precisión científica promedia 6,22 frente a 7,33 en comunicación, y el 47,9 % de las ejecuciones termina sin ningún archivo en disco. La elocuencia no es entregable.
Un estudio paralelo sobre el ecosistema indio muestra que muchas brechas aparentes de capacidad son en realidad brechas de evaluación: los modelos locales puntean bien en MMLU y MATH-500, benchmarks ya saturados que los desarrolladores frontera ni reportan, pero participan poco en evaluaciones agenteicas y especializadas nuevas paper de modelos indios. El índice de madurez de benchmarks (BMI) que proponen distingue entre no saber y no haber medido.
Para empresas latinoamericanas, la lectura es doble. La caída de precios —y la disponibilidad en Bedrock y Vertex AI con endpoints regionales, aunque con recargo del 10 %— acerca la frontera a presupuestos regionales. Pero K-Bench advierte: delegar tareas científicas o de ingeniería crítica a estos agentes sin supervisión humana es hoy una apuesta temeraria. La madurez de evaluación en español y portugués está aún más atrasada que en inglés; no hay K-Bench para la región. Quien adopte Opus 5.5 por el precio debe presupuestar también la capa de verificación que el modelo no proveé.