IA hoy DeepSeek mete ojo a los modelos baratos: visión casi gratis
El nuevo DeepSeek-V4-Flash-Vision-Exp añade visión por la mitad de precio que Opus 4.8 y promete agentes que leen pantallas. ¿El truco? Seguir costando 57 veces menos.
DeepSeek volvió a mover la mesa con un lanzamiento pensado para quien no quiere elegir entre un modelo que razona y otro que ve. Su nueva versión experimental del V4-Flash, denominada DeepSeek-V4-Flash-Vision-Exp, ahora procesa imágenes y capturas de pantalla con la misma eficiencia de razonamiento que la versión de texto, y cobra exactamente lo mismo que el modelo muerto. Según informó la compañía, esta adición de visión nace de un codificador visual que no toca los pesos del modelo original: sigue siendo un MoE de 284 mil millones de parámetros con 13 mil millones activos, la misma arquitectura que ya era barata en texto.
La novedad no es que un modelo vea, sino que esta funcionalidad deje de ser exclusiva de los modelos caros. Procesar un millón de tokens con este modelo experimental cuesta 0,22 dólares por entrada en hora valle y 0,44 dólares en hora punta. La ventaja no es solo de precio, es de categoría.
El ojo que mueve el marcador
El beneficio se nota sobre todo en tareas de agentes que tienen que moverse por interfaces reales. El modelo apenas cambia sus resultados cuando la entrada es texto puro: solo hay que comparar el test de Terminal-Bench 2.1, donde pasó de 82,7 a 83,9 de precisión. Pero cuando las pruebas incluyen capturas de pantalla o gráficos, multiplica su valor. En ApexBench, por ejemplo, pasa de 26,2 a 36,5 puntos: lo que antes ignoraba el contenido visual ahora lo lee, interpreta y así lo resuelve sin que nadie le dé instrucciones extra. Benchmarks como Chartography o ZeroBench no hay manera de correrlos con el modelo de solo texto, y se ven esos campos vacíos.
La empresa ha publicado sus propios benchmarks comparando la versión con visión contra la de solo texto, sin hacer grandes aspavientos. Comparar tu propio modelo con los grandes rivales y reclamar victorias parciales en agentes, con el tono que usa Anthropic, es un síntoma de que alguien anda buscando spots de humor.
LatAm y la promesa de la visión en planos operativos
Para una empresa que maneja documentos digitales, facturas escaneadas o sistemas de soporte por captura de pantalla en cualquier parte de América Latina donde el dólar pesa, la novedad desbloquea por sí misma la puesta en práctica de automatización visual. Cada imagen que envías se convierte en hasta 384 tokens, una fracción mínima de céntimo de dólar fuera de horas pico. Un flujo normal puede gastar cien imágenes por lote sin que el bolsillo tiemble, siempre que corra en hora valle.
El detalle que hay que vigilar: los audios, claro. Aunque el cerebro que hace hablar a este modelo es el mismo que ya venía funcionando en producción en V4 Flash, el camino de visión es nuevo y DeepSeek lo etiqueta como estado único de experimental, sin fecha de disponibilidad general. Para producciones críticas que van a enviar a la morgue millones al día, esperar por la versión oficial es una decisión de ingeniería más táctica que de capricho.
La decisión de enrutamiento que ya está en tu escritorio
Su precio no sube, su desempeño no baja en texto, y la capacidad de ver es insensible al régimen de funcionamiento. Antes de que llegue la versión estable, la única pregunta que queda es cuánto estás dispuesto a apostar por una API que algún día palme de un fallo silencioso a las dos de la mañana. Para quien quiere montar ahora un piloto de visión y ahorrarle al presupuesto del cuatrimestre, esta es la puerta más segura de entrada con costos del mismo nivel que la generación pasada. La respuesta no la da solo el modelo, la da la inteligencia de hoy y la pata sin ataduras en la que decides pasar la noche.