DeepSeek mete ojo a los modelos baratos: visión casi gratis

El nuevo DeepSeek-V4-Flash-Vision-Exp añade visión por la mitad de precio que Opus 4.8 y promete agentes que leen pantallas. ¿El truco? Seguir costando 57 veces menos.

DeepSeek mete ojo a los modelos baratos: visión casi gratis

Foto: Matheus Bertelli

DeepSeek volvió a mover la mesa con un lanzamiento pensado para quien no quiere elegir entre un modelo que razona y otro que ve. Su nueva versión experimental del V4-Flash, denominada DeepSeek-V4-Flash-Vision-Exp, ahora procesa imágenes y capturas de pantalla con la misma eficiencia de razonamiento que la versión de texto, y cobra exactamente lo mismo que el modelo muerto. Según informó la compañía, esta adición de visión nace de un codificador visual que no toca los pesos del modelo original: sigue siendo un MoE de 284 mil millones de parámetros con 13 mil millones activos, la misma arquitectura que ya era barata en texto.

La novedad no es que un modelo vea, sino que esta funcionalidad deje de ser exclusiva de los modelos caros. Procesar un millón de tokens con este modelo experimental cuesta 0,22 dólares por entrada en hora valle y 0,44 dólares en hora punta. La ventaja no es solo de precio, es de categoría.

El ojo que mueve el marcador

Patrocinado Advertisement

El beneficio se nota sobre todo en tareas de agentes que tienen que moverse por interfaces reales. El modelo apenas cambia sus resultados cuando la entrada es texto puro: solo hay que comparar el test de Terminal-Bench 2.1, donde pasó de 82,7 a 83,9 de precisión. Pero cuando las pruebas incluyen capturas de pantalla o gráficos, multiplica su valor. En ApexBench, por ejemplo, pasa de 26,2 a 36,5 puntos: lo que antes ignoraba el contenido visual ahora lo lee, interpreta y así lo resuelve sin que nadie le dé instrucciones extra. Benchmarks como Chartography o ZeroBench no hay manera de correrlos con el modelo de solo texto, y se ven esos campos vacíos.

La empresa ha publicado sus propios benchmarks comparando la versión con visión contra la de solo texto, sin hacer grandes aspavientos. Comparar tu propio modelo con los grandes rivales y reclamar victorias parciales en agentes, con el tono que usa Anthropic, es un síntoma de que alguien anda buscando spots de humor.

LatAm y la promesa de la visión en planos operativos

Para una empresa que maneja documentos digitales, facturas escaneadas o sistemas de soporte por captura de pantalla en cualquier parte de América Latina donde el dólar pesa, la novedad desbloquea por sí misma la puesta en práctica de automatización visual. Cada imagen que envías se convierte en hasta 384 tokens, una fracción mínima de céntimo de dólar fuera de horas pico. Un flujo normal puede gastar cien imágenes por lote sin que el bolsillo tiemble, siempre que corra en hora valle.

El detalle que hay que vigilar: los audios, claro. Aunque el cerebro que hace hablar a este modelo es el mismo que ya venía funcionando en producción en V4 Flash, el camino de visión es nuevo y DeepSeek lo etiqueta como estado único de experimental, sin fecha de disponibilidad general. Para producciones críticas que van a enviar a la morgue millones al día, esperar por la versión oficial es una decisión de ingeniería más táctica que de capricho.

La decisión de enrutamiento que ya está en tu escritorio

Su precio no sube, su desempeño no baja en texto, y la capacidad de ver es insensible al régimen de funcionamiento. Antes de que llegue la versión estable, la única pregunta que queda es cuánto estás dispuesto a apostar por una API que algún día palme de un fallo silencioso a las dos de la mañana. Para quien quiere montar ahora un piloto de visión y ahorrarle al presupuesto del cuatrimestre, esta es la puerta más segura de entrada con costos del mismo nivel que la generación pasada. La respuesta no la da solo el modelo, la da la inteligencia de hoy y la pata sin ataduras en la que decides pasar la noche.

Fuentes

  1. DeepSeek lanza IA experimental que interpreta imágenes con gran precisión
  2. DeepSeek V4 Flash Vision (Exp) contra V4-Flash - OrcaRouter
  3. Deepseek-v4: Hacia una inteligencia de contexto de millón de tokens altamente eficiente
  4. ¿Puede DeepSeek razonar como un cirujano? Una evaluación empírica para la comprensión visión-lenguaje en cirugía asistida por robot
  5. DeepSeek lanza un modelo de IA experimental que rivaliza con Opus 4.8 de Anthropic en tareas de agentes y multimodal
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.