DeepSeek lanza modelo multimodal competitivo con Opus 4.8

⏱ Tiempo de lectura: 4 min
DeepSeek presentó V4 Flash Vision Exp, un modelo de lenguaje multimodal disponible en su plataforma de desarrolladores de pago. La startup china comparó el nuevo modelo contra su predecesor V4 Flash en siete benchmarks basados en texto, obteniendo mejoras en todos salvo uno: Cybergym, que evalúa la detección de vulnerabilidades de software. El rendimiento más notable aparece en análisis de imágenes, donde supera en más de un 10 % a su versión anterior en dos de cuatro pruebas de evaluación.
Desempeño competitivo frente a Anthropic Opus 4.8
V4 Flash Vision Exp superó al modelo Opus 4.8 de Anthropic en dos benchmarks visuales específicos: ALE y ZeroBench. ALE contiene más de 1.000 tareas multietapa que requieren que los modelos interactúen con aplicaciones, escriban código e interpreten archivos de medios. ZeroBench, por su lado, incluye 100 tareas de análisis de imágenes diseñadas para ser altamente desafiantes para modelos de frontera. DeepSeek aún no ha compartido detalles sobre la arquitectura interna de V4 Flash Vision Exp, aunque la página de Hugging Face de la empresa sí detalla el modelo V4 Flash del que se deriva.
Arquitectura y optimizaciones técnicas
V4 Flash es un modelo de mezcla de expertos con 284 mil millones de parámetros, compuesto por múltiples redes neuronales de 13 mil millones de parámetros cada una. El sistema activa solo la red neuronal más adecuada para cada pregunta del usuario, reduciendo significativamente el consumo de hardware respecto a activar el modelo completo. DeepSeek implementa dos técnicas de compresión: HCA y CSA, que reducen un 73 % el poder computacional necesario para procesar indicaciones de 1 millón de tokens. La empresa entrenó V4 Flash con 32 billones de tokens usando un algoritmo llamado Muon, que acelera la calibración de capas ocultas. DeepSeek también lanzó V4 Pro en abril, modelo con más de cinco veces los parámetros de V4 Flash. Ambos modelos forman parte de la serie V4 de modelos de lenguaje de la startup. Es posible que V4 Pro eventualmente también origine versiones especializadas optimizadas para análisis de imágenes u otras tareas específicas.
Disponibilidad y próximos pasos
V4 Flash Vision Exp está disponible únicamente en la plataforma de desarrolladores de pago de DeepSeek. La empresa ha abierto como código fuente varios de sus modelos anteriores, por lo que podría liberar una versión gratuita en el futuro. V4 Flash, lanzado en abril de 2026, fue el primer paso hacia esta arquitectura más eficiente. Según reporta SiliconANGLE, la estrategia de DeepSeek apunta a entregar modelos de menor consumo sin sacrificar capacidades visuales ni textuales.
| Elemento | Detalle |
|---|---|
| Modelo | V4 Flash Vision Exp |
| Tipo | Modelo multimodal de lenguaje |
| Disponibilidad actual | Plataforma de desarrolladores de pago de DeepSeek |
| Versión gratuita | Posible futura; DeepSeek ha abierto como código fuente modelos anteriores |
| Modelo base | V4 Flash (284 mil millones de parámetros) |
| Benchmarks de texto superados | 6 de 7 (excepto Cybergym) |
| Mejora en análisis de imágenes | Más de 10 % superior a V4 Flash en 2 de 4 benchmarks visuales |
| Competencia directa | Supera a Opus 4.8 de Anthropic en benchmarks ALE y ZeroBench |
| Arquitectura | No se especifica en el texto fuente recibido para V4 Flash Vision Exp |
| Fecha de lanzamiento | 21 de agosto de 2026 |
Preguntas frecuentes sobre V4 Flash Vision Exp
¿Cuál es la diferencia entre V4 Flash Vision Exp y V4 Flash?
V4 Flash Vision Exp agrega capacidades multimodales de análisis de imágenes. En benchmarks de texto supera a V4 Flash en 6 de 7 evaluaciones, con la mayor mejora en procesamiento visual: más de 10 % superior en dos de cuatro pruebas de benchmarks visuales.
¿Cómo accedo a V4 Flash Vision Exp?
Actualmente solo está disponible en la plataforma de desarrolladores de pago de DeepSeek. La empresa podría liberar una versión gratuita en el futuro, dado que ha abierto como código fuente modelos anteriores.
¿Qué tan competitivo es frente a otros modelos de frontera?
Supera a Opus 4.8 de Anthropic en dos benchmarks visuales específicos: ALE (más de 1.000 tareas multietapa) y ZeroBench (100 tareas de análisis de imágenes). En benchmarks de texto, V4 Flash Vision Exp superó a su predecesor en 6 de 7 pruebas.
Qué conviene mirar de cerca
El enfoque de DeepSeek en eficiencia computacional mediante mezcla de expertos y compresión de caché marca una tendencia en la industria: modelos más capaces con menor consumo de hardware. La comparación directa contra Opus 4.8 sugiere que la brecha de rendimiento entre startups chinas y laboratorios occidentales continúa estrechándose, especialmente en tareas visuales.
En Inteligencia Artificial, el lanzamiento subraya que la competencia multimodal se intensifica más allá de generación de texto. ¿Cuál será el siguiente paso: disponibilidad gratuita o modelos aún más optimizados?
Fuente: siliconangle.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.