DeepSeek lanza un modelo multimodal experimental para rivalizar con Anthropic
DeepSeek lanzó un modelo multimodal experimental el viernes y dijo que su rendimiento de agente está cerca del Opus-4.8 de Anthropic. En la propia tabla publicada por DeepSeek, supera ese modelo en tres benchmarks de once.
DeepSeek-V4-Flash-Vision-Exp está activo en la plataforma API de la empresa. Toma el V4-Flash solo de texto y añade la capacidad de leer imágenes y capturas de pantalla. Luego puede actuar sobre lo que ve. La empresa de Hangzhou también lanzó la versión 0.1.1 de su arnés de agente, con soporte incorporado.
“Este modelo multimodal experimental iguala a DeepSeek-V4-Flash en capacidades de texto, incluyendo agentes, razonamiento y conocimiento del mundo”, escribió DeepSeek en X. En benchmarks de agentes multimodales, “da un gran salto sobre V4-Flash, acercando el rendimiento del agente multimodal al Opus-4.8”.
Cuál Opus, y por qué importa menos de lo que parece
El Opus-4.8 llegó en mayo. Anthropic presentó Claude Opus 5 el 24 de julio, y TNW informó entonces que Opus 5 igualaba a Fable en codificación por la mitad del costo.
El Opus-4.8 no ha desaparecido. La página de depreciación del modelo de Anthropic lo lista como Activo, un estado que la empresa define como totalmente soportado y recomendado para su uso, sin retiro antes de mayo de 2027. Cinco modelos Opus tienen ese estado al mismo tiempo.
Así que DeepSeek eligió un competidor actual y soportado en lugar de uno abandonado. Lo que la tabla no incluye es una columna de Opus 5, y nadie más ha publicado esa comparación tampoco. Cómo se mide V4-Flash-Vision-Exp contra el Opus más nuevo de Anthropic es simplemente desconocido, y el lanzamiento no afirma lo contrario.
Bloomberg informó sobre el lanzamiento el viernes, describiendo el Opus 4.8 como un modelo avanzado de Anthropic.
Lo que realmente dicen los números
DeepSeek publicó once resultados de benchmarks. Su nuevo modelo supera al Opus-4.8 en tres de ellos.
Gana en DeepSWE por 1.3 puntos, en el Último Examen de Agentes por 1.6, y en ZeroBench por 1.0. En los otros ocho queda atrás. En dos de esos el margen es amplio. NL2Repo tiene a DeepSeek en 57.7 contra 69.7, una diferencia de 12 puntos. DSBench-Hard lo tiene en 63.6 contra 71.7.
Los resultados cercanos son genuinamente cercanos. Toolathlon-Verified divide 75.9 a 76.2. Chartography divide 64.3 a 65.0. Terminal Bench 2.1 es 83.9 contra 85.0.
Un número vale la pena señalar por lo que dice sobre el campo en lugar de la competencia. En AutomationBench, los tres modelos puntúan en los veinticinco medios: 25.7, 25.1 y 27.2. Cualquiera que sea la habilidad actual de los agentes, ese benchmark no es.
El salto multimodal tiene un asterisco, y DeepSeek lo proporcionó
La afirmación principal es el salto en el rendimiento del agente multimodal sobre V4-Flash. En ApexBench eso es 36.5 contra 26.2, y en el Último Examen de Agentes 27.3 contra 25.2.
La propia nota al pie de DeepSeek explica parte de la brecha. En esas dos evaluaciones, dice, el V4-Flash basado en texto “ignora los elementos multimodales contenidos en él”. El modelo más antiguo está siendo evaluado en pruebas que contienen imágenes que no puede ver.
Eso no hace que las puntuaciones del nuevo modelo sean incorrectas. Significa que el salto es en parte una medida de lo que sucede cuando le das a un modelo ciego una prueba de visión. DeepSeek lo divulgó en la tabla en lugar de dejarlo para ser encontrado, lo cual es más de lo que hacen muchos laboratorios.
DeepSeek está subestimando un resultado
La empresa dice que el modelo de visión “igual” a V4-Flash en texto. En sus propias cifras lo hace mejor que eso.
A través de los siete benchmarks de texto, la variante de visión supera al modelo solo de texto en seis. Toolathlon-Verified mejora en 5.6 puntos, DeepSWE en 4.9, DSBench-Hard en 4.0. Cybergym es la excepción. Allí el modelo de visión puntúa 75.3 contra 76.7, así que añadir visión le costó 1.4 puntos en un benchmark de seguridad.
Cada una de estas cifras proviene de DeepSeek. La empresa afirma que evaluó sus propios modelos utilizando su propio arnés en modo mínimo, con temperatura en 1.0 y top_p en 0.95. Los benchmarks de proveedores son normales, y se divulgan los ajustes. Siguen siendo del proveedor.
Por qué la comparación importa comercialmente
La razón por la que todo esto tiene relevancia es el precio. Una investigación de este mes encontró que el V4-Flash es el modelo bien conocido más barato de ejecutar. Un millón de palabras cuesta alrededor de 87 centavos de DeepSeek frente a aproximadamente $50 de Anthropic, una diferencia que los compradores corporativos ya han notado.
Contra esa diferencia, quedar atrás por uno o dos puntos es un argumento comercial en lugar de una derrota. Perder en NL2Repo por 12 puntos es un asunto diferente. El trabajo a escala de repositorio es exactamente lo que las empresas están comprando agentes para hacer.
DeepSeek confirmó por separado en su propio sitio que la versión oficial de V4-Pro ha sido lanzada, con lo que llama capacidades de agente significativamente mejoradas, soporte para la API de Respuestas e integración de Codex. Ese es el modelo que la mayoría de los compradores empresariales realmente estarían considerando, y tampoco está en la tabla del viernes.
Lee la afirmación, luego lee la tabla
Nada de esto es inusual. Los laboratorios eligen líneas de base favorables. La mesa ha estado aquí recientemente, cuando Alibaba llamó a Qwen el modelo abierto más descargado del mundo, lo cual era cierto por un margen menor al reclamado.
La declaración de DeepSeek es defendible en sus propios términos. Dijo que está cerca de Opus-4.8, y en varios benchmarks está cerca de Opus-4.8. No dijo que está cerca del modelo más nuevo de Anthropic, y no afirmó liderar en el conjunto.
La prueba que lo resolvería tiene un nombre y no resultados. Alguien necesita ejecutar V4-Flash-Vision-Exp contra Opus 5 en el mismo arnés. Hasta entonces, el resumen honesto es más estrecho que los titulares. Un modelo multimodal experimental chino se sitúa dentro de unos pocos puntos de un modelo estadounidense soportado en la mayoría de un conjunto de benchmarks, gana tres de once, cuesta una fracción, y queda atrás por doce puntos en la tarea más difícil en él.
Otros artículos
DeepSeek lanza un modelo multimodal experimental para rivalizar con Anthropic
El modelo multimodal experimental de DeepSeek gana tres de once puntos de referencia contra Opus-4.8 de Anthropic, en la propia tabla publicada de DeepSeek.
