DeepSeek запускает экспериментальную мультимодальную модель, чтобы составить конкуренцию Anthropic
DeepSeek выпустила экспериментальную мультимодальную модель в пятницу и заявила, что ее производительность агентов близка к Opus-4.8 от Anthropic. В опубликованной таблице DeepSeek она обходит эту модель по трем бенчмаркам из одиннадцати.
DeepSeek-V4-Flash-Vision-Exp доступна на API платформе компании. Она берет текстовую версию V4-Flash и добавляет возможность читать изображения и скриншоты. Затем она может действовать в зависимости от того, что видит. Компания из Ханчжоу также выпустила версию 0.1.1 своего каркаса для агентов с встроенной поддержкой.
«Эта экспериментальная мультимодальная модель соответствует DeepSeek-V4-Flash по текстовым возможностям, включая агентов, рассуждения и знание мира», — написала DeepSeek в X. По мультимодальным бенчмаркам агентов она «совершает значительный скачок по сравнению с V4-Flash, приближая производительность мультимодальных агентов к Opus-4.8».
Какой Opus и почему это имеет меньшее значение, чем кажется
Opus-4.8 появился в мае. Anthropic представила Claude Opus 5 24 июля, и TNW тогда сообщила, что Opus 5 соответствует Fable по кодированию за половину стоимости.
Opus-4.8 никуда не делся. Страница устаревания моделей Anthropic указывает на него как на активный, статус, который компания определяет как полностью поддерживаемый и рекомендуемый для использования, с отсутствием выхода на пенсию ранее мая 2027 года. Пять моделей Opus одновременно имеют этот статус.
Таким образом, DeepSeek выбрала текущего, поддерживаемого конкурента, а не заброшенного. В таблице нет колонки Opus 5, и никто другой также не опубликовал это сравнение. Как V4-Flash-Vision-Exp соотносится с самым новым Opus от Anthropic, просто неизвестно, и релиз не утверждает иного.
Bloomberg сообщила о релизе в пятницу, описывая Opus 4.8 как продвинутую модель Anthropic.
Что на самом деле говорят цифры
DeepSeek опубликовала одиннадцать результатов бенчмарков. Ее новая модель обходит Opus-4.8 по трем из них.
Она выигрывает у DeepSWE на 1.3 балла, у Agents’ Last Exam на 1.6 и у ZeroBench на 1.0. По другим восьми она отстает. По двум из них разрыв значительный. NL2Repo показывает DeepSeek на уровне 57.7 против 69.7, разрыв в 12 баллов. DSBench-Hard показывает 63.6 против 71.7.
Близкие результаты действительно близки. Toolathlon-Verified разделяет 75.9 на 76.2. Chartography разделяет 64.3 на 65.0. Terminal Bench 2.1 составляет 83.9 против 85.0.
Одно число стоит отметить за то, что оно говорит о поле, а не о соревновании. На AutomationBench все три модели набирают баллы в среднем по двадцатым: 25.7, 25.1 и 27.2. Что бы агенты сейчас ни умели, этот бенчмарк не об этом.
Мультимодальный скачок имеет звездочку, и DeepSeek ее предоставила
Основное утверждение — это скачок в производительности мультимодальных агентов по сравнению с V4-Flash. На ApexBench это 36.5 против 26.2, а на Agents’ Last Exam 27.3 против 25.2.
Собственная сноска DeepSeek объясняет часть разрыва. В этих двух оценках, говорится, текстовая версия V4-Flash «игнорирует мультимодальные элементы, содержащиеся в ней». Более старая модель оценивается по тестам, содержащим изображения, которые она не может видеть.
Это не делает оценки новой модели неправильными. Это означает, что скачок частично является измерением того, что происходит, когда вы даете слепой модели тест на зрение. DeepSeek раскрыла это в таблице, а не оставила на усмотрение, что больше, чем делают многие лаборатории.
DeepSeek недооценивала один результат
Компания утверждает, что визуальная модель «соответствует» V4-Flash по тексту. По собственным данным она делает это лучше.
По семи текстовым бенчмаркам визуальный вариант обходит текстовую модель по шести. Toolathlon-Verified улучшает на 5.6 баллов, DeepSWE на 4.9, DSBench-Hard на 4.0. Cybergym — исключение. Там визуальная модель набирает 75.3 против 76.7, так что добавление зрения стоило ей 1.4 балла по бенчмарку безопасности.
Каждое из этих чисел исходит от DeepSeek. Компания заявляет, что оценила свои собственные модели, используя свой собственный каркас в минимальном режиме, с температурой 1.0 и top_p 0.95. Бенчмарки поставщиков являются нормальными, и настройки раскрыты. Они все еще принадлежат поставщику.
Почему сравнение имеет коммерческое значение
Причина, по которой все это имеет значение, — цена. Исследование этого месяца показало, что V4-Flash является самой дешевой известной моделью для запуска. Миллион слов стоит около 87 центов от DeepSeek против примерно 50 долларов от Anthropic, разрыв, который корпоративные покупатели уже заметили.
На фоне этого разрыва отставание на балл или два является коммерческим аргументом, а не поражением. Проиграть NL2Repo на 12 баллов — это другое дело. Работа на уровне репозитория именно то, что предприятия покупают для агентов.
DeepSeek отдельно подтвердила на своем сайте, что официальная версия V4-Pro была выпущена, с тем, что она называет значительно улучшенными возможностями агентов, поддержкой Responses API и интеграцией Codex. Это модель, которую большинство корпоративных покупателей действительно будут оценивать, и ее также нет в таблице пятницы.
Прочитайте утверждение, затем прочитайте таблицу
Ничего из этого не является необычным. Лаборатории выбирают благоприятные базовые линии. Стол был здесь недавно, когда Alibaba назвала Qwen самой скачиваемой открытой моделью в мире, что было правдой с меньшим отрывом, чем заявлено.
Заявление DeepSeek можно защитить на его собственных условиях. Оно сказало, что близко к Opus-4.8, и по нескольким бенчмаркам оно близко к Opus-4.8. Оно не сказало, что близко к самой новой модели Anthropic, и не утверждало, что ведет по набору.
Тест, который мог бы это установить, имеет имя и нет результатов. Кто-то должен запустить V4-Flash-Vision-Exp против Opus 5 на том же каркасе. До тех пор честное резюме уже более узкое, чем заголовки. Экспериментальная китайская мультимодальная модель находится в нескольких баллах от поддерживаемой американской модели по большинству наборов бенчмарков, выигрывает три из одиннадцати, стоит лишь часть стоимости и отстает на двенадцать баллов по самой сложной задаче в нем.
Другие статьи
DeepSeek запускает экспериментальную мультимодальную модель, чтобы составить конкуренцию Anthropic
Экспериментальная мультимодальная модель DeepSeek выигрывает три из одиннадцати тестов против Opus-4.8 от Anthropic, согласно опубликованной таблице DeepSeek.
