Anthropic запускает Claude Opus 5, свою четвертую модель за два месяца, и она превосходит Fable 5 по большинству тестов.
TL;DRClaude Opus 5 превосходит Fable 5 по большинству тестов при половинной цене токена и является самым согласованным моделью Anthropic на сегодняшний день.
Anthropic в четверг выпустила Claude Opus 5, модель, которая соответствует или превосходит ее флагманскую Fable 5 по большинству тестов программирования и знаний при половинной цене токена. Эта модель является четвертой, которую Anthropic выпустила менее чем за два месяца, после Fable 5 в начале июня, Sonnet 5 в конце июня и теперь Opus 5 24 июля. Она стоит 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов, такая же цена, как у ее предшественника.
На Frontier-Bench, оценке программирования, которая измеряет, могут ли модели создавать рабочее программное обеспечение из инженерных чертежей, Opus 5 более чем вдвое превышает оценку своего предшественника и превосходит каждую конкурирующую модель, включая Fable 5. На ARC-AGI 3, который тестирует новые способы решения проблем, Opus 5 набирает примерно в три раза больше, чем следующая лучшая модель. На Zapier AutomationBench, который измеряет, могут ли модели выполнять реальные бизнес-задачи от начала до конца, Opus 5 выполняет больше задач, чем любой соперник, даже на самом низком уровне усилий.
Anthropic утверждает, что Opus 5 также является самой согласованной моделью на сегодняшний день, с самым низким уровнем обманного поведения, зафиксированным в ее автоматизированном аудите безопасности. Его предшественник установил новую планку честности, когда был запущен в конце мая, а Opus 5 поднимает эту планку еще выше, оставаясь при этом позади Mythos 5 по задачам кибербезопасности. Anthropic говорит, что намеренно избегала обучения модели на киберработах, хотя она улучшилась в этих задачах как побочный эффект повышения общей способности.
Модель доступна сегодня как новый стандарт на Claude Max и самая мощная модель на Claude Pro. Разработчики могут получить к ней доступ через API, Amazon Bedrock, Google Cloud и Microsoft Foundry. Режим Fast работает в два с половиной раза быстрее стандартного режима за двойную базовую цену, и вместе с ним выпускаются две новые функции API: изменения инструментов в середине разговора, которые позволяют разработчикам менять инструменты, не нарушая кэш подсказок, и автоматические резервные копии, которые перенаправляют отмеченные запросы на другую модель вместо их блокировки.
Темп выпуска рассказывает более широкую историю о том, куда движется рынок моделей ИИ. Anthropic перешла от выпуска одного флагмана за квартал к четырем моделям примерно за восемь недель, каждая из которых нацелена на разные ценовые и производительные сегменты. Opus 5 заполняет пробел между дорогим уровнем Fable и бюджетным уровнем Sonnet, предлагая почти передовой интеллект для повседневного программирования и работы с знаниями без ограничений кибербезопасности, которые ограничивают Fable, или ограничений доступа, которые держат Mythos за закрытыми дверями.
Получите новостную рассылку TNW
Получайте самые важные новости технологий на свой почтовый ящик каждую неделю.
Другие статьи
Anthropic запускает Claude Opus 5, свою четвертую модель за два месяца, и она превосходит Fable 5 по большинству тестов.
Клод Опус 5 устанавливает новые рекорды на Frontier-Bench и ARC-AGI по цене $5 за миллион входных токенов, что вдвое дешевле Fable 5, и является наиболее согласованной моделью Anthropic.
