Новый ультрабыстрый режим OpenAI работает на GPT-5.6 Sol в 14 раз быстрее на чипах Cerebras.
OpenAI хочет, чтобы его самый умный модель также была самой быстрой. Компания представила Ultrafast, новый уровень своего API, который запускает флагманский GPT-5.6 Sol с скоростью до 14 раз выше обычной, достигая около 750 токенов вывода в секунду, на оборудовании, созданном производителем чипов Cerebras.
Ultrafast не является новой моделью, скорее это новый способ обслуживания существующей. Он опирается на огромные чипы Cerebras, чтобы устранить задержки, которые долгое время преследовали передовой ИИ, и OpenAI открыла ограниченный предварительный просмотр 13 августа для небольшой группы клиентов, с планами расширить доступ по мере увеличения мощности.
Предложение основывается на компромиссе, который, по словам OpenAI, наконец можно разрешить. До сих пор любой, кто хотел получать действительно мгновенные ответы, должен был перейти на меньшую, менее мощную модель, принимая меньшую интеллектуальность в обмен на скорость.
Ultrafast предназначен для предоставления передового уровня рассуждений и почти мгновенных ответов одновременно, а не для выбора между ними.
Это сочетание имеет наибольшее значение для агентного программного обеспечения, за которым гонится вся индустрия. ИИ-агент, который должен думать тридцать секунд перед каждым шагом, является демонстрацией, в то время как тот, кто отвечает за время, необходимое для ведения разговора, начинает ощущаться как продукт.
Скорость, другими словами, тихо становится такой же важной характеристикой, как и чистая умность.
OpenAI нацеливает этот уровень на работу, чувствительную ко времени, включая реагирование на инциденты и отладку, финансовые исследования и обнаружение мошенничества, поддержку клиентов в реальном времени и голосовые услуги, а также электронную коммерцию.
Ранние тестировщики, такие как Jane Street, Podium, Basis и Rogo, описывают изменения как качественные, а не инкрементальные, один из них говорит, что скорость «полностью меняет опыт вызова для сложной работы» и открывает «синхронные опыты для пользователей, которые ранее были ограничены интеллектом».
Для Cerebras сделка является знаковым одобрением в подходящий момент. Компания вышла на биржу в одном из крупнейших размещений года, но с тех пор испытывает трудности с убеждением рынка в том, что амбиции по производству чипов в масштабе вафли переводятся в устойчивую прибыль, поэтому поддержка самой быстрой категории OpenAI — это именно то подтверждение, которое ей было нужно.
Это также напоминание о том, что экзотические архитектуры чипов, когда-то отвергнутые как научные проекты, теперь выполняют реальную работу для крупнейших имен в ИИ.
Сама скорость приходит от необычного инженерного решения. Cerebras строит процессоры размером с обеденную тарелку, вырезанные из одной кремниевой вафли, что позволяет всей модели находиться на одном чипе, а не быть разделенной между стойками графических процессоров Nvidia, которые постоянно должны передавать данные между собой.
Устранение этого внутреннего трафика и есть то, что сокращает задержку между запросом и ответом, и это основа долгосрочного аргумента компании о том, что ее дизайн подходит для вывода гораздо лучше, чем универсальные чипы, созданные для обучения.
Этот шаг также соответствует более широкому сдвигу. Поскольку чистая мощность модели начинает достигать плато, конкуренция перемещается к тому, кто может запускать эти модели быстрее и дешевле, гонка, которая подняла специалистов по выводу, таких как Groq, и превратила задержку в торговую точку.
Конкуренты, такие как SambaNova и группа специализированных облаков, гонятся за тем же призом, и рынок все больше вознаграждает тех, кто может заставить данную модель ответить быстрее всего, а не просто тех, кто обучил самую большую.
Для OpenAI опора на Cerebras также является тихим шагом к уменьшению зависимости от Nvidia, в рамках работы над собственным пользовательским кремнием.
OpenAI не опубликовала цены, и запуск своей топовой модели на специализированном оборудовании со скоростью 14 раз выше вряд ли будет дешевым, поэтому Ultrafast может остаться премиум-опцией для случаев, одержимых задержкой, а не стандартной настройкой.
Это также всего лишь предварительный просмотр, доступный лишь небольшой группе клиентов, пока OpenAI ищет возможности. Тем не менее, сообщение достаточно ясно. На следующем этапе гонки ИИ быть умным не будет иметь большого значения, если вы также медлительны.
Другие статьи
Новый ультрабыстрый режим OpenAI работает на GPT-5.6 Sol в 14 раз быстрее на чипах Cerebras.
OpenAI представила Ultrafast, уровень API, который работает на GPT-5.6 Sol с скоростью до 14 раз быстрее на оборудовании Cerebras, делая ставку на то, что задержка, а не только интеллект, делает ИИ-агентов удобными для использования.
