Революция ИИ оптимизирует неправильные вещи
TL;DRМодели Frontier AI становятся лучше в кодировании и агентских задачах, но хуже в общем письме. Основатель Wizard Labs Маз Ахмади сообщает о заметной регрессии по клиентским стандартам прозы после обновлений моделей. 44% организаций внедряют ИИ на уровне всего предприятия, но только 37% видят влияние на EBIT (McKinsey), разрыв между внедрением и ценностью растет. Его рецепт: создавать пользовательские оценочные комплекты до начала разработки и прекратить выбор моделей на основе публичных стандартов. Каждый крупный языковой модель, существующий сегодня, становится хуже в письме, и почти никто этого не измеряет. Индустрия продолжает спрашивать, какая модель самая умная, но более важный вопрос: умная в чем? В то время как технологические гиганты гонятся за прибыльными корпоративными контрактами, они оптимизируют передовые модели для кодирования, логики и автономных рабочих процессов агентов. В процессе общее письмо стало второстепенным. На наших клиентских стандартах моя команда заметила регрессию, которая должна насторожить любого, кто использует ИИ для коммуникации. По мере обновления моделей их производительность в письме активно снижается. Это может показаться эзотерической проблемой для инженеров и контент-команд. Это не так. ИИ теперь присутствует в повседневной работе миллионов людей. Почти девять из десяти компаний теперь регулярно используют ИИ в одной бизнес-функции: составление отчетов, ответы клиентам, подготовка юридических документов, написание кода, анализ исследований и принятие решений. Если основные модели оптимизируются для другой трактовки производительности, все унаследуют последствия. Последние дебаты по поводу водяных знаков текста ИИ делают это еще более интересным. Anthropic объявила в этом месяце, что будущие модели Claude будут ставить водяные знаки на сгенерированный текст, чтобы соответствовать Закону ЕС о ИИ. Техника использует статистические шаблоны в выборе токенов, чтобы сгенерированный текст можно было позже идентифицировать как вероятно связанный с Claude. Anthropic настаивает, что ее метод не оказывает практического влияния на качество, креативность или читаемость и ссылается на исследования, стоящие за этим подходом. Тем не менее, корпоративные пользователи должны задаваться вопросом, что происходит, когда модель одновременно оптимизируется под регуляторные требования, агентскую производительность, кодирование и рассуждение. Я уже видел доказательства в нашей собственной работе, что обновления моделей могут давать худшие результаты для конкретных задач письма. Водяные знаки могут оказаться безвредными в изоляции; я бы не стал утверждать иное. Но более широкая тенденция заслуживает внимания. Если передовые лаборатории оптимизируют по стандартам, которые способствуют принятию и доходам, модель может стать объективно лучше, становясь хуже для конкретного бизнеса. Это парадокс, с которым начинают сталкиваться предприятия. 44% организаций теперь сообщают о масштабировании ИИ на уровне всего предприятия, по сравнению с 38% годом ранее. Тем не менее, только 37% сообщают о каком-либо влиянии на EBIT на уровне предприятия от ИИ, в то время как 80% утверждают, что ИИ улучшил индивидуальную продуктивность. Технология распространяется быстрее, чем ценность. Я вижу одну и ту же ошибку снова и снова. Компания спрашивает: "Какая модель лучшая?" Она выбирает модель, доминирующую в публичных стандартах, строит вокруг нее систему и ожидает, что проект будет вести себя как традиционная разработка программного обеспечения. ИИ не работает таким образом. Модель, которая является лучшей обобщенной крупной языковой моделью, может быть посредственной в конкретном рабочем процессе компании. Единственным значимым тестом является сама задача. Это означает разработку пользовательских оценочных комплектов до начала разработки, измерение моделей по фактическим требованиям компании и затем постоянное тестирование этих результатов по мере изменения моделей. Здесь корпоративному ИИ нужна новая дисциплина. Начните с бизнес-проблемы, протестируйте технологию на реальной производительности и продолжайте уточнять ее, пока экономика и рабочий процесс не станут разумными, обеспечивая, чтобы технология поддерживала то, как бизнес на самом деле работает, прежде чем она будет масштабирована по всей организации. Может существовать более сильное будущее, где компании строят ИИ вокруг своих собственных данных и экспертизы, предоставляя сотрудникам системы поддержки принятия решений, которые могут расширять специализированные знания по всей организации. Опасность заключается в том, чтобы передать критическое суждение универсальным системам, рассматривая баллы стандартов как доказательство компетентности и обнаруживая слишком поздно, что технология была оптимизирована для чужого определения успеха. Я верю, что первое будущее принадлежит компаниям, готовым ставить под сомнение стандартные установки. Это также может означать пересмотр предположения о том, что каждое предприятие должно полагаться на крупнейшую собственную модель. Модели с открытыми весами становятся все более способными, и их можно размещать в инфраструктуре, выбранной организацией. Вопрос, который я слышу от предприятий о том, являются ли модели, разработанные в Китае, по своей сути небезопасными, часто формулируется как геополитический вопрос. Технически более важный вопрос заключается в том, где работает модель, кто контролирует инфраструктуру, какие данные покидают среду и какая архитектура безопасности ее окружает. Конкурентное преимущество будет заключаться в том, чтобы делать эти выборы намеренно. Природа революции ИИ изменилась с гонки за сырой интеллектуальностью на дисциплину соответствия инженерии. Будущие лидеры рынка не выиграют просто развернув последние базовые модели. Вместо этого успех будет на стороне организаций, которые определяют точные операционные потребности, устанавливают строгие стандарты и сохраняют стратегическую ясность, чтобы заменить разрекламированную, прославленную модель, когда менее гламурная альтернатива дает лучшие результаты. Руководители должны прекратить спрашивать своих поставщиков ИИ, какая модель лучшая. Они должны попросить их доказать, какая модель лучше для их бизнеса. Этот единственный сдвиг превратит ИИ из упражнения по закупке технологий в то, чем он на самом деле является: долгосрочным тестом конкурентного выживания.
Другие статьи
Революция ИИ оптимизирует неправильные вещи
По мере того как пограничные лаборатории оптимизируют кодирование и агентов, общее качество прозы снижается. Основатель Wizard Labs Маз Ахмади утверждает, что предприятиям следует прекратить спрашивать, какая модель лучше, и начать доказывать, какая из них лучше для их бизнеса.
