Новая проблема ИИ в Китае не в чипах. Она заключается в нехватке обучающих данных на китайском языке.
TL;DR Китай сталкивается с критической нехваткой данных для ИИ. Китайский язык составляет всего 1,3% веб-контента по сравнению с 49% английского. Пекин планирует создание национальных наборов данных к 2028 году. WeChat и Douyin не делятся данными с внешними источниками. Издатели вводят запреты на обучение ИИ.
Гонка Китая в области ИИ столкнулась с новым ограничением, и это не чипы. Страна испытывает нехватку качественных данных для обучения на китайском языке. В то время как экспортные ограничения США на современные полупроводники доминируют в обсуждении возможностей ИИ Китая, китайские эксперты все чаще предупреждают, что нехватка данных может оказаться столь же ограничивающей, и, в отличие от чипов, нет аппаратного обходного решения. Китайский язык составляет всего 1,3% глобального веб-контента, согласно интернет-трекеру W3Techs, по сравнению с почти половиной для английского, 6% для испанского и 5% для японского.
Проблема глобальная, но в Китае она ощущается острее. Epoch AI оценивает, что мировые запасы качественного, общедоступного текста могут быть полностью исчерпаны в течение шести лет. Соучредитель OpenAI Андрей Карпаты предупреждал о "стене данных" к концу десятилетия. Китайские разработчики уже платят больше за полезный токен, чем их западные коллеги, потому что их модели должны работать усерднее с меньшим количеством материалов на родном языке. Цифровая экосистема Китая усугубляет нехватку: такие платформы, как WeChat и Douyin, не делятся данными с разработчиками третьих сторон, оставляя лаборатории ИИ обучаться на источниках низкого качества.
Пекин реагирует, рассматривая данные как стратегическую инфраструктуру. В июне Национальная администрация данных представила общенациональный план по созданию проверенных наборов данных для обучения ИИ к 2028 году, охватывающих производство, энергетику, здравоохранение, финансы, сельское хозяйство, автономное вождение и воплощенный ИИ. "Конкуренция в эпоху ИИ заключается не только в моделях и вычислительной мощности, но и в системах поставки качественных данных", - сказал Юй Сяохуэй, президент государственной академии информационных и коммуникационных технологий Китая. Компьютерный ученый Цинхуа Сун Маосунг призвал власти оцифровать исторические архивы, древние рукописи, научную литературу и региональные диалекты.
Не все хотят быть оцифрованными. Издательство Huaxia недавно добавило предупреждение к новому переводу: "Запрещено использовать содержание этой книги для обучения искусственного интеллекта. Нарушители будут нести юридическую ответственность." Китай уже беспокоится о американских моделях ИИ, с которыми не может сравниться, и нехватка данных объясняет часть этого разрыва. У США есть проект Anthropic Panama, который купил и уничтожил миллионы физических книг для их сканирования. У Китая 1,3% веба и издательская индустрия, которая начинает закрывать двери.
Другие статьи
Новая проблема ИИ в Китае не в чипах. Она заключается в нехватке обучающих данных на китайском языке.
Китайский язык составляет всего 1,3% глобального веб-контента. Пекин теперь рассматривает данные как стратегическую инфраструктуру, с планом на 2028 год по созданию национальных наборов данных ИИ.
