Новая проблема ИИ в Китае не в чипах. Она заключается в нехватке обучающих данных на китайском языке.

Новая проблема ИИ в Китае не в чипах. Она заключается в нехватке обучающих данных на китайском языке.

      TL;DR Китай сталкивается с критической нехваткой данных для ИИ. Китайский язык составляет всего 1,3% веб-контента по сравнению с 49% английского. Пекин планирует создание национальных наборов данных к 2028 году. WeChat и Douyin не делятся данными с внешними источниками. Издатели вводят запреты на обучение ИИ.

      Гонка Китая в области ИИ столкнулась с новым ограничением, и это не чипы. Страна испытывает нехватку качественных данных для обучения на китайском языке. В то время как экспортные ограничения США на современные полупроводники доминируют в обсуждении возможностей ИИ Китая, китайские эксперты все чаще предупреждают, что нехватка данных может оказаться столь же ограничивающей, и, в отличие от чипов, нет аппаратного обходного решения. Китайский язык составляет всего 1,3% глобального веб-контента, согласно интернет-трекеру W3Techs, по сравнению с почти половиной для английского, 6% для испанского и 5% для японского.

      Проблема глобальная, но в Китае она ощущается острее. Epoch AI оценивает, что мировые запасы качественного, общедоступного текста могут быть полностью исчерпаны в течение шести лет. Соучредитель OpenAI Андрей Карпаты предупреждал о "стене данных" к концу десятилетия. Китайские разработчики уже платят больше за полезный токен, чем их западные коллеги, потому что их модели должны работать усерднее с меньшим количеством материалов на родном языке. Цифровая экосистема Китая усугубляет нехватку: такие платформы, как WeChat и Douyin, не делятся данными с разработчиками третьих сторон, оставляя лаборатории ИИ обучаться на источниках низкого качества.

      Пекин реагирует, рассматривая данные как стратегическую инфраструктуру. В июне Национальная администрация данных представила общенациональный план по созданию проверенных наборов данных для обучения ИИ к 2028 году, охватывающих производство, энергетику, здравоохранение, финансы, сельское хозяйство, автономное вождение и воплощенный ИИ. "Конкуренция в эпоху ИИ заключается не только в моделях и вычислительной мощности, но и в системах поставки качественных данных", - сказал Юй Сяохуэй, президент государственной академии информационных и коммуникационных технологий Китая. Компьютерный ученый Цинхуа Сун Маосунг призвал власти оцифровать исторические архивы, древние рукописи, научную литературу и региональные диалекты.

      Не все хотят быть оцифрованными. Издательство Huaxia недавно добавило предупреждение к новому переводу: "Запрещено использовать содержание этой книги для обучения искусственного интеллекта. Нарушители будут нести юридическую ответственность." Китай уже беспокоится о американских моделях ИИ, с которыми не может сравниться, и нехватка данных объясняет часть этого разрыва. У США есть проект Anthropic Panama, который купил и уничтожил миллионы физических книг для их сканирования. У Китая 1,3% веба и издательская индустрия, которая начинает закрывать двери.

Новая проблема ИИ в Китае не в чипах. Она заключается в нехватке обучающих данных на китайском языке.

Другие статьи

Учителя Гонконга требуют запретить социальные сети для лиц младше 16 лет. Правительство заявляет, что не планирует принимать законодательство. Учителя Гонконга требуют запретить социальные сети для лиц младше 16 лет. Правительство заявляет, что не планирует принимать законодательство. Педагоги Гонконга и законодатели призвали к принятию законодательства, запрещающего использование социальных сетей для лиц младше 16 лет. 62% жителей поддерживают это. Правительство заявляет, что пока не будет принимать закон. Я закончил заряжать вещи, которые никогда не покидают мой стол. Я закончил заряжать вещи, которые никогда не покидают мой стол. Беспроводные периферийные устройства стали невероятно хорошими, но я задаюсь вопросом, почему устройства, которые никогда не покидают мой стол, все еще нуждаются в батареях, режимах сопряжения и процедурах зарядки. Рекрутеры используют AI-аватары для проведения собеседований. Теперь кандидаты отправляют аватары, чтобы участвовать в них. Рекрутеры используют AI-аватары для проведения собеседований. Теперь кандидаты отправляют аватары, чтобы участвовать в них. Рекрутер из Сиднея дисквалифицировал трех кандидатов, которые appeared в виде AI-аватаров. Gartner ожидает, что один из четырех профилей кандидатов будет поддельным к 2028 году. Еще одна Googlebook только что появилась в сети, и эта от Asus Еще одна Googlebook только что появилась в сети, и эта от Asus Asus стал последним крупным производителем ПК, у которого появилась онлайн-версия Googlebook, присоединившись к ранее замеченным моделям от Lenovo и Dell перед IFA. Южная Африка хочет запретить компаниям вывозить стейблкоины за границу. Физические лица сохраняют свои лимиты. Южная Африка хочет запретить компаниям вывозить стейблкоины за границу. Физические лица сохраняют свои лимиты. Проект правил SARB и Казначейства запретит компаниям осуществлять трансакции с криптовалютой через границу, в то время как физические лица сохранят лимит в 2 миллиона рандов. Биржи рассматривают возможность судебного иска. Рекрутеры используют AI-аватары для проведения собеседований. Теперь кандидаты отправляют аватары, чтобы присутствовать на них. Рекрутеры используют AI-аватары для проведения собеседований. Теперь кандидаты отправляют аватары, чтобы присутствовать на них. Сиднейский рекрутер дисквалифицировал троих кандидатов, которые появились в виде AI-аватаров. Gartner ожидает, что один из четырех профилей кандидатов будет поддельным к 2028 году.

Новая проблема ИИ в Китае не в чипах. Она заключается в нехватке обучающих данных на китайском языке.

Китайский язык составляет всего 1,3% глобального веб-контента. Пекин теперь рассматривает данные как стратегическую инфраструктуру, с планом на 2028 год по созданию национальных наборов данных ИИ.