El nuevo cuello de botella de IA de China no son los chips. Se está quedando sin datos de entrenamiento en chino.

El nuevo cuello de botella de IA de China no son los chips. Se está quedando sin datos de entrenamiento en chino.

      TL;DRChina enfrenta una grave escasez de datos de IA. El chino representa solo el 1.3% del contenido web frente al 49% del inglés. Pekín planea conjuntos de datos nacionales para 2028. WeChat y Douyin no comparten datos externamente. Los editores están añadiendo prohibiciones de entrenamiento de IA.

      La carrera de IA de China tiene una nueva limitación, y no son los chips. El país se está quedando sin datos de entrenamiento de alta calidad en chino. Mientras que los controles de exportación de EE. UU. sobre semiconductores avanzados han dominado el debate sobre las capacidades de IA de China, los expertos chinos advierten cada vez más que la escasez de datos podría resultar igualmente limitante, y a diferencia de los chips, no hay una solución de hardware. El chino representa solo el 1.3% del contenido web global, según el rastreador de internet W3Techs, en comparación con casi la mitad para el inglés, el 6% para el español y el 5% para el japonés.

      El problema es global, pero afecta más a China. Epoch AI estima que el suministro mundial de texto de alta calidad, disponible públicamente, podría agotarse por completo en seis años. El cofundador de OpenAI, Andrej Karpathy, ha advertido sobre un "muro de datos" para finales de la década. Los desarrolladores chinos ya pagan más por token útil que sus contrapartes occidentales porque sus modelos deben trabajar más duro con menos material en su idioma nativo. El ecosistema digital de China agrava la escasez: plataformas como WeChat y Douyin no comparten datos con desarrolladores de terceros, dejando a los laboratorios de IA entrenar con fuentes de menor calidad.

      Pekín está respondiendo tratando los datos como infraestructura estratégica. En junio, la Administración Nacional de Datos presentó un plan nacional para construir conjuntos de datos de entrenamiento de IA validados para 2028, cubriendo manufactura, energía, atención médica, finanzas, agricultura, conducción autónoma y IA encarnada. “La competencia en la era de la IA no solo se trata de modelos y potencia de cálculo, sino también de sistemas de suministro de datos de alta calidad”, dijo Yu Xiaohui, presidente de la Academia China de Tecnología de la Información y las Comunicaciones, afiliada al estado. El científico informático de la Universidad de Tsinghua, Sun Maosong, ha instado a las autoridades a digitalizar archivos históricos, manuscritos antiguos, literatura científica y dialectos regionales.

      No todos quieren ser digitalizados. La Casa Editorial Huaxia recientemente añadió una advertencia a una nueva traducción: “Está prohibido utilizar el contenido de este libro para el entrenamiento de inteligencia artificial. Los infractores serán responsables legalmente.” China ya está ansiosa por los modelos de IA estadounidenses que no puede igualar, y la escasez de datos explica parte de la brecha. EE. UU. tiene el Proyecto Panamá de Anthropic, que compró y destruyó millones de libros físicos para escanearlos. China tiene el 1.3% de la web y una industria editorial que está comenzando a cerrar la puerta.

      

      

      

       Recibe el boletín de TNW

       Recibe las noticias tecnológicas más importantes en tu bandeja de entrada cada semana.

El nuevo cuello de botella de IA de China no son los chips. Se está quedando sin datos de entrenamiento en chino.

Otros artículos

Los reclutadores están utilizando avatares de IA para realizar entrevistas. Ahora los candidatos están enviando avatares para asistir a ellas. Los reclutadores están utilizando avatares de IA para realizar entrevistas. Ahora los candidatos están enviando avatares para asistir a ellas. Un reclutador de Sídney descalificó a tres solicitantes que aparecieron como avatares de IA. Gartner espera que uno de cada cuatro perfiles de candidatos sea falso para 2028. El código oculto en la aplicación de Android de ChatGPT sugiere que OpenAI está construyendo una exportación directa de stickers de WhatsApp. El código oculto en la aplicación de Android de ChatGPT sugiere que OpenAI está construyendo una exportación directa de stickers de WhatsApp. Un desglose de APK encontró código para una opción de "Agregar a WhatsApp" en ChatGPT que permitiría a los usuarios generar stickers a partir de mensajes de texto y exportarlos directamente. Aún no está disponible. Los reclutadores están utilizando avatares de IA para realizar entrevistas. Ahora los candidatos están enviando avatares para asistir a ellas. Los reclutadores están utilizando avatares de IA para realizar entrevistas. Ahora los candidatos están enviando avatares para asistir a ellas. Un reclutador de Sídney descalificó a tres solicitantes que aparecieron como avatares de IA. Gartner espera que uno de cada cuatro perfiles de candidatos sea falso para 2028. Los educadores de Hong Kong quieren una prohibición de las redes sociales para menores de 16 años. El gobierno dice que no tiene planes de legislar. Los educadores de Hong Kong quieren una prohibición de las redes sociales para menores de 16 años. El gobierno dice que no tiene planes de legislar. Educadores de Hong Kong y un legislador instaron a la legislación para prohibir a los menores de 16 años el acceso a las redes sociales. El 62% de los residentes lo apoya. El gobierno dice que no legislará por ahora. Otro Googlebook acaba de aparecer en línea, y este es de Asus. Otro Googlebook acaba de aparecer en línea, y este es de Asus. Asus es el último gran fabricante de PC en tener una superficie Googlebook en línea, uniéndose a los modelos previamente detectados de Lenovo y Dell antes de la IFA. Armenia acaba de abrir la fábrica de IA más grande de la región. Existe porque Washington firmó una licencia. Armenia acaba de abrir la fábrica de IA más grande de la región. Existe porque Washington firmó una licencia. Firebird abrió la fábrica de IA más grande de la región de la CEI en Armenia. La cantidad de GPU importa menos que la licencia de exportación y el ministro kazajo en la sala.

El nuevo cuello de botella de IA de China no son los chips. Se está quedando sin datos de entrenamiento en chino.

El chino representa solo el 1.3% del contenido web global. Pekín ahora está tratando los datos como infraestructura estratégica, con un plan para 2028 para construir conjuntos de datos nacionales de IA.