China publica el corpus 4.0 de internet en chino: 120 GB para entrenar modelos
La Asociación de Seguridad del Ciberespacio china libera 120 GB de texto en chino con acceso mediante registro y certificación previa, con Baidu, iFlytek o Zhihu entre los aportantes.

La Asociación de Seguridad del Ciberespacio de China ha publicado el corpus 4.0 de internet en chino, un paquete de 120 GB pensado para entrenar modelos de lenguaje. El anuncio se hizo este 15 de septiembre en el foro de gobernanza de seguridad de la IA, dentro de la Semana Nacional de Ciberseguridad que se celebra en Jinan, y el material ya está colgado en la plataforma de recursos de corpus en chino de la propia asociación.
Para hacerse con él no basta con un enlace de descarga. Hay que entrar en la web de la asociación, registrarse y pasar un proceso de certificación; también cabe solicitar el acceso por contacto directo. El reparto pasa por el control de la entidad, no por espejos ni torrents.
Quién lo firma
El trabajo lo presentan la asociación y el Centro Nacional de Respuesta a Emergencias de Internet (CNCERT), con el regulador del ciberespacio chino detrás. En la recolección han participado Baidu, iFlytek, Zhihu, Zhongke Wenge, Kaipuyun y TRS. Es la cuarta entrega de una serie: las versiones 1.0, 2.0 y 3.0 salieron antes bajo el mismo mecanismo de aportación y reutilización de corpus que coordina el comité de gobernanza de seguridad de la IA de la asociación, así que hay un ritmo de publicación anual detrás.
El comunicado se queda corto justo en lo que más miraría alguien que vaya a usar esto. No hay desglose de qué contiene esos 120 GB: qué proporción es prensa, foros, enciclopedia o texto técnico, ni cuántos tokens salen, ni con qué criterios se filtró. Tampoco se detalla la licencia ni si el material se puede emplear en entrenamientos comerciales, y menos si el uso desde fuera de China está contemplado. La asociación habla de datos "de confianza" y de un procesamiento "riguroso", pero eso es una afirmación suya: no viene acompañada de documentación técnica publicada.
Por qué importa
El cuello de botella de los modelos en chino no es el cómputo, es el texto limpio y con derechos claros. Buena parte de los grandes conjuntos abiertos están dominados por inglés, y montar un corpus en chino de tamaño razonable obliga a rastrear foros y webs con licencias ambiguas. Que un regulador y media docena de empresas se sienten a liberar una versión nueva cada año apunta a una política de datos centralizada, con la certificación previa como filtro de quién entra y quién no.
Queda por ver si las próximas entregas incluyen documentación de composición y licencia a la altura de lo que se exige a un corpus abierto, o si el acceso sigue siendo una caja opaca para quien no esté dentro del ecosistema chino.