BookinglyTech News
Infraestructura

China prevé consumir 10^17 tokens en 2026 y multiplicar por doce su demanda anual

El instituto de investigación de China Telecom proyecta un crecimiento compuesto del 12x anual y sitúa la inferencia en el 80% del cómputo en 2029.

2 min de lecturaITHome0 vistas

El Instituto de Investigación de China Telecom calcula que China consumirá 10^17 tokens a lo largo de 2026 y 3,5×10^19 en 2030, con una tasa de crecimiento anual compuesta cercana a doce veces. Los datos salen del informe que la propia entidad ha publicado sobre infraestructura de IA en la era de los agentes, y la televisión estatal china se ha hecho eco de ellos. El documento sitúa el origen del salto en un cambio de fase: la industria deja atrás la carrera por el tamaño de los modelos y por el cómputo bruto para centrarse en desplegar agentes a escala y sacarles rendimiento.

Rao Shaoyang, director del instituto de estrategia sectorial y empresarial de China Telecom, ha puesto cifras a la consecuencia inmediata. Según él, el empuje de los agentes mantendrá el crecimiento del cómputo en China cerca de diez veces al año durante los próximos dos o tres ejercicios. Y la estructura de esa demanda se inclina hacia la inferencia: en 2029, el 80% del mercado de cómputo correspondería a servir modelos ya entrenados, no a entrenarlos.

El cómputo se desplaza a la inferencia

El informe mide también quién paga. En 2026, el gasto de capital en IA de las grandes tecnológicas chinas rondaría los 600.000 millones de yuanes, más del 10% de la inversión total del país. Es una proporción que conviene mirar con cautela porque procede del propio sector y de una operadora con intereses directos en que esa infraestructura crezca.

Del lado de la demanda, las cifras que maneja el instituto también son de otra escala. La previsión es que en 2026 haya cerca de 80 millones de agentes activos en todo el mundo, y que en 2030 la cifra llegue a 2.216 millones. Cada uno de esos agentes sostiene sesiones largas, con llamadas repetidas al modelo, memoria y herramientas externas: el consumo de tokens se multiplica por la arquitectura, no solo por el número de usuarios.

Para quien planifica capacidad, el mensaje práctico es que la mezcla cambia. Comprar GPU para entrenar y comprar GPU para inferir no es el mismo ejercicio: la inferencia es más sensible al coste por token, a la latencia y a la eficiencia energética que al pico de FLOPS. Si la proporción que describe el informe se cumple, la mayor parte del gasto en aceleradores durante la próxima década irá a servir tráfico, no a fabricar modelos.

Queda por ver si el ritmo se sostiene. Las proyecciones a 2030 sobre agentes y tokens dependen de que la monetización llegue a tiempo; el propio informe reconoce que ese es el eje del cambio de fase. Las cifras son del instituto, no de un organismo independiente, y a cuatro años vista conviene tratarlas como un escenario, no como una medición.