BookinglyTech News
Inteligencia artificial

TaichuAI publica ZDTaichu5.0‑9B, modelo multimodal espacial de 9 B parámetros

El nuevo modelo combina Qwen3.5‑9B y C‑RADIOv4‑H, admite entradas de imagen o video a cualquier resolución y publica métricas de rendimiento en varios benchmarks.

2 min de lecturaPandaily0 vistas

TaichuAI ha lanzado ZDTaichu5.0‑9B, un modelo multimodal de aproximadamente 9 000 millones de parámetros que se publica bajo una licencia open source. La arquitectura mezcla el modelo de lenguaje Qwen3.5‑9B con el encoder visual C‑RADIOv4‑H, lo que le permite procesar imágenes y videos de resolución arbitraria sin necesidad de pre‑escalado.

El anuncio incluye una serie de puntuaciones en benchmarks orientados a la evaluación espacial y de agentes. En ViewSpatial el modelo alcanza 62,5, en MMSI 47,2, en MindCube‑tiny 78,3, en TAU2 87,7 y en Claw‑Eval 71,4. Estos valores sitúan a ZDTaichu5.0‑9B por encima de varios modelos de referencia de similar tamaño, aunque todavía queda espacio para mejorar en tareas de razonamiento visual complejo.

El código y los pesos se encuentran disponibles en el repositorio oficial de TaichuAI, lo que facilita su integración en pipelines de inferencia que requieran procesamiento multimodal. Al ser compatible con los formatos de entrada habituales (JPEG, PNG, MP4, etc.) y admitir resolución libre, el modelo puede emplearse tanto en entornos de investigación como en aplicaciones de producción que necesiten análisis de contenido visual a gran escala.

Desde la perspectiva de infraestructura, ZDTaichu5.0‑9B requiere alrededor de 18 GB de VRAM para una inferencia de precisión completa, aunque es posible ejecutar una versión cuantizada de 8 bits en GPUs con 12 GB, sacrificando algo de precisión en los scores. La licencia permite su uso comercial, lo que abre la puerta a su adopción en productos de visión por computadora, análisis de video en tiempo real y sistemas de agentes autónomos que dependan de percepción espacial.

Queda pendiente observar cómo la comunidad optimiza el modelo para hardware especializado y si surgen versiones ligeras que reduzcan la huella de memoria sin degradar demasiado los resultados en los benchmarks citados. Mientras tanto, el lanzamiento amplía el ecosistema de modelos abiertos de gran escala y ofrece una alternativa viable a las soluciones propietarias que dominan el mercado de IA multimodal.