anything2explainer lleva la generación de videos explicativos a código React y TypeScript
El proyecto empaqueta una skill de Claude Code y Codex que transforma documentos en videos narrados, con cada fotograma editable como código Remotion.

anything2explainer publica una skill para Claude Code y Codex que convierte un tema, artículo o documento en un video explicativo narrado. En lugar de usar material de archivo o un modelo generativo de video, cada fotograma se genera con Remotion, una librería basada en React y TypeScript, lo que permite editar los disparos directamente en el código fuente.
El pipeline está pensado para producir un MP4 H.264 de 1280×720 a 30 fps, con voz sincronizada, subtítulos alineados palabra a palabra, tarjetas de capítulo, un HUD superior y una barra de progreso. Soporta inglés y chino y entrega, además del video final, el documento de investigación, la narración, el storyboard, el código fuente por disparo y los informes de control de calidad, tal como describe la especificación del repositorio.
A diferencia de una herramienta de línea de comandos, el repositorio incluye una plantilla Remotion compilable, primitivas visuales, componentes de iluminación, herramientas de voz y render, especificaciones de estilo y movimiento, y un protocolo de trabajo multi‑agente. El flujo de trabajo consta de nueve fases: scaffolding del proyecto, investigación del tema, redacción de la narración con línea de tiempo por fotograma, storyboard, construcción de superposiciones y primitivas temáticas, generación de un preview de 30 segundos, construcción paralela de los disparos restantes, render completo con métricas de fotogramas y, finalmente, control de calidad, correcciones y notas de entrega.
Los agentes de construcción reciben grupos de cinco a siete disparos y crean los componentes Remotion correspondientes. La estructura de la narración controla la edición: una línea en blanco marca tanto un párrafo como un disparo, y los límites de palabras del TTS rellenan la tabla de subtítulos y la línea de tiempo. El repositorio indica que los disparos mantienen una breve pausa al final, lo que alarga el video respecto al discurso bruto según sus reglas de temporización.
El proceso se detiene en cuatro checkpoints: selección de longitud e idioma, aprobación de la narración, elección del motor de voz y revisión de los primeros 30 segundos. La aprobación de la narración ocurre antes de generar la voz porque los números de fotograma se fijan a esa línea de tiempo; el preview permite decidir estilo antes de que todos los grupos de disparos estén listos.
Según la propia estimación del proyecto, el tiempo de reloj real oscila entre una y tres horas según la duración del video. Para un film de tres a cinco minutos, el objetivo de referencia indica 40‑50 disparos, ocho agentes de construcción y alrededor de dos horas de procesamiento; estos números son planes internos, no benchmarks externos.
La instalación opcional crea enlaces simbólicos del repositorio en los directorios de skills de Claude Code o Codex. También es posible invocar manualmente la plantilla, el TTS, el storyboard, el preview, el render y los scripts de métricas siguiendo la secuencia documentada. El entorno requerido incluye Node 18 o superior, FFmpeg y paquetes de Python seleccionados por el motor de TTS. Las pruebas se realizaron en macOS; el repositorio afirma que Linux funciona, describe una configuración verificada en Raspberry Pi 5 y marca Windows como no probado.
El valor diferencial de anything2explainer radica en la trazabilidad: cada decisión de producción queda registrada como artefactos inspeccionables (investigación, narración, tablas de tiempo, storyboard y componentes de disparo). Esto facilita correcciones puntuales o revisiones visuales sin rehacer todo el video. La desventaja es la complejidad de una cadena de herramientas multi‑etapa frente a servicios de video más automáticos, lo que obliga al desarrollador a gestionar dependencias, selección de TTS, ejecución de agentes y revisión final.
En resumen, el proyecto ofrece a los equipos de desarrollo una vía para crear videos explicativos totalmente controlables y versionables mediante código, aunque implica una inversión inicial en configuración y flujo de trabajo.

