BookinglyTech News
Software

Un pipeline en Python convierte un tema en un documental de 20-30 minutos

AI Video Factory encadena guion con citas verificadas, visuales por escena, TTS local y montaje con FFmpeg. Su autor lo publica bajo licencia MIT y corre sin depender de la nube.

2 min de lecturaDev.to0 vistas

AI Video Factory es un pipeline en Python con licencia MIT que recibe un tema y devuelve un documental completo de 20 a 30 minutos: guion con citas, visuales por escena, narracion con TTS local, colchon musical, subtitulos tipo karaoke, montaje con FFmpeg, una puerta de control de calidad, miniatura y metadatos para YouTube. El autor lo ha dejado en el repositorio y confiesa que no sabe si alguien ademas de el quiere algo asi.

El proyecto trae siete presets, entre ellos los de autopsia de empresa, reconstruccion historica, documental cientifico y antologia de terror. Las visuales por escena salen de Pexels, Pixabay y NASA, con generacion local de imagenes fijas y rellenos procedurales cuando ninguna encaja.

Tres cosas que aprendio a golpes

La primera es que un LLM escribiendo guiones se inventa citas con una pinta perfectamente legal. Los primeros guiones volvian con referencias que sonaban a verdad y no apuntaban a ningun sitio. Ahora cada URL citada pasa una comprobacion HTTP real y tiene que devolver un 200; lo que falla se recorta o se reescribe.

La segunda es la deriva de metraje. Un video pensado para 25 minutos salia en 14. Los guiones se escriben ahora en bloques cronometrados y los bloques cortos se estiran a unas 150 palabras por minuto hasta que el tiempo objetivo aguanta.

La tercera le sorprendio a el mismo: para la mayoria de escenas gana el metraje de stock real. Los visuales generados por IA aguantan bien el fotograma suelto, pero a lo largo de 20 minutos se notan raros. El pipeline prefiere material rodado y solo tira de generacion cuando no hay nada que encaje.

Lo aburrido que sostiene la cosa

El cacheo por contenido de las etapas del pipeline permite repetir una escena sin rehacer el render entero. Hay una puerta de calidad que aborta la ejecucion, antes de codificar, si detecta fotogramas oscuros, silencio digital o una resolucion equivocada. Y una sola pasada de loudnorm a -16 LUFS con transiciones xfade por escena.

El diseno es local primero: el guionizado ataca cualquier endpoint compatible con OpenAI, como LM Studio o llama-server, el TTS corre en la maquina y no hace falta nada en la nube. En la hoja de ruta aparecen alineacion de subtitulos con Whisper, mas perfiles musicales, proveedores opcionales tipo Veo o Sora y narracion multilingue.

Para quien monta tuberias de generacion, lo aprovechable no es el documental en si, sino los problemas que documenta: la verificacion de citas, el control de duracion y el cacheo por etapas son cosas que aparecen en cualquier pipeline de contenido con LLM de por medio. El autor pide que le digan que le tirarian a el primero, asi que la validacion externa todavia esta por llegar.