Tres formas de automatizar producción de contenido con IA — voz, edición de vídeo y retoque de imagen — con un patrón que ya conocemos en esta serie: cuanto más se promete «sin restricciones», más conviene leer la licencia real.
Piper, F5-TTS y Orpheus: gratis y open source, pero no todos aptos para uso comercial
Tres modelos de texto a voz instalables con un solo clic vía Pinokio se presentan como alternativa gratuita y «sin restricciones comerciales» a plataformas de pago como ElevenLabs. Los tres existen y son gratuitos: Piper funciona sin conexión y corre incluso en una Raspberry Pi; F5-TTS clona una voz con pocos segundos de audio; Orpheus TTS, basado en Llama, suena más natural, con emociones y susurros. Lo que no se sostiene es la afirmación de que ninguno tiene restricciones de uso comercial: los pesos oficiales de F5-TTS están bajo licencia CC-BY-NC-4.0, que prohíbe explícitamente el uso comercial, y los de Orpheus llevan la Llama Community License heredada de su modelo base, con condiciones propias (atribución obligatoria, límite de usuarios activos) que tampoco son un Apache 2.0 sin restricciones. Antes de monetizar cualquier proyecto con estas voces, conviene revisar la licencia de los pesos, no solo la del código.
video-use: la edición automática de vídeo con Claude Code funciona, la idea de negocio es aparte
Un proyecto open source real, video-use, deja caer clips en bruto en una carpeta y, conversando con Claude Code, corta silencios y muletillas, corrige color, quema subtítulos y genera animaciones — confirmado casi punto por punto contra el repositorio oficial, con más de 17.000 estrellas. Donde el vídeo que lo presenta se aparta de los hechos es al proponer montar con esto «un servicio recurrente» cobrando entre 200 y 500 euros por vídeo: esa cifra es una idea de negocio del propio creador del vídeo, no una afirmación del proyecto. También compara la herramienta con Remotion como si fueran competidores, cuando Remotion es en realidad uno de los motores internos que usa video-use para generar animaciones — una comparación que mezcla categorías distintas.
Mejorar una foto con la palabra «hermoso»: la técnica es real, la ejecución mostrada es floja
Usar Gemini o ChatGPT para restaurar o mejorar la calidad de una imagen de baja resolución mediante un prompt de texto es una técnica real y ampliamente documentada en torno al modelo de imagen de Gemini conocido como «Nano Banana». Pero el vídeo que la muestra usa como prompt, aparentemente, una sola palabra suelta — «hermoso» — y fuentes especializadas en la técnica coinciden en que términos genéricos como ese rinden peor que descriptores técnicos concretos (resolución, iluminación, apertura de cámara). La técnica de fondo es real; la demostración concreta es, en el mejor de los casos, una simplificación que no enseña lo que realmente hace funcionar el resultado.
Cómo lo aplicamos nosotros
En los tres casos la tecnología funciona; lo que cambia es cuánto hay que leer más allá del titular antes de usarla en un proyecto real — una licencia que prohíbe la reventa, una cifra de negocio que no viene del fabricante, o un prompt de ejemplo que no explica de verdad la técnica.
Si necesitas automatizar producción de contenido — voz, vídeo o imagen — con las herramientas correctas para tu caso de uso, hablemos. Escríbenos desde el formulario de contacto.