Cada pocos meses circula un vídeo que promete «la alternativa gratuita definitiva» a una herramienta de pago. La mayoría exagera. Esta vez, contrastado contra el repositorio oficial y la documentación del fabricante, el claim central resulta ser cierto — con dos matices que ningún vídeo menciona.
Clonación de voz en 5 segundos, licencia MIT, y sí, corre en local
Chatterbox Turbo, de Resemble AI, es real: repositorio oficial en GitHub (resemble-ai/chatterbox) y pesos en Hugging Face (ResembleAI/chatterbox-turbo), publicado bajo licencia MIT — uso comercial libre, sin royalties. Clona una voz a partir de un clip de referencia de 5 a 10 segundos sin necesidad de fine-tuning, y soporta tags paralingüísticos nativos como [laugh], [sigh] o [cough] para dar expresividad a la voz generada, algo que la mayoría de alternativas gratuitas no ofrecen. Corre en local (CPU o GPU) y existe un servidor comunitario, devnen/Chatterbox-TTS-Server, con API compatible con OpenAI para integrarlo en un producto sin depender de la nube de nadie.
La latencia de «menos de 150 ms» es real — solo en GPU
La cifra que más circula, «responde en menos de 150 ms», figura tal cual en la página oficial del fabricante y está confirmada: en una GPU RTX 4090 el primer fragmento de audio llega en unos 75 ms. Lo que casi ningún vídeo aclara es que esa cifra depende de tener una tarjeta gráfica dedicada — en CPU, la latencia sube a 1-2 segundos por fragmento, un orden de magnitud distinto y perfectamente aceptable para generar audio sin necesidad de tiempo real, pero no la experiencia instantánea que sugiere el titular.
Los benchmarks «independientes» los organizó el propio fabricante
Resemble AI publicó en junio de 2025 un resultado de 63,75% de preferencia frente a ElevenLabs Turbo v2.5 en tests de escucha realizados a través de Podonos, una plataforma externa de evaluación de audio. El resultado es público y verificable, y Podonos es efectivamente un tercero — pero fue el propio Resemble AI quien diseñó, encargó y anunció ese benchmark. No existe, a fecha de esta revisión, ningún test equivalente publicado por una parte completamente ajena al fabricante que confirme esa misma diferencia. No es un dato falso: es un dato promovido por quien tiene interés en el resultado, una distinción que vale la pena tener presente antes de tomar una cifra de marketing como si fuera un peer review.
Cómo lo aplicamos nosotros
Chatterbox Turbo es una opción sólida cuando el proyecto necesita voz clonada sin coste de licencia y sin depender de una API externa — con la condición de tener GPU si la latencia importa, y de leer los benchmarks del fabricante como lo que son: una demostración de parte, no una auditoría neutral.
Si tu proyecto necesita síntesis o clonación de voz y quieres saber qué herramienta encaja de verdad con tu infraestructura, hablemos. Contacta con nosotros.