Respuesta rápida (agosto de 2026): ElevenLabs es una plataforma de audio con IA que cubre texto a voz, clonación de voz, doblaje de video, generación de música, efectos de sonido y agentes de voz en tiempo real. Puedes empezar gratis en elevenlabs.io con 10,000 créditos al mes (aproximadamente 10 minutos de audio a 1 crédito por carácter), o pagar desde $6/mes para desbloquear derechos comerciales y mayor volumen de salida. La API usa una sola variable de entorno para la autenticación y cuenta con SDKs oficiales para Python y JavaScript. La calidad va desde ultra rápida y económica (Eleven Flash con ~75ms de latencia) hasta la más expresiva y con mayor cobertura de idiomas (Eleven v3 en 70+ idiomas).
Última verificación: 3 de agosto de 2026, con la documentación oficial y las páginas de precios.
Qué es ElevenLabs hoy
ElevenLabs nació como una herramienta de texto a voz y ahora opera en tres superficies de producto. ElevenCreative cubre TTS, clonación de voz, doblaje, música y efectos de sonido. ElevenAgents permite construir y desplegar agentes de voz conversacionales en teléfono, web y móvil. ElevenAPI da acceso programático a todo lo anterior.
El flujo básico de TTS no ha cambiado: pega texto, elige una voz de la biblioteca, selecciona un modelo y genera el audio. Lo que sí ha cambiado es que las empresas usan cada vez más la plataforma para reemplazar centralitas IVR, y los desarrolladores usan la API para pipelines de voz en producción que combinan entrada y salida de audio en tiempo real.
Planes, créditos y derechos comerciales
Los créditos son la unidad de cuenta. En la interfaz, cada carácter de texto cuesta 1 crédito sin importar el modelo TTS que elijas. A través de la API, los modelos Flash y Turbo tienen tarifas reducidas. En los planes de pago, los créditos no utilizados se acumulan hasta dos meses, con un límite de 2x tu cuota mensual, por lo que el saldo máximo en cualquier momento es 3x tu asignación mensual.
La facturación anual elimina dos meses de costo: pagas 10 meses y obtienes 12.
El plan gratuito no incluye licencia comercial y los doblajes llevan marca de agua. Todos los planes de pago incluyen licencia comercial.
| Plan | Precio mensual | Equivalente anual/mes | Créditos/mes | Beneficio clave |
|---|---|---|---|---|
| Free | $0 | $0 | 10,000 | Sin licencia comercial; doblajes con marca de agua |
| Starter | $6 | $5 | 30,000 | Licencia comercial; Instant Voice Cloning |
| Creator | $22 | ~$18 | 121,000 | Professional Voice Cloning |
| Pro | $99 | ~$83 | 600,000 | Mayor volumen de salida |
| Scale | $299 | ~$249 | 1,800,000 | 3 asientos; 3 Professional Voice Clones |
| Business | $990 | $825 | 6,000,000 | 10 asientos; 10 Professional Voice Clones |
| Enterprise | Custom | Custom | Custom | Asientos y cuota de clonación de voz personalizados |
El plan Creator a $22/mes es el primer nivel que incluye Professional Voice Cloning, lo que importa si necesitas un clon prácticamente indistinguible del hablante original.
Qué modelo elegir
La elección del modelo determina la expresividad, la cobertura de idiomas, la latencia por solicitud y el máximo de texto que puedes enviar en una sola llamada. Elegir el modelo equivocado es la causa más común de gasto innecesario o resultados decepcionantes.
| ID del modelo | Ideal para | Idiomas | Máx. caracteres por llamada | Latencia |
|---|---|---|---|---|
eleven_v3 |
Narración expresiva, diálogo emocional, trabajo con personajes | 70+ | 5,000 | No especificada |
eleven_multilingual_v2 |
Contenido de formato largo, calidad consistente (predeterminado de la API) | 29 | 10,000 | No especificada |
eleven_flash_v2_5 |
Agentes en tiempo real, trabajos masivos de API, velocidad multilingüe | 32 | 40,000 | ~75ms |
eleven_flash_v2 |
Generación rápida solo en inglés | Solo inglés | 30,000 | ~75ms |
eleven_v3 cubre más idiomas y ofrece el mayor rango emocional, pero su límite de 5,000 caracteres significa que necesitas dividir los scripts más largos antes de enviarlos. eleven_flash_v2_5 es el modelo adecuado para cualquier caso de uso sensible a la latencia y para trabajos de API de alto volumen donde importa la tarifa reducida por carácter. eleven_multilingual_v2 sigue siendo el predeterminado y es la mejor opción para narración de formato largo cuando no hay requisitos de latencia.
Más allá del TTS, ElevenLabs también ofrece modelos de conversión de voz a texto (scribe_v2 para transcripción en lote en 90+ idiomas, scribe_v2_realtime para streaming con ~150ms de latencia), generación de música (music_v2) y efectos de sonido (eleven_text_to_sound_v2).
Primeros pasos: navegador y API
Navegador: Crea una cuenta gratuita en elevenlabs.io, abre la herramienta Text to Speech en ElevenCreative, elige una voz de la biblioteca (con búsqueda por idioma, acento, género y edad), pega tu texto, selecciona un modelo y genera. Las descargas en MP3 y WAV están disponibles desde la misma pantalla.
Clave de API: Ve a tu perfil en el panel de ElevenLabs y genera una clave de API. Guárdala como variable de entorno.
Configuración en Python:
pip install elevenlabs python-dotenv
Configuración en JavaScript:
npm install @elevenlabs/elevenlabs-js dotenv
Llamada básica de TTS en Python:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
audio = client.text_to_speech.convert(
text="Your script text here.",
voice_id="JBFqnCBsd6RMkjVDRZzb", # replace with your chosen voice ID
model_id="eleven_flash_v2_5",
output_format="mp3_44100_128",
)
play(audio)
El endpoint REST es POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}. ElevenLabs expone variantes regionales para EE. UU., UE, India y Singapur si tu caso de uso requiere enrutamiento geográfico de datos.
Clonación de voz: Instant vs. Professional
Las dos rutas de clonación tienen techos de calidad, requisitos de tiempo y umbrales de plan fundamentalmente distintos.
| Instant Voice Cloning | Professional Voice Cloning | |
|---|---|---|
| Plan requerido | Starter y superiores | Creator y superiores |
| Audio requerido | 1-2 minutos | Mínimo 30 minutos; óptimo 2-3 horas |
| Tiempo de procesamiento | Casi inmediato | 2-6 horas (a veces más) |
| Mecanismo | Estima la voz usando datos de entrenamiento previos | Realiza fine-tuning de un modelo dedicado con tu audio |
| Precisión | Buena para acentos comunes; más débil con voces inusuales | Prácticamente indistinguible del original |
| Compartible en Voice Library | No | Sí |
La calidad del audio importa más que el formato de archivo en cualquiera de las dos rutas. Graba entre -23 dB y -18 dB RMS con un pico real de -3 dB, sin ruido de fondo ni reverberación. Para Instant Cloning, la documentación de ElevenLabs advierte no superar los 3 minutos de audio fuente. Más audio por encima de ese umbral no mejora la calidad y puede degradar el clon.
MP3 a 192 kbps y WAV funcionan bien. ElevenLabs señala explícitamente que usar WAV sin comprimir ofrece poca o ninguna mejora de calidad respecto a un MP3 de alta tasa de bits.
Professional Voice Cloning requiere un paso de captcha de voz para verificar que el audio subido coincide con tu propia voz. No puedes usar esta vía para clonar la voz de un tercero.
Doblaje, efectos de sonido y música
Doblaje disponible en todos los planes, incluido el gratuito (con marca de agua en el plan free). Sube un archivo de video o audio o pega una URL de YouTube o TikTok, selecciona los idiomas de destino, y ElevenLabs detecta cada hablante, traduce el guion y regenera el audio en el nuevo idioma preservando las características de voz de cada hablante. Los formatos de entrada incluyen MP4, MOV, MKV, MP3, WAV y unos 15 más. Los formatos de salida son MP4 (video), AAC, WAV y SRT (subtítulos). El tamaño máximo de archivo es 2 GB y 180 minutos. El precio varía según la duración del contenido y el número de idiomas de destino.
Efectos de sonido: Describe el sonido que quieres en texto plano usando el modelo eleven_text_to_sound_v2 y descarga el clip generado. Útil para prototipar audio en demos de producto o videos antes de encargar assets de producción.
Música: El modelo music_v2 genera pistas desde un prompt de texto en cualquier estilo. La calidad de salida es adecuada para prototipos. Para música lista para lanzamiento, trata la generación como un borrador e itera.
Agentes de voz
ElevenAgents combina el reconocimiento de voz de ElevenLabs, un modelo de lenguaje a tu elección y TTS en un bucle de conversación en tiempo real. Configuras los agentes mediante un panel visual: selecciona un LLM, diseña flujos de conversación, adjunta una base de conocimiento o llamadas a API externas, y asigna una voz. Los agentes se despliegan en llamadas telefónicas, chat web y móvil.
Para transcripción independiente, scribe_v2 gestiona trabajos en lote en 90+ idiomas con marcas de tiempo a nivel de palabra, diarización de hablantes para hasta 32 hablantes y detección de 65 tipos de entidades. scribe_v2_realtime transmite transcripciones parciales con aproximadamente 150ms de latencia y admite detección de actividad de voz.
Para más información sobre cómo construir sistemas agénticos en torno a la voz u otras herramientas, la guía de AI Weekly sobre cómo construir un agente de IA cubre la arquitectura subyacente. Para ideas de automatización de flujos de trabajo, consulta cómo automatizar el trabajo con IA.
Preguntas frecuentes
¿El plan gratuito permite uso comercial?
No. ElevenLabs excluye la licencia comercial del plan gratuito. El plan Starter a $6/mes es el mínimo para obtener licencia comercial.
¿Qué ocurre con los créditos no utilizados al final del ciclo de facturación?
En los planes de pago, los créditos se acumulan hasta dos meses, con un límite de 2x tu cuota mensual. El saldo total máximo en cualquier ciclo de facturación es 3x tu asignación mensual.
¿Puedo clonar la voz de otra persona?
La ruta de Professional Voice Cloning requiere un captcha de voz que verifica que el audio subido coincide con tu propia voz. Legalmente, las normas varían según la jurisdicción. Un permiso de plataforma de ElevenLabs no reemplaza la legislación local aplicable, así que consulta asesoría legal antes de clonar la voz de un tercero para cualquier propósito comercial.
¿Cuál es la diferencia práctica entre eleven_v3 y eleven_flash_v2_5?
Usa eleven_v3 cuando la expresividad sea la prioridad: rango emocional, entrega dramática, interpretación de personajes. Usa eleven_flash_v2_5 cuando la latencia sea la restricción (agentes en tiempo real, streaming), cuando necesites procesar texto muy largo en una sola llamada (límite de 40,000 caracteres frente a 5,000), o cuando importe el costo de API por carácter.
¿Puedo usar voces de ElevenLabs en un podcast o video de YouTube?
Sí, en cualquier plan de pago. Starter y superiores incluyen licencia comercial. Las voces de la Voice Library pueden tener términos adicionales establecidos por el creador individual de la voz, así que revísalos antes de publicar.
Si te ahorró tiempo, recibe AI Weekly gratis, 3 ediciones por semana, leídas por 40,000+ profesionales.