Resumo rápido (agosto de 2026): O ElevenLabs é uma plataforma de áudio com IA que cobre síntese de voz, clonagem de voz, dublagem de vídeo, geração de música, efeitos sonoros e agentes de voz em tempo real. Você pode começar gratuitamente em elevenlabs.io com 10.000 créditos por mês (cerca de 10 minutos de fala, a 1 crédito por caractere), ou assinar a partir de $6/mês para liberar direitos comerciais e maior volume de saída. A API usa uma única variável de ambiente para autenticação e vem com SDKs oficiais para Python e JavaScript. A qualidade vai de ultra-rápido e barato (Eleven Flash com latência de ~75ms) ao mais expressivo e com maior cobertura de idiomas (Eleven v3 em mais de 70 idiomas).
Última verificação: 3 de agosto de 2026, em relação à documentação oficial e páginas de preços.
O que é o ElevenLabs Hoje
O ElevenLabs nasceu como uma ferramenta de síntese de voz e hoje opera em três superfícies de produto. ElevenCreative cobre TTS, clonagem de voz, dublagem, música e efeitos sonoros. ElevenAgents permite criar e implantar agentes de voz conversacionais em telefone, web e mobile. ElevenAPI oferece acesso programático a tudo isso.
O fluxo principal de TTS não mudou: cole o texto, escolha uma voz da biblioteca, selecione um modelo e gere o áudio. O que mudou é que empresas cada vez mais usam a plataforma para substituir sistemas de URA telefônica, e desenvolvedores usam a API para pipelines de voz em produção que combinam entrada e saída de áudio em tempo real.
Planos, Créditos e Direitos Comerciais
Os créditos são a unidade de conta. Na interface, cada caractere de texto custa 1 crédito, independentemente do modelo TTS escolhido. Pela API, os modelos Flash e Turbo têm tarifas com desconto. Nos planos pagos, os créditos não usados são transferidos por até dois meses, limitados a 2x a sua cota mensal, então o saldo máximo em qualquer momento é de 3x a cota mensal.
A cobrança anual elimina dois meses de custo: você paga por 10 meses e recebe 12.
O plano gratuito não inclui licença comercial e as dublagens saem com marca d'água. Todos os planos pagos incluem licença comercial.
| Plano | Preço mensal | Equivalente anual/mês | Créditos/mês | O que desbloqueia |
|---|---|---|---|---|
| Free | $0 | $0 | 10,000 | Sem licença comercial; dublagens com marca d'água |
| Starter | $6 | $5 | 30,000 | Licença comercial; Instant Voice Cloning |
| Creator | $22 | ~$18 | 121,000 | Professional Voice Cloning |
| Pro | $99 | ~$83 | 600,000 | Volume de saída maior |
| Scale | $299 | ~$249 | 1,800,000 | 3 assentos; 3 Professional Voice Clones |
| Business | $990 | $825 | 6,000,000 | 10 assentos; 10 Professional Voice Clones |
| Enterprise | Custom | Custom | Custom | Assentos e cota de clones de voz customizados |
O plano Creator a $22/mês é o primeiro nível a incluir o Professional Voice Cloning, o que importa se você precisar de um clone praticamente indistinguível da voz original.
Qual Modelo Usar
A escolha do modelo determina a expressividade, a cobertura de idiomas, a latência por requisição e o tamanho máximo de texto aceito em uma única chamada. Escolher o modelo errado é a causa mais comum de gasto desnecessário ou resultado frustrante.
| ID do modelo | Melhor para | Idiomas | Máx. de caracteres por chamada | Latência |
|---|---|---|---|---|
eleven_v3 |
Narração expressiva, diálogo emocional, trabalho com personagens | 70+ | 5,000 | Não especificada |
eleven_multilingual_v2 |
Conteúdo longo, qualidade consistente (padrão da API) | 29 | 10,000 | Não especificada |
eleven_flash_v2_5 |
Agentes em tempo real, jobs em lote via API, velocidade multilíngue | 32 | 40,000 | ~75ms |
eleven_flash_v2 |
Geração rápida apenas em inglês | Apenas inglês | 30,000 | ~75ms |
O eleven_v3 cobre mais idiomas e entrega a maior variedade emocional, mas seu limite de 5.000 caracteres exige que scripts mais longos sejam divididos antes do envio. O eleven_flash_v2_5 é o modelo certo para qualquer caso de uso sensível à latência e para trabalhos de alto volume via API, onde a tarifa reduzida por caractere faz diferença. O eleven_multilingual_v2 continua sendo o padrão e é a escolha certa para narração de conteúdo longo quando não há restrição de latência.
Além do TTS, o ElevenLabs também oferece modelos de fala para texto (scribe_v2 para transcrição em lote em mais de 90 idiomas, scribe_v2_realtime para streaming com latência de ~150ms), geração de música (music_v2) e efeitos sonoros (eleven_text_to_sound_v2).
Primeiros Passos: Navegador e API
Navegador: Crie uma conta gratuita em elevenlabs.io, abra a ferramenta Text to Speech no ElevenCreative, escolha uma voz da biblioteca (pesquisável por idioma, sotaque, gênero e idade), cole o texto, selecione um modelo e gere o áudio. Os downloads em MP3 e WAV estão disponíveis na mesma tela.
Chave de API: Acesse seu perfil no painel do ElevenLabs e gere uma chave de API. Armazene-a como variável de ambiente.
Configuração em Python:
pip install elevenlabs python-dotenv
Configuração em JavaScript:
npm install @elevenlabs/elevenlabs-js dotenv
Chamada básica de TTS em Python:
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
audio = client.text_to_speech.convert(
text="Your script text here.",
voice_id="JBFqnCBsd6RMkjVDRZzb", # replace with your chosen voice ID
model_id="eleven_flash_v2_5",
output_format="mp3_44100_128",
)
play(audio)
O endpoint REST é POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}. O ElevenLabs disponibiliza variantes regionais para EUA, UE, Índia e Singapura caso seu uso exija roteamento geográfico de dados.
Clonagem de Voz: Instant vs. Professional
As duas formas de clonagem têm tetos de qualidade, requisitos de tempo e barreiras de plano fundamentalmente diferentes.
| Instant Voice Cloning | Professional Voice Cloning | |
|---|---|---|
| Plano necessário | Starter e acima | Creator e acima |
| Áudio necessário | 1-2 minutos | Mínimo de 30 minutos; ideal de 2-3 horas |
| Tempo de processamento | Quase instantâneo | 2-6 horas (às vezes mais) |
| Mecanismo | Estima a voz usando dados de treinamento anteriores | Realiza fine-tuning de um modelo dedicado com seu áudio |
| Precisão | Boa para sotaques comuns; mais fraca com vozes atípicas | Praticamente indistinguível do original |
| Disponível na Voice Library | Não | Sim |
A qualidade do áudio importa mais do que o formato de arquivo em ambos os casos. Grave entre -23 dB e -18 dB RMS com pico real de -3 dB, sem ruído de fundo ou reverberação. Para o Instant Cloning, a própria documentação do ElevenLabs adverte contra ultrapassar 3 minutos de áudio-fonte. Mais áudio além desse limite não melhora a qualidade e pode degradar o clone.
MP3 a 192 kbps e WAV funcionam bem nos dois casos. O ElevenLabs afirma explicitamente que usar um WAV não comprimido gera pouca ou nenhuma melhoria em relação a um MP3 de alta taxa de bits.
O Professional Voice Cloning requer uma etapa de captcha de voz para verificar que o áudio enviado corresponde à sua própria voz. Não é possível usar esse caminho para clonar a voz de terceiros.
Dublagem, Efeitos Sonoros e Música
A dublagem está disponível em todos os planos, incluindo o gratuito (com marca d'água no gratuito). Faça upload de um vídeo ou arquivo de áudio, ou cole uma URL do YouTube ou TikTok, selecione os idiomas-alvo e o ElevenLabs detecta cada locutor, traduz o roteiro e regenera a fala no novo idioma preservando as características de voz de cada um. Os formatos de upload incluem MP4, MOV, MKV, MP3, WAV e cerca de 15 outros. Os formatos de saída são MP4 (vídeo), AAC, WAV e SRT (legendas). O tamanho máximo de arquivo é 2 GB e 180 minutos. O preço varia conforme a duração do conteúdo e o número de idiomas-alvo.
Efeitos sonoros: Descreva o som desejado em texto simples usando o modelo eleven_text_to_sound_v2 e baixe o clipe gerado. Útil para prototipar áudio em demos de produto ou vídeos antes de encomendar assets de produção.
Música: O modelo music_v2 gera faixas a partir de um prompt de texto em qualquer estilo. A qualidade da saída é adequada para prototipagem. Para música pronta para lançamento, trate a geração como rascunho e itere.
Agentes de Voz
O ElevenAgents combina o reconhecimento de fala do ElevenLabs, um modelo de linguagem de sua escolha e TTS em um loop de conversa em tempo real. Você configura os agentes por meio de um painel visual: selecione um LLM, projete os fluxos de conversa, vincule uma base de conhecimento ou chamadas de API externas e atribua uma voz. Os agentes são implantados em chamadas telefônicas, chat web e mobile.
Para transcrição independente, o scribe_v2 processa jobs em lote em mais de 90 idiomas com timestamps por palavra, diarização para até 32 locutores e detecção de 65 tipos de entidade. O scribe_v2_realtime transmite transcrições parciais com latência de aproximadamente 150ms e suporta detecção de atividade de voz.
Para saber mais sobre a construção de sistemas agênticos em torno de voz ou outras ferramentas, o guia da AI Weekly sobre como criar um agente de IA cobre a arquitetura subjacente. Para ideias de automação de fluxo de trabalho, veja como automatizar o trabalho com IA.
Perguntas Frequentes
O plano gratuito permite uso comercial?
Não. O ElevenLabs exclui a licença comercial do plano gratuito. O plano Starter a $6/mês é o mínimo para licenciamento comercial.
O que acontece com os créditos não usados ao final de um ciclo de cobrança?
Nos planos pagos, os créditos são transferidos por até dois meses, limitados a 2x a sua cota mensal. O saldo máximo total em qualquer ciclo de cobrança é de 3x a sua cota mensal.
Posso clonar a voz de outra pessoa?
O caminho do Professional Voice Cloning requer um captcha de voz que verifica se o áudio enviado corresponde à sua própria voz. Legalmente, as regras variam conforme a jurisdição. Uma permissão da plataforma do ElevenLabs não substitui a legislação local aplicável, portanto consulte um advogado antes de clonar a voz de terceiros para qualquer finalidade comercial.
Qual é a diferença na prática entre eleven_v3 e eleven_flash_v2_5?
Use o eleven_v3 quando a expressividade for a prioridade: amplitude emocional, entrega dramática, performance de personagem. Use o eleven_flash_v2_5 quando a latência for a restrição (agentes em tempo real, streaming), quando você precisar processar textos muito longos em uma única chamada (limite de 40.000 caracteres vs. 5.000) ou quando o custo por caractere na API for relevante.
Posso usar vozes do ElevenLabs em um podcast ou vídeo do YouTube?
Sim, em qualquer plano pago. Os planos Starter e acima incluem licença comercial. Vozes da Voice Library podem ter termos adicionais definidos pelo criador da voz; verifique antes de publicar.
Se este guia economizou o seu tempo, receba a AI Weekly grátis, 3 edições por semana, lida por mais de 40.000 profissionais de IA.