Generative AI

Como Usar o ElevenLabs: TTS, Clonagem de Voz e Guia de API

Resumo rápido (agosto de 2026): O ElevenLabs é uma plataforma de áudio com IA que cobre síntese de voz, clonagem de voz, dublagem de vídeo, geração de música, efeitos sonoros e agentes de voz em tempo real. Você pode começar gratuitamente em elevenlabs.io com 10.000 créditos por mês (cerca de 10 minutos de fala, a 1 crédito por caractere), ou assinar a partir de $6/mês para liberar direitos comerciais e maior volume de saída. A API usa uma única variável de ambiente para autenticação e vem com SDKs oficiais para Python e JavaScript. A qualidade vai de ultra-rápido e barato (Eleven Flash com latência de ~75ms) ao mais expressivo e com maior cobertura de idiomas (Eleven v3 em mais de 70 idiomas).

Última verificação: 3 de agosto de 2026, em relação à documentação oficial e páginas de preços.

O que é o ElevenLabs Hoje

O ElevenLabs nasceu como uma ferramenta de síntese de voz e hoje opera em três superfícies de produto. ElevenCreative cobre TTS, clonagem de voz, dublagem, música e efeitos sonoros. ElevenAgents permite criar e implantar agentes de voz conversacionais em telefone, web e mobile. ElevenAPI oferece acesso programático a tudo isso.

O fluxo principal de TTS não mudou: cole o texto, escolha uma voz da biblioteca, selecione um modelo e gere o áudio. O que mudou é que empresas cada vez mais usam a plataforma para substituir sistemas de URA telefônica, e desenvolvedores usam a API para pipelines de voz em produção que combinam entrada e saída de áudio em tempo real.

Planos, Créditos e Direitos Comerciais

Os créditos são a unidade de conta. Na interface, cada caractere de texto custa 1 crédito, independentemente do modelo TTS escolhido. Pela API, os modelos Flash e Turbo têm tarifas com desconto. Nos planos pagos, os créditos não usados são transferidos por até dois meses, limitados a 2x a sua cota mensal, então o saldo máximo em qualquer momento é de 3x a cota mensal.

A cobrança anual elimina dois meses de custo: você paga por 10 meses e recebe 12.

O plano gratuito não inclui licença comercial e as dublagens saem com marca d'água. Todos os planos pagos incluem licença comercial.

Plano Preço mensal Equivalente anual/mês Créditos/mês O que desbloqueia
Free $0 $0 10,000 Sem licença comercial; dublagens com marca d'água
Starter $6 $5 30,000 Licença comercial; Instant Voice Cloning
Creator $22 ~$18 121,000 Professional Voice Cloning
Pro $99 ~$83 600,000 Volume de saída maior
Scale $299 ~$249 1,800,000 3 assentos; 3 Professional Voice Clones
Business $990 $825 6,000,000 10 assentos; 10 Professional Voice Clones
Enterprise Custom Custom Custom Assentos e cota de clones de voz customizados

O plano Creator a $22/mês é o primeiro nível a incluir o Professional Voice Cloning, o que importa se você precisar de um clone praticamente indistinguível da voz original.

Qual Modelo Usar

A escolha do modelo determina a expressividade, a cobertura de idiomas, a latência por requisição e o tamanho máximo de texto aceito em uma única chamada. Escolher o modelo errado é a causa mais comum de gasto desnecessário ou resultado frustrante.

ID do modelo Melhor para Idiomas Máx. de caracteres por chamada Latência
eleven_v3 Narração expressiva, diálogo emocional, trabalho com personagens 70+ 5,000 Não especificada
eleven_multilingual_v2 Conteúdo longo, qualidade consistente (padrão da API) 29 10,000 Não especificada
eleven_flash_v2_5 Agentes em tempo real, jobs em lote via API, velocidade multilíngue 32 40,000 ~75ms
eleven_flash_v2 Geração rápida apenas em inglês Apenas inglês 30,000 ~75ms

O eleven_v3 cobre mais idiomas e entrega a maior variedade emocional, mas seu limite de 5.000 caracteres exige que scripts mais longos sejam divididos antes do envio. O eleven_flash_v2_5 é o modelo certo para qualquer caso de uso sensível à latência e para trabalhos de alto volume via API, onde a tarifa reduzida por caractere faz diferença. O eleven_multilingual_v2 continua sendo o padrão e é a escolha certa para narração de conteúdo longo quando não há restrição de latência.

Além do TTS, o ElevenLabs também oferece modelos de fala para texto (scribe_v2 para transcrição em lote em mais de 90 idiomas, scribe_v2_realtime para streaming com latência de ~150ms), geração de música (music_v2) e efeitos sonoros (eleven_text_to_sound_v2).

Primeiros Passos: Navegador e API

Navegador: Crie uma conta gratuita em elevenlabs.io, abra a ferramenta Text to Speech no ElevenCreative, escolha uma voz da biblioteca (pesquisável por idioma, sotaque, gênero e idade), cole o texto, selecione um modelo e gere o áudio. Os downloads em MP3 e WAV estão disponíveis na mesma tela.

Chave de API: Acesse seu perfil no painel do ElevenLabs e gere uma chave de API. Armazene-a como variável de ambiente.

Configuração em Python:

pip install elevenlabs python-dotenv

Configuração em JavaScript:

npm install @elevenlabs/elevenlabs-js dotenv

Chamada básica de TTS em Python:

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play

load_dotenv()
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))

audio = client.text_to_speech.convert(
text="Your script text here.",
voice_id="JBFqnCBsd6RMkjVDRZzb", # replace with your chosen voice ID
model_id="eleven_flash_v2_5",
output_format="mp3_44100_128",
)

play(audio)

O endpoint REST é POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}. O ElevenLabs disponibiliza variantes regionais para EUA, UE, Índia e Singapura caso seu uso exija roteamento geográfico de dados.

Clonagem de Voz: Instant vs. Professional

As duas formas de clonagem têm tetos de qualidade, requisitos de tempo e barreiras de plano fundamentalmente diferentes.

Instant Voice Cloning Professional Voice Cloning
Plano necessário Starter e acima Creator e acima
Áudio necessário 1-2 minutos Mínimo de 30 minutos; ideal de 2-3 horas
Tempo de processamento Quase instantâneo 2-6 horas (às vezes mais)
Mecanismo Estima a voz usando dados de treinamento anteriores Realiza fine-tuning de um modelo dedicado com seu áudio
Precisão Boa para sotaques comuns; mais fraca com vozes atípicas Praticamente indistinguível do original
Disponível na Voice Library Não Sim

A qualidade do áudio importa mais do que o formato de arquivo em ambos os casos. Grave entre -23 dB e -18 dB RMS com pico real de -3 dB, sem ruído de fundo ou reverberação. Para o Instant Cloning, a própria documentação do ElevenLabs adverte contra ultrapassar 3 minutos de áudio-fonte. Mais áudio além desse limite não melhora a qualidade e pode degradar o clone.

MP3 a 192 kbps e WAV funcionam bem nos dois casos. O ElevenLabs afirma explicitamente que usar um WAV não comprimido gera pouca ou nenhuma melhoria em relação a um MP3 de alta taxa de bits.

O Professional Voice Cloning requer uma etapa de captcha de voz para verificar que o áudio enviado corresponde à sua própria voz. Não é possível usar esse caminho para clonar a voz de terceiros.

Dublagem, Efeitos Sonoros e Música

A dublagem está disponível em todos os planos, incluindo o gratuito (com marca d'água no gratuito). Faça upload de um vídeo ou arquivo de áudio, ou cole uma URL do YouTube ou TikTok, selecione os idiomas-alvo e o ElevenLabs detecta cada locutor, traduz o roteiro e regenera a fala no novo idioma preservando as características de voz de cada um. Os formatos de upload incluem MP4, MOV, MKV, MP3, WAV e cerca de 15 outros. Os formatos de saída são MP4 (vídeo), AAC, WAV e SRT (legendas). O tamanho máximo de arquivo é 2 GB e 180 minutos. O preço varia conforme a duração do conteúdo e o número de idiomas-alvo.

Efeitos sonoros: Descreva o som desejado em texto simples usando o modelo eleven_text_to_sound_v2 e baixe o clipe gerado. Útil para prototipar áudio em demos de produto ou vídeos antes de encomendar assets de produção.

Música: O modelo music_v2 gera faixas a partir de um prompt de texto em qualquer estilo. A qualidade da saída é adequada para prototipagem. Para música pronta para lançamento, trate a geração como rascunho e itere.

Agentes de Voz

O ElevenAgents combina o reconhecimento de fala do ElevenLabs, um modelo de linguagem de sua escolha e TTS em um loop de conversa em tempo real. Você configura os agentes por meio de um painel visual: selecione um LLM, projete os fluxos de conversa, vincule uma base de conhecimento ou chamadas de API externas e atribua uma voz. Os agentes são implantados em chamadas telefônicas, chat web e mobile.

Para transcrição independente, o scribe_v2 processa jobs em lote em mais de 90 idiomas com timestamps por palavra, diarização para até 32 locutores e detecção de 65 tipos de entidade. O scribe_v2_realtime transmite transcrições parciais com latência de aproximadamente 150ms e suporta detecção de atividade de voz.

Para saber mais sobre a construção de sistemas agênticos em torno de voz ou outras ferramentas, o guia da AI Weekly sobre como criar um agente de IA cobre a arquitetura subjacente. Para ideias de automação de fluxo de trabalho, veja como automatizar o trabalho com IA.

Perguntas Frequentes

O plano gratuito permite uso comercial?
Não. O ElevenLabs exclui a licença comercial do plano gratuito. O plano Starter a $6/mês é o mínimo para licenciamento comercial.

O que acontece com os créditos não usados ao final de um ciclo de cobrança?
Nos planos pagos, os créditos são transferidos por até dois meses, limitados a 2x a sua cota mensal. O saldo máximo total em qualquer ciclo de cobrança é de 3x a sua cota mensal.

Posso clonar a voz de outra pessoa?
O caminho do Professional Voice Cloning requer um captcha de voz que verifica se o áudio enviado corresponde à sua própria voz. Legalmente, as regras variam conforme a jurisdição. Uma permissão da plataforma do ElevenLabs não substitui a legislação local aplicável, portanto consulte um advogado antes de clonar a voz de terceiros para qualquer finalidade comercial.

Qual é a diferença na prática entre eleven_v3 e eleven_flash_v2_5?
Use o eleven_v3 quando a expressividade for a prioridade: amplitude emocional, entrega dramática, performance de personagem. Use o eleven_flash_v2_5 quando a latência for a restrição (agentes em tempo real, streaming), quando você precisar processar textos muito longos em uma única chamada (limite de 40.000 caracteres vs. 5.000) ou quando o custo por caractere na API for relevante.

Posso usar vozes do ElevenLabs em um podcast ou vídeo do YouTube?
Sim, em qualquer plano pago. Os planos Starter e acima incluem licença comercial. Vozes da Voice Library podem ter termos adicionais definidos pelo criador da voz; verifique antes de publicar.

Se este guia economizou o seu tempo, receba a AI Weekly grátis, 3 edições por semana, lida por mais de 40.000 profissionais de IA.