En résumé (août 2026) : ElevenLabs est une plateforme audio IA couvrant la synthèse vocale, le clonage de voix, le doublage vidéo, la génération musicale, les effets sonores et les agents vocaux en temps réel. Le plan gratuit offre 10,000 crédits par mois (environ 10 minutes de parole à 1 crédit par caractère) sur elevenlabs.io, les plans payants démarrent à $6/mois pour débloquer les droits commerciaux et des volumes de sortie plus élevés. L'API s'authentifie via une seule variable d'environnement et propose des SDK officiels Python et JavaScript. La qualité va de l'ultra-rapide et économique (Eleven Flash à ~75 ms de latence) à la plus expressive avec la couverture linguistique la plus large (Eleven v3 sur 70+ langues).
Dernière vérification : 3 août 2026, d'après la documentation officielle et les pages de tarification.
ElevenLabs aujourd'hui
ElevenLabs a débuté comme outil de synthèse vocale et couvre désormais trois surfaces produit. ElevenCreative regroupe la synthèse vocale, le clonage de voix, le doublage, la musique et les effets sonores. ElevenAgents permet de créer et déployer des agents vocaux conversationnels sur téléphone, web et mobile. ElevenAPI offre un accès programmatique à l'ensemble de ces fonctionnalités.
Le flux de travail TTS de base n'a pas changé : coller du texte, choisir une voix dans la bibliothèque, sélectionner un modèle, générer l'audio. Ce qui a évolué, c'est l'adoption croissante par les entreprises pour remplacer leurs serveurs vocaux interactifs, et l'usage de l'API par les développeurs pour des pipelines vocaux en production combinant entrée et sortie vocale en temps réel.
Offres, crédits et droits commerciaux
Les crédits sont l'unité de compte. Dans l'interface, chaque caractère de texte coûte 1 crédit, quel que soit le modèle TTS choisi. Via l'API, les modèles Flash et Turbo bénéficient de tarifs réduits. Sur les plans payants, les crédits non utilisés sont reportés jusqu'à deux mois, plafonnés à 2x votre quota mensuel, soit un solde maximum de 3x votre allocation mensuelle.
La facturation annuelle supprime deux mois de coût : vous payez 10 mois et obtenez 12.
Le plan gratuit n'inclut pas de licence commerciale et les doublages portent un filigrane. Chaque plan payant inclut une licence commerciale.
| Plan | Prix mensuel | Équivalent annuel/mois | Crédits/mois | Fonctionnalité clé débloquée |
|---|---|---|---|---|
| Free | $0 | $0 | 10,000 | Pas de licence commerciale ; doublages avec filigrane |
| Starter | $6 | $5 | 30,000 | Licence commerciale ; Instant Voice Cloning |
| Creator | $22 | ~$18 | 121,000 | Professional Voice Cloning |
| Pro | $99 | ~$83 | 600,000 | Volume de sortie plus élevé |
| Scale | $299 | ~$249 | 1,800,000 | 3 sièges ; 3 Professional Voice Clones |
| Business | $990 | $825 | 6,000,000 | 10 sièges ; 10 Professional Voice Clones |
| Enterprise | Custom | Custom | Custom | Sièges et quota de clones vocaux sur mesure |
Le plan Creator à $22/mois est le premier niveau à inclure le Professional Voice Cloning, ce qui importe si vous avez besoin d'un clone quasi indiscernable du locuteur original.
Quel modèle utiliser
Le choix du modèle détermine l'expressivité, la couverture linguistique, la latence par requête et le volume de texte transmissible en un seul appel. Choisir le mauvais modèle est la principale source de dépenses inutiles ou de résultats décevants.
| ID du modèle | Idéal pour | Langues | Caractères max par appel | Latence |
|---|---|---|---|---|
eleven_v3 |
Narration expressive, dialogues émotionnels, personnages | 70+ | 5,000 | Non spécifié |
eleven_multilingual_v2 |
Contenu long format, qualité constante (défaut API) | 29 | 10,000 | Non spécifié |
eleven_flash_v2_5 |
Agents en temps réel, traitements API en masse, rapidité multilingue | 32 | 40,000 | ~75ms |
eleven_flash_v2 |
Génération rapide en anglais uniquement | English only | 30,000 | ~75ms |
eleven_v3 couvre le plus de langues et offre la plus grande plage émotionnelle, mais sa limite de 5,000 caractères impose de découper les scripts longs avant envoi. eleven_flash_v2_5 est le bon choix pour tout cas d'usage sensible à la latence et pour les traitements API à fort volume où le tarif réduit par caractère compte. eleven_multilingual_v2 reste le modèle par défaut et convient à la narration longue format sans contrainte de latence.
Au-delà de la synthèse vocale, ElevenLabs propose aussi des modèles de transcription (scribe_v2 pour le traitement par lots en 90+ langues, scribe_v2_realtime pour le streaming à ~150 ms de latence), de génération musicale (music_v2) et d'effets sonores (eleven_text_to_sound_v2).
Premiers pas : navigateur et API
Navigateur : Créez un compte gratuit sur elevenlabs.io, ouvrez l'outil Text to Speech dans ElevenCreative, choisissez une voix dans la bibliothèque (filtrable par langue, accent, genre et âge), collez votre texte, sélectionnez un modèle et générez. Les téléchargements MP3 et WAV sont disponibles depuis le même écran.
Clé API : Accédez à votre profil dans le tableau de bord ElevenLabs et générez une clé API. Stockez-la dans une variable d'environnement.
Configuration Python :
pip install elevenlabs python-dotenv
Configuration JavaScript :
npm install @elevenlabs/elevenlabs-js dotenv
Appel TTS Python de base :
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
from elevenlabs.play import play
load_dotenv()
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
audio = client.text_to_speech.convert(
text="Your script text here.",
voice_id="JBFqnCBsd6RMkjVDRZzb", # replace with your chosen voice ID
model_id="eleven_flash_v2_5",
output_format="mp3_44100_128",
)
play(audio)
L'endpoint REST est POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}. ElevenLabs propose des variantes régionales pour les États-Unis, l'UE, l'Inde et Singapour si votre cas d'usage requiert un routage géographique des données.
Clonage vocal : Instant vs. Professional
Les deux parcours de clonage ont des plafonds de qualité, des exigences de temps et des conditions de plan fondamentalement différents.
| Instant Voice Cloning | Professional Voice Cloning | |
|---|---|---|
| Plan requis | Starter et supérieur | Creator et supérieur |
| Audio requis | 1-2 minutes | 30 minutes minimum ; 2-3 heures optimal |
| Durée de traitement | Quasi instantané | 2-6 heures (parfois plus) |
| Mécanisme | Estime la voix à partir des données d'entraînement existantes | Fine-tune un modèle dédié sur votre audio |
| Précision | Bon pour les accents courants ; moins précis pour les voix atypiques | Quasi indiscernable de l'original |
| Partageable dans la Voice Library | Non | Oui |
La qualité audio compte plus que le format de fichier pour les deux parcours. Enregistrez entre -23 dB et -18 dB RMS avec un pic réel de -3 dB, sans bruit de fond ni réverbération. Pour l'Instant Cloning, la documentation officielle d'ElevenLabs déconseille de dépasser 3 minutes d'audio source. Un volume supérieur n'améliore pas la qualité et peut dégrader le clone.
Un MP3 à 192 kbps et le WAV fonctionnent tous deux très bien. ElevenLabs précise explicitement qu'un WAV non compressé n'apporte que peu ou pas d'amélioration de qualité par rapport à un MP3 à haut débit.
Le Professional Voice Cloning requiert une étape de captcha vocal pour vérifier que l'audio téléchargé correspond à votre propre voix. Ce parcours ne permet pas de cloner la voix d'un tiers.
Doublage, effets sonores et musique
Doublage : disponible sur tous les plans, y compris gratuit (avec filigrane sur le plan gratuit). Téléchargez un fichier vidéo ou audio, ou collez une URL YouTube ou TikTok, sélectionnez les langues cibles, et ElevenLabs détecte chaque locuteur, traduit le script et régénère la parole dans la nouvelle langue en préservant les caractéristiques vocales de chaque locuteur. Les formats d'entrée incluent MP4, MOV, MKV, MP3, WAV et une quinzaine d'autres. Les formats de sortie sont MP4 (vidéo), AAC, WAV et SRT (sous-titres). La taille maximale est de 2 Go et 180 minutes. La tarification varie selon la durée du contenu et le nombre de langues cibles.
Effets sonores : décrivez le son souhaité en langage naturel avec le modèle eleven_text_to_sound_v2 et téléchargez le clip généré. Utile pour prototyper l'audio dans des démos produit ou des vidéos avant de commander des ressources de production.
Musique : le modèle music_v2 génère des pistes à partir d'un prompt textuel dans n'importe quel style. La qualité de sortie convient au prototypage. Pour une musique prête à la diffusion, traitez la génération comme une ébauche et itérez.
Agents vocaux
ElevenAgents combine la reconnaissance vocale d'ElevenLabs, le LLM de votre choix et la synthèse vocale dans une boucle de conversation en temps réel. Vous configurez les agents via un tableau de bord visuel : sélectionnez un LLM, concevez les flux de conversation, attachez une base de connaissances ou des appels API externes, et assignez une voix. Les agents se déploient sur appels téléphoniques, chat web et mobile.
Pour la transcription autonome, scribe_v2 gère les traitements par lots en 90+ langues avec des horodatages au niveau du mot, la diarisation des locuteurs jusqu'à 32 intervenants et la détection de 65 types d'entités. scribe_v2_realtime diffuse des transcriptions partielles à environ 150 ms de latence et prend en charge la détection d'activité vocale.
Pour en savoir plus sur la construction de systèmes agentiques autour de la voix ou d'autres outils, le guide AI Weekly sur comment créer un agent IA couvre l'architecture sous-jacente. Pour des idées d'automatisation des flux de travail, consultez comment automatiser votre travail avec l'IA.
FAQ
Le plan gratuit autorise-t-il un usage commercial ?
Non. ElevenLabs exclut la licence commerciale du plan gratuit. Le plan Starter à $6/mois est le minimum pour obtenir une licence commerciale.
Que se passe-t-il avec les crédits non utilisés en fin de cycle de facturation ?
Sur les plans payants, les crédits sont reportés jusqu'à deux mois, plafonnés à 2x votre quota mensuel. Votre solde total maximum sur n'importe quel cycle de facturation est de 3x votre allocation mensuelle.
Puis-je cloner la voix de quelqu'un d'autre ?
Le parcours Professional Voice Cloning requiert un captcha vocal qui vérifie que l'audio téléchargé correspond à votre propre voix. Sur le plan juridique, les règles varient selon la juridiction. Une autorisation de la plateforme ElevenLabs ne se substitue pas au droit local applicable ; consultez un conseil juridique avant de cloner la voix d'un tiers à des fins commerciales.
Quelle est la différence pratique entre eleven_v3 et eleven_flash_v2_5 ?
Utilisez eleven_v3 quand l'expressivité est la priorité : plage émotionnelle, rendu dramatique, performance de personnage. Utilisez eleven_flash_v2_5 quand la latence est la contrainte (agents en temps réel, streaming), quand vous devez traiter de très longs textes en un seul appel (limite de 40,000 caractères contre 5,000), ou quand le coût API par caractère compte.
Puis-je utiliser les voix ElevenLabs dans un podcast ou une vidéo YouTube ?
Oui, sur n'importe quel plan payant. Starter et supérieur incluent une licence commerciale. Les voix issues de la Voice Library peuvent être soumises à des conditions supplémentaires définies par le créateur de voix individuel ; vérifiez-les avant de publier.
Si ce guide vous a été utile, recevez AI Weekly gratuitement, 3 numéros par semaine, lu par 40,000+ praticiens.