ElevenLabs clonage vocal, guide complet et cadre légal

ElevenLabs : guide du clonage vocal pro et des voix synthétiques

ElevenLabs clonage vocal, guide complet et cadre légal

Un module de formation de vingt minutes, lu par une voix française naturelle, produit en dix minutes sans studio, et modifiable en tapant une phrase quand une slide change. C’est ce qu’ElevenLabs permet depuis 2023, et ce qui en a fait la référence mondiale de la voix synthétique, valorisée 11 milliards de dollars en février 2026. L’outil fait bien plus que lire un texte : il clone une voix à partir d’une minute d’audio, double une vidéo dans plus de soixante-dix langues en gardant la voix d’origine, transcrit, isole une voix d’un bruit de fond, et anime des agents vocaux. Ce guide couvre ce que la plateforme fait, les modèles à choisir, la qualité en français, les deux niveaux de clonage et le cadre légal qui va avec, les tarifs ramenés au coût de la minute, les usages professionnels, et les limites que les avis enthousiastes oublient.

Il complète notre guide complet de l’IA musicale, qui situe ElevenLabs dans la famille « voix », et renvoie vers notre tutoriel pour cloner sa propre voix pour le pas à pas, et vers ElevenLabs Music pour la partie musicale.

En bref

  • ElevenLabs est la référence de la voix synthétique : quatorze produits, dont la synthèse vocale, le clonage, le doublage dans plus de 70 langues, la transcription et les agents conversationnels, résume Vidéo IA.
  • Deux niveaux de clonage : instantané à partir d’une minute d’audio, professionnel à partir de trente minutes, réservé à votre propre voix, vérifiée par une procédure de consentement.
  • Le gratuit ne permet aucun usage commercial ; Starter à 5 $ par mois l’ouvre, Creator à 22 $ ajoute le clonage professionnel. Comptez 0,10 à 0,25 $ la minute d’audio selon le plan et le modèle.
  • Le français est bon sur la narration et la voix off, avec des faiblesses sur les sigles et les noms propres étrangers.
  • Le modèle v3, plus expressif, a des défauts de jeunesse : artefacts et régénérations, qui coûtent des crédits.
  • Verdict : l’outil à retenir pour la voix off de formation et le doublage, à condition de cadrer le consentement pour tout clone et de choisir le bon modèle par usage.
  • CTA : Proactive Academy vous aide à cadrer ces pratiques et à former vos équipes.

ElevenLabs, c’est quoi exactement

ElevenLabs a été fondée en 2022 à Londres par deux Polonais, un ancien de Google et un ancien de Palantir, autour d’une idée simple : un doublage de film mal fait dans leur enfance. Quatre ans plus tard, la société a levé plus de 780 millions de dollars et propose une plateforme à quatorze produits, d’après Vidéo IA. Le cœur reste la synthèse vocale : vous collez un texte, vous choisissez une voix, vous obtenez un fichier audio dont la qualité, à vitesse d’écoute normale, se distingue difficilement d’un enregistrement humain.

Autour de ce cœur, cinq briques comptent pour un usage professionnel. Le clonage vocal, pour créer une voix à partir d’échantillons. Le doublage, pour traduire une vidéo en gardant la voix et le rythme de l’orateur. Scribe, pour transcrire. L’isolateur de voix, pour nettoyer un enregistrement. Et les agents conversationnels, pour des assistants vocaux en temps réel, un terrain que ce guide n’aborde que pour le situer.

Depuis août 2025, ElevenLabs génère aussi de la musique, et en septembre 2026 Universal Music s’est allié à lui pour une plateforme sous licence. Ce sont deux sujets à part, traités dans les articles dédiés de cette série.

Les modèles : v2, v3, Flash, lequel choisir

C’est la première décision, et la plupart des utilisateurs la sautent. Trois familles de modèles coexistent.

Multilingual v2 est le modèle éprouvé : stable, régulier, prononciation fiable dans les langues principales. C’est celui que nous recommandons pour un module de formation, une narration longue, tout ce qui doit être constant d’un bout à l’autre.

Eleven v3 est le modèle expressif, sorti en 2025 : gamme émotionnelle plus large, balises de jeu dans le texte (rire, chuchotement, pause), meilleur sur les dialogues et les contenus courts qui doivent avoir du relief. Il a aussi des défauts de jeunesse. Des utilisateurs décrivent sur G2 des artefacts, un ton chantonnant par moments et des régénérations à répétition qui consomment des crédits, rapporte la fiche tarifaire de G2. Notre expérience en formation rejoint ces retours : v3 est brillant sur trente secondes, capricieux sur vingt minutes.

Flash est le modèle rapide et économique, deux fois moins cher en crédits, pensé pour les agents en temps réel et les volumes. Sa qualité est en retrait, acceptable pour une notification, pas pour une voix off.

La règle que nous donnons : v2 par défaut pour tout ce qui est long, v3 pour ce qui est court et doit vivre, Flash pour ce qui doit être bon marché. Et toujours un test de trente secondes sur le même texte avec les trois avant de lancer un module entier.

La qualité en français

C’est la question que posent tous les formateurs francophones, et la réponse est nuancée mais positive.

Sur la narration courante, la voix off de vidéo et le podcast, le français d’ElevenLabs est bon : intonations naturelles, liaisons bien gérées, rythme crédible. La bibliothèque de voix françaises s’est nettement étoffée en 2025 et 2026, avec des voix masculines et féminines dans plusieurs registres, d’après le test de Vidéo IA.

Trois faiblesses reviennent. Les sigles (SNCF, RGPD, OPCO) sont parfois lus lettre par lettre quand il faudrait un mot, ou l’inverse. Les noms propres étrangers et les anglicismes sont prononcés à la française ou à l’anglaise sans logique stable. Et les nombres longs, les dates, les montants peuvent être lus de façon inattendue.

Les parades sont simples et tiennent dans le texte. Écrivez les sigles comme vous voulez les entendre (« R-G-P-D », « opco »). Écrivez les nombres en lettres quand ils comptent. Utilisez la fonction de prononciation personnalisée, qui permet de fixer une fois pour toutes la lecture d’un terme. Et relisez à l’écoute : une voix de synthèse ne bute jamais, elle lit avec assurance ce qu’elle a mal compris.

Le clonage vocal : deux niveaux, une règle

Le clonage est ce qui fait la réputation d’ElevenLabs, et ce qui demande le plus de rigueur.

Le clonage instantané. À partir d’une minute d’audio propre, ElevenLabs crée une voix qui vous ressemble, en quelques secondes. Le résultat est bon pour une voix reconnaissable, moins bon sur les nuances ; il convient à un usage interne, un prototype, une vidéo courte. Disponible dès le plan Starter.

Le clonage professionnel. À partir de trente minutes d’enregistrement de qualité, et plusieurs heures d’entraînement, il produit un clone de qualité broadcast, capable de tenir un livre audio. Disponible à partir du plan Creator. Et il obéit à une règle que beaucoup découvrent trop tard : il ne s’applique qu’à votre propre voix. La procédure de vérification vous demande de lire un texte à voix haute pour prouver que la voix clonée est la vôtre. Vous ne pouvez pas cloner la voix d’un collègue, d’un dirigeant ou d’un comédien sur votre compte, même avec son accord écrit : c’est cette personne qui doit créer et vérifier son propre clone, puis le partager avec vous. Notre tutoriel de clonage détaille les deux procédures pas à pas.

Cette restriction n’est pas une gêne, c’est une protection. Elle empêche l’usage le plus dangereux de l’outil, et elle vous protège vous-même le jour où quelqu’un voudrait utiliser votre voix.

Clonage vocal ElevenLabs : deux niveaux, une règle Clonage instantané 1 minute d’audio propre résultat en quelques secondes voix reconnaissable, nuances limitées Dès le plan Starter (5 $/mois) usage interne, prototype, vidéo courte Clonage professionnel 30 minutes et plus d’enregistrement entraînement de plusieurs heures qualité broadcast, livre audio, modules À partir du plan Creator (22 $/mois) votre propre voix uniquement, vérifiée La règle : on ne clone que sa propre voix. Un tiers crée et vérifie son clone, puis le partage. Schéma Proactive Academy, conditions ElevenLabs constatées en septembre 2026

Le cadre légal en France et en Europe

Une voix est un attribut de la personnalité, protégé au même titre que l’image par l’article 9 du Code civil. Trois règles concrètes pour une entreprise française.

Le consentement, écrit et précis. Cloner la voix d’un salarié pour ses modules demande son accord écrit, qui précise les usages autorisés (quels contenus, quelle durée, quel périmètre de diffusion) et ce qui se passe s’il quitte l’entreprise. Un clone de voix n’est pas un enregistrement : il peut dire demain ce que la personne n’a jamais dit. Le consentement doit couvrir cela.

Les contenus trompeurs sont sanctionnés. Depuis 2024, le Code pénal sanctionne la diffusion d’un contenu généré par IA représentant l’image ou la voix d’une personne sans son consentement, lorsqu’il peut induire en erreur. Et depuis le 2 août 2026, l’AI Act impose la transparence pour les contenus synthétiques : un contenu audio généré ou manipulé qui imite une personne réelle doit être signalé comme tel, hors exceptions de création artistique.

Les voix de la bibliothèque ont leurs conditions. Les voix partagées par leurs créateurs sur ElevenLabs sont utilisables selon les conditions de chaque voix, avec rémunération des propriétaires. Une voix « premium » peut avoir des restrictions d’usage ; lisez-les avant de bâtir une série de modules dessus.

ElevenLabs a ses propres garde-fous : la vérification vocale pour le clonage professionnel, une liste de voix interdites (personnalités publiques), une modération des textes, et un classifieur capable de reconnaître un audio produit par ses modèles. Ces protections sont réelles ; elles ne remplacent pas le consentement écrit de votre côté.

Tarifs : ce que coûte une minute de voix

ElevenLabs facture en crédits, un crédit correspondant grossièrement à un caractère de texte. Ramené à la minute d’audio, d’après BIGVU et Vidéo IA, en septembre 2026 :

PlanPrixCrédits/moisMinutes (v2/v3)Droits commerciauxClonage
Gratuit0 $10 000~10Non, attribution obligatoireNon
Starter5 $/mois30 000~30OuiInstantané
Creator22 $/mois (11 $ le 1er mois)100 000~100, jusqu’à 200 avec FlashOui, 192 kbpsProfessionnel
Pro99 $/mois500 000~500Oui, 44,1 kHz via APIProfessionnel
Scale et Business330 $/mois et plus2 M et plusVolumeOuiProfessionnel, équipes

Le calcul qui compte : environ 1 000 crédits pour une minute avec v2 ou v3, 500 avec Flash. Sur Creator, une minute revient à 0,11 à 0,22 $ ; sur Starter, autour de 0,17 $. Un comédien voix-off facture 50 à 200 € la minute. La différence ne se discute pas ; ce qui se discute, c’est le temps de relecture et de correction, qui reste à votre charge.

Deux pièges. Les régénérations consomment des crédits : un texte mal préparé, relu trois fois, coûte trois fois. Et les crédits mensuels ne se reportent pas. Préparez le texte, testez sur trente secondes, puis générez le module en une fois.

Cas d’usage en formation et en entreprise

Quatre usages. Ceux que nous mettons en place avec les organisations accompagnées, avec le modèle et le plan qui conviennent.

La voix off des modules e-learning. Le cas central. Un module de vingt minutes réenregistré à chaque mise à jour coûtait une demi-journée de studio ; avec une voix de la bibliothèque ou le clone vérifié du formateur, une modification de paragraphe se fait en tapant la phrase. Multilingual v2, plan Creator, prononciations personnalisées pour le vocabulaire métier. Le gain est sur les mises à jour, pas sur la première version.

Le doublage d’une vidéo existante. Une vidéo de présentation en français, déclinée en anglais, espagnol et allemand en gardant la voix et le rythme de l’orateur. Le pipeline de doublage d’ElevenLabs est réellement performant, note BIGVU, même s’il demande une relecture par un locuteur natif pour les termes techniques.

L’accessibilité. Une version audio de chaque support écrit, pour les publics dyslexiques ou malvoyants. Coût marginal, obligation de plus en plus attendue des organismes de formation.

Le podcast interne et les messages audio. Un texte de communication lu par une voix stable, avec un fond musical sous licence, publié sans studio. v3 y trouve sa place si le message est court.

Dans les quatre cas, la règle de production est la même : un texte relu, un test de trente secondes, une génération, une écoute intégrale, des corrections dans le texte, pas dans l’audio. C’est ce processus que Proactive Academy formalise avec les équipes qui produisent leurs contenus en interne.

💡 À ne pas confondre avec un agent IA : la synthèse vocale et le doublage restent des outils qui exécutent une demande à la fois. Les agents conversationnels d’ElevenLabs, qui dialoguent en temps réel et enchaînent des actions, relèvent de la logique des agents. Pour découvrir les agents IA autonomes (qui exécutent plusieurs étapes en chaîne), voir notre cocon Agents IA.

Bien préparer un texte pour ElevenLabs

La qualité de la voix se joue dans le texte autant que dans le modèle. Cinq règles.

Écrivez pour l’oreille. Phrases courtes, un sujet par phrase, pas de parenthèses. Ce qui se lit bien ne s’écoute pas forcément bien.

Ponctuez pour le rythme. Une virgule est une respiration, un point une pause, un point de suspension une hésitation. ElevenLabs les lit. Un paragraphe sans ponctuation devient un flot.

Fixez les prononciations. Sigles, noms propres, termes métier : dans le dictionnaire de prononciation, une fois pour toutes, plutôt que dans chaque texte.

Utilisez les balises avec v3, avec modération. [rire], [chuchote], [pause] donnent du relief ; trop de balises donnent une voix qui joue. Une par paragraphe, au plus.

Réglez stabilité et clarté par usage. Stabilité haute pour une narration longue, plus basse pour un dialogue ; clarté moyenne par défaut. Testez ces deux curseurs sur le même texte avant de trancher.

Un exemple de texte préparé pour un module :

Bienvenue dans ce module sur le R-G-P-D. En vingt minutes, vous allez voir trois choses. D'abord, ce qu'est une donnée personnelle. Ensuite, les six bases légales d'un traitement. Enfin, vos obligations concrètes au quotidien. Commençons.

Sigle épelé, phrases courtes, énumération marquée, point final avant chaque respiration, et un « commençons » qui donne à la voix un point de chute net avant la première slide, ce qui évite le flottement qu’on entend dans la plupart des modules générés sans préparation. Générez, écoutez, corrigez le texte, régénérez. Jamais l’inverse.

Un module de A à Z : le déroulé en quarante minutes

Pour fixer les idées, voici comment se déroule la production de la voix off d’un module de vingt minutes, telle que nous la faisons pratiquer en formation.

Minute 0 à 10 : le texte. Le script du module existe déjà, sous forme de notes de slides. On le réécrit pour l’oreille : phrases courtes, transitions explicites (« passons au deuxième point »), sigles épelés, nombres en lettres. On le découpe en sections d’une slide, chacune dans un bloc séparé, parce qu’on corrigera par bloc.

Minute 10 à 15 : le test. Un bloc de trente secondes, généré avec trois voix de la bibliothèque et deux modèles (v2 et v3). On écoute les six versions. On retient une voix et un modèle, presque toujours v2 pour vingt minutes de contenu.

Minute 15 à 25 : la génération. Bloc par bloc, dans le Studio, avec la même voix et les mêmes réglages de stabilité. Vingt blocs, vingt fichiers courts, ou un projet unique exporté en une fois selon la façon dont le module est monté.

Minute 25 à 40 : l’écoute intégrale. Casque, texte sous les yeux, un crayon. Chaque hésitation, chaque sigle mal lu, chaque liaison bizarre est notée. Les corrections se font dans le texte du bloc concerné, qui est régénéré seul. Trois ou quatre blocs sur vingt, en général.

Quarante minutes, une vingtaine de milliers de crédits, un module prêt. La prochaine mise à jour prendra cinq minutes : un bloc modifié, un bloc régénéré, la même voix. C’est là que l’outil rembourse le temps passé à préparer.

Limites et pièges

v3 et les crédits. Le modèle expressif régénère souvent, et chaque régénération coûte. Pour du long, v2.

Les sigles et les noms. Relisez à l’écoute, systématiquement. Une voix de synthèse ne signale jamais ses erreurs.

Le clone qui vieillit. Un clone professionnel fixe une voix à un moment. Un an plus tard, la personne a changé de rythme ou de timbre, et le clone sonne daté. Prévoyez un réenregistrement annuel pour les voix qui portent beaucoup de contenus.

La dépendance. Vos clones vivent chez ElevenLabs. Exportez chaque fichier produit, gardez vos échantillons d’enregistrement, et lisez ce que les conditions disent de la suppression d’un compte.

Le consentement qui ne suit pas. Un salarié parti, un intervenant qui change d’avis : sans accord écrit qui prévoit la fin d’usage, vous êtes en risque. Écrivez-le avant.

L’AI Act. Depuis août 2026, un contenu audio synthétique qui imite une personne réelle doit être signalé. Une mention dans le générique ou la fiche du module suffit ; l’oubli, non.

ElevenLabs est-il gratuit ?

Il existe un plan gratuit avec 10 000 crédits par mois, environ dix minutes de voix, sans droits commerciaux et avec attribution obligatoire. Pour un usage professionnel, le plan Starter à 5 $ par mois ouvre les droits commerciaux et le clonage instantané ; Creator à 22 $ ajoute le clonage professionnel et une centaine de minutes.

ElevenLabs fonctionne-t-il bien en français ?

Oui, sur la narration, la voix off et le podcast, avec des intonations naturelles et une bibliothèque de voix françaises étoffée. Les sigles, les noms propres étrangers et les nombres longs demandent une préparation du texte et un dictionnaire de prononciation. Relisez toujours à l’écoute.

Peut-on cloner la voix d’un collègue ?

Pas sur votre compte. Le clonage professionnel ne s’applique qu’à votre propre voix, vérifiée en lisant un texte. Un collègue crée son propre clone sur son compte, le vérifie, puis le partage. Dans tous les cas, un consentement écrit précisant les usages et la fin d’usage est indispensable.

Quelle différence entre v2, v3 et Flash ?

Multilingual v2 est stable et régulier, à préférer pour tout contenu long. Eleven v3 est plus expressif, avec des balises de jeu, mais moins prévisible et plus coûteux en régénérations. Flash est rapide et deux fois moins cher en crédits, pour les volumes et le temps réel. Testez les trois sur trente secondes du même texte.

Combien coûte une minute de voix ?

Environ 1 000 crédits avec v2 ou v3, 500 avec Flash. Sur le plan Creator, une minute revient à 0,11 à 0,22 $ ; sur Starter, autour de 0,17 $. Les régénérations et les crédits non reportés sont les deux postes qui font grimper la facture.

ElevenLabs peut-il doubler une vidéo ?

Oui, dans plus de 70 langues, en gardant la voix et le rythme de l’orateur d’origine. Le résultat est convaincant, avec une relecture par un locuteur natif recommandée pour les termes techniques. Le doublage est accessible dès le plan Starter, avec un coût en crédits proportionnel à la durée.

Un contenu vocal généré par IA doit-il être signalé ?

Oui, depuis le 2 août 2026, l’AI Act impose la transparence pour les contenus synthétiques imitant une personne réelle, hors exceptions artistiques. Une mention claire dans le générique, la description ou la fiche du contenu suffit. Le Code pénal sanctionne aussi les contenus trompeurs diffusés sans consentement.

ElevenLabs remplace-t-il un comédien voix-off ?

Pour les modules, les mises à jour fréquentes, l’accessibilité et les versions multilingues, oui, à une fraction du coût. Pour une campagne où la voix est un élément de marque, un comédien reste souvent préférable, et son clone vérifié, avec son accord, peut ensuite prendre le relais des mises à jour.Et après ?

Et après ?

ElevenLabs a rendu la voix off aussi simple qu’un traitement de texte, et c’est précisément ce qui demande du cadre. Notre conviction : l’outil est le meilleur du marché pour la formation et la communication, à trois conditions. Choisir le modèle par usage plutôt que par nouveauté, préparer le texte comme on prépare un script, et traiter chaque clone de voix comme un contrat, avec un consentement écrit qui prévoit la fin. Commencez par une voix de la bibliothèque sur un module existant, mesurez le temps de relecture, puis décidez du clonage. Pour une équipe, la question n’est pas technique : c’est qui parle, avec quel accord, et comment on le signale. Proactive Academy forme vos équipes à produire des voix off IA conformes et de qualité, du choix du modèle aux règles de consentement.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *