ElevenLabs vs Chatterbox TTS 2026
Chatterbox TTS remporte 63 % des tests à l'aveugle face à ElevenLabs — et c'est gratuit. Qualité vocale, tarifs, latence et clonage comparés.
Lire l'article →
Contient des liens d'affiliation
Voici comment cloner sa voix avec l’IA gratuitement en quelques minutes, grâce à des modèles open source plutôt qu’aux pages d’éditeurs qui se disent « gratuites » sans l’être. Ce guide couvre deux méthodes réellement gratuites, Chatterbox et OpenVoice V2 (qui parle nativement français), plus l’option payante la moins chère qui fonctionne vraiment : ElevenLabs Starter à $6 par mois.
Les résultats de recherche pour « clonage de voix IA gratuit » sont surtout du marketing d’éditeurs. Les outils qui affichent le clonage sur leur page d’accueil verrouillent souvent la fonction derrière un forfait payant dès qu’on essaie de s’en servir. Ce guide s’en tient à ce qui est vérifiablement gratuit : des modèles open source qui tournent sur des démos officielles Hugging Face, sans inscription et sans coordonnées bancaires.
Le plan gratuit d'ElevenLabs n'inclut aucun clonage. Starter débloque le clonage vocal instantané et une licence commerciale pour $6/mois.
Essayer le clonage vocal ElevenLabs →La préparation est la même quelle que soit la méthode ci-dessous, que tu utilises un modèle open source gratuit ou un outil payant : un téléphone ou un micro USB basique, une pièce calme, et 30 secondes à 2 minutes de voix propre. C’est vraiment tout ce qu’il faut ; les différences entre outils n’apparaissent qu’à l’étape de l’envoi du fichier.
Un appareil d’enregistrement. Un smartphone ou un micro USB basique suffit ; pas besoin de matériel de studio. Ce qui compte davantage, c’est une pièce calme, car ces modèles reproduisent tout ce qui se trouve dans l’extrait de référence, bruit de fond et écho compris, pas seulement la voix.
Un espace calme. Enregistre-toi loin d’un ventilateur, du bruit de la circulation ou de conversations. Un placard rempli de vêtements ou une petite pièce moquettée vaut mieux qu’un salon ouvert, car les surfaces souples réduisent l’écho.
30 secondes à 2 minutes de voix propre. C’est la fourchette idéale pour la plupart des outils de ce guide. Lis un ou deux paragraphes à voix haute, avec ta voix normale, sans musique ni bruit de fond. Certaines méthodes ci-dessous demandent bien moins, à peine 5 secondes, précisé dans les étapes de chaque méthode.
Chatterbox (et sa variante plus rapide, Chatterbox Turbo) est un modèle de clonage vocal open source de Resemble AI, publié sous licence MIT. Cela signifie qu’il est gratuit pour un usage personnel, de recherche et commercial, y compris pour des produits à code fermé, pas seulement un essai gratuit qui expire. Il clone une voix en zero-shot, à partir d’un court extrait de référence, sans réglage fin ni entraînement à faire.
Va sur le Space ResembleAI/chatterbox-turbo-demo sur Hugging Face, la variante Turbo plus rapide. Tout se passe dans le navigateur, sans compte ni installation.
Envoie ou enregistre un extrait propre de ta voix. Environ 5 secondes suffisent pour le clonage zero-shot de Chatterbox.
Garde un seul locuteur, sans bruit de fond. Le modèle reproduit tout ce qui se trouve dans l’extrait, accent et bruit de fond compris, donc un enregistrement propre compte plus qu’un enregistrement long.
Saisis le script ou la phrase que tu veux entendre lue avec ta voix clonée.
Clique sur générer, écoute le résultat, puis télécharge le fichier audio. Comme Chatterbox est sous licence MIT, le résultat est utilisable commercialement, sans licence séparée à demander.
Pour un comparatif détaillé sur la qualité vocale, la latence et le prix face à une alternative payante, consulte le comparatif complet ElevenLabs vs Chatterbox TTS.
OpenVoice V2 est une seconde option open source, développée par MyShell et des chercheurs du MIT, également publiée sous licence MIT (depuis avril 2024, usage commercial inclus). Son avantage sur Chatterbox, c’est la couverture linguistique : il prend nativement en charge l’anglais, l’espagnol, le français, le chinois, le japonais et le coréen. Un seul extrait de référence peut donc générer ta voix clonée s’exprimant dans l’une de ces six langues.
C’est le point fort pour un locuteur francophone : tu peux enregistrer un échantillon dans n’importe quelle langue et obtenir ta voix clonée qui lit du texte en français, sans jamais avoir à te réenregistrer dans cette langue.
Va sur le Space myshell-ai/OpenVoiceV2 sur Hugging Face. Comme Chatterbox, c'est une démo dans le navigateur, sans inscription.
Envoie un enregistrement court et propre de la voix à cloner, même règle de pièce calme qu'à la méthode 1.
Sélectionne le français parmi les six langues prises en charge, puis génère.
C’est la fonctionnalité qui distingue OpenVoice V2 : tu peux cloner une voix à partir d’un échantillon en anglais et lui faire lire un texte en français, sans jamais réenregistrer dans cette langue.
Télécharge l'audio généré une fois satisfait du résultat. Même licence MIT que Chatterbox, l'usage commercial est donc clair.
Resemble AI propose également Chatterbox Multilingual (licence MIT), qui prend en charge le français en plus de l’anglais. C’est une option à connaître, mais attention : la démo Turbo en anglais présentée en méthode 1 ne parle pas français ; pour un rendu en français avec la famille Chatterbox, il faut passer par le modèle Multilingual, pas la démo Turbo.
Si tu veux une interface plus soignée et une licence commerciale sans avoir à décortiquer toi-même les conditions MIT, ElevenLabs est l’option payante la moins chère qui fonctionne réellement. Son plan gratuit mérite d’être précisé clairement : synthèse vocale, transcription, effets sonores et conception de voix, mais aucun clonage vocal et aucune licence commerciale. Le plan Starter, $6 par mois pour 30 000 crédits, est le forfait qui débloque le clonage vocal instantané et ajoute la licence commerciale.
Le plan gratuit ne permet pas de cloner. Starter à $6/mois débloque le clonage vocal instantané plus une licence commerciale absente du plan gratuit.
La documentation officielle d'ElevenLabs indique que 30 secondes peuvent donner d'excellents résultats, avec 1 à 2 minutes d'audio propre recommandées pour le meilleur équilibre.
Au-delà de 3 minutes, la qualité peut en fait se dégrader, selon les recommandations d’ElevenLabs. Garde un seul locuteur, et n’oublie pas que le modèle reproduit accent et bruit de fond sans distinction, donc enregistre-toi dans un endroit calme.
Envoie l'extrait dans le Voice Lab et coche la case de consentement obligatoire confirmant que tu as le droit de cloner cette voix.
Tape ton script, génère la voix clonée, puis ajuste le texte ou les réglages jusqu'à ce que le rendu te convienne.
Comme il s’agit de clonage vocal instantané, tout ce cycle prend quelques minutes, pas des heures.
Si tu peux fournir 30 minutes à 3 heures d’audio, le clonage vocal professionnel (Professional Voice Cloning) d’ElevenLabs (disponible à partir du forfait Creator, $22/mois avec une promo de $11 le premier mois) entraîne un modèle dédié en environ 3 à 6 heures. Il ne peut cloner que ta propre voix, même avec le consentement écrit de quelqu’un d’autre, et exige un enregistrement de vérification lors de la configuration.
Envoie un échantillon de 1 à 2 minutes et entends ta voix clonée en quelques minutes, avec 30 000 crédits mensuels et les droits commerciaux inclus.
Obtenir ElevenLabs Starter →Si tu cherches des options de synthèse vocale au-delà du seul clonage, le comparatif des meilleurs générateurs de voix IA couvre un plus large éventail d’outils et d’usages.
Plusieurs noms connus mettent en avant le clonage vocal sans réellement l’offrir gratuitement : Murf verrouille le clonage derrière un appel commercial Enterprise, le plan gratuit de Speechify n’inclut aucun clonage malgré un marketing qui laisse penser le contraire, et le palier à $0 d’ElevenLabs s’arrête à la synthèse vocale. Voici ce que chacun facture réellement.
Murf AI : le clonage vocal est un module complémentaire Custom Voice Clones réservé au plan Enterprise, verrouillé derrière « Contact Sales ». Il n’est disponible ni sur le plan Free (10 minutes de génération vocale à usage unique, sans clonage), ni sur Creator ($19/mois facturé annuellement), ni sur Business ($66/mois facturé annuellement). Il n’existe aucun moyen en libre-service de cloner une voix sur Murf, à aucun prix.
Speechify : la page marketing annonce « Essayez le clonage vocal, c’est gratuit », mais la grille tarifaire officielle raconte une autre histoire : le plan Free affiche « No Voice Cloning », et le clonage ne démarre qu’avec le plan Studio Starter, à $100/an.
Le plan gratuit d’ElevenLabs lui-même : ça vaut la peine de le répéter, tant c’est la source de confusion la plus fréquente. Le plan à $0 donne 10 000 crédits par mois pour la synthèse vocale, la transcription et les effets sonores, mais zéro clonage vocal et aucune licence commerciale.
Comparé aux grilles tarifaires officielles, août 2026
| Tool | Vraiment gratuit ? | Audio nécessaire | Usage commercial | Le hic |
|---|---|---|---|---|
| Chatterbox | Oui | ~5 secondes | Oui (licence MIT) | La démo officielle est pensée pour tester, pas pour la production à haut volume |
| OpenVoice V2 | Oui | Un court extrait | Oui (licence MIT) | Meilleurs résultats dans les 6 langues nativement prises en charge, dont le français |
| ElevenLabs Free | Non | N/A | Non | Aucun clonage inclus, quel que soit le niveau de crédits |
| ElevenLabs Starter ($6/mois) | Non (payant) | 30 s - 2 min | Oui | Instantané seulement ; le clonage professionnel exige le forfait Creator ($22/mois) |
| Murf AI | Non | N/A | N/A | Clonage réservé à l'Enterprise, verrouillé côté commercial |
| Speechify | Non | N/A | N/A | Le plan gratuit n'inclut aucun clonage ; ça démarre à $100/an |
De 5 secondes à 3 heures selon la méthode : les outils zero-shot comme Chatterbox fonctionnent à partir d’environ 5 secondes, le clonage vocal instantané d’ElevenLabs demande 1 à 2 minutes, et le clonage de qualité professionnelle nécessite 30 minutes à 3 heures. Plus l’audio propre est abondant, plus le clone est précis et stable, et la différence entre paliers s’entend clairement.
Quelques secondes (zero-shot) : Chatterbox et OpenVoice V2 fonctionnent tous deux à partir d’un court extrait, sans étape d’entraînement. La qualité est correcte, suffisante pour des tests rapides, des extraits courts ou des projets personnels, mais les petites imperfections de ton et de rythme se remarquent davantage qu’avec un échantillon plus long.
1 à 2 minutes (clonage instantané) : le clonage vocal instantané d’ElevenLabs est entraîné sur cette plage, et il produit un clone nettement plus stable et naturel qu’un échantillon zero-shot de 5 secondes. C’est la fourchette à viser si la qualité compte pour toi.
30 minutes à 3 heures (clonage professionnel) : le clonage vocal professionnel d’ElevenLabs entraîne un modèle dédié sur cette quantité d’audio, ce qui donne ce qui se rapproche le plus d’un clone qualité broadcast à l’heure actuelle. L’entraînement prend des heures et ne peut servir qu’à cloner ta propre voix.
Cloner sa propre voix est légal et fait partie des usages de l’IA les moins controversés qui soient ; c’est ta voix, ton enregistrement, ton résultat. Cloner la voix de quelqu’un d’autre, c’est là que se situe la limite légale et éthique, et tout se joue sur le consentement.
Cloner la voix d’une autre personne sans sa permission peut porter atteinte à ses droits, même quand l’outil le permet techniquement. Chaque méthode de ce guide exige de confirmer que tu as le droit de cloner la voix envoyée.
L’ELVIS Act du Tennessee : en vigueur depuis le 1er juillet 2024, c’est une loi d’État américain, pas une loi fédérale, qui protège spécifiquement la voix d’une personne contre les répliques IA non autorisées et exige une autorisation écrite avant le clonage d’une voix à des fins commerciales. D’autres États pourraient suivre, mais cette protection n’est pas encore nationale aux États-Unis.
L’EU AI Act : les règles de transparence de l’article 50 sont entrées en vigueur le 2 août 2026 et exigent que tout audio généré ou manipulé par IA, deepfakes inclus, soit signalé aux auditeurs. Cette obligation s’applique directement en France. Si tu publies de l’audio cloné pour un public européen, l’étiqueter comme généré par IA est désormais une exigence légale. Voir les règles d’étiquetage du contenu selon l’article 50 de l’EU AI Act pour le détail complet.
Les arnaques sont l’autre risque. La FTC a plusieurs fois mis en garde les consommateurs contre les arnaques au clonage vocal, où une voix clonée, souvent celle d’un proche, extraite de clips publiés sur les réseaux sociaux, sert à simuler un appel d’urgence pour réclamer de l’argent. Aucune des méthodes de ce guide n’est conçue pour ça, mais la même technologie peut être détournée, ce qui explique pourquoi le consentement et l’étiquetage comptent autant.
Oui. Cloner sa propre voix est légal et ne demande la permission de personne d'autre que toi-même, puisque c'est ton enregistrement et ta voix. Les questions légales autour du clonage vocal concernent le clonage de la voix de quelqu'un d'autre, où le consentement est requis, pas le clonage de sa propre voix.
Oui, grâce aux modèles open source. Chatterbox et OpenVoice V2 sont tous deux sous licence MIT et tournent sur des Spaces Hugging Face officiels et gratuits, sans inscription ni installation. OpenVoice V2 parle nativement français, ce qui en fait l'option la plus utile pour un usage francophone. Beaucoup d'outils qui annoncent un clonage vocal « gratuit » sur leurs pages marketing ne l'offrent en réalité pas gratuitement, y compris le palier à $0 d'ElevenLabs, qui n'inclut aucun clonage.
Cela va d'environ 5 secondes à plusieurs heures, selon la méthode et la qualité recherchée. Les outils zero-shot comme Chatterbox et OpenVoice V2 fonctionnent à partir d'environ 5 secondes d'audio propre. Le clonage vocal instantané d'ElevenLabs recommande 1 à 2 minutes pour le meilleur équilibre entre rapidité et qualité. Le clonage de qualité professionnelle nécessite 30 minutes à 3 heures d'audio et prend des heures à entraîner.
Les outils eux-mêmes sont sûrs à utiliser quand tu clones ta propre voix ou une voix pour laquelle tu as le consentement. Le risque vient du détournement : des voix clonées ont servi dans des appels frauduleux imitant des proches, ce qui a poussé la FTC à émettre des mises en garde. Utiliser un outil réputé, réserver l'audio cloné à des usages consentis et signaler l'audio généré par IA là où c'est exigé (comme sous l'EU AI Act) permet de rester du bon côté.
Correcte à bonne, selon ton extrait de référence. Chatterbox et OpenVoice V2 produisent tous deux des clones reconnaissables et exploitables à partir d'un court échantillon zero-shot, suffisants pour des projets personnels, des tests rapides ou du contenu qui ne demande pas la perfection. Ils n'égaleront pas un modèle entraîné professionnellement à partir de plusieurs heures d'audio, mais pour des outils gratuits accessibles depuis le navigateur, l'écart est plus faible qu'on ne l'imagine.
Cela dépend de ton budget et de ton usage. Si le coût est la priorité, Chatterbox et OpenVoice V2 sont réellement gratuits et sous licence MIT pour un usage commercial, et OpenVoice V2 a l'avantage de parler nativement français. Si tu préfères un workflow plus rapide et plus soigné et que payer ne te dérange pas, ElevenLabs Starter à $6/mois est le plan le moins cher où le vrai clonage est débloqué. Consulte le comparatif des meilleurs outils de clonage vocal gratuits et le comparatif ElevenLabs vs Chatterbox TTS pour un examen plus approfondi des deux options.