De ElevenLabs website met de tekst-naar-spraak-interface, stemmenbibliotheek en de belofte van realistische AI-audio
ElevenLabs zet de standaard voor realistische AI-spraak, en is uitgegroeid van een tekst-naar-spraaktool tot een compleet audioplatform.

Je hebt ElevenLabs waarschijnlijk al gehoord zonder het te weten. De stem in die uitlegvideo, de voice-over onder een reclame, het ingesproken artikel dat verdacht vloeiend klonk. Een groot deel daarvan komt hier vandaan. ElevenLabs zette de lat voor AI-spraak zo hoog dat "klinkt het als een echt mens" nauwelijks nog de juiste vraag is.

De juiste vraag is of je grip houdt op wat het je kost. Want zodra je zelf begint, merk je twee dingen: je tegoed smelt sneller dan je verwacht, en het klonen van een stem is inmiddels een juridisch mijnenveld. Allebei de moeite waard om te snappen voor je erin duikt.

Eén naam, drie heel verschillende producten

Wat begon als een tekst-naar-spraaktool is uitgewaaierd tot drie lagen die maar losjes met elkaar te maken hebben. Weten in welke laag je zit, scheelt verwarring.

De creatieve laag: stem, muziek, nasynchronisatie

Dit is de laag waar het je waarschijnlijk om gaat. Je plakt tekst, kiest een stem uit een bibliotheek van duizenden, kiest een taal, en krijgt audio terug die je nauwelijks van een opname onderscheidt.

Expressiviteit is de kracht: adempauzes, klemtoon, emotie. De nieuwste modellen laten zich zelfs met inline aanwijzingen sturen, zodat je nadruk en gevoel kunt regelen en meerdere sprekers in één dialoog kunt zetten.

De Voice Library van ElevenLabs met de optie om je eigen stem te klonen en de bibliotheek te verkennen
De stemmenbibliotheek is enorm. Voice cloning kent twee smaken: een snelle instant-kloon om te testen, en een professionele variant die schone studio-opnames vraagt.

Onder diezelfde laag vallen ook nasynchronisatie (een bestaande video naar een andere taal, met behoud van de karakteristiek van de stem) en sinds kort een muziekgenerator, met controle over genre en zang en zelfs het scheiden van stemmen en instrumenten uit een track.

Dat laatste brengt ElevenLabs op het terrein van Udio en Suno. Het verschil: die zijn gebouwd als toegewijde muziekmachines, terwijl muziek hier één onderdeel is van een breder platform. Handig als je er al zit, geen reden om ervoor te komen.

De agent-laag: pratende assistenten

Bedrijven bouwen er spraakgestuurde AI-agents mee die in gesprek acties kunnen uitvoeren: een klantenservice die live antwoordt, een assistent die een boeking afhandelt. Waarschijnlijk nog niet jouw ding, maar het laat zien waar het platform heen wil.

Eén belangrijk detail: het mooiste, meest expressieve model draait niet realtime. Voor live agents val je dus terug op een sneller maar iets minder rijk model.

De developer-laag

Een snelle API en spraakherkenning voor wie het in een eigen product wil bouwen. Prima om te weten dat het bestaat, verder niets waar je als gewone gebruiker mee zit.

Reken op meer credits dan je denkt

Hier zit de grootste verrassing, dus even een rekensom. Een script van 1.500 woorden is grofweg 8.000 tot 9.000 tekens. Op papier past dat ruim binnen een goedkoop plan.

In de praktijk verstook je door mislukte generaties, herhalingen en dat ene woord dat net verkeerd wordt uitgesproken al snel richting het dubbele. In tests liep het werkelijke verbruik op tot bijna 2,8 keer de reclamewaarde. Je zit dus continu mentaal te rekenen, en dat haalt iets van het plezier weg.

De plannen zelf, met credits als eenheid:

  • Free: 10.000 credits per maand (±10 minuten spraak), niet-commercieel, met verplichte vermelding van ElevenLabs.
  • Starter: $6 per maand (ongeveer €6), rond 30.000 credits, de eerste tier met commerciële rechten en instant cloning.
  • Creator: $22 per maand (rond €20), rond 121.000 credits, met professionele cloning. De praktische keuze voor makers.
  • Pro, Scale, Business: vanaf $99 (ongeveer €90) en hoger, voor volume, meer stemklonen of teamgebruik.

Bij jaarbetaling krijg je grofweg twee maanden cadeau, en op betaalde plannen rollen credits beperkt door. Op Free verdampt alles wat je aan het eind van de maand niet gebruikt.

De simpele remedie tegen verrassingen: test je stem en toon op een kort fragment voordat je een lange tekst laat inspreken. En draai je echt veel volume via de API, dan kom je op zo'n $180 per miljoen tekens uit, een flinke premie boven de commodity-diensten die richting $15 tot $30 gaan.

Waar het knelt

De klonkwaliteit is wisselend aan de onderkant. Instant-klonen en opnames van matige kwaliteit klinken geregeld blikkerig of net niet echt, ook na meerdere pogingen. Een echt overtuigende kloon vraagt schone studio-audio en de professionele route.

En de fijne sturing van emotie, hoe knap ook, blijft grillig. Dezelfde aanwijzing pakt niet elke keer hetzelfde uit, en consistentie over een lang project vasthouden is lastig.

Dan de juridische kant, die je niet mag negeren. Iemands stem klonen zonder aantoonbare toestemming is verboden bij ElevenLabs en riskant daarbuiten. Er kwam stevige wetgeving bij rond stemklonen, en voor AI-content geldt in de EU een openbaarmakingsplicht.

Voor je eigen stem is dat geen probleem. Voor die van een ander, zeker een bekend persoon of in een advertentie, is het oppassen geblazen. En kleiner, maar goed om te weten: de support gaat via e-mail en kan bij ingewikkelde kwesties dagen tot weken duren.

Waarmee je het naast legt

ElevenLabs vs OpenAI TTS

Het scherpste prijsverschil zit hier. OpenAI's tekst-naar-spraak is met zo'n $15 tot $30 per miljoen tekens vele malen goedkoper, en je stuurt de stem via een gewone tekstinstructie aan. Maar je kunt er geen stemmen mee klonen en de keuze aan stemmen is klein. Voor grote hoeveelheden neutrale spraak, en zeker als je al in het OpenAI-ecosysteem zit, is het de nuchtere keuze. Voor expressie aan de bovenkant blijft ElevenLabs voorop. (bekijk OpenAI TTS ↗)

ElevenLabs vs Cartesia

Cartesia is gebouwd voor snelheid: het reageert in enkele tientallen milliseconden, wat het de logische keuze maakt voor realtime spraakassistenten, precies daar waar het beste ElevenLabs-model niet inzetbaar is. Je levert wat dramatisch bereik in, maar wint aan reactietijd en kosten. Bouw je een pratende agent die live moet antwoorden, dan is Cartesia een serieuze overweging. (bekijk Cartesia ↗)

ElevenLabs vs PlayHT en Murf

PlayHT is een sterke keuze als je vooral variatie en veel talen wilt. Het biedt honderden stemmen in ruim honderd talen en is prettig voor lange content, al haalt het net niet de allerhoogste expressie van ElevenLabs. Murf kijkt meer naar het werkproces, met een complete voice-overstudio inclusief tijdlijn en samenwerking, gemaakt voor e-learning en bedrijfsvideo. Gaat het je puur om de mooiste stem, dan blijft ElevenLabs de tool om bij te blijven. (bekijk Murf ↗)

Het beste, mits je oplet

Voor wie stemkwaliteit vooropstelt, is ElevenLabs aan de bovenkant gewoon het beste dat er is. Denk aan luisterboeken, verhalende video en nasynchronisatie, aan alles waar de stem het verschil maakt tussen professioneel en amateuristisch. De uitbreiding naar muziek en agents maakt het bovendien steeds meer een compleet audioplatform.

De valkuil is de rekening, in twee opzichten. De credits gaan sneller dan je denkt, dus reken vooraf uit hoeveel je echt nodig hebt en test klein. En het klonen van stemmen vraagt om zorgvuldigheid met toestemming die je niet moet onderschatten.

Ga je puur voor volume tegen lage kosten, dan is een goedkopere dienst slimmer. Wil je dat het écht goed klinkt, dan betaal je hier een premie die je vaak terughoort.