Luisteren & AI-stemmen

Waarom offline AI-stemmen ertoe doen

Jarenlang betekende goede synthetische spraak dat je je tekst naar iemands server stuurde. Voor één alinea een eerlijke ruil. Voor een heel boek, over drie weken uitgelezen, is het een andere afweging, en een kleine technische verschuiving heeft die stilletjes overbodig gemaakt.

Een roman is acht tot twaalf uur spraak. Ruwweg een half miljoen tekens. Dat getal is het hele argument, dus het loont er even bij stil te staan voordat we verdergaan.

1. De kosten worden zichtbaar

Cloud-tekst-naar-spraak wordt per teken afgerekend. Op boekformaat is dat geen afrondingsverschil: het is precies waarom elke dienst die erop gebouwd is een abonnement verkoopt in plaats van een aankoop. Je betaalt maandelijks zolang je blijft lezen, of je draait het model op hardware die je al hebt en betaalt niets per uur.

Dit is geen betoog dat abonnementen verkeerd zijn. Het is een betoog dat er juist op lezen geen meter hoort te staan.

2. Je boeken zijn geen anonieme data

Om je tekst uit te spreken moet een clouddienst je tekst ontvangen. Bij een artikel is dat triviaal. Bij een bibliotheek is het een register van alles wat je leest, in volgorde, op welk tijdstip, en hoe ver je kwam. Leesgeschiedenis is ongewoon onthullend: gezondheid, geloof, politiek, verdriet, waar je vorige maand stilletjes iets over opzocht.

En het gaat niet alleen om boeken. Mensen halen contracten, medische brieven en ongepubliceerde manuscripten door voorleesgereedschap. Vertellen op het toestel betekent dat die inhoud de telefoon nooit verlaat, en dat is een garantie die geen privacyverklaring evenaart.

3. Het werkt waar je echt leest

Metro’s, vliegtuigen, plattelandswegen, hotelwifi die elke anderhalf uur opnieuw wil inloggen. Een stem die op je toestel woont begint in dezelfde seconde, of je nu vijf streepjes hebt of geen. Een cloudstem buffert, hapert aan de rand van het bereik, en stopt op tien kilometer hoogte helemaal.

Er is een subtielere versie hiervan: een engine op het toestel kan de volgende paar alinea’s vooruit genereren, zodat een hoofdstukovergang niets kost. Niemand merkt het als dit werkt. Iedereen merkt het als het niet werkt.

4. Batterij en data, mét de nuance

De eerlijke versie: spraak lokaal genereren gebruikt de processor, en streamen gebruikt de radio. Geen van beide is gratis. In de praktijk kost aanhoudend netwerkgebruik meestal meer batterij dan een klein, efficiënt model, en vertellen op het toestel gebruikt helemaal geen mobiele data, wat bij lang luisteren het grotere getal is.

Modelgewicht telt hier. Een lichte engine als Piper merk je nauwelijks; een zwaardere als Kokoro vraagt meer van de chip en wordt op een oudere telefoon zichtbaar in de accuduur. Kiezen tussen die twee is een echte afweging, die we behandelen in Piper vs Kokoro.

5. Het blijft werken

Clouddiensten veranderen. Prijzen stijgen, gratis lagen sluiten, API’s vervallen, bedrijven worden overgenomen. Een stemmodel in de opslag van je app kent geen van die faalvormen: het leest je over vijf jaar precies zo voor als vandaag, of iemand de dienst die het inspireerde nog onderhoudt of niet.

Voor een leesapp, die mensen jarenlang houden, is die stabiliteit net zoveel waard als de klankkwaliteit.

Wat er technisch veranderde

Dit alles kon tot voor kort niet, en het is de moeite waard precies te zijn over waarom. Neurale spraakmodellen hadden een datacenter nodig. Twee dingen loste dat op: architecturen die goede spraak maken met veel minder parameters, en telefoonchips die hier echt snel in werden.

Piper komt uit de open-source wereld van spraakassistenten, met kleine modellen per stem en nadruk op snelheid en taaldekking. Kokoro ging de andere kant op en stak meer capaciteit in hoe menselijk het resultaat klinkt, terwijl het klein genoeg bleef voor een telefoon. Samen dekken ze het meeste wat een lezer nodig heeft, en beide zijn open, en juist daarom kan een onafhankelijke app ze meeleveren.

De eerlijke tegenargumenten

  • De beste cloudstemmen zijn nog steeds beter. In expressie, karakterstemmen en emotioneel bereik wint een groot gehost model. Op het toestel is het gat grotendeels gedicht, niet helemaal.
  • De taaldekking is ongelijk. Sommige talen hebben uitstekende stemmen op het toestel en sommige helemaal geen. Clouddiensten hebben meer middelen en dekken meer.
  • Modellen nemen ruimte in. Elke gedownloade stem kost opslag, en op een telefoon van 64 GB is dat een reële kostenpost.

Waar dat op uitkomt: voor één artikel gebruik je wat het mooist klinkt. Voor je bibliotheek hoort de stem te wonen waar de boeken wonen.

Hoe dat er in de praktijk uitziet

Lectern levert beide engines mee, herkent de taal van het boek dat je opent, stelt een passende stem voor, downloadt die één keer, en heeft daarna het netwerk nooit meer nodig. De gesproken zin licht op zodat je kunt meelezen, het scherm blijft aan tijdens het vertellen, en er zit nergens in de keten een account.

Het punt is niet dat offline een functie is. Het punt is dat een boek dat van jou is, voorgelezen door een stem die op je eigen toestel draait, zonder dat iemand het bijhoudt, is wat lezen was voordat het een dienst werd.

Veelgestelde vragen

Zijn offline stemmen net zo goed als cloudstemmen?

Dichtbij, niet identiek. De beste gehoste modellen zijn nog steeds expressiever. Voor rustig doorvertellen over uren zijn de huidige neurale stemmen op het toestel, zoals Kokoro, prettig genoeg dat de meeste luisteraars het niet meer merken.

Hoeveel opslag kost een stem?

Meestal tientallen megabytes per stem bij een lichte engine, meer bij een zwaardere. Je downloadt alleen de talen waarin je leest, en dat gebeurt één keer.

Kost vertellen op het toestel veel batterij?

Het gebruikt de processor in plaats van de radio. Over lange sessies komt dat meestal gelijk of gunstiger uit dan streamen, en het gebruikt geen mobiele data. Een zwaarder model op een oudere telefoon is het geval om op te letten.

Waarom gebruiken de meeste apps nog de cloud?

Omdat het makkelijker is: één API-aanroep en elk toestel krijgt dezelfde stem. Modellen meeleveren die op de telefoon draaien betekent ze verpakken, bijwerken en testen op een hoop verschillende hardware.

De stem woont op je telefoon

Piper en Kokoro, offline, geen abonnement, geen upload. Lees mee terwijl hij vertelt.

Ontdek het opGoogle Play