AI · 13 september 2026
Tekst voorbereiden voor spraaksynthese in 2026
Het proces om tekst om te zetten in spraak met behulp van kunstmatige intelligentie vereist in 2026 een zorgvuldige voorbereiding van de invoer om technische fouten te voorkomen. De gebruiker voert de tekst in, selecteert een model en een stem, en downloadt het bestand. Hoewel de technische infrastructuur snel is, leidt onvoorbereide tekst vaak tot onjuiste uitspraak van woorden, getallen en afkortingen.
De kwaliteit van de spraakmodellen is verbeterd, waardoor ze nu pauzes, intonatie en de onderscheiding tussen vragen en stellingen beter aan kunnen. Sommige modellen accepteren zelfs tekstuele instructies voor de toon, zoals een vermoeide of neutrale nieuwslezerstoon. Dit biedt meer regie over de presentatie dan alleen snelheid en toonhoogte aan te passen. De snelheid van de eerste klank is ook toegenomen, met latencies van ongeveer 82 tot 90 milliseconden bij bepaalde providers, wat cruciaal is voor spraakassistenten om onnatuurlijke pauzes te vermijden. De ondersteuning voor het Russisch is uitgebreid, met meer dan 70 talen beschikbaar in recente versies van verschillende systemen.
Een belangrijk probleem blijft de ambiguïteit in de geschreven taal. Woorden met dezelfde spelling maar verschillende betekenissen, zoals die het verschil maken tussen een slot en een kasteel, worden door het model statistisch gelezen en niet contextueel. Dit kan worden opgelost door de zin te herschrijven om de dubbelzinnigheid te verwijderen of door accenttekens toe te voegen. In sommige systemen wordt een plus-teken gebruikt, in andere een specifiek Unicode-symbool. Het toevoegen van accenten maakt de tekst voor mensen onleesbaar, waardoor een aparte versie voor de spraakversie nodig is.
Getallen en data vormen een ander risico. Het model leest cijfers letterlijk zonder grammaticale vervoeging, wat leidt tot onnatuurlijke uitspraken bij datums of bedragen. De aanbevolen oplossing is om getallen in de versie voor spraaksynthese volledig in woorden uit te schrijven. Dit is tijdroepend maar zorgt voor een voorspelbare en correcte uitspraak. Ook afkortingen en gemengde constructies, zoals normnummers met letters en cijfers, worden vaak per letter gelezen in plaats van als woord. Transliteratie van Latijnse termen naar het Russisch kan helpen om de uitspraak te sturen.
De maximale lengte van de tekst per aanvraag varieert sterk tussen de verschillende modellen. Sommige systemen accepteren slechts enkele duizenden tekens, terwijl andere tot 40.000 tekens kunnen verwerken. Bij het verwerken van lange teksten moet deze limiet in acht worden genomen. Het is aan te raden om de tekst niet willekeurig te snijden op de lengtelimiet, maar op semantische grenzen, zoals het einde van een alinea. Dit voorkomt dat de intonatie aan het begin van een nieuw fragment abrupt begint, omdat het model geen geheugen heeft van de vorige fragmenten.