KI · 13. september 2026

BotHub forbedrer tekst-til-tale-synthese med nye funksjoner

Floating metallic cubes in shades of blue and purple with reflective surfaces
Milad Fakurian / Unsplash

BotHub har innført betydelige forbedringer i tekst-til-tale-synthese, noe som gjør prosessen raskere og mer tilgjengelig. I 2026 kan brukere nå fullføre hele prosessen på bare ett minutt ved å åpne tjenesten, lime inn teksten, velge en modell og en stemme, og deretter laste ned filen. Dette er mulig gjennom en forenklet grensesnitt som består av ett tekstfelt, to nedtrekkslister og en knapp.

En av de største utfordringene med tekst-til-tale-synthese har vært å få riktig uttale og intonation. BotHub har løst dette ved å tilby modeller som kan skille mellom spørsmål og utsagn, samt legge inn passende pauser og intonation. Noen modeller kan til og med følge tekstbaserte instruksjoner, som for eksempel å lese teksten trett, som om det er den femte møtet på dagen.

Imidlertid har brukere fortsatt problemer med uttalelsen av bestemte ord og tall. For eksempel kan ord som «zamok» (slott/lås) uttales feil, og tall som «1 250 000» kan bli lest opp som en uklar sekvens av sifre. For å unngå slike feil, anbefaler BotHub at brukere skriver tall med ord i stedet for sifre i versjonen av teksten som skal syntheseres.

En annen viktig forbedring er økt støtte for flerspråklighet. Modeller som Gemini 3.1 Flash TTS og ElevenLabs v3 støtter nå over 70 språk, inkludert russisk, som ikke lenger er klassifisert som et eksotisk språk.

Hastigheten på syntesen har også blitt forbedret. Modeller som Cartesia Sonic 3.5 og Deepgram Aura-2 kan nå produsere den første lydbølgen på under 90 millisekunder, noe som er avgjørende for applikasjoner som stemmeassistenter, der forsinkelser kan forstyrre brukeropplevelsen.

Til tross for disse fremskrittene, er det viktig å huske at modeller fortsatt leser symboler, ikke meninger. Derfor er det nødvendig å forberede teksten nøye for å unngå feil. Dette inkluderer å legge til tegn for trykk i ord som kan uttales på flere måter, og å unngå å bruke sammensatte konstruksjoner som kan forvirre modellen.