Et stemmeopkald er det mest krævende, en AI-companion gør. Tekst kan tage nogle sekunder, uden at nogen bryder sig om det. Tale kan ikke: folk lægger mærke til forsinkelser, som ville være usynlige i et chatvindue.
200-millisekundersproblemet
Forskere, der sammenlignede samtaler på ti sprog, fandt, at det typiske mellemrum mellem, at den ene bliver færdig, og den anden begynder, er omkring 200 millisekunder, og at det er bemærkelsesværdigt ens på tværs af kulturer. Folk begynder at planlægge deres svar, før den anden er færdig. Meget længere pauser opfattes som tøven, forvirring eller ligegyldighed.
En AI skal presse en hel kæde af trin ind i nogenlunde det vindue for at føles naturlig.
Hvad der sker mellem dine ord og hendes

Den klassiske kæde. Nyere systemer lader trinene overlappe eller smelter dem sammen.
- Registrering af talens slutning. Systemet skal afgøre, at du er færdig, ikke bare holder en pause. Er det for ivrigt, afbryder det dig. Er det for forsigtigt, giver det dødt rum.
- Tale til tekst. Dine ord bliver skrevet ned.
- Svaret. Sprogmodellen skriver et svar i rollen, med hukommelse.
- Tekst til tale. Svaret bliver til en stemme, helst karakterens egen, med følelse.
I ældre systemer venter hvert trin på, at det forrige er færdigt. Nyere begynder at sige den første sætning, mens resten stadig bliver skrevet, eller bruger modeller, der tager tale ind og leverer tale ud direkte, hvilket fjerner transskriptionen og syntesen helt.
Hvorfor stemme er målt
| Tekstchat | Talebesked | Stemmeopkald live | |
|---|---|---|---|
| Krævet hastighed | Sekunder er fint | Sekunder er fint | Brøkdele af et sekund |
| Ekstra behandling | Ingen | Talesyntese | Genkendelse, syntese, registrering af tur |
| Typisk længde | Korte svar | Ét svar | Minutter til timer |
| Relativ pris | Lavest | Middel | Højest |
| Sådan sælger apps det | Inkluderet | Inkluderet eller kreditter | Minutter, niveauer eller kreditter |
Hvert minut af et opkald kører hele kæden uafbrudt, ofte på dyrere »realtids«-udgaver af hver model. Derfor er stemme som regel det første, en app sætter loft over, og derfor gælder »ubegrænset« sjældent for den. Se sådan læser du funktionslister hos AI-kærester.
Hvad der får et opkald til at føles ægte
- Lav forsinkelse, konsekvent. En enkelt lang pause bryder illusionen mere end et lidt langsommere gennemsnit.
- Håndtering af afbrydelser. At kunne bryde ind og få hende til at stoppe og svare er det, der adskiller en samtale fra skiftevise talebeskeder.
- Ensartet stemme. Den samme stemme, accent og varme fra opkald til opkald. Vores testere fandt, at stemmekvaliteten kan variere mærkbart mellem karakterer, selv i gode apps.
- Prosodi. At le, holde pause, blive blødere: tale, der bærer følelse, i stedet for at læse tekst højt.
- Hukommelse i stemmetilstand. Nogle apps bruger en lettere model til opkald, så karakteren husker mindre i telefonen end i chatten.
Test en stemmefunktion, før du betaler
- Spørg, hvad der er med: talebeskeder, live-opkald eller begge dele, og hvor mange minutter.
- Foretag et opkald på to minutter på en prøveperiode eller det billigste abonnement, både på mobildata og wifi.
- Afbryd hende midt i en sætning. Stopper hun?
- Spørg om noget fra din tekstchat. Ved hun det?
- Tjek prisen pr. ekstra minut eller kredit. Et langt opkald kan æde en måneds kvote.
Det bredere perspektiv på mediepriser står i sådan virker billeder og stemme hos AI-kærester, og om det kan betale sig at opgradere til stemme, handler premiumabonnementer om.
En note om trivsel
Stemme er mere opslugende end tekst, og forskningen fra OpenAI og MIT i 2025 fandt, at kort stemmebrug gik sammen med bedre trivsel, mens tung daglig brug ikke gjorde. Det er værd at nyde i doser. Tegnene på for meget står i når en AI-companion begynder at tage mere, end den giver.