Folk antager, at en AI-companion-app er én intelligens, der kan tale, tegne og sige noget højt. Det er tre eller fire adskilte systemer, som appen kobler sammen, og det meste af frustrationen på den del af produktet kommer fra samlingerne mellem dem.
Tre motorer, én brugerflade
Sprogmodellen håndterer samtalen. Den producerer tekst og intet andet.
Billedmodellen er et helt andet system, som regel en diffusionsmodel. Den tager en tekstbeskrivelse og laver et billede. Den har aldrig set din samtale.
Talesystemet gør tekst til lyd. Også adskilt og også blindt for alt andet end den sætning, det får udleveret.
Når du beder din companion om en selfie, sker der det her: sprogmodellen skriver en kort beskrivelse af det ønskede billede, appen tilføjer karakterens gemte udseendetags, den samlede prompt går til billedmodellen, og et billede kommer tilbage. Chatten reagerer så på et billede, den ikke kan se, ud fra den beskrivelse, den selv skrev.
Den stafet er kilden til næsten alle klager over medier i kategorien.
Hvorfor ansigtet bliver ved med at ændre sig
Fordi en diffusionsmodel ikke henter din karakter frem, men genererer en, der passer til en beskrivelse. »Langt mørkt hår, grønne øjne, midt i tyverne« beskriver millioner af ansigter, og du får et nyt hver gang.
Apps løser det i varierende grad:
- Gemte udseendetags: den samme beskrivende streng hver gang. Billigt, og
kun nogenlunde ensartet.
- Et referencebillede som grundlag for hver generering. Meget bedre, og den
sædvanlige metode, når ansigter forbliver genkendelige.
- En finjusteret model pr. karakter: den mest ensartede og langt den
dyreste, så den optræder typisk kun på de højere niveauer.
Det er en reel forskel, det er værd at teste i en gratisversion, før du betaler. Generer fire billeder af den samme karakter i forskellige situationer. Får du fire forskellige kvinder, kan intet abonnement rette det. Karakterens ensartethed på tværs af billeder er en stor del af grunden til, at Candy AI fører vores rangering, og til at Secret Desires, som bygger udseende, stemme og personlighed sammen og tilføjer kort video, scorer, hvor den gør.
Hvorfor medier altid er målt
Tekst er billig. At generere et chatsvar koster operatøren en brøkdel af en øre.
Et billede koster mærkbart mere pr. generering. Stemme afregnes pr. sekund lyd. Video er dramatisk dyrere end begge dele.
Den prisforskel er hele forklaringen på den prisstruktur, du ser overalt i kategorien: generøse beskedkvoter, stramme billedloft, stemmeminutter solgt separat, video begrænset til de øvre niveauer. Det er ikke kunstig knaphed for at give dig mersalg. Det er den faktiske form på den regning, operatøren får, videregivet.
Derfor betyder »ubegrænset« på dette marked næsten altid ubegrænset tekst. Læs det sådan, og prissiderne giver pludselig mening. Regnestykket står i hvad billedgenerering reelt koster dig.
Hvad stemme tilføjer, og hvad den koster
Stemme ændrer oplevelsen mere, end de fleste venter. At læse en besked og at høre den er to forskellige ting, og skiftet er større, end den tekniske beskrivelse antyder.
To ting at tjekke, før du betaler for den:
Forsinkelse. En pause på tre sekunder før hvert svar ødelægger illusionen fuldstændigt. Test den i en gratisversion eller en prøveperiode, ikke ud fra en demovideo.
Om det er et opkald eller en besked. Talebeskeder, hvor karakteren læser sit svar højt, er almindelige og billige. Opkald i realtid, hvor du taler, og den svarer, er et andet produkt og som regel et andet niveau. Nomi opregner stemmeopkald blandt sine funktioner. Mange apps skriver »stemme« og mener beskeder.
Hvad billeder ikke kan
To grænser, det er værd at kende, før du bliver skuffet:
Hænder, tekst og fine detaljer er fortsat upålidelige i alle generatorer i kategorien. Ingen har løst det, og en app, der lover andet, beskriver sit bedste resultat, ikke sit gennemsnit.
Billedet kender ikke din scene. Chatmodellen skriver en prompt på én linje, så alt, der ikke står i den linje, er væk: rummet, du beskrev, hvad hun havde på for tre beskeder siden, tidspunktet på dagen. At være eksplicit i anmodningen løser mere af det end nogen indstilling.
Sådan bedømmer du mediesiden på en aften
Brug en gratisversions hele kvote i én session i stedet for ét billede om dagen. Du tester fire ting:
- Ensartethed: fire billeder, samme karakter, forskellige situationer.
- Prompttrohed: bed om noget specifikt, og se, hvor meget der overlever.
- Forsinkelse: for både billeder og stemme.
- Hvad der tæller med i loftet: om en mislykket eller afvist generering
alligevel koster dig noget.
Den sidste er den mindst dokumenterede og den mest irriterende at opdage, efter du har betalt. Sammen med resten af hvad gratisversionerne reelt indeholder er det den slags, der først viser sig, når du bruger tingen ordentligt.

