Billeder, stemme og video: Sådan virker mediesiden i praksis

Sådan virker det

Chatten og billederne laves af helt adskilte systemer, der næsten ikke taler sammen. Det ene faktum forklarer, hvorfor din companions ansigt hele tiden ændrer sig, og hvorfor medier er det første, hver app måler.

Vi kan modtage en provision for links på denne side. Det ændrer aldrig en karakter.

Folk antager, at en AI-companion-app er én intelligens, der kan tale, tegne og sige noget højt. Det er tre eller fire adskilte systemer, som appen kobler sammen, og det meste af frustrationen på den del af produktet kommer fra samlingerne mellem dem.

Tre motorer, én brugerflade

Sprogmodellen håndterer samtalen. Den producerer tekst og intet andet.

Billedmodellen er et helt andet system, som regel en diffusionsmodel. Den tager en tekstbeskrivelse og laver et billede. Den har aldrig set din samtale.

Talesystemet gør tekst til lyd. Også adskilt og også blindt for alt andet end den sætning, det får udleveret.

Når du beder din companion om en selfie, sker der det her: sprogmodellen skriver en kort beskrivelse af det ønskede billede, appen tilføjer karakterens gemte udseendetags, den samlede prompt går til billedmodellen, og et billede kommer tilbage. Chatten reagerer så på et billede, den ikke kan se, ud fra den beskrivelse, den selv skrev.

Den stafet er kilden til næsten alle klager over medier i kategorien.

Hvorfor ansigtet bliver ved med at ændre sig

Fordi en diffusionsmodel ikke henter din karakter frem, men genererer en, der passer til en beskrivelse. »Langt mørkt hår, grønne øjne, midt i tyverne« beskriver millioner af ansigter, og du får et nyt hver gang.

Apps løser det i varierende grad:

  • Gemte udseendetags: den samme beskrivende streng hver gang. Billigt, og

kun nogenlunde ensartet.

  • Et referencebillede som grundlag for hver generering. Meget bedre, og den

sædvanlige metode, når ansigter forbliver genkendelige.

  • En finjusteret model pr. karakter: den mest ensartede og langt den

dyreste, så den optræder typisk kun på de højere niveauer.

Det er en reel forskel, det er værd at teste i en gratisversion, før du betaler. Generer fire billeder af den samme karakter i forskellige situationer. Får du fire forskellige kvinder, kan intet abonnement rette det. Karakterens ensartethed på tværs af billeder er en stor del af grunden til, at Candy AI fører vores rangering, og til at Secret Desires, som bygger udseende, stemme og personlighed sammen og tilføjer kort video, scorer, hvor den gør.

Hvorfor medier altid er målt

Tekst er billig. At generere et chatsvar koster operatøren en brøkdel af en øre.

Et billede koster mærkbart mere pr. generering. Stemme afregnes pr. sekund lyd. Video er dramatisk dyrere end begge dele.

Den prisforskel er hele forklaringen på den prisstruktur, du ser overalt i kategorien: generøse beskedkvoter, stramme billedloft, stemmeminutter solgt separat, video begrænset til de øvre niveauer. Det er ikke kunstig knaphed for at give dig mersalg. Det er den faktiske form på den regning, operatøren får, videregivet.

Derfor betyder »ubegrænset« på dette marked næsten altid ubegrænset tekst. Læs det sådan, og prissiderne giver pludselig mening. Regnestykket står i hvad billedgenerering reelt koster dig.

Hvad stemme tilføjer, og hvad den koster

Stemme ændrer oplevelsen mere, end de fleste venter. At læse en besked og at høre den er to forskellige ting, og skiftet er større, end den tekniske beskrivelse antyder.

To ting at tjekke, før du betaler for den:

Forsinkelse. En pause på tre sekunder før hvert svar ødelægger illusionen fuldstændigt. Test den i en gratisversion eller en prøveperiode, ikke ud fra en demovideo.

Om det er et opkald eller en besked. Talebeskeder, hvor karakteren læser sit svar højt, er almindelige og billige. Opkald i realtid, hvor du taler, og den svarer, er et andet produkt og som regel et andet niveau. Nomi opregner stemmeopkald blandt sine funktioner. Mange apps skriver »stemme« og mener beskeder.

Hvad billeder ikke kan

To grænser, det er værd at kende, før du bliver skuffet:

Hænder, tekst og fine detaljer er fortsat upålidelige i alle generatorer i kategorien. Ingen har løst det, og en app, der lover andet, beskriver sit bedste resultat, ikke sit gennemsnit.

Billedet kender ikke din scene. Chatmodellen skriver en prompt på én linje, så alt, der ikke står i den linje, er væk: rummet, du beskrev, hvad hun havde på for tre beskeder siden, tidspunktet på dagen. At være eksplicit i anmodningen løser mere af det end nogen indstilling.

Sådan bedømmer du mediesiden på en aften

Brug en gratisversions hele kvote i én session i stedet for ét billede om dagen. Du tester fire ting:

  1. Ensartethed: fire billeder, samme karakter, forskellige situationer.
  2. Prompttrohed: bed om noget specifikt, og se, hvor meget der overlever.
  3. Forsinkelse: for både billeder og stemme.
  4. Hvad der tæller med i loftet: om en mislykket eller afvist generering

alligevel koster dig noget.

Den sidste er den mindst dokumenterede og den mest irriterende at opdage, efter du har betalt. Sammen med resten af hvad gratisversionerne reelt indeholder er det den slags, der først viser sig, når du bruger tingen ordentligt.

Candy AI

4,6Karakter: 4,6 af 5

Den eneste app, hvor chat, billeder og stemme fungerer godt med ét abonnement.

Pris
fra 12,99 US$/md.
Gratisversion
Ja
Danmark
Tilgængelig

Secret Desires

4,3Karakter: 4,3 af 5

Rollespil uden filtre, hvor karaktererne forbliver konsekvente i stedet for at miste tråden efter få beskeder.

Gratisversion
Ja
Danmark
Tilgængelig

Ofte stillede spørgsmål

Hvorfor ser min companion anderledes ud på hvert billede?

Fordi billedmodellen genskaber karakteren ud fra en tekstbeskrivelse hver gang. Apps, der holder et ansigt stabilt, bruger en gemt reference eller en finjusteret model. Apps, der ikke gør, slår terningerne om ved hver forespørgsel.

Hvorfor er stemme målt så stramt?

Talesyntese afregnes efter lydens længde og koster operatøren penge pr. sekund. Tekst er størrelsesordener billigere, og derfor er beskedgrænserne generøse og stemmeminutterne ikke.

Ser billedmodellen vores samtale?

Kun gennem en kort prompt, appen skriver til den. Den har ikke adgang til din historik, og derfor mangler et billede ofte sammenhæng, som føltes åbenlys i chatten.