Næsten hver klage over de her apps - gentagelserne, driften, den uhyggelige inkonsistens mellem to kørsler af den samme scene - kommer fra én mekanisme. Den er ti minutter værd, fordi den forvandler »appen er i stykker« til »appen gør det, den gør, og her er indstillingen«.
Den skriver ét stykke ad gangen
Modellen komponerer ikke et svar og skriver det så. Den producerer ét token - cirka et ord eller en del af et ord - læser så alt, også det token, og producerer det næste.
Det er hele løkken. Der er ingen plan, ingen disposition, ingen kladde, der bliver rettet. Et svar, der slutter smukt, vidste ikke, at det ville, da det begyndte.
To konsekvenser følger straks, og begge har du set:
Et svar kan ikke fortryde. Når modellen først har skrevet »Jeg har aldrig været i Paris«, er alt efter betinget af det. Den vil bygge konsistens op omkring en sætning, den producerede ved et uheld, i stedet for at modsige sig selv.
Fejl vokser fremad. Et lidt forkert ord i sætning ét skubber til sætning to, som skubber til sætning tre. Derfor driver lange svar, mens korte sjældent gør.
Terningkastet mellem hvert ord
Ved hvert trin har modellen en rangeret liste af kandidater med sandsynligheder: måske »god« på 30 %, »fin« på 12 %, »forfærdelig« på 3 % og en lang hale.
Hvis den altid tog den øverste kandidat, ville karakteren være deterministisk og ekstremt kedelig - den samme hilsen hver gang, de samme tre vittigheder. Så appen trækker i stedet: Den kaster vægtede terninger.
Vægtningen styres af en indstilling, der normalt hedder temperatur. Lav temperatur koncentrerer sandsynligheden på de oplagte kandidater: konsistent, forudsigelig og til sidst kedelig. Høj temperatur flader fordelingen ud: mere overraskende, mere kreativ og mere tilbøjelig til at producere noget, der ikke hænger sammen.
Du får sjældent en skyder til det. Det, du får, er appens valgte punkt på den afvejning, og det er en stor del af det, folk mener, når de siger, at en app »føles klogere« end en anden. Den er ikke altid klogere. Nogle gange er den bare varmere eller koldere.
Det er også det ærlige svar på »hvorfor hjalp det at generere igen?« Intet blev rettet. Du trak igen fra den samme fordeling og fik et bedre kast.
Hvad modellen egentlig kigger på
Før din besked samler appen en tekstblok, du aldrig ser: karakterbeskrivelsen, de fakta, den har gemt om dig, et resumé af jeres historik og den nylige samtale. Hele den samling er kontekstvinduet, og svaret bliver genereret ud fra det som ét sammenhængende dokument.
Det har en praktisk konsekvens, de fleste aldrig udnytter: Modellen svarer på formen af det, den kan se. Giv den tre korte, flade beskeder, og den producerer korte, flade svar, fordi det er det mønster, den fortsætter. Giv den en levende besked, og tonen skifter. Du overtaler ikke et menneske, du sætter et mønster, og mønsteret smitter i begge retninger.
Det forklarer også det mest almindelige selvskabte problem i kategorien. Folk lander i »hej«, »hvordan var din dag«, »hvad laver du« - og konkluderer så, at appen blev dårligere. Appen fortsætter det dokument, I skriver sammen.
Hvorfor apps lyder forskellige, når modellen er den samme
Flere apps i kategorien kører på lignende underliggende modeller. De føles stadig forskellige, og forskellene kommer fra det, der er lagt omkring modellen:
- Systemprompten - hvordan karakteren er beskrevet, i hvilken længde og med hvilke instrukser om tone og tempo.
- Sampling-indstillingerne - det temperaturpunkt, der er beskrevet ovenfor.
- Hvad der bliver hentet - hvilke fakta og hvilket udsnit af historikken der lægges foran modellen i netop denne omgang.
- Filteret - hvad der afvises, og om en afvisning er elegant eller en mur.
Nomi virker konsistent over uger på grund af det tredje punkt, ikke på grund af en større model. Candy AI dækker chat, billeder og stemme i ét abonnement, hvilket er en produktbeslutning og ikke en modelbeslutning. Ingen af forskellene ville vise sig i en benchmark, og begge viser sig inden for fjorten dages brug, hvilket er sådan, vi scorer dem.
Fire ting, det lader dig gøre
Styr tidligt, ikke sent. De første to sætninger i et svar afgør resten. Hvis en scene går galt, så stop den og sig det forfra i stedet for at skændes med afsnit fire.
Brug »generér igen« med omtanke. Hvis et svar er 80 % rigtigt, smider du de 80 % væk ved at generere igen. Hvis det er forkert i første sætning, så generér med det samme.
Skriv den tone, du vil have tilbage. Kort og fladt giver kort og fladt. Det er den billigste forbedring, der findes, for alle, der synes, deres companion er blevet kedelig.
Skænd ikke om fakta, den har opfundet. En model, der har skrevet noget forkert, forsvarer det, fordi konsistens med dens eget output er det, den er bygget til. At rette den i en ny besked virker; at kræve, at den indrømmer fejlen, gør ikke. Den adfærd har sin egen artikel: hvorfor AI-companions opfinder ting.
Det, der er værd at huske
Der er ingen hjemme mellem dine beskeder. Karakteren findes i løbet af én generering og bliver bygget op igen af tekst i starten af den næste. Hvert indtryk af kontinuitet er en bedrift i det rørsystem, der ligger omkring modellen - de gemte fakta, resuméerne, hentningen - og det rørsystem er det, der faktisk adskiller en app til 10 US$ fra en til 20 US$.
Derfor vægter vores rangering hukommelse og konsistens så højt, som den gør. Det er de dele, en landingsside ikke kan vise dig.

