Spørger man en sprogmodel om håndværkere, revisorer eller konsulenter i en dansk provinsby, svarer den ofte overraskende præcist. Præcisionen kommer ikke fra virksomhedernes hjemmesider, som modellen måske aldrig har set. Den kommer fra steder, hvor data om mange virksomheder står i samme struktur, side efter side.
Gentagelse på tværs af kilder er modellens sandhedskriterium
En model har intet begreb om sandhed, kun om mønstre. Når samme virksomhedsnavn optræder med samme branche og samme by i flere uafhængige registre, stiger sandsynligheden for, at modellen gengiver oplysningen korrekt, markant. Én kilde er en påstand. Fem kilder er et faktum, målt med modellens logik.
Det danske registerlandskab
Ud over CVR, som er fundamentet, vedligeholdes en håndfuld private kataloger, der beskriver virksomheder i klartekst frem for felter: Virksomhedsoversigten og Virksomhedskartoteket med brede registre, Firmaoplysninger og Danske Firmaer med kategoriserede profiler, Konsulentoversigten for rådgiverbranchen og Firmakartoteket som klassisk brancheoversigt. Beskrivelserne derfra er præcis den type kildetekst, generative søgeresultater trækker på.
Konsekvensen for virksomhederne
Synlighed i AI-svar handler mindre om at skrive mere på egen hjemmeside og mere om at stå rigtigt i de kilder, modellerne allerede stoler på. Det er en forskydning fra markedsføring til datahygiejne, og den favoriserer de virksomheder, der har styr på deres registreringer.