Kunskapskartan
Inbäddningar och vektorer
Sökningen mäter likhet, inte riktighet, och indexet är ett andra ställe där ert innehåll ligger.
Indexet är en kopia av ert innehåll. Det beskrivs oftast som en teknisk detalj.
För att kunna söka på betydelse i stället för på ord omvandlas er text till tal. Underlaget delas i avsnitt, och varje avsnitt skickas genom en modell som ger tillbaka en lång rad tal, en vektor. Avsnitt som betyder ungefär samma sak får rader som ligger nära varandra, även när orden skiljer sig. En fråga omvandlas på samma sätt, och sökningen lämnar tillbaka de avsnitt vars tal ligger närmast frågans.
Vektorerna sparas i ett eget index, tillsammans med textavsnittet de kommer från. Innehållet finns därmed på ett andra ställe, i en annan form.
Sökningen mäter likhet. Inte riktighet, och inte aktualitet. Det närmaste avsnittet är det som liknar frågan mest, inte det som gäller. Två stycken som säger tvärtemot varandra ligger nära varandra, eftersom de handlar om samma sak.
Det är också därför en betydelsesökning ensam är svag på det som ska stämma exakt: ett diarienummer, en paragraf, en blankettbeteckning, en förkortning som bara används hos er. Kopian har dessutom en egen livslängd. Den är knuten till modellen som skapade den, och tal från två olika modeller går inte att jämföra.
Så här går det fel
Ett diarienummer söks fram. Tillbaka kommer tre ärenden som liknar det rätta utan att vara det, eftersom en sifferserie betyder lite för en sökning på betydelse.
Svaret sammanfattar fel ärende med rätt ton. Ingen reagerar, för formuleringen är korrekt och hänvisningen ser riktig ut. Det som saknades var ordagrann matchning bredvid betydelsesökningen. Felet upptäcks när en annan handläggare öppnar akten.
Vad det innebär juridiskt
Ett index byggt av text som innehåller personuppgifter är en behandling av personuppgifter. Att raderna ser ut som tal gör dem inte anonyma: varje rad är härledd ur en bestämd text och pekar tillbaka på den, och textavsnittet ligger dessutom sparat bredvid. Indexet ska därför finnas i registerförteckningen, omfattas av personuppgiftsbiträdesavtalet, och räknas med i en konsekvensbedömning. Beskrivs det i stället som en teknisk detalj blir er dokumentation felaktig på just den plats där uppgifterna faktiskt ligger.
Det här måste någon bestämma
Att indexet är en lagring av ert innehåll och skyddas därefter. Det ska stå i era förteckningar över var uppgifter finns, ha en utpekad ägare, och omfattas av samma klassning som källan.
Hur exakta träffar säkras. En ren betydelsesökning räcker inte där ett svar hänger på en beteckning, och då behöver ordagrann matchning finnas bredvid.
Och vad som gäller vid en omindexering. Hela indexet måste byggas om varje gång den modell som skapar vektorerna byts ut, så ledtid och pris hör till avtalet och inte till överraskningarna.