Forestil dig, at du skal bygge en AI, der opsummerer telefonsamtaler om borgeres sager. I et opkald fortæller en borger om sit helbred og sin økonomi. Du arbejder også på en model, der skal sortere dokumenter om danske borgere, hvor lige så private oplysninger står sort på hvidt. Begge modeller har brug for eksempler at lære af, men rigtige opkald og sagsdokumenter kan du ikke bare lægge i et træningssæt.
Her kan Danish Personas hjælpe. Datasættet rummer 100.000 opdigtede danske voksne med forskellige baggrunde. Brug dem som udgangspunkt for fiktive samtaler eller dokumenter, og lav nye trænings- og testeksempler uden at bruge virkelige menneskers fortrolige oplysninger.
Personaerne varierer i alder, køn, bopæl, civilstand, uddannelse og arbejdsmarkedstilknytning. Udgangspunktet er udvalgte, aggregerede fordelinger fra Danmarks Statistik. Dertil kommer personlighedsvariation og en kort, genereret beskrivelse, så du kan arbejde med konkrete profiler frem for en anonym række tal. Hele kodebasen er frit tilgængelig på GitHub. Datasættet er udgivet under Apache 2.0 og kan bruges frit, også kommercielt.
100.000 profiler med dansk variation
Danmarks Statistiks samlede tal giver os et solidt afsæt for en bred blanding af syntetiske voksne med forskellige aldre, bopæle, uddannelser og livssituationer. Vi har også bevaret udvalgte sammenhænge mellem egenskaber, hvor de tilgængelige statistikker giver grundlag for det. Resultatet er et datasæt med indbygget variation, som du kan bruge til at lave nye test- og træningsscenarier.
Personaerne får også variation efter OCEAN, en model med fem brede personlighedstræk: åbenhed over for nye oplevelser, samvittighedsfuldhed, udadvendthed, imødekommenhed og tilbøjelighed til bekymring. Det giver profilerne flere nuancer og gør scenarierne mere varierede. Mistral Small 4 har skrevet personaernes beskrivelser og øvrige tekstfelter med udgangspunkt i profilerne.
Hvordan fordeler profilerne sig?
Vi har gjort vores bedste for, at de syntetiske personaer afspejler befolkningen i Danmark på udvalgte områder. Her kan du se, hvordan alder, civilstand og region fordeler sig blandt voksne i Danmarks Statistiks tal (røde linjer) og i vores datasæt (blå søjler). Fordelingerne ligger tæt på hinanden.



Brug dem i dine egne scenarier
Danish Personas er lavet til at blive brugt: til at bygge syntetiske træningseksempler og prøve AI-løsninger af på mange forskellige profiler. Lad for eksempel en chatbot svare på det samme spørgsmål fra forskellige personaer, og se, om den giver dem lige hjælpsomme svar. Hvis svarene varierer systematisk med profilen, kan det være tegn på skævheder.
Sådan lyder to personaer fra det udgivne datasæt:
Han er 21 år gammel og kommer fra Vejen. Efter en erhvervsuddannelse som maskinoperatør arbejder han på en moderne produktionsvirksomhed i omegnen, hvor han betjener avancerede maskiner med stor præcision. I fritiden reparerer han gerne gamle cykler i garagen, hvilket giver ham en følelse af at skabe noget konkret med hænderne. Han nyder også at gå lange ture i det omkringliggende landskab, hvor han kan slappe af og lade tankerne vandre. Når han er sammen med vennerne, spiller de ofte brætspil eller følger med i lokale fodboldkampe. Selvom han er glad for sit arbejde, drømmer han om en dag at kunne lede sit eget team og videreudvikle produktionen.
Hun er en rolig og eftertænksom kvinde på 74 år, der har tilbragt det meste af sit liv i København. Hendes pensionisttilværelse er præget af en fast rutine med havearbejde i de lokale fælles haver og læsning af lokalhistorisk litteratur. Hun nyder at deltage i frivilligt arbejde i ældreplejen, hvor hun kan bruge sin erfaring og empati til at støtte andre. Om aftenen samles hun ofte med sin mand til kammermusik eller koncertbesøg, hvilket giver hende glæde og inspiration. Selvom hun er glad for det velkendte, er hun også åben over for nye ideer, især når de kommer fra mennesker, hun holder af.
Du kan hente alle profilerne på Hugging Face og bruge dem som udgangspunkt for dine egne syntetiske eksempler.
