Spring til indhold
Guide

Hvad er en sprogmodel? ChatGPT forklaret for ikke-teknikere

Af Jarle Kondrup28. september 202610 min. læsetid
Hvad er en sprogmodel: små brikker strømmer ud af en laptop og stiller sig på række som en sætning

Du skriver et spørgsmål, og få sekunder senere står der et velformuleret svar. Det føles som at tale med en, der ved noget. Men det, der sker bag skærmen, er noget andet. Når du forstår det, forstår du også de fleste af de fejl, folk oplever med ChatGPT, Copilot og Claude: kilder, der ikke findes, svar, der skifter fra gang til gang, og lange samtaler, der langsomt bliver dårligere.

Artiklen her forklarer det uden matematik. Du skal ikke kunne bygge en sprogmodel. Du skal bare vide nok til at bruge den med omtanke.

Hvad sker der, når du skriver til ChatGPT?

En sprogmodel gætter det næste stykke tekst, igen og igen, indtil svaret er færdigt. Det er i grunden det hele. GPT står for Generativ Prætrænet Transformer. Generativ, fordi den skaber ny tekst. Prætrænet, fordi den har lært på forhånd ud fra enorme mængder tekst. Transformer er navnet på den type neurale netværk, den er bygget på.

Når du sender din besked, ser modellen på al teksten i samtalen og beregner, hvilke ord der sandsynligvis kommer som det næste. Den vælger ét, føjer det til og gentager. Skriver du "Tak for i dag, vi ses i", er "morgen" og "næste uge" oplagte fortsættelser, mens "badekarret" ikke er det. Stephen Wolfram beskriver det i en gennemgang fra 2023 sådan, at ChatGPT hele tiden forsøger at lave en "reasonable continuation", en fornuftig fortsættelse, af den tekst, den har foran sig.

Det lyder banalt, men konsekvensen er stor. Modellen slår ikke noget op i en database. Den skriver det, der lyder sandsynligt. Når du spørger til noget velkendt, er det sandsynlige som regel også det rigtige. Når du spørger til noget sjældent, fx en bestemt paragraf i en overenskomst eller omsætningen i en lokal virksomhed, kan det sandsynlige være helt forkert og stadig lyde overbevisende. Det er det, man kalder hallucinationer.

Nogle værktøjer kan søge på nettet eller læse dine filer, og det hjælper. Men selve teksten bliver stadig skrevet af modellen, ét stykke ad gangen, efter samme princip.

Hvordan har modellen lært det?

I to faser. Først fortræning: modellen læser en enorm mængde tekst og øver sig i at forudsige det næste ord, igen og igen. Her lærer den grammatik, fagord, skrivestile og en masse viden om verden, sådan som den er beskrevet i teksterne. Men efter fortræningen er den ikke en assistent. Den er en tekstfortsætter. Stiller du den et spørgsmål, kan den lige så godt finde på at fortsætte med tre nye spørgsmål, fordi det også er en fornuftig fortsættelse af en tekst.

Derfor kommer fase to: træning med menneskelig feedback. Den mest kendte beskrivelse er OpenAIs forskningsartikel om InstructGPT fra 2022. Først skrev mennesker eksempler på gode svar, som modellen blev trænet videre på. Bagefter rangerede mennesker flere af modellens svar fra bedst til dårligst, og modellen blev trænet til at give den slags svar, folk foretrak. Metoden kaldes RLHF.

Effekten var markant. Testpersonerne foretrak svarene fra en InstructGPT-model med 1,3 milliarder parametre frem for den oprindelige GPT-3 med 175 milliarder, altså en model over hundrede gange større. Den hjælpsomme, høflige tone, du møder i ChatGPT, er med andre ord trænet ind.

Her er det værd at være kritisk. Modellen er trænet til at give svar, som mennesker kan lide. Det er ikke det samme som svar, der er sande. Forfatterne skriver selv, at InstructGPT stadig laver simple fejl. En sprogmodel kan derfor lyde lige så sikker, når den tager fejl, som når den har ret.

Læg dertil noget, vi ser igen og igen i praksis: modellen tager det, du skriver, for gode varer. Skriver du "kunden har jo allerede accepteret prisen", bygger den videre på det uden at spørge ind. Den "tror" på alt, hvad du fortæller den.

Hvordan forbinder modellen ord og betydning?

Modellen lægger ord og betydninger ind på en slags kæmpestort kort, hvor det, der ligner hinanden, ligger tæt, og det, der er forskelligt, ligger langt fra hinanden. Tag de to sætninger, vi bruger på kurset:

  • "Hej, mit navn er Jarle, jeg bor i Aarhus. Jeg kan godt lide øl og film."
  • "Hej, mit navn er også Jarle, jeg bor i Ribe. Jeg kan godt lide burger og pomfritter."

For modellen ligger de to sætninger tæt på hinanden. Begge er en person, der præsenterer sig. Aarhus og Ribe ligger tæt, fordi begge er danske byer. Burger og pomfritter ligger meget tæt, og øl er ikke langt væk, for det er alt sammen noget, man spiser og drikker. Film ligger længere ude, fordi det er noget, man laver, ikke noget, man indtager. På fagsprog kaldes den slags placeringer embeddings.

Det forklarer, hvorfor du ikke behøver at ramme de præcise ord. "Mødereferat" og "notat fra mødet" lander tæt på hinanden, og modellen forstår dig, selvom du staver forkert eller skriver lidt uklart. Det forklarer også, hvorfor den kan skrive i en bestemt stil eller oversætte: den har et kort over, hvordan ord hænger sammen.

Men husk, at billedet er en forenkling. Det rigtige kort har langt flere dimensioner end et landkort, og ingen kan læse det direkte. Og nærheden handler om, hvordan ord bruges i tekster, ikke om, hvad der er sandt. Aarhus og Ribe ligger tæt, fordi de optræder i lignende sætninger, ikke fordi modellen har været der.

Hvad er tokens, og hvorfor koster dansk mere?

En sprogmodel læser ikke ord, men tokens: små stykker tekst. Korte, almindelige ord er ofte ét token. Lange eller sjældne ord bliver delt op i flere. OpenAIs hjælpeside giver en tommelfingerregel for engelsk: Ét token er cirka fire tegn eller omkring tre fjerdedele af et ord.

Dansk klarer sig dårligere. Vi har lange sammensatte ord som "arbejdsmiljørepræsentant" og "overenskomstforhandlingerne", og de fleste tokenizere, altså de programmer, der deler teksten op, er primært bygget til engelsk. En preprint af Ovcharov fra 2026 har målt, at dansk i gennemsnit bruger 1,87 tokens pr. ord mod 1,23 for engelsk. Det betyder, at dansk typisk bruger omkring halvanden gang så mange tokens pr. ord.

Tag tallet med forbehold. Det er en preprint, som ikke er fagfællebedømt, og de nyeste tokenizere var ikke med i målingen. Forskellen kan derfor være mindre i de modeller, du bruger i dag. Retningen er dog ikke overraskende.

Hvorfor er det vigtigt for dig? Af tre grunde:

  • Pris. Betaler virksomheden pr. token, fx når en udvikler har koblet en model på jeres eget system, koster dansk tekst mere end den samme tekst på engelsk.
  • Plads. Kontekstvinduet, som vi kommer til nu, måles i tokens. Dansk fylder det hurtigere op.
  • Grænser. Med et almindeligt abonnement mærker du ikke prisen direkte, men du kan ramme loftet for, hvor meget du må bruge, lidt tidligere.

Hvad er kontekstvinduet?

Kontekstvinduet er modellens arbejdshukommelse: al den tekst, den kan se på én gang, målt i tokens. Anthropic bruger selv sammenligningen med arbejdshukommelse. Alt, hvad modellen skal bruge til at svare dig, skal ligge i vinduet: din besked, tidligere beskeder, dokumenter du har sat ind, og de instruktioner, værktøjet selv lægger ind i baggrunden.

Det vigtigste at forstå er, at modellen ikke husker noget mellem to beskeder. ChatGPT sender hele samtalen med, hver eneste gang du sender din prompt. Modellen læser det hele forfra og skriver så det næste svar. Det virker som hukommelse, men det er genlæsning.

Det har to konsekvenser, du kan mærke i hverdagen. Den første er, at gammelt indhold påvirker nye svar. Har du brugt chatten til at skrive et svar på en sur klage og derefter beder om en festlig invitation til julefrokosten, kan tonen fra klagen sive ind. Den anden er, at lange samtaler bliver dårligere. Anthropic skriver, at mere kontekst ikke automatisk er bedre, og at modellens præcision og evne til at finde detaljer falder, når mængden af tekst vokser. Det kalder de context rot.

Løsningen er enkel: Start en ny chat til hver opgave. Skal du bruge noget fra en tidligere samtale, så bed modellen om et kort resumé og sæt det ind i den nye chat. Så får du det vigtige med og slipper for resten.

Hvorfor får du ikke det samme svar to gange?

Fordi modellen ikke altid vælger det mest sandsynlige ord, men ét af de mest sandsynlige. Hvis du giver samme instruktion to gange, vil svaret variere. Wolfram forklarer, at tekst bliver flad og gentagende, hvis man altid tager det øverste ord på listen. Derfor lægger man lidt tilfældighed ind, som styres af en indstilling, der kaldes temperatur.

Hvert valg påvirker det næste. Vælger modellen "Kære kolleger" i stedet for "Hej alle" i første linje, bevæger resten af mailen sig ad en lidt anden vej. Efter et par hundrede ord kan to svar på den samme prompt se ret forskellige ud.

Jo mindre du fortæller, jo større bliver forskellen. Ufuldstændige instruktioner giver modellen "kreativ frihed". Beder du om "en mail om lørdagsvagter", må den selv finde på tone, længde, begrundelse og tilmeldingsfrist. Giver du den alt det, er der langt mindre at variere på.

Én ting mere: Spørger du modellen, om en leverandør er et godt valg, eller om et udkast holder, så er svaret ikke "AI'ens mening". Det er én ud af flere mulige fortsættelser. Spørg igen, og du kan få en anden konklusion. Brug derfor modellen til at få argumenter frem, ikke til at træffe beslutningen.

Hvad betyder det for dit arbejde?

Hvis du husker, at modellen forudsiger tekst ud fra det, der står i samtalen, følger tre råd næsten af sig selv:

  1. Giv modellen den kontekst, den ikke kan kende. Den ved intet om jeres kunder, jeres priser eller stemningen i afdelingen. Skal den skrive et tilbud, så sæt prislisten ind. Skal den svare en medarbejder, så fortæl, hvad der er sket. Hvordan du bygger en god prompt op, kan du læse i Sådan skriver du gode prompts.
  2. Start en ny chat til hver opgave. Så undgår du, at gammel kontekst forurener svaret, og at lange samtaler mister præcision.
  3. Brug den aldrig som eneste kilde til fakta. Tal, navne, datoer, lovhenvisninger og kilder skal tjekkes, før de bruges. Det gælder især, når teksten skal ud til kunder eller danne grundlag for en beslutning. Læs mere om, hvorfor AI finder på, og hvordan du tjekker den.

Og så et fjerde, der hænger sammen med kontekstvinduet: Alt, hvad du lægger ind i samtalen, sendes til leverandøren. Tænk derfor over, hvilke oplysninger der hører hjemme i værktøjet. Hvad der er i orden, og hvad der ikke er, gennemgår vi i GDPR og AI i praksis.

Det er den forståelse, vi starter med på vores kurser, fordi resten bygger på den. Når folk ved, hvad der sker bag skærmen, holder de op med at blive overraskede over fejlene og begynder at forebygge dem.

Findes der danske sprogmodeller?

Ja. I august 2026 fortalte Syddansk Universitet om Mimir, en sprogmodel fra projektet Danish Foundation Models. Den har 1 milliard parametre, cirka 22 % af træningsdataene er dansk, og den er frigivet under den åbne licens Apache 2.0, som også tillader erhvervsmæssig brug.

Projektet kalder modellen "bedst i sin klasse". Det er deres egen påstand, og den er ikke efterprøvet uafhængigt. Klassen er også vigtig: Mimir er en lille model sammenlignet med dem, der ligger bag ChatGPT og Claude, så den skal sammenlignes med modeller af samme størrelse. InstructGPT-eksemplet ovenfor viser dog, at størrelse ikke er alt.

Det interessante for danske virksomheder og myndigheder er især to ting. En model, der er trænet på meget dansk, kan håndtere sproget bedre. Og fordi den er frigivet under en åben licens, kan den i princippet køres på egne servere, så data ikke skal sendes til en udenlandsk leverandør. Det kræver dog teknisk kunnen at sætte den op.

For de fleste vil ChatGPT, Copilot eller Claude stadig være hverdagens værktøj. Principperne er de samme uanset model: Den forudsiger tekst, den kender kun det, der står i samtalen, og den skal tjekkes. Vil du vide, hvordan du får mere ud af den i det daglige samarbejde, kan du læse om at bruge AI som kollega.

Ofte stillede spørgsmål

Er ChatGPT og en sprogmodel det samme?

Ikke helt. Sprogmodellen er motoren, der forudsiger tekst. ChatGPT, Copilot og Claude er programmer bygget omkring en sprogmodel, ofte med ekstra funktioner som websøgning eller læsning af filer. Selve teksten bliver stadig skrevet af modellen, ét stykke ad gangen.

Husker ChatGPT, hvad jeg skrev i går?

Selve modellen husker ikke noget mellem to beskeder. Programmet sender hele samtalen med hver gang, og derfor virker det, som om den husker. Starter du en ny chat, begynder modellen forfra med et tomt kontekstvindue, medmindre værktøjet selv lægger gemte oplysninger ind.

Tænker en sprogmodel?

Den regner. Den har lært mønstre i sprog fra enorme tekstmængder og bruger dem til at vælge en fornuftig fortsættelse. Resultatet kan ligne tænkning og er ofte imponerende, men modellen har ingen forståelse af, om det, den skriver, er sandt. Derfor er din egen faglige vurdering stadig nødvendig.

Kan jeg få ChatGPT til at give det samme svar hver gang?

Ikke helt i de almindelige chatprogrammer. Du kan mindske variationen ved at give en fast skabelon, et eksempel på det ønskede resultat og præcise krav til format og længde. Jo mindre der er overladt til modellen, jo mere ens bliver svarene.

Kilder

  1. What is ChatGPT doing ... and why does it work?, Stephen Wolfram, Stephen Wolfram Writings, 14. februar 2023
  2. Training language models to follow instructions with human feedback (Ouyang m.fl.), arXiv, 2022
  3. What are tokens and how to count them?, OpenAI Help Center, tilgået september 2026
  4. Tokenizer Tax (Ovcharov), preprint uden fagfællebedømmelse, arXiv, 2026
  5. Context windows, Anthropic (Claude Docs), tilgået september 2026
  6. Mimir: dansk sprogmodel fra Danish Foundation Models, Syddansk Universitet, IMADA, 20. august 2026

Emner

sprogmodelchatgpttokenskunstig intelligens

Vil du lære mere om AI i praksis?

Vores kurser giver dig hands on erfaring med de nyeste AI værktøjer.

Se alle kurser