Spring til indhold
Guide

Hallucinationer: hvorfor AI finder på, og hvordan du tjekker den

Af Jarle Kondrup28. september 202610 min. læsetid
AI-hallucinationer: forstørrelsesglas over et dokument med én tvivlsom linje ved siden af en stak tjekkede kilder

Kort svar: En hallucination er, når en AI-model skriver noget, der lyder rigtigt, men er forkert. Det kan være en kilde, der ikke findes, et tal uden hold i virkeligheden eller en dom, ingen har afsagt. Det er ikke en fejl, der forsvinder med næste opdatering. Det følger af den måde, modellerne er bygget og testet på. Du kan ikke slå det fra, men du kan lære at fange det, og artiklen slutter med en tjekrutine i fem trin.

Hvad er en hallucination?

Ordet er lånt fra psykologien, og det er lidt misvisende. Modellen ser ikke syner. Den skriver tekst, der er sprogligt korrekt og selvsikker, men faktuelt forkert. Du finder også en kort definition i vores AI-ordbog under hallucination.

Problemet er ikke, at AI tager fejl. Det gør mennesker også. Problemet er, at fejlen ser ud præcis som et rigtigt svar. Der er ingen tøven og ingen fodnote om usikkerhed, og ofte er der flere detaljer, end et rigtigt svar ville have. De typiske former er:

  • Kilder: artikler, bøger og rapporter med troværdige titler, forfattere og årstal, som ikke findes.
  • Tal: procenter, markedsstørrelser og statistik, der lyder plausible, men ikke stammer fra nogen opgørelse.
  • Domme og paragraffer: sagsnumre i det rigtige format uden en dom bag.
  • Citater: sætninger lagt i munden på virkelige personer eller institutioner.
  • Forvrængede referater: en rigtig kilde, der gengives forkert, nogle gange så konklusionen bliver vendt om.

Den sidste type er den sværeste at fange, fordi kilden findes. Du opdager først fejlen, når du læser den.

Hvorfor finder AI på?

Der er to forklaringer, og de supplerer hinanden. Den ene handler om, hvad en sprogmodel er. Den anden handler om, hvordan den bliver trænet og målt. Dertil kommer en tredje fejlkilde, som du selv styrer.

Modellen forudsiger tekst, den slår ikke op

En sprogmodel som den bag ChatGPT eller Copilot har ikke en database med fakta, den slår op i. Den har lært mønstre fra enorme mængder tekst og regner sig frem til, hvilke ord der sandsynligvis kommer som de næste. Beder du om en kilde, ved den, hvordan en kildehenvisning ser ud: forfatter, årstal, titel og tidsskrift. Den kan derfor skrive en henvisning med den helt rigtige form, uden at der findes en artikel bag. Vi forklarer mekanikken nærmere i Hvad er en sprogmodel?

Det rammer især detaljer, der sjældent optræder i træningsdata: et bestemt sagsnummer, en persons fødselsdato, et tal fra en snæver brancherapport. Jo sjældnere en oplysning er, desto mindre har modellen at holde sig til, og desto mere gætter den.

Træning og test belønner gæt

I september 2025 udgav Adam Tauman Kalai, Ofir Nachum, Santosh Vempala og Edwin Zhang artiklen "Why Language Models Hallucinate". Flere af forfatterne er forskere hos OpenAI, firmaet bag ChatGPT. Deres hovedpointe er, at sprogmodeller hallucinerer, fordi den måde, de trænes og evalueres på, belønner gæt frem for at erkende usikkerhed.

Tænk på en multiple choice-prøve, hvor et forkert svar giver nul point, og hvor "ved ikke" også giver nul. Så kan det kun betale sig at gætte. De fleste test, som AI-modeller bliver målt på, fungerer på samme måde: svaret er rigtigt eller forkert, og ærlig usikkerhed giver ingen point. En model, der altid gætter, ser derfor bedre ud på ranglisterne end en model, der siger "det ved jeg ikke", når den ikke ved det. Forskerne foreslår at ændre målingerne, så selvsikre fejl koster mere end en ærlig indrømmelse.

For dig betyder det, at hallucinationer ikke er en børnesygdom. Nyere modeller tager sjældnere fejl på mange opgaver, men så længe de er bygget til at give et svar, vil de nogle gange give et forkert.

Den tror på det, du fortæller den

Den tredje fejlkilde er dig selv. Modellen tager dine præmisser for gode varer. Spørger du "hvorfor steg vores eksport til Tyskland med 40 procent sidste år?", får du sandsynligvis en overbevisende forklaring, også selvom tallet er forkert. ChatGPT vil "tro" på alt, hvad du fortæller den, så du skal sikre dig, at de oplysninger, du giver den, er korrekte.

Hvad har det kostet? Sager fra virkeligheden

Hallucinationer er gået fra at være en kuriositet til at give bøder og tilbagebetalinger. Her er fire eksempler, to af dem danske.

Mata v. Avianca, USA 2023

En passager sagsøgte flyselskabet Avianca ved den føderale domstol i New York. Hans advokater indleverede et processkrift med henvisninger til seks domme, der ikke fandtes. Henvisningerne kom fra ChatGPT. Da den ene advokat spurgte ChatGPT, om sagerne var rigtige, svarede den ja. Den 22. juni 2023 pålagde dommeren advokaterne og deres firma en bøde på 5.000 dollars. Lektien er, at du ikke kan bruge modellen til at kontrollere sig selv.

Deloitte, Australien 2025

Deloitte lavede en rapport for det australske beskæftigelsesministerium, Department of Employment and Workplace Relations, på en kontrakt til omkring 440.000 australske dollars. Efter udgivelsen blev der fundet henvisninger til akademiske kilder, der ikke findes, og et opdigtet citat fra en dom ved den australske forbundsdomstol. I oktober 2025 oplyste ministeriet, at Deloitte havde betalt en del af honoraret tilbage, godt 97.000 australske dollars. Den reviderede rapport oplyste, at der var brugt Azure OpenAI i arbejdet. Lektien er, at det ikke kun sker for travle enkeltpersoner. Det sker også i store rådgivningshuse med egen kvalitetskontrol.

Advokatnævnet, Danmark

I maj 2026 fortalte Djøfbladet, at Advokatnævnet i december havde givet en dansk advokat en bøde på 10.000 kr. Advokaten havde henvist til U.2006.2042V og U.2008.1166H, to domme, der ikke findes, som de var citeret. Advokaten forklarede det som en tastefejl og afviste at have brugt AI. Advokatnævnet godtog ikke forklaringen om en tastefejl. Der var fejl i begge henvisninger, og de domme, der kunne komme på tale, afveg både i årstal, sidetal, domstol og indhold. Nævnet fandt, at advokaten ikke havde udvist den fornødne omhu.

Det er ikke bevist, at AI stod bag, og advokaten har ikke erkendt at have brugt AI. Sagen er med her af to grunde. Fejlen har det mønster, man kender fra hallucinationer: henvisninger i korrekt format til afgørelser, der ikke findes. Og konsekvensen er den samme, uanset hvordan fejlen opstod. Den, der sætter sit navn under, står til ansvar.

Højesteret, Danmark 2025

I en udvisningssag, som Højesteret afgjorde den 29. oktober 2025, indeholdt forsvarerens skriftlige indlæg syv referater af tidligere domme. Ifølge Djøfbladets gennemgang i september 2026 var alle syv helt eller delvist gengivet forkert. To af dommene handlede slet ikke om udvisning, og en afgørelse fra Den Europæiske Menneskerettighedsdomstol blev brugt til at støtte det modsatte af, hvad den faktisk siger. Advokaten har forklaret, at en medarbejder på hans kontor havde brugt ChatGPT til at udarbejde referaterne, og at han selv tager ansvaret.

Det er den type fejl, der er sværest at fange. Dommene findes. Det er indholdet, der er forkert, og det ser du kun ved at læse dem.

Hvor ofte sker det?

Der findes ikke ét tal. Det afhænger af model, opgave og emne. En af de mest citerede målinger er Vectaras Hallucination Leaderboard på GitHub. I september 2026 viste den, at de bedste modeller fandt på noget i omkring 2 til 3 procent af opsummeringerne, mens de svageste lå over 20 procent.

Tre forbehold, før du bruger tallene:

  • Den måler kun opsummering. Modellen får en tekst og skal gengive den korrekt. Målingen siger ikke noget om, hvor ofte modellen tager fejl på åbne spørgsmål, hvor den ikke har en tekst at holde sig til.
  • Det er leverandørens egen test. Vectara bedømmer svarene med sin egen model, og testmaterialet er ikke offentligt. Det er gjort, så modellerne ikke kan trænes til testen, men det betyder også, at ingen udefra kan efterprøve resultatet.
  • Også 2 procent er meget. Laver du 50 opsummeringer om ugen, kan du med 2 procent regne med omkring én fejl om ugen. Du ved bare ikke hvilken.

Hvornår er risikoen størst?

Du kan ikke tjekke alt lige grundigt, så brug din opmærksomhed der, hvor fejlene oftest sidder:

  • Kilder og henvisninger. Titler, forfattere, links og sidetal. Her er formen let at efterligne og indholdet let at opfinde.
  • Tal. Statistik, markedsdata, procenter og beløb, især når du ikke har givet modellen tallene selv.
  • Jura og regler. Sagsnumre, paragraffer, frister og satser. Danske regler fylder formentlig langt mindre i træningsdata end for eksempel amerikanske.
  • Nichefag. Jo smallere emnet er, desto mindre materiale har modellen lært af, og desto mere gætter den.
  • Lange dokumenter. Jo mere tekst modellen skal holde styr på, desto flere steder kan en detalje smutte.
  • Spørgsmål, modellen ikke kan kende svaret på. Begivenheder efter træningen, interne forhold i jeres virksomhed, en bestemt persons holdning. Uden søgning eller materiale fra dig gætter den.

Omvendt er risikoen lav, når opgaven ikke handler om fakta: omskriv mailen i en venligere tone, giv ti bud på en overskrift, stil kritiske spørgsmål til mit oplæg. Her er et dårligt svar sjældent farligt, fordi du selv vurderer resultatet med det samme.

En tjekrutine i fem trin

Rutinen tager få minutter og passer til alt, der indeholder fakta. Jo mere der står på spil, desto grundigere skal du gå til trin 1, 4 og 5.

  1. Bed om kilder, og åbn dem. Bed modellen angive, hvor hver påstand kommer fra, med et link. Klik på hvert link, og find den sætning, påstanden bygger på. Findes kilden ikke, eller står der noget andet, så er påstanden ubrugelig. Spørg ikke modellen, om kilden er rigtig. Det var præcis, hvad advokaterne i Mata v. Avianca gjorde.
  2. Giv modellen materialet i stedet for at spørge ud i luften. Indsæt rapporten, kontrakten eller notatet, og skriv for eksempel: "Svar kun ud fra den vedlagte tekst. Står svaret ikke i teksten, så skriv, at det ikke fremgår." Så arbejder modellen med dine fakta i stedet for sin hukommelse. Tjek først, at du må lægge materialet ind i værktøjet. Det gennemgår vi i GDPR og AI i praksis.
  3. Bed den markere usikkerhed. Skriv for eksempel: "Marker de påstande, du er mindst sikker på, og skriv hvorfor." Modellens egen vurdering er ikke pålidelig, men den peger dig ofte hen mod de svage steder, og den gør det lettere for modellen at sige, at den ikke ved det.
  4. Krydstjek tal. Find hvert tal, der skal bruges, i den oprindelige kilde. Regn summer, gennemsnit og procenter efter selv eller i et regneark. Et tal, du ikke kan finde i en kilde, bliver ikke brugt.
  5. Et menneske godkender alt, der går ud af huset. Tekster til kunder, myndigheder, domstole, presse og samarbejdspartnere skal læses af en navngiven person, før de sendes. Den person har ansvaret, uanset hvem eller hvad der skrev udkastet.

Trin 2 gør typisk den største forskel, fordi det flytter opgaven fra at huske til at læse. En god prompt hjælper også, for eksempel når du beder modellen skelne mellem det, der står i materialet, og det, den selv tilføjer. Det kan du læse mere om i Prompting der virker. Men ingen prompt fjerner behovet for at åbne kilden.

Hvordan skriver I det ind i jeres regler?

En tjekrutine virker bedst, når den ikke afhænger af, om den enkelte husker den en travl fredag. Skriv den ind i jeres AI-politik. Her er de anbefalinger, vi står inde for:

  • Brug aldrig AI som eneste kilde til fakta. Lær at prompte ordentligt, ellers skal du lade være med at bruge Copilot, ChatGPT og lignende som kilde til information. Fakta skal kunne findes i en kilde, et menneske har åbnet.
  • Giv modellen det materiale, den skal arbejde med. Hellere en opsummering af jeres egen rapport end et svar ud i luften.
  • Den, der sender det videre, har ansvaret. Skriv ind, hvilke typer tekster der altid skal godkendes af en navngiven person, før de forlader huset.

Hvordan I skriver og forankrer en politik, som medarbejderne faktisk følger, gennemgår vi i Sådan skriver I en AI-politik. Regler for, hvilke data der må bruges, står i GDPR-artiklen. Vil I øve tjekrutinen på jeres egne opgaver, er den en fast del af vores AI kursus for virksomheder.

Ofte stillede spørgsmål

Kan man stole på ChatGPT?

Til at skrive, omformulere, strukturere og komme med idéer: ja, fordi du selv vurderer resultatet. Til fakta, tal, kilder og jura: ikke uden kontrol. Brug aldrig ChatGPT eller andre AI-værktøjer som eneste kilde til information. Tjek påstande i den oprindelige kilde, før du bruger dem.

Kan jeg bede ChatGPT om at tjekke, om kilderne er rigtige?

Nej, ikke som eneste kontrol. Modellen kan bekræfte en kilde, den selv har fundet på. Det skete i den amerikanske sag Mata v. Avianca, hvor ChatGPT svarede, at de opdigtede domme var rigtige. Åbn selv kilden, og find den sætning, påstanden bygger på.

Hallucinerer AI mindre, når den kan søge på nettet?

Søgning giver modellen noget konkret at holde sig til, og den kan vise links, du kan klikke på. Det hjælper, men det løser ikke problemet. Modellen kan stadig gengive en rigtig kilde forkert eller vælge en upålidelig side. Du skal stadig åbne kilden og læse efter.

Hvem har ansvaret, hvis AI laver en fejl i noget, vi sender ud?

Den, der sender det videre, og den virksomhed, der står som afsender. AI-værktøjet kan ikke stå til ansvar. I de danske advokatsager var det advokaten, der fik kritikken, uanset hvem eller hvad der havde skrevet teksten.

Kilder

  1. Why Language Models Hallucinate (Kalai, Nachum, Vempala og Zhang), arXiv, september 2025
  2. Mata v. Avianca, Inc., Opinion and Order on Sanctions (S.D.N.Y.), United States District Court, Southern District of New York (arkiveret af Berkeley Law), 22. juni 2023
  3. Deloitte refunds over $60K for report with AI errors, Australian government says, CFO Dive, oktober 2025
  4. Dansk advokat får bøde for opdigtede domme, Djøfbladet, 19. maj 2026
  5. Advokat begik grove AI-fejl i Højesteret, Djøfbladet, 10. september 2026
  6. Hallucination Leaderboard, Vectara (GitHub), opdateret september 2026, tjekket september 2026

Emner

hallucinationchatgptkildekritikkvalitetskontrol

Vil du lære mere om AI i praksis?

Vores kurser giver dig hands on erfaring med de nyeste AI værktøjer.

Se alle kurser