Hvor henter ChatGPT informasjonen fra?

48 visninger
ChatGPT henter informasjonen sin fra enorme mengder tekstdata, inkludert digitaliserte bøker, nettsider og artikler. Nyere versjoner kan også utføre sanntidssøk på internett for å hente dagsfersk informasjon og lenker.
Kommentar 0 liker

Hvor henter ChatGPT informasjonen fra?

ChatGPT bygger sine svar basert på mønstre fra enorme mengder forhåndstrent tekst, ikke ved å slå opp i en ferdig database. Når dagsfersk informasjon er nødvendig, bruker nyere versjoner hvor henter chatgpt informasjonen sin fra ved hjelp av sanntidssøk på nettet for å supplere med oppdaterte fakta.

Hvorfor virker det som om AI vet alt?

ChatGPT henter informasjonen sin fra enorme mengder tekstdata den har blitt trent på, inkludert bøker, artikler og nettsider. I tillegg kan nyere versjoner søke på internett i sanntid for å finne oppdatert informasjon, og verktøyet bruker teksten du skriver inn for å skreddersy svaret. De fleste forstår at teknologien har lest mye tekst.

Men det er én kritisk misforståelse om hvordan den faktisk husker denne informasjonen - jeg skal forklare dette i delen om sannsynlighet lenger ned.

Plattformen har nå over 900 millioner aktive brukere hver uke. En slik enorm vekst krever massiv datakapasitet. Første gang jeg brukte verktøyet til seriøs research, gjorde jeg alle nybegynnerfeilene.

Jeg ba om akademiske kilder til en artikkel, og den ga meg fem lenker som så helt perfekte ut. Resultatet? Tre av dem fantes ikke. Det tok meg timer å rydde opp. Da lærte jeg at man aldri kan stole blindt på at teknologien bare slår opp i et leksikon. Den bygger ordene underveis.

Treningsdata: Det massive biblioteket under panseret

Grunnmuren i systemet er de såkalte treningsdataene. Før modellen i det hele tatt kan svare på spørsmålet ditt, har den gått gjennom en dyp læringsprosess. Her blir den matet med en ubeskrivelig mengde digital tekst. Eldre modeller ble trent på over 45 terabyte med tekst, mens chatgpt treningsdata og internettsøk viser at dagens versjoner analyserer flere petabyte med data.

Hvor kommer dette fra? Kildene inkluderer digitaliserte bøker, Wikipedia, nyhetsnettsider og offentlige forum. La oss være ærlige - den har i praksis lest store deler av det åpne internettet fram til et bestemt tidspunkt.

Dette gir den en bred, men noen ganger utdatert, forståelse av verden. Hvis en begivenhet skjedde etter at treningen var ferdig, vet ikke grunnmodellen om det i det hele tatt.

Sanntidssøk på internett

Når spørsmålet ditt krever dagsfersk informasjon, aktiveres en annen mekanisme. Verktøyet går ut på nettet akkurat slik du ville gjort, leser gjennom de øverste treffene, og sammenfatter innholdet raskt.
Nesten 17 % av alle digitale søk globalt skjer nå via denne typen AI-verktøy. Det er en massiv endring i forbrukeradferd.

Dette neste poenget overrasker de fleste.

Hvordan ChatGPT bygger svar (Sannsynlighet, ikke leksikon)

Her er den kritiske misforståelsen jeg nevnte tidligere: AI-en har ikke en enorm harddisk der den lagrer artikler og henter dem fram ord for ord. Slik fungerer det ikke. Mange tror at den kopierer tekst direkte. Helt feil.
I stedet har den lært mønstre, språk og hvordan fungerer chatgpt kilder ut fra usynlige sammenhenger.

Når du stiller et spørsmål, beregner den hvilket ord som har høyest sannsynlighet for å komme som det neste. Den skriver ett ord om gangen. Akkurat som autofullfør på mobilen din, bare milliarder av ganger kraftigere.
Dette betyr at den teknisk sett genererer helt ny tekst for hvert eneste svar den gir deg.

Problemet med hallusinasjoner

Fordi den gjetter ord i stedet for å slå opp fakta, kan den ta feil. Ganske ofte, faktisk. Nye modeller har en hallusinasjonsrate på mellom 33 % og 51 % avhengig av hvor komplekse fakta det er snakk om.

Det betyr at den gjetter feil nesten hver tredje gang på rene faktaspørsmål. Den høres skråsikker ut, men produserer av og til rent oppspinn.

Jeg pleide å tro at hvis språket var overbevisende, var innholdet sant. Realiteten er en helt annen. Den er programmert til å være hjelpsom og glitrende i språket, uansett om den har rett eller ikke.
Det tok meg mange feiltrinn å innse at man alltid må verifisere kritiske påstander manuelt.

Treningsdata vs. Sanntidssøk

For å forstå hvor svarene kommer fra, må man kjenne forskjellen på de to hovedmetodene teknologien bruker for å hente informasjon.

Treningsdata (Grunnmodellen)

Kunnskapen stopper ved en bestemt dato

Høy på generelle konsepter, men oppfinner fakta noen ganger

Ekstremt rask, siden mønstrene ligger lagret lokalt

Et massivt datasett med bøker og nettsider

Sanntidssøk (Nettlesing)

Helt avhengig av kvaliteten på de øverste treffene

Mye bedre på dagsaktuelle fakta, gir ofte klikkbare kildelenker

Litt tregere, da den må lese artikler i sanntid

Live søkeresultater fra dagens internett

For generell skriving, idémyldring og koding lener systemet seg tungt på treningsdataene. Men når du spør om nyheter, produktpriser eller ferske tall, er sanntidssøket uunnværlig for at svaret skal være pålitelig.

Karis kamp med kildekritikk

Kari, en 34 år gammel prosjektleder i Oslo, trengte historiske data om norsk eksport for en viktig presentasjon. Hun spurte AI-assistenten, som leverte en velskrevet oppsummering full av imponerende tall og akademiske referanser. Hun var strålende fornøyd med tidsbesparelsen.

Morgenen etter bestemte hun seg for å sjekke én av kildene. Lenken fungerte ikke i det hele tatt. Da hun søkte opp forfatteren manuelt, oppdaget hun at personen aldri hadde skrevet om temaet. Tallene for lakseeksporten var også ren fiksjon.

Det gikk opp for henne at verktøyet ikke hadde slått opp i noen statistikkbank, men heller gjettet seg til hvordan en slik rapport vanligvis ser ut. Alt måtte kastes i søpla, bare timer før møtet.

Nå ber Kari alltid verktøyet om å gjøre et aktivt nettsøk for statistikk, og hun krever klikkbare, ekte lenker. Feilene ble redusert drastisk, og hun lærte den harde veien at blind tillit til generativ teknologi sjelden lønner seg på jobb.

Viktigste lærdommer

Sannsynlighet over fakta

Systemet gjetter neste ord basert på språklige mønstre, det slår ikke systematisk opp i en intern database.

Hvis du lurer på hva verktøyet ellers kan bidra med, kan du lese mer om Hva kan ChatGPT brukes til?.
Kombinerer metoder

Moderne AI-svar er en smart blanding av gammel forhåndstrening og ferske, innhentede data fra sanntidssøk.

Verifisering er kritisk

Med en betydelig feilrate på komplekse faktaspørsmål, må alle viktige tall og påstander dobbeltsjekkes før de brukes profesjonelt.

Mer diskusjon

Lagrer ChatGPT de personlige samtalene mine?

Ja, samtalene blir vanligvis lagret for å trene fremtidige versjoner, med mindre du aktivt slår av dette i innstillingene. Du bør aldri dele sensitiv eller personlig informasjon.

Hvor ofte blir informasjonen oppdatert?

Grunnmodellen oppdateres i rykk og napp gjennom store oppdateringer. Sanntidssøket oppdateres derimot kontinuerlig når assistenten kobler seg til internettet.

Kan jeg stole på at kildene den oppgir er ekte?

Absolutt ikke alltid. Hvis den bruker sanntidssøk, er lenkene som oftest reelle. Men hvis den henter utelukkende fra treningsdata, kan den fort finne opp falske referanser som ser helt ekte ut.

Leter den på Wikipedia etter svar?

Wikipedia er en viktig del av treningsdataene fordi det er en stor og velstrukturert tekstbase. Likevel utgjør det bare en brøkdel av det massive datasettet maskinen har fordøyd.