Vi säger att en AI tränats på data. Vi säger det om systemet som övervakar en vattentäkt, och vi säger det om språkmodellen vi vänder oss till när vi ska sätta oss in i något nytt.
Det är samma ord om två olika saker. Och skillnaden mellan dem säger något om hur vi bör läsa det som kommer ut.
AI är ett brett ord
Systemet som håller koll på vattennivån i en damm är AI. Det som räknar ut rutten för en lastbil är AI. Och språkmodellen, ofta förkortad LLM efter engelskans large language model, är också AI.
I vardagligt tal har ordet krympt till att betyda det sista. Följden är att vi använder samma ord om system som fungerar olika, och därmed samma ord om det de utgår från. Det är där otydligheten uppstår.
Ett system som mäter
Systemet som övervakar vattenkvalitet får in avläsningar. Temperatur klockan sju. Nivå klockan sju och fem. Ett provsvar från torsdagen.
Siffrorna uppstod när något mättes. Systemet tar emot dem, räknar på dem och producerar något läsbart: en kurva, ett larm, en sammanställning.
Den rörelsen har ett namn. I informationsvetenskapen beskrivs den som en trappa: först data, alltså obehandlade värden, sedan information, alltså det någon gjort av dem. Steget mellan dem är bearbetningen.
Här har ordet rådata fog för sig. Det finns ett före och ett efter, och bearbetningen ligger mellan dem. Mänskliga val finns förvisso även här, i vad som mäts och hur ofta, men de ligger före mätningen och går att räkna upp. Mer om det längre ner.
Vad en språkmodell har fått
En språkmodell har fått text.
Någon satt vid ett tangentbord. En människa som läst på, valt ut vad som var relevant, bestämt vad som skulle utelämnas, tolkat materialet och formulerat en slutsats. Sedan publicerades det. En artikel, en handbok, ett blogginlägg.
Det som producerades var information. Redan innan modellen fanns. En människa tog ett material, hanterade det och skapade ett resultat, och det är precis vad information är.
Texten behåller den statusen när den matas in i en modell. Den förblir någons bearbetade resultat, och modellen har miljontals sådana resultat, skrivna av olika människor, i olika tider, med olika avsikter.
Skillnaden mot mätvärdet ryms i en mening: mätaren registrerar något, texten säger redan något.
En språkmodell startar alltså på trappans andra steg. Bearbetningen är utförd innan modellen såg materialet, och den utfördes av människor.
Vad ordet döljer
Självklart arbetar en språkmodell med data. Inom maskininlärning betyder ordet en representation som går att räkna på, och i den meningen är det korrekt använt.
Min invändning gäller något annat. När vi säger data om en språkmodells underlag neutraliserar vi med ett ord något som är högst viktat. Ordet bär med sig bilden av det registrerade och opåverkade, och den bilden lägger sig över ett material som består av mänskliga urval från början till slut.
Glidningen sitter i att ordet data ligger så nära rådata att vi hör det ena när det andra sägs. Data låter som det oförmedlade, det som fanns före tolkningen.
Till det kommer att fler urval sker på vägen. Vilka texter som togs med och vilka som sållades bort. Vilka svar mänskliga granskare bedömde som bra. Allt det ligger bakom svaret, osynligt för den som frågar.
Och det är här biasen sitter. Vi talar ofta om bias i AI som något som uppstår i systemet, ett fel att justera bort. Men urvalen låg i materialet innan någon ställde en enda fråga. Varje text bar sitt eget perspektiv, och sammanvägningen av dem bär allihop. Kallar vi det data låter det som ett resultat. Det är en sammanvägning av vad människor hävdat, och ju mer den låter som ett konstaterande, desto lättare tas den för sanning.
Det vi lär oss med är viktat
Det gäller förresten allt material vi lär oss av. Handboken är någons urval, med en författare som valt bort och lyft fram. Kursmaterialet likaså. Kollegan som visar hur något görs förmedlar sin egen version av saken. Allt lärande har byggt på bearbetat material, och det är en förutsättning snarare än en brist. En handbok utan urval vore oläslig.
Det ligger i sakens natur. Kunskapsöverföring har alltid gått genom människor som tolkat, sammanfattat och prioriterat, från den muntliga traditionen till dagens utbildningsmaterial.
Skillnaden ligger i vad vi byggt runt det. Författaren står på omslaget. Upplagan har ett årtal. Förlaget har ett granskningsled. Kollegan går att fråga vidare. Var och en av de delarna gör viktningen synlig och därmed möjlig att förhålla sig till.
Det språkmodellen ändrar är alltså tillgången till den apparaten. Viktningen finns kvar. Författaren, årtalet, upplagan och den som kan svara på varför just det här utelämnades har försvunnit. Och ordet data hjälper till att hålla den osynlig.
Det som gör granskningen svår
Svaret kommer välformulerat, sammanhängande och i ett tonläge som låter säkert oavsett hur välbelagt innehållet är. Modellen väver samman tusentals människors texter till en enda röst, avsändarna försvinner på vägen, och det som kommer ut låter som det alla vet.
Men den svåraste delen sitter i oss.
Bekräftelsebias är benägenheten att söka och värdera det som stödjer vad vi redan tror. En språkmodell som håller med förser oss precis med det, välformulerat och omedelbart. Två saker sammanfaller: vår önskan att ha rätt, och ett system byggt att ge oss rätt. Det som annars hejdar oss, att någon invänder eller att en text skaver, uteblir.
Jag har tidigare kallat den upplevelsen syntetisk trygghet. Här går den ett steg längre. Modellen bekräftar innehållet, och den slår dessutom undan vår egen kritik mot våra egna tankar, eftersom kritiken blir obekväm när svaret redan gav oss det vi ville ha.
Och här tar källkritiken slut. Den frågar vem som skrivit det här och varför. Frågan som återstår är varför jag tog emot det så villigt.
Det jag arbetar med under namnet kognitiv integritet handlar om just den frågan: att behålla sitt eget tänkande intakt i mötet med ett system som svarar. Att resonera vidare trots att svaret låter rätt. Att märka när något bekräftar, och att just då fortsätta i stället för att stanna.
Vad det betyder när vi lär oss
Källkritiken behöver bli mer gedigen än den varit, och den behöver sitta inåt. Vi behöver bygga in en granskare i oss själva, en som går igång av sig själv när ett svar kommer.
Det går att öva. Skillnaden mot vanlig källkritik är riktningen. Källkritiken frågar vad texten är värd. Den här frågar varför jag godtog den.
Behovet är störst just när vi lär oss något nytt, för då saknar vi det som annars hejdar oss. Den som kan ett område märker när ett svar skaver. Den som är ny på det har inget att jämföra med, och tar emot svaret som det ser ut.
Juridiken har gett det tydligaste exemplet på vad som händer då. I fallet Mata mot Avianca lämnade två advokater in en inlaga med sex påhittade rättsfall. När motparten påpekade att fallen saknade motsvarighet bad de modellen bekräfta att de existerade. Den gjorde det. Först då gick de vidare. Frågan ställdes till den part som redan gett dem svaret de ville ha.
Samma mönster återkommer överallt. Politiker som citerar personer som aldrig sagt det citerade. Redaktioner som publicerat texter där instruktionen till modellen ligger kvar i brödtexten, vilket bevisar att ingen läste igenom innan publicering. Steget som hoppas över är alltid detsamma, och det är alltid det sista.
Tre saker att ta med sig
Vet vad du har framför dig. Arbetar du i Claude, ChatGPT eller någon annan språkmodell, så är det inte rådata du hämtar ur. Det är information som människor redan bearbetat och viktat. Det gäller från första frågan, innan du ens formulerat den.
Beskriv underlaget som bearbetad information. Ordet data neutraliserar det som är viktat, och därmed avgör det vilken fråga som ställs härnäst. Data leder till frågan om systemet räknar rätt. Information leder till frågan vems urval svaret bär.
Granska hårdast det svar som bekräftar dig. Där är motståndet svagast och risken störst. Begär underlag just då: var uppgiften kommer ifrån, vad som talar emot och hur säker slutsatsen är. Och kontrollera underlaget någon annanstans än hos den som gav dig det. Begärt underlag ger dig något att kontrollera, och kontrollen gör du själv.
Det börjar med att vi slutar kalla det data.
För den som vill gräva
Vilket informationsbegrepp som används här. Ordet information bär minst två etablerade betydelser. Den här artikeln använder den som kommer från informationsvetenskapen: data som någon bearbetat och gett mening. Inom den matematiska informationsteorin, grundad av Claude Shannon 1948, betyder information ett mått på hur mycket osäkerhet ett meddelande undanröjer. Den definitionen är frikopplad från innehåll, så ett meddelande utan mening kan bära hög information i Shannons mening. Det är den första betydelsen som är relevant för lärande, eftersom frågan där gäller vad ett material säger och vem som valt det.
Vad LLM står för. Large language model, stor språkmodell. Den gör i grunden en sak: utifrån texten så här långt bedömer den vad som sannolikt kommer härnäst.
Hur ordet AI krympte. Uttrycket artificiell intelligens skrevs första gången i en forskningsansökan 1955, undertecknad av John McCarthy, Marvin Minsky, Nathaniel Rochester och Claude Shannon, inför en workshop vid Dartmouth College sommaren därpå. Det var tänkt som ett paraply över allt som handlar om att få maskiner att göra sådant som kräver tänkande. Sedan dess har paraplyet krympt av sig självt, enligt en iakttagelse som brukar tillskrivas datavetaren Larry Tesler: intelligens är det maskiner ännu inte gjort. Stavningskontroll kallades AI en gång. Nu heter det stavningskontroll.
Trappan från data till information brukar kallas DIKW-hierarkin, efter data, information, knowledge, wisdom. Den tillskrivs vanligen Russell Ackoff och hans artikel From Data to Wisdom från 1989, även om Jennifer Rowley senare visat att idén cirkulerade tidigare. Modellen är omstridd, bland annat av Martin Frické, som 2009 kritiserade den för att förutsätta att kunskap växer fram ur observationer av sig själva. Som beskrivning av steget mellan mätning och läsbart resultat fungerar den väl, och det är det steget som är relevant här.
Att också mätvärden bär mänskliga val. Någon bestämde var sonden skulle sitta och hur ofta den läser av. När ett vattenprov ska visa om vatten är farligt letar vi dessutom efter indikatorer som E. coli snarare än efter det som gör människor sjuka. Varje mätning vilar alltså på antaganden om vad som är värt att mäta. Skillnaden är att de antagandena ligger före mätningen och går att beskriva, medan valen i en textmängd ligger inne i materialet.
Att rådata är en självmotsägelse är titeln på en antologi som Lisa Gitelman gav ut 2013. Formuleringen kommer från vetenskapshistorikern Geoffrey Bowker, och tanken är att data framställs snarare än samlas in.
Att stora textmängder inte ger bredd är kärnan i en uppsats av Emily Bender med flera från 2021, On the Dangers of Stochastic Parrots. Mer text ger framför allt mer av det som redan dominerar.
Mer om Avianca-fallet. De påhittade rättsfallen kom från ChatGPT, och advokaterna presenterade dessutom fabricerade utdrag ur domarna som modellen tagit fram på följdfrågor. Domaren P. Kevin Castel dömde ut böter på 5 000 dollar solidariskt och krävde att advokaterna skulle skriva till var och en av de domare vars namn hade knutits till de uppdiktade avgörandena.
Lagstiftningen skiljer redan på sorterna. EU:s AI-förordning definierar AI-system brett och behandlar sedan modeller för allmänna ändamål, dit språkmodellerna hör, i ett eget kapitel med egna skyldigheter.
Vidare läsning
Bekräftelsemaskinen: Om syntetisk trygghet, tolkningsmellanrummet och MIT-papret som bekräftar Begreppet syntetisk trygghet i sin helhet, och vad som händer i mellanrummet mellan svar och förståelse.
AI som sanningsorakel: När vi förankrar verkliga beslut i en modell som speglar och förstärker Vad det kostar en organisation att behandla modellens svar som ett konstaterande.
Sycophancy betyder medhåll: Ett tekniskt ord för ett välbekant fenomen Varför modeller håller med, och vad medhållet gör med den som frågar.
AI arbetar, människan granskar: Varför Human-in-the-Loop är en förutsättning Granskningen satt i system, bortom den enskilda frågan.
Källor
Ackoff, R. L. (1989). From Data to Wisdom. Journal of Applied Systems Analysis, 16.
Bender, E. M., Gebru, T., McMillan-Major, A. & Shmitchell, S. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21.
Europaparlamentets och rådets direktiv 2006/7/EG om förvaltning av badvattenkvaliteten.
Europaparlamentets och rådets förordning (EU) 2024/1689 om artificiell intelligens.
Frické, M. (2009). The Knowledge Pyramid: A Critique of the DIKW Hierarchy. Journal of Information Science, 35(2).
Gitelman, L. (red.) (2013). "Raw Data Is an Oxymoron". MIT Press.
Mata v. Avianca, Inc., 678 F. Supp. 3d 443, No. 22-cv-1461 (PKC) (S.D.N.Y. 22 juni 2023).
McCarthy, J., Minsky, M., Rochester, N. & Shannon, C. (1955). A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence.
Nickerson, R. S. (1998). Confirmation Bias: A Ubiquitous Phenomenon in Many Guises. Review of General Psychology, 2(2).
Rowley, J. (2007). The Wisdom Hierarchy: Representations of the DIKW Hierarchy. Journal of Information Science, 33(2).
Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27.