Språkmodell

En språkmodell är en statistisk modell och sannolikhetsfördelning som tränas på stora textmängder (textkorpus) för att förutsäga sannolika ordsekvenser och efterlikna mänskligt språk inom artificiell intelligens och språkteknologi. Historiskt har den använts för traditionella uppgifter som optisk teckenigenkänning, taligenkänning och maskinöversättning, men forskningen har gått från äldre N-gram-modeller till avancerade neurala nätverk (som transformatorer) som kan generera helt nya texter. De moderna stora språkmodellerna (LLM) tränas på enorma datamängder, exempelvis böcker och webbinnehåll, och uppvisar emergenta egenskaper som logiska resonemang och förmågan att skriva datorprogram. Denna typ av modell låg bakom den globala genombrottsvågen för generativ AI i början av 2020-talet, med chattbotten ChatGPT (baserad på GPT-3.5) som lanserades i slutet av 2022 och den mer avancerade GPT-4 (släppt 2023) som även driver Microsoft Copilot. För att göra modellerna interaktiva och säkra används tekniken RLHF (förstärkningsinlärning från mänsklig feedback), och utvecklingen domineras av ett fåtal stora teknikföretag som OpenAI.