Build your ultimate AI agent
Kursbeskrivning
Att analysera data i tabellform är givande. Men vad händer när det mest intressanta inte finns i välorganiserade datamängder, utan i ren text? Ingen fara: I den här kursen lär du dig allt du behöver för att skapa kraftfulla reguljära uttryck som hjälper dig att hitta all information du behöver i ett textblock. Dessutom lär du dig att arbeta med text som innehåller stavfel eller skanningsfel – med hjälp av strängavstånd kan du matcha sådan text mot rätt poster i andra datakällor (postlänkning). Som kursmaterial analyserar vi verkliga dokument om biljettintäkter från schweiziska biografer.
Förkunskapskrav
Kursplan
Kursöversikt
1
Reguljära uttryck: Skriv egna mönster
Reguljära uttryck kan verka överväldigande till en början, med alla sina specialtecken. I det här kapitlet lär du dig att tolka dem och skriva egna mönster för att hitta exakt det du söker efter.
- Välkommen50 XP
- Börjar med, slutar med100 XP
- När du inte vet vad du letar efter100 XP
- Teckenklasser och repetitioner50 XP
- Siffror, ord och mellanslag100 XP
- Matcha repetitioner100 XP
- Vad gör specialtecknen igen?100 XP
- Pipe-tecknet och frågetecknet50 XP
- Det ena eller det andra100 XP
- Frågetecknet och dess två betydelser100 XP
- Nu kan du läsa det här!50 XP
2
Skapa strängar med data
I det här kapitlet går vi delvis bort från reguljära uttryck och fokuserar i stället på strängmanipulering – vi skapar strängar från andra datastrukturer som vektorer och listor.
3
Extrahera strukturerad data från text
Reguljära uttryck är särskilt kraftfulla när det gäller att skapa ordning i ostrukturerad text. I det här kapitlet lär du dig att extrahera information från rörig data som inte är snyggt ordnad i tabeller, utan som förekommer i ren text.
4
Likheter mellan strängar
I det sista kapitlet lämnar vi reguljära uttryck och fokuserar på strängavstånd. Genom att beräkna skillnader mellan strängar kan vi matcha dem som liknar varandra – vilket gör det möjligt att hitta dubbletter även när de innehåller små fel som stavfel. Det här är en viktig del av postlänkning, där vi kombinerar datamängder från flera olika källor.
R
Reguljära uttryck på mellannivå i R
Kurs
slutförd

