Build your ultimate AI agent
Cursusbeschrijving
Gegevens analyseren die in tabellen staan is leuk. Maar wat als de dingen die we het interessantst vinden niet beschikbaar zijn als een netjes georganiseerde gegevensset, maar als platte tekst? Geen paniek: in deze cursus leer je alles wat je moet weten om krachtige reguliere expressies te maken waarmee je alle informatie kunt vinden die je nodig hebt voor je analyses, gewoon uit een lap tekst. En dat is niet alles. Met het concept van tekenreeksafstanden leer je ook werken met tekst die typefouten of scanfouten bevat, omdat je die kunt koppelen aan de juiste tegenhangers uit andere databronnen (record linkage). Als oefenmateriaal analyseren we echte documenten over box office-cijfers in Zwitserse bioscopen.
Vereisten
Curriculum
Cursusoverzicht
1
Reguliere expressies: eigen patronen schrijven
Reguliere expressies kunnen in het begin best intimiderend zijn, omdat ze vol staan met speciale tekens. In dit hoofdstuk leer je die te ontcijferen en je eigen patronen te schrijven om precies te vinden wat je zoekt.
- Welkom50 XP
- Begint met, eindigt op100 XP
- Als je niet weet waar je naar zoekt100 XP
- Tekenklassen en herhalingen50 XP
- Cijfers, woorden en spaties100 XP
- Herhalingen matchen100 XP
- Welk speciaal teken deed ook alweer wat?100 XP
- De pipe en het vraagteken50 XP
- Dit of dat100 XP
- Het vraagteken en zijn twee betekenissen100 XP
- Dit kun je nu lezen!50 XP
2
Tekenreeksen maken met data
In dit hoofdstuk stappen we even weg van reguliere expressies en richten we ons op tekenreeksmanipulatie door tekenreeksen te maken uit andere datastructuren zoals vectoren of lijsten.
3
Gestructureerde data uit tekst halen
Een taak waarin reguliere expressies echt uitblinken, is betekenis halen uit een lap tekst. In dit hoofdstuk leer je informatie te extraheren uit rommelige data die niet netjes in tabellen staat, maar als platte tekst voorkomt.
4
Overeenkomsten tussen tekenreeksen
In het laatste hoofdstuk schakelen we over van reguliere expressies naar het begrijpen van tekenreeksafstanden. Door de verschillen tussen meerdere tekenreeksen te berekenen, kunnen we degene koppelen die op elkaar lijken. Zo vinden we duplicaten, zelfs als ze kleine fouten zoals typefouten bevatten. Dit is een belangrijk onderdeel van record linkage, waarbij we gegevenssets uit meerdere bronnen combineren.
R
Gevorderde reguliere expressies in R
Cursus
voltooid

