Il corso si propone di fornire un’introduzione teorica e pratica alla linguistica computazionale e al trattamento automatico del linguaggio. Nella prima parte del corso si illustreranno le metodologie per la raccolta, la compilazione e la gestione dei corpora. Verranno approfondite le tecniche di (pre-)elaborazione del testo (ad es., tokenizzazione, stemming, lemmatizzazione, rimozione stopword, ecc.) e di annotazione linguistica (ad es., POS-tagging, annotazione semantica, ecc.). L’analisi dei dati e dei fenomeni linguistici sarà affrontata attraverso lo studio delle co-occorrenze, delle analisi frequentiste e dell’estrazione dei pattern dai corpora. Saranno, inoltre, introdotti i modelli di base per la rappresentazione del testo, come il Bag-of-Words e il TF-IDF. Saranno inoltre introdotti alcuni modelli di base per la classificazione supervisionata, come il Naive Bayes e la regressione, in relazione ad alcuni task di NLP. Infine, il corso offrirà un’introduzione pratica all’uso di Python per il trattamento automatico del linguaggio, con particolare attenzione alle librerie NLTK e spaCy. Durante le attività pratiche, gli studenti e le studentesse avranno la possibilità di usare le conoscenze acquisite, lavorando da soli/e o in piccoli gruppi su task di raccolta, annotazione e analisi di corpora attraverso strumenti e tecniche della linguistica computazionale.