Apache Solr: applicazioni di NLP per l'estrazione della conoscenza dal testo e dal codice sorgente
| |
|
|
@mastersthesis{apachesolratti2023,
abstract = {I motori di ricerca svolgono un ruolo importante nel recupero delle informazioni, in quanto sono ormai lo strumento preferito dagli utenti per ricercare e gestire le informazioni desiderate. La ricerca tramite parole chiave \`{e} il paradigma di ricerca pi\`{u} popolare, che richiede all'utente di cercare all'interno di un intero repository sulla base di poche parole che riassumono le informazioni desiderate. La disponibilit\`{a} di repository di software open source continua a crescere, e dunque anche la necessit\`{a} di strumenti in grado di analizzarli automaticamente su scala sempre pi\`{u} grande. L'analisi automatizzata di tali repository risulta importante, ad esempio per comprendere la struttura del software, le sue funzioni, complessit\`{a} ed evoluzione, nonch\'{e} per identificare le relazioni tra gli esseri umani e il software che producono, facilitando il riutilizzo interno del codice ed il processo di refactoring. Queste relazioni possono essere incapsulate da parole chiave e tendono a corrispondere a concetti o caratteristiche implementati dal software e sono strettamente correlati alle classi dei sistemi software. Usando questi topic come guida, uno sviluppatore pu\`{o} essere in grado di capire meglio e pi\`{u} rapidamente la struttura dei sistemi, che potrebbe non essere riflessa dalla gerarchia dei pacchetti o dalla documentazione. Lo scopo di questa tesi \`{e} di esplorare l’utilizzo di tecnologie, quali Apache Solr e Apache Spark, per effettuare il lavoro di analisi ed estrazione dei topic. In primo luogo verr\`{a} esaminato il caso d’uso del testo in linguaggio naturale, in particolare andando ad esaminare le note delle consuntivazioni all'interno dei progetti sviluppati in azienda, e successivamente il caso d’uso del codice sorgente, andando ad esaminare direttamente il codice di progetti open-source assieme al contenuto dei messaggi di commit.},
amspractice = {3073532},
author = {Atti, Nicola},
available = {2023-07-12},
cycle = {LM},
keywords = {Apace Solr • Apache Spark • NLP • Knowledge Extraction • Distributed Systems},
language = {it},
month = dec,
start = {2023-07-19},
supervisor = {Omicini, Andrea},
title = {Apache Solr: applicazioni di NLP per l'estrazione della conoscenza dal testo e dal codice sorgente},
type = {Master's thesis},
year = 2023
}
abstract = {I motori di ricerca svolgono un ruolo importante nel recupero delle informazioni, in quanto sono ormai lo strumento preferito dagli utenti per ricercare e gestire le informazioni desiderate. La ricerca tramite parole chiave \`{e} il paradigma di ricerca pi\`{u} popolare, che richiede all'utente di cercare all'interno di un intero repository sulla base di poche parole che riassumono le informazioni desiderate. La disponibilit\`{a} di repository di software open source continua a crescere, e dunque anche la necessit\`{a} di strumenti in grado di analizzarli automaticamente su scala sempre pi\`{u} grande. L'analisi automatizzata di tali repository risulta importante, ad esempio per comprendere la struttura del software, le sue funzioni, complessit\`{a} ed evoluzione, nonch\'{e} per identificare le relazioni tra gli esseri umani e il software che producono, facilitando il riutilizzo interno del codice ed il processo di refactoring. Queste relazioni possono essere incapsulate da parole chiave e tendono a corrispondere a concetti o caratteristiche implementati dal software e sono strettamente correlati alle classi dei sistemi software. Usando questi topic come guida, uno sviluppatore pu\`{o} essere in grado di capire meglio e pi\`{u} rapidamente la struttura dei sistemi, che potrebbe non essere riflessa dalla gerarchia dei pacchetti o dalla documentazione. Lo scopo di questa tesi \`{e} di esplorare l’utilizzo di tecnologie, quali Apache Solr e Apache Spark, per effettuare il lavoro di analisi ed estrazione dei topic. In primo luogo verr\`{a} esaminato il caso d’uso del testo in linguaggio naturale, in particolare andando ad esaminare le note delle consuntivazioni all'interno dei progetti sviluppati in azienda, e successivamente il caso d’uso del codice sorgente, andando ad esaminare direttamente il codice di progetti open-source assieme al contenuto dei messaggi di commit.},
amspractice = {3073532},
author = {Atti, Nicola},
available = {2023-07-12},
cycle = {LM},
keywords = {Apace Solr • Apache Spark • NLP • Knowledge Extraction • Distributed Systems},
language = {it},
month = dec,
start = {2023-07-19},
supervisor = {Omicini, Andrea},
title = {Apache Solr: applicazioni di NLP per l'estrazione della conoscenza dal testo e dal codice sorgente},
type = {Master's thesis},
year = 2023
}