Aggregazione di dati testuali in MoK: matchmaking basato su ontologie o similarità
| |
|
|
@mastersthesis{mokmatchmaking2017,
abstract = {Sono stati inizialmente analizzati due approcci per il calcolo di similarit\`{a}: uno basato su ontologie e l'altro basato su misure di similarit\`{a}. Con l'obiettivo di realizzare un sistema di aggregazione di conoscenza sono state illustrate, attraverso uno studio sullo stato dell'arte, le propriet\`{a} computazionali di tali approcci. Successivamente \`{e} stato effettuato uno studio che ha permesso di individuare tre strumenti per ogni approccio. Tra questi si \`{e} cercato di selezionare quello ottimale per ogni approccio che rispettasse determinati requisiti di espressivit\`{a} computazionale e di performance. A tale scopo \`{e} stato necessario introdurre dei test. Dai risultati ottenuti si \`{e} potuti giungere alla scelta del motore di inferenza semantica Hermit, definito come approccio semantico, e dell'algoritmo Generalized Jaccard per il calcolo di similarit\`{a} sintattica, definito come approccio non-semantico, come strumenti ottimali. I risultati ottenuti dai test di performance hanno permesso di affermare che i due strumenti ottimali sono utilizzabili nel contesto dell'aggregazione di conoscenza individuato per il modello MoK. É stato pertanto progettato un sistema di aggregazione di cui sono state realizzate due versioni per aggregare frasi, una per l'approccio semantico e l'altra per quello non-semantico. Entrambe si compongono di tre passi realizzati ispirandosi al modello MoK: aggregazione di soli atomi, aggregazione di atomi in molecole gi\`{a} esistenti e aggregazione di sole molecole. Per l'approccio non-semantico \`{e} risultato immediato, una volta scelto il dataset, implementare il comportamento di ognuno dei tre passi, mentre per quello semantico \`{e} stato necessario introdurre un'apposito algoritmo di aggregazione che utilizza l'ontologia WordNet per riconoscere i sinonimi tra due frasi. Per verificare la validit\`{a} di ciascun approccio \`{e} stato introdotto un apposito metodo di validazione grazie al quale \`{e} stato possibile mettere a confronto fra i due approcci.},
amseprint = {12876},
amspractice = {830561},
author = {Fattori, Matteo},
available = {2016-05-16},
cosupervisor = {Mariani, Stefano},
cycle = {LM},
description = {In the so-called Semantic Web, ontology-based inference engines are a common solution for providing semantic reasoning capabilities to applications devoted to textual information management. Despite their constant improvement, these engines often perform quite expensive computations even for simple inferences, thus are impractical for scenarios like the IoT or pervasive systems in general. Also, they obviously rely on the availability (and, completeness and correctness) of the ontologies upon which to ground reasoning. Similarity measures instead, are usually less accurate and powerful, but requires less computational resources and are more computationally efficient. The aim of the thesis is that of performing a survey of the state of art regarding ontology-based inference and similarity measures in the context of textual document management, then to investigate the applicability and expressiveness of both approaches, in the sense of the types of inferences that can be drawn, to implement matchmaking mechanisms for the aggregation reaction of the MoK model.},
keywords = {MoK, similarit\`{a} sintattica, similarit\`{a} semantica, text mining},
language = {it},
month = mar,
start = {2016-09-13},
supervisor = {Omicini, Andrea},
title = {Aggregazione di dati testuali in MoK: matchmaking basato su ontologie o similarit\`{a}},
type = {Master's thesis},
year = 2017
}
abstract = {Sono stati inizialmente analizzati due approcci per il calcolo di similarit\`{a}: uno basato su ontologie e l'altro basato su misure di similarit\`{a}. Con l'obiettivo di realizzare un sistema di aggregazione di conoscenza sono state illustrate, attraverso uno studio sullo stato dell'arte, le propriet\`{a} computazionali di tali approcci. Successivamente \`{e} stato effettuato uno studio che ha permesso di individuare tre strumenti per ogni approccio. Tra questi si \`{e} cercato di selezionare quello ottimale per ogni approccio che rispettasse determinati requisiti di espressivit\`{a} computazionale e di performance. A tale scopo \`{e} stato necessario introdurre dei test. Dai risultati ottenuti si \`{e} potuti giungere alla scelta del motore di inferenza semantica Hermit, definito come approccio semantico, e dell'algoritmo Generalized Jaccard per il calcolo di similarit\`{a} sintattica, definito come approccio non-semantico, come strumenti ottimali. I risultati ottenuti dai test di performance hanno permesso di affermare che i due strumenti ottimali sono utilizzabili nel contesto dell'aggregazione di conoscenza individuato per il modello MoK. É stato pertanto progettato un sistema di aggregazione di cui sono state realizzate due versioni per aggregare frasi, una per l'approccio semantico e l'altra per quello non-semantico. Entrambe si compongono di tre passi realizzati ispirandosi al modello MoK: aggregazione di soli atomi, aggregazione di atomi in molecole gi\`{a} esistenti e aggregazione di sole molecole. Per l'approccio non-semantico \`{e} risultato immediato, una volta scelto il dataset, implementare il comportamento di ognuno dei tre passi, mentre per quello semantico \`{e} stato necessario introdurre un'apposito algoritmo di aggregazione che utilizza l'ontologia WordNet per riconoscere i sinonimi tra due frasi. Per verificare la validit\`{a} di ciascun approccio \`{e} stato introdotto un apposito metodo di validazione grazie al quale \`{e} stato possibile mettere a confronto fra i due approcci.},
amseprint = {12876},
amspractice = {830561},
author = {Fattori, Matteo},
available = {2016-05-16},
cosupervisor = {Mariani, Stefano},
cycle = {LM},
description = {In the so-called Semantic Web, ontology-based inference engines are a common solution for providing semantic reasoning capabilities to applications devoted to textual information management. Despite their constant improvement, these engines often perform quite expensive computations even for simple inferences, thus are impractical for scenarios like the IoT or pervasive systems in general. Also, they obviously rely on the availability (and, completeness and correctness) of the ontologies upon which to ground reasoning. Similarity measures instead, are usually less accurate and powerful, but requires less computational resources and are more computationally efficient. The aim of the thesis is that of performing a survey of the state of art regarding ontology-based inference and similarity measures in the context of textual document management, then to investigate the applicability and expressiveness of both approaches, in the sense of the types of inferences that can be drawn, to implement matchmaking mechanisms for the aggregation reaction of the MoK model.},
keywords = {MoK, similarit\`{a} sintattica, similarit\`{a} semantica, text mining},
language = {it},
month = mar,
start = {2016-09-13},
supervisor = {Omicini, Andrea},
title = {Aggregazione di dati testuali in MoK: matchmaking basato su ontologie o similarit\`{a}},
type = {Master's thesis},
year = 2017
}