Detection of toxicity in social media. A study on semantic orientation and linguistic structure

Las redes sociales han crecido mucho en popularidad recientemente y esto ha permitido a los usuarios estar conectados con sus amigos y familiares, además de permitirles encontrar nuevos contactos tanto en el área personal como en la académica o personal. No cabe duda de que los beneficios de las red...

Descripción completa

Detalles Bibliográficos
Autor: Nogués Graell, Jordina
Tipo de recurso: tesis de maestría
Fecha de publicación:2022
País:España
Institución:Universidad Nacional de Educación a Distancia
Repositorio:e-spacio. Repositorio Institucional de la UNED
Idioma:inglés
OAI Identifier:oai:e-spacio.uned.es:20.500.14468/14303
Acceso en línea:https://hdl.handle.net/20.500.14468/14303
Access Level:acceso abierto
Palabra clave:1203 Ciencia de los ordenadores
Descripción
Sumario:Las redes sociales han crecido mucho en popularidad recientemente y esto ha permitido a los usuarios estar conectados con sus amigos y familiares, además de permitirles encontrar nuevos contactos tanto en el área personal como en la académica o personal. No cabe duda de que los beneficios de las redes sociales durante la pandemia de COVID-19 fueron increíbles, ya que permitieron un entorno virtual para encuentros sociales. Sin embargo, las redes sociales tienen una cara oscura que se muestra en forma de contenido tóxico. Esta toxicidad que está presente en muchas redes sociales ha alarmado tanto a los usuarios como a los investigadores y las compañías y por ello se ha dado un incremento en los estudios y trabajos relacionados con la detección y prevención de la toxicidad en las redes sociales. Aunque no es fácil de describir qué se entiendo por tóxico, la comunidad científica ha trabajado según su propio entendimiento de lo que abarca el término o según sus necesidades a cubrir para definir lo que se entiende por tóxico y qué formas de contenido tóxico existen en línea, además de cómo detectar la toxicidad utilizando diferentes aproximaciones de machine learning. Este trabajo se basa en la detección de toxicidad en las redes sociales y se centra en el uso del sesgo en la orientación semántica y la estructura lingüística de los mensajes para detectar contenido tóxico. En concreto, nos basamos en el término anisotropía: el significado de los vectores de palabras se distribuye según una orientación particular en el espacio semántico. Por ello, utilizamos embeddings estáticos (Static Word Emgeddings), ya que permiten mantener las propiedades semánticas del significado de las palabras que representan. Siguiendo esta idea hemos realizado varios experimentos en proximidad vectorial y proximidad de orientación para determinar y predecir contenido tóxico. El segundo pilar de este trabajo se basa en explorar si la estructura lingüística influencia la detección de contenido tóxico. Es decir, si hay categorías gramaticales o estructuras lingüísticas que tienen un impacto en la detección de la toxicidad y cómo se pueden crear vectores de frase mediante composición para abordar este mismo proceso a nivel de frases. Para ello, hemos realizado iv diferentes experimentos para demostrar qué estructura lingüística era más relevante para tener en cuenta. A nivel de palabra, hemos seleccionado los sustantivos, además de excluir las stopwords (ya que presentan sesgos inherentes en la orientación semántica); a nivel de frase, hemos compuesto los vectores de las palabras de manera linear utilizando una función de promedio general (global average), que nos ha permitido calcular el vector promedio de los vectores de las palabras que componen la frase para obtener el vector de la frase. Los resultados obtenidos de esta investigación nos han permitido afirmar que el contenido tóxico presenta una orientación direccional en el espacio semántico, además de permitirnos demostrar que la estructura lingüística también juega un papel relevante en este tipo de contenido.