On Language and Structure in Polarized Communities

[ES] En esta tesis abordamos el problema de la detección de las opiniones (stance detection, SD) en las redes sociales, centrándose en los debates políticos polarizados en Twitter. La SD consiste en determinar automáticamente si el autor de una publicación está a favor o en contra de un objetivo de...

Descripción completa

Detalles Bibliográficos
Autor: Lai, Mirko
Tipo de recurso: tesis doctoral
Fecha de publicación:2019
País:España
Institución:Universitat Politècnica de València (UPV)
Repositorio:RiuNet. Repositorio Institucional de la Universitat Politécnica de Valéncia
Idioma:inglés
OAI Identifier:oai:riunet.upv.es:10251/119116
Acceso en línea:https://riunet.upv.es/handle/10251/119116
Access Level:acceso abierto
Palabra clave:Natural Language Processing
Stance Detetecion
Polarized Communities
Political Debates
LENGUAJES Y SISTEMAS INFORMATICOS
Descripción
Sumario:[ES] En esta tesis abordamos el problema de la detección de las opiniones (stance detection, SD) en las redes sociales, centrándose en los debates políticos polarizados en Twitter. La SD consiste en determinar automáticamente si el autor de una publicación está a favor o en contra de un objetivo de interés, o si no se puede inferir la opinión. Nos ocupamos de temas políticos como las elecciones políticas y los referendos y, como resultado, los objetivos son tanto personas como referendos. También exploramos las comunicaciones que tienen lugar en estos debates polarizados, arrojando luz sobre las dinámicas de comunicación entre personas que tienen opiniones en acuerdo o en conflicto, enfocándonos en particular en la observación del cambio de opiniones (opinion shifting). Proponemos modelos de aprendizaje automático para la SD como si fuera un problema de clasificación binaria. Exploramos características basadas en el contenido del texto del tweet, además usamos características basadas en información contextual que no emerge directamente del texto. Utilizando el corpus de benchmark propuesto para la tarea compartida sobre la SD realizado para SemEval 2016, exploramos la contribución que el estudio de las relaciones entre el objetivo de interés y las otras entidades involucradas en el debate proporciona a la SD. Al participar en la tarea ``Stance and Gender Detection in Tweets on Catalan Independence'' organizado para IberEval 2017, hemos propuesto otras características textuales y contextuales para la SD en tweets en español y en catalán. Explorando la SD desde una perspectiva multilingüe, hemos creado un corpus de tweets en francés y uno en italiano. La extensión multilingüe de nuestro modelo (multiTACOS) muestra que la SD está influenciada más por los diferentes estilos utilizados por los usuarios para comunicar la opinión sobre objetivos de diferentes tipos (personas o referendos) en lugar del idioma utilizado. Con el objetivo de recuperar información contextual sobre la red social de los usuarios de Twitter (generalmente las tareas compartidas solo consisten en el contenido del tweet, dejando de lado la información sobre el usuario), hemos creado otros dos conjuntos de datos, uno en inglés y uno en italiano, respectivamente, sobre el Brexit (TW-BREXIT) y sobre el referéndum constitucional italiano (ConRef-STANCE-ita). En ambos casos de estudio, mostramos que los usuarios tienden a agruparse en grupos con ideas similares. Por este motivo, el modelo que explota el conocimiento de la comunidad social a la que el autor del tweet pertenece, supera los resultados obtenidos utilizando solo las funciones basadas en el contenido de la publicación. Además, la evidencia muestra que los usuarios utilizan diferentes tipos de comunicación según el nivel de acuerdo con la opinión del interlocutor, por ejemplo, las relaciones de amistad, los retweets y las citas (quote) son más comunes entre los usuarios relacionados, mientras que las respuestas (replies) se utilizan a menudo para interactuar con usuarios que tienen diferentes posiciones. Al abordar la SD desde una perspectiva diacrónica, también observamos tanto el cambio de opinión como la mitigación del debate hacia posiciones neutrales después del resultado de la votación. Además, hemos observado que tener contacto con una variedad más amplia de opiniones puede influir en la propensión a cambiar de opinión. Finalmente, mostramos que las características basadas en una representación gráfica de un dominio de interés no se limitan a la SD, sino que se puede aplicar a diferentes escenarios. Al proponer otra tarea de clasificación que realiza la identificación del talento en el deporte, especialmente en el estudio de caso del tenis de mesa, mostramos que las métricas de redes basadas en la centralidad son una señal fuerte para el talento y pueden usarse para entrenar un modelo de algoritmo de aprendizaje automático para enfrentar esta