Detección de urls maliciosas mediante aprendizaje automático
Los ciberataques han experimentado un incremento significativo, es común encontrarse con palabras como phishing, hackeos, fraudes informática, entre otros, en nuestro día a día. Si bien los avances tecnológicos han contribuido a la mejora de vida, también han traído consigo técnicas más sofisticadas...
| Autor: | |
|---|---|
| Tipo de recurso: | tesis de maestría |
| Fecha de publicación: | 2024 |
| País: | España |
| Institución: | Universidad Complutense de Madrid (UCM) |
| Repositorio: | Docta Complutense |
| Idioma: | español |
| OAI Identifier: | oai:docta.ucm.es:20.500.14352/109077 |
| Acceso en línea: | https://hdl.handle.net/20.500.14352/109077 |
| Access Level: | acceso abierto |
| Palabra clave: | 004(043.3) Aprendizaje Automático URL maliciosa Clasificación Detección Características léxicas Phishing Machine Learning Malicious URL Classification Detection Lexical features Informática (Informática) 33 Ciencias Tecnológicas |
| Sumario: | Los ciberataques han experimentado un incremento significativo, es común encontrarse con palabras como phishing, hackeos, fraudes informática, entre otros, en nuestro día a día. Si bien los avances tecnológicos han contribuido a la mejora de vida, también han traído consigo técnicas más sofisticadas para atacar y estafar a los usuarios. Una de las técnicas empleadas por los atacantes es la propagación de URLs maliciosas. El simple acto de realizar clic en URLs erróneas puede traer consigo grandes consecuencias para el usuario. En el presente trabajo de máster aborda la detección de URLs mediante aprendizaje automático. Un enfoque que ha demostrado ser eficaz para combatir las URL maliciosas. Durante la fase inicial se llevó a cabo una recopilación y creación de un conjunto de datos a partir de diferentes fuentes con un total de cuatro categorías de URL: phishing, malware, defacement y benigna. Este proceso fue seguido de la extracción de atributos asociados a las URL, extrayendo un total de 16 atributos como longitud de la URL, días que lleva activo el dominio, entropía y atributos similares. Además, se aplicaron técnicas de preprocesamiento de datos como la eliminación de valores duplicados y escalado de los datos para minimizar los valores atípicos. En la fase de experimentación, se seleccionaron cinco modelos de aprendizaje automático: bosques aleatorios, regresión logística, support vector machine, k vecinos más próximos y redes neuronales. La fase de experimentación se finalizó con una evaluación de las métricas y rendimiento de cada modelo para la dentificación y clasificación de URLs. Por último, como parte del proyecto, se desarrolló una interfaz gráfica que permite la interacción directa con los modelos entrenados, facilitando así la compresión de los resultados. |
|---|