Contributions for active querying in constrained clustering with neighborhood-based methods

Agrupamento por restrição permite incorporar conhecimento prévio sobre os dados no processo de agrupamento, por meio do uso de restrições. Restrições a nível de instância estão entre as mais utilizadas e fornecem informação sobre pares de instâncias que devem estar no mesmo grupo (restrição must-lin...

Descripción completa

Detalles Bibliográficos
Autor: Paz, Hério Ênio de Sousa [UNIFESP]
Tipo de recurso: tesis doctoral
Estado:Versión publicada
Fecha de publicación:2022
País:Brasil
Institución:Universidade Federal de São Paulo (UNIFESP)
Repositorio:Repositório Institucional da UNIFESP
Idioma:inglés
OAI Identifier:oai:repositorio.unifesp.br:11600/63763
Acceso en línea:https://hdl.handle.net/11600/63763
Access Level:acceso abierto
Palabra clave:Constrained clustering
Active querying
Constraint selections
Heuristics
Number of clusters
Descripción
Sumario:Agrupamento por restrição permite incorporar conhecimento prévio sobre os dados no processo de agrupamento, por meio do uso de restrições. Restrições a nível de instância estão entre as mais utilizadas e fornecem informação sobre pares de instâncias que devem estar no mesmo grupo (restrição must-link) ou que devem estar em grupos diferentes (cannot-link). Algoritmos de consulta ativa podem ser usados para determinar os pares de instâncias mais informativos a terem os seus rótulos reais consultados de forma a determinar se eles devem estar em um mesmo grupo ou não. Algoritmos de consulta ativa baseados em vizinhança usam os resultados das consultas para construir esqueletos dos grupos em que cada vizinhança corresponde a um grupo de instância com restrições must-link, separada das outras vizinhanças por restrições cannot-link. Este trabalho analisa algoritmos de consulta ativa baseados em vizinhança e como eles se comportam quando acoplados a diferentes algoritmos de agrupamento por restrições. Novos algoritmos de agrupamento baseados em informação extraída de uma árvore geradora mínima construída a partir dos dados também são introduzidos. Essa estrutura permite a identificação de pares de instâncias que estão próximas entre si mas colocadas em grupos diferentes, bem como instâncias em um mesmo grupo que estão distantes umas das outras. Experimentos ilustram as situações onde algoritmos de consulta ativa são benéficos e o impacto da escolha das combinações de algoritmos de agrupamento por restrições e algoritmos de consulta ativa na qualidade da partição. Além disso, este trabalho também demonstra a viabilidade de identificar automaticamente o número de grupos nos dados por meio de modificações em algoritmos tradicionais de consulta ativa baseados em vizinhança.