Contributions for active querying in constrained clustering with neighborhood-based methods
Agrupamento por restrição permite incorporar conhecimento prévio sobre os dados no processo de agrupamento, por meio do uso de restrições. Restrições a nível de instância estão entre as mais utilizadas e fornecem informação sobre pares de instâncias que devem estar no mesmo grupo (restrição must-lin...
| Autor: | |
|---|---|
| Tipo de recurso: | tesis doctoral |
| Estado: | Versión publicada |
| Fecha de publicación: | 2022 |
| País: | Brasil |
| Institución: | Universidade Federal de São Paulo (UNIFESP) |
| Repositorio: | Repositório Institucional da UNIFESP |
| Idioma: | inglés |
| OAI Identifier: | oai:repositorio.unifesp.br:11600/63763 |
| Acceso en línea: | https://hdl.handle.net/11600/63763 |
| Access Level: | acceso abierto |
| Palabra clave: | Constrained clustering Active querying Constraint selections Heuristics Number of clusters |
| Sumario: | Agrupamento por restrição permite incorporar conhecimento prévio sobre os dados no processo de agrupamento, por meio do uso de restrições. Restrições a nível de instância estão entre as mais utilizadas e fornecem informação sobre pares de instâncias que devem estar no mesmo grupo (restrição must-link) ou que devem estar em grupos diferentes (cannot-link). Algoritmos de consulta ativa podem ser usados para determinar os pares de instâncias mais informativos a terem os seus rótulos reais consultados de forma a determinar se eles devem estar em um mesmo grupo ou não. Algoritmos de consulta ativa baseados em vizinhança usam os resultados das consultas para construir esqueletos dos grupos em que cada vizinhança corresponde a um grupo de instância com restrições must-link, separada das outras vizinhanças por restrições cannot-link. Este trabalho analisa algoritmos de consulta ativa baseados em vizinhança e como eles se comportam quando acoplados a diferentes algoritmos de agrupamento por restrições. Novos algoritmos de agrupamento baseados em informação extraída de uma árvore geradora mínima construída a partir dos dados também são introduzidos. Essa estrutura permite a identificação de pares de instâncias que estão próximas entre si mas colocadas em grupos diferentes, bem como instâncias em um mesmo grupo que estão distantes umas das outras. Experimentos ilustram as situações onde algoritmos de consulta ativa são benéficos e o impacto da escolha das combinações de algoritmos de agrupamento por restrições e algoritmos de consulta ativa na qualidade da partição. Além disso, este trabalho também demonstra a viabilidade de identificar automaticamente o número de grupos nos dados por meio de modificações em algoritmos tradicionais de consulta ativa baseados em vizinhança. |
|---|