Performability issues of fault tolerance solutions for message-passing systems

¿Es adecuado un sistema rápido pero poco robusto?¿Es adecuado un sistema disponible pero lento? Estas dos cuestiones representan la importancia de prestaciones y disponibilidad en clusters de computadores. Esta tesis se enmarca en el estudio de la relación entre prestaciones y disponibilidad cuando...

ver descrição completa

Detalhes bibliográficos
Autor: Santos, Guna Alexander Silva dos
Formato: tesis doctoral
Fecha de publicación:2009
País:España
Recursos:Universitat Autònoma de Barcelona
Repositorio:Dipòsit Digital de Documents de la UAB
Idioma:inglés
OAI Identifier:oai:ddd.uab.cat:55473
Acesso em linha:https://ddd.uab.cat/record/55473
Access Level:acceso abierto
Palavra-chave:Ordinadors
Ordinadors digitals
Cluster, Anàlisi de
Tolerància als errors (Informàtica)
id ES_40bfebf28aa4acd137442d9a8f2ba230
oai_identifier_str oai:ddd.uab.cat:55473
network_acronym_str ES
network_name_str España
repository_id_str
dc.title.none.fl_str_mv Performability issues of fault tolerance solutions for message-passing systems
the case of RADIC
title Performability issues of fault tolerance solutions for message-passing systems
spellingShingle Performability issues of fault tolerance solutions for message-passing systems
Santos, Guna Alexander Silva dos
Ordinadors
Ordinadors
Ordinadors digitals
Cluster, Anàlisi de
Tolerància als errors (Informàtica)
title_short Performability issues of fault tolerance solutions for message-passing systems
title_full Performability issues of fault tolerance solutions for message-passing systems
title_fullStr Performability issues of fault tolerance solutions for message-passing systems
title_full_unstemmed Performability issues of fault tolerance solutions for message-passing systems
title_sort Performability issues of fault tolerance solutions for message-passing systems
dc.creator.none.fl_str_mv Santos, Guna Alexander Silva dos
author Santos, Guna Alexander Silva dos
author_facet Santos, Guna Alexander Silva dos
author_role author
dc.contributor.none.fl_str_mv Rexachs, Dolores
dc.subject.none.fl_str_mv Ordinadors
Ordinadors
Ordinadors digitals
Cluster, Anàlisi de
Tolerància als errors (Informàtica)
topic Ordinadors
Ordinadors
Ordinadors digitals
Cluster, Anàlisi de
Tolerància als errors (Informàtica)
description ¿Es adecuado un sistema rápido pero poco robusto?¿Es adecuado un sistema disponible pero lento? Estas dos cuestiones representan la importancia de prestaciones y disponibilidad en clusters de computadores. Esta tesis se enmarca en el estudio de la relación entre prestaciones y disponibilidad cuando un cluster de computadores basado en el modelo de paso de mensajes, usa un protocolo de tolerancia a fallos basado en rollback-recovery con log de mensajes pesimista. Esta relación también es conocida como performability. Los principales factores que influyen en la performability cuando se usa la arquitectura de tolerancia a fallos RADIC son identificados y estudiados. Los factores fundamentales son la latencia de envío de mensajes que se incrementa cuando se usa el log pesimista, que implica una perdida de prestaciones, como también la replicación de los datos redundantes (checkpoint y log) necesaria para el incremento de la disponibilidad en RADIC y el cambio de la distribución de procesos por nodo causada por los fallos, que pueden causar degradación de las prestaciones así como las paradas por mantenimiento preventivo. Para tratar estos problemas se proponen alternativas de diseño basadas en análisis de la performability. La pérdida de prestaciones causada por el log y la replicación ha sido mitigada usando la técnica de pipeline. El cambio en la distribución de procesos por nodo puede ser evitado o restaurada usando un mecanismo flexible y transparente de redundancia dinámica que ha sido propuesto, que permite inserción dinámica de nodos spare o de repuesto. Los resultados obtenidos demuestran que las contribuciones presentadas son capaces de mejorar la performability de un cluster de computadores cuando se usa una solución de tolerancia a fallos como RADIC.
publishDate 2009
dc.date.none.fl_str_mv 2
2009-01-01
2009
2009-01-01
dc.type.none.fl_str_mv Tesi doctoral
http://purl.org/coar/resource_type/c_db06
VoR
http://purl.org/coar/version/c_970fb48d4fbd8a85
dc.type.openaire.fl_str_mv info:eu-repo/semantics/doctoralThesis
format doctoralThesis
dc.identifier.none.fl_str_mv https://ddd.uab.cat/record/55473
url https://ddd.uab.cat/record/55473
dc.language.none.fl_str_mv Inglés
eng
language_invalid_str_mv Inglés
language eng
dc.rights.none.fl_str_mv open access
http://purl.org/coar/access_right/c_abf2
https://rightsstatements.org/vocab/InC/1.0/
dc.rights.openaire.fl_str_mv info:eu-repo/semantics/openAccess
rights_invalid_str_mv open access
http://purl.org/coar/access_right/c_abf2
https://rightsstatements.org/vocab/InC/1.0/
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Universitat Autònoma de Barcelona
publisher.none.fl_str_mv Universitat Autònoma de Barcelona
dc.source.none.fl_str_mv reponame:Dipòsit Digital de Documents de la UAB
instname:Universitat Autònoma de Barcelona
instname_str Universitat Autònoma de Barcelona
reponame_str Dipòsit Digital de Documents de la UAB
collection Dipòsit Digital de Documents de la UAB
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869406778430586880
spelling Performability issues of fault tolerance solutions for message-passing systemsthe case of RADICSantos, Guna Alexander Silva dosOrdinadorsOrdinadorsOrdinadors digitalsCluster, Anàlisi deTolerància als errors (Informàtica)¿Es adecuado un sistema rápido pero poco robusto?¿Es adecuado un sistema disponible pero lento? Estas dos cuestiones representan la importancia de prestaciones y disponibilidad en clusters de computadores. Esta tesis se enmarca en el estudio de la relación entre prestaciones y disponibilidad cuando un cluster de computadores basado en el modelo de paso de mensajes, usa un protocolo de tolerancia a fallos basado en rollback-recovery con log de mensajes pesimista. Esta relación también es conocida como performability. Los principales factores que influyen en la performability cuando se usa la arquitectura de tolerancia a fallos RADIC son identificados y estudiados. Los factores fundamentales son la latencia de envío de mensajes que se incrementa cuando se usa el log pesimista, que implica una perdida de prestaciones, como también la replicación de los datos redundantes (checkpoint y log) necesaria para el incremento de la disponibilidad en RADIC y el cambio de la distribución de procesos por nodo causada por los fallos, que pueden causar degradación de las prestaciones así como las paradas por mantenimiento preventivo. Para tratar estos problemas se proponen alternativas de diseño basadas en análisis de la performability. La pérdida de prestaciones causada por el log y la replicación ha sido mitigada usando la técnica de pipeline. El cambio en la distribución de procesos por nodo puede ser evitado o restaurada usando un mecanismo flexible y transparente de redundancia dinámica que ha sido propuesto, que permite inserción dinámica de nodos spare o de repuesto. Los resultados obtenidos demuestran que las contribuciones presentadas son capaces de mejorar la performability de un cluster de computadores cuando se usa una solución de tolerancia a fallos como RADIC.Is a fast but fragile system good? Is an available but slow system good? These two questions demonstrate the importance of performance and availability in computer clusters. This thesis addresses issues correlated to performance and availability when a rollback- recovery pessimistic message log based fault tolerance protocol is applied into a computer cluster based on the message-passing model. Such a correlation is also known as performability. The root factors influencing the performability when using the RADIC (Redundant Array of Distributed Independent Fault Tolerance Controllers) fault tolerance architecture are raised and studied. Factors include the message delivery latency, which increases when using pessimistic logging causing performance overhead, as also in the redundant data (logs and checkpoints) replication needed to increase availability in RADIC and the process per node distribution changed by faults, which may cause performance degradation and preventive maintenance stops. In order to face these problems some alternatives are presented based on a performability analysis. Using a pipeline approach the performance overhead of message logging and the redundant data replication were mitigated. Changes in the process per node distribution can be avoided or restored using the flexible and transparent mechanism for dynamic redundancy proposed, or using a dynamic insertion of spare or replacement nodes.Universitat Autònoma de BarcelonaRexachs, Dolores 22009-01-0120092009-01-01Tesi doctoralhttp://purl.org/coar/resource_type/c_db06VoRhttp://purl.org/coar/version/c_970fb48d4fbd8a85info:eu-repo/semantics/doctoralThesisapplication/pdfhttps://ddd.uab.cat/record/55473reponame:Dipòsit Digital de Documents de la UABinstname:Universitat Autònoma de BarcelonaInglésengopen accesshttp://purl.org/coar/access_right/c_abf2Aquest material està protegit per drets d'autor i/o drets afins. Podeu utilitzar aquest material en funció del que permet la legislació de drets d'autor i drets afins d'aplicació al vostre cas. Per a d'altres usos heu d'obtenir permís del(s) titular(s) de drets.https://rightsstatements.org/vocab/InC/1.0/info:eu-repo/semantics/openAccessoai:ddd.uab.cat:554732026-06-06T12:50:31Z
score 15,198674