Resumen
El análisis de datos es la ciencia que tiene como objetivo estudiar los conjuntos de datos, con el objetivo de obtener la mayor cantidad de información para aumentar los conocimientos sobre un tema, o para poder tomar decisiones con fundamento. Este trabajo lleva a cabo un análisis de datos sobre un dataset, que contiene datos de los hospitales de salud pública de Estados Unidos, con el objetivo de extraer la mayor información posible. Para ello se han realizado distintos tipos de análisis iniciales para comprobar cómo se organiza dicho dataset, o las variables que lo componen. A continuación y una vez realizado la preparación de los datos, se ha procedido a ejecutar diversos algoritmos, entre los que se encuentran el clustering de densidad, el clustering jerárquico, el algoritmo k-modes, el análisis discriminante o los árboles de clasificación. Los resultados obtenidos con estos algoritmos son analizados para comprobar la efectividad de cada uno de ellos, para concluir con la realización de un modelo final en el que se combina la ejecución de forma consecutiva, de los dos algoritmos que mejores resultados han presentado para tratar de optimizar dicho proceso.---ABSTRACT---Data analysis is the science that aims to study data sets, with the aim of obtaining the greatest amount of information to increase knowledge about a topic, or to be able to make informed decisions. This work carries out a data analysis on a dataset, which contains data from public health hospitals in the United States, with the aim of extracting as much information as possible. For this, different types of initial analyzes have been carried out to verify how said data set is organized, or the variables that compose it. Next, and once the data preparation has been carried out, various algorithms have been executed, among which are density clustering, hierarchical clustering, the k-modes algorithm, discriminant analysis or classification trees. The results obtained with these algorithms are analyzed to check the effectiveness of each one of them, to conclude with the realization of a final model in which the consecutive execution of the two algorithms that have presented the best results is combined to try to optimize this process.