<?xml version="1.0" encoding="ISO-8859-1"?><article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
<front>
<journal-meta>
<journal-id>2415-2323</journal-id>
<journal-title><![CDATA[Revista de Investigación Estudiantil Iluminate ]]></journal-title>
<abbrev-journal-title><![CDATA[Rev. Inv. Est. I.]]></abbrev-journal-title>
<issn>2415-2323</issn>
<publisher>
<publisher-name><![CDATA[UNIVERSIDAD LA SALLE]]></publisher-name>
</publisher>
</journal-meta>
<article-meta>
<article-id>S2415-23232020000100005</article-id>
<title-group>
<article-title xml:lang="es"><![CDATA[Análisis de riesgo para préstamos bancarios]]></article-title>
<article-title xml:lang="en"><![CDATA[Risk analysis for bank loans]]></article-title>
</title-group>
<contrib-group>
<contrib contrib-type="author">
<name>
<surname><![CDATA[Vilca Paredes]]></surname>
<given-names><![CDATA[Juan Salvador]]></given-names>
</name>
</contrib>
</contrib-group>
<aff id="A">
<institution><![CDATA[,  ]]></institution>
<addr-line><![CDATA[ ]]></addr-line>
</aff>
<pub-date pub-type="pub">
<day>00</day>
<month>11</month>
<year>2020</year>
</pub-date>
<pub-date pub-type="epub">
<day>00</day>
<month>11</month>
<year>2020</year>
</pub-date>
<volume>12</volume>
<numero>1</numero>
<fpage>47</fpage>
<lpage>61</lpage>
<copyright-statement/>
<copyright-year/>
<self-uri xlink:href="http://www.scielo.br/scielo.php?script=sci_arttext&amp;pid=S2415-23232020000100005&amp;lng=en&amp;nrm=iso&amp;tlng=en"></self-uri><self-uri xlink:href="http://www.scielo.br/scielo.php?script=sci_abstract&amp;pid=S2415-23232020000100005&amp;lng=en&amp;nrm=iso&amp;tlng=en"></self-uri><self-uri xlink:href="http://www.scielo.br/scielo.php?script=sci_pdf&amp;pid=S2415-23232020000100005&amp;lng=en&amp;nrm=iso&amp;tlng=en"></self-uri><abstract abstract-type="short" xml:lang="es"><p><![CDATA[Resumen En estos tiempos de pandemia, existen muchas dificultades a la hora de saber a quién prestar, inclusive si el cliente es una persona que demuestra solvencia. El objetivo es identificar si es prudente o no realizar un préstamo a los clientes según el monto del préstamo que solicitan y los datos que se tienen de los mismos. Es un problema de clasificación para predecir si es recomendable o no un préstamo. Se debe predecirvalores discretos basados en un conjunto dado de variables independientes. Se empleo la metodología cuantitativa con diseño de investigación no experimental en el tipo de estudio correlacional. Los resultados fueron que no siempre las hipótesis pueden estar alineadas con el análisis y evaluación de los datos, pues los resultados demostraron que los solicitantes con más ingresos no necesariamente eran los que tenían mayor posibilidad de acceder al préstamo.]]></p></abstract>
<abstract abstract-type="short" xml:lang="en"><p><![CDATA[Abstract In these times of pandemic, there are many diffículties when it comes to knowing Iwho to lend to, even if the client is a person who demonstrates solvency. The objective is to identify whether or not it is prudent to make a loan to clients based on the amount of the loan they request and the data they have about them. It is a classification problem to predict whether or not a loan is recommended. Discrete valúes must be predicted based on a given set of independent variables. The quantitative methodology was used with a non-experimental research design in the correlational type of study. The results were that the hypotheses could not always be aligned with the analysis and evaluation of the data, since the results showed that the applicants with the highest income were not necessarily the ones with the greatest possibility of accessing the loan]]></p></abstract>
<kwd-group>
<kwd lng="es"><![CDATA[Aprendizaje automático]]></kwd>
<kwd lng="es"><![CDATA[ciencia de datos]]></kwd>
<kwd lng="es"><![CDATA[clasificación]]></kwd>
<kwd lng="es"><![CDATA[python,]]></kwd>
<kwd lng="es"><![CDATA[regresión logística]]></kwd>
<kwd lng="en"><![CDATA[Machine learning,]]></kwd>
<kwd lng="en"><![CDATA[data science,]]></kwd>
<kwd lng="en"><![CDATA[classification]]></kwd>
<kwd lng="en"><![CDATA[python,]]></kwd>
<kwd lng="en"><![CDATA[logistic regression]]></kwd>
</kwd-group>
</article-meta>
</front><body><![CDATA[ <p align="right"><font color="#000000" size="2" face="Verdana, Arial, Helvetica, sans-serif"><b>ART&Iacute;CULO  ORIGINAL</b></font></p>     <p align="right">&nbsp;</p>     <p align="center"><font size="2" face="Verdana, Arial, Helvetica, sans-serif"><b><font size="4">An&aacute;lisis de riesgo  para pr&eacute;stamos bancarios</font></b></font></p>     <p align="center">&nbsp;</p>     <p align="center"><font size="4"><b><font size="3" face="Verdana, Arial, Helvetica, sans-serif">Risk analysis for bank loans</font></b></font></p>     <p align="center">&nbsp;</p>     <p align="center">&nbsp;</p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Juan Salvador Vilca Paredes</b></font>    <br> *<a href="mailto:slvdrvlc@gmail.com">slvdrvlc@gmail.com</a><font face="Verdana, Arial, Helvetica, sans-serif" size="2"> Instituto de Investigación en Ciencia y Tecnología, Universidad La Salle - Bolivia</font>    <br>   <font face="Verdana, Arial, Helvetica, sans-serif" size="2" color="#333333"><b>Art&iacute;culo recibido: </b>22-09-2020 <b>Art&iacute;culo aceptado: </b>05-11-2020</font></p>     ]]></body>
<body><![CDATA[<p align="center">&nbsp;</p>     <p align="center">&nbsp;</p> <hr>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Resumen</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">En estos tiempos de pandemia, existen muchas dificultades a la hora de saber a quién prestar, inclusive si el cliente es una persona que demuestra solvencia. El objetivo es identificar si es prudente o no realizar un préstamo a los clientes según el monto del préstamo que solicitan y los datos que se tienen de los mismos. Es un problema de clasificación para predecir si es recomendable o no un préstamo. Se debe predecirvalores discretos basados en un conjunto dado de variables independientes. Se empleo la metodología cuantitativa con diseño de investigación no experimental en el tipo de estudio correlacional. Los resultados fueron que </font><font face="Verdana, Arial, Helvetica, sans-serif" size="2" color="#333333">no siempre las hipótesis pueden estar alineadas con el análisis y evaluación de los datos, pues los resultados demostraron que los solicitantes con más ingresos no necesariamente eran los que tenían mayor posibilidad de acceder al préstamo.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Palabras claves</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Aprendizaje automático, ciencia de datos, clasificación, python, regresión logística</font></p> <hr>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Abstract</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">In these times of pandemic, there are many diffículties when it comes to knowing Iwho to lend to, even if the client is a person who demonstrates solvency. The objective is to identify whether or not it is prudent to make a loan to clients based on the amount of the loan they request and the data they have about them. It is a classification problem to predict whether or not a loan is recommended. Discrete valúes must be predicted based on a given set of independent variables. The quantitative methodology was used with a non-experimental research design in the correlational type of study. The results were that the hypotheses could not always be aligned with the analysis and evaluation of the data, since the results showed that the applicants with the highest income were not necessarily the ones with the greatest possibility of accessing the loan</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Key words</b></font> <font face="Verdana, Arial, Helvetica, sans-serif" size="2">Machine learning, data science, classification, python, logistic regression </font></p> <hr>     <p align="justify">&nbsp;</p>     ]]></body>
<body><![CDATA[<p align="justify">&nbsp;</p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="3"><b>Introducción</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">La predicción de préstamos es un problema muy común de la vida real que cada banco enfrenta. Si se hace correctamente, puede ahorrar muchas horas de trabajo. Es importante tener en cuenta que las predicciones por lo general son de apoyo para la toma de decisiones, es decir, que apoyan a profesionales a tomar decisiones en sus áreas y no así reemplazarlos en sus tareas.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">El trabajo consiste en ayudar a una empresa bancaria que realiza préstamos con presencia en todas las áreas urbanas, semiurbanas y rurales. El cliente primero solicita un préstamo hipotecario después de que la compañía valida la elegibilidad del cliente para el préstamo. Sin embargo, hacer esto manualmente lleva mucho tiempo. Se propone realizar la predicción de la aprobación de los clientes para el préstamo ayudando de esta manera a respaldar la elegibilidad del préstamo en función de la información del cliente.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Se utilizó el modelo de regresión logística para realizar una clasificación binaria donde las predicciones fueron:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Y/1 (si) para indicar que el préstamo es recomendable. </font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">N/0(no) para indicar que el préstamo no es recomendable.</font></p> </blockquote>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Referentes conceptuales.</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">La Regresión Logística según Amat (2016), desarrollada por David Cox en 1958, es un método de regresión que permite estimar la probabilidad de una variable cualitativa binaria en función de una variable cuantitativa.</font></p>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Es un problema de clasificación en el que tenemos que predecir si se aprobase o no un préstamo. En un problema de clasificación, tenemos que predecir valores discretos basados en un conjunto dado de variables independientes, la clasificación puede ser de dos tipos:</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Clasificación binaria: en esta clasificación tenemos que predecir cualquiera de las dos clases dadas. Por ejemplo: clasificar el género como masculino o femenino, predecir el resultado como ganar o perder, etc., o como en este paso aceptar o rechazar la solicitud.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Clasificación multiclase: Aquí tenemos que clasificar los datos en tres o más clases. Por ejemplo: clasificar el género de una película como comedia, acción o romántico, clasificar frutas como naranjas, manzanas o peras, etc.</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Según Amat (2016):</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">&quot;Una de las principales aplicaciones de la regresión logística es la de clasificación binaria, en el que las observaciones se clasifican en un grupo u otro dependiendo del valor que tome la variable empleada como predictor. Por ejemplo, clasificar a un individuo desconocido como hombre o mujer en función del tamaño de la mandíbula&quot; (p.3).</font></p> </blockquote>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Para la predicción de la variable objetivo se aplica el modelo de regresión</font> <font face="Verdana, Arial, Helvetica, sans-serif" size="2">logística para predecir el resultado binario.</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Según Fernandez (2011):</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">&quot;Con el fin de estimar p = P<sub>1</sub> P<sub>2</sub> L pk y analizar el comportamiento del modelo estimado se toma una muestra aleatoria de tamaño n dada por (X. Y<sub>i)</sub>i =.,, <sub>2</sub>, ...,<sub>n</sub> donde el valor de las variables independientes es X. = (X<sub>n</sub> X<sub>i2</sub>,...', X<sub>ik</sub>) e Y<sub>i</sub> &isin; [0.1] es el valor observado de Y en el i-ésimo elemento de la muestra&quot; (p.4)</font></p> </blockquote>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">La regresión logística, a pesar de su nombre, es un modelo lineal para clasificación en lugar de regresión. La regresión logística también se conoce en la literatura como regresión logit, clasificación de máxima entropía (MaxEnt) o clasificador log-lineal. En este modelo, las probabilidades que describen los posibles resultados de un solo ensayo se modelan utilizando una función logística.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="3"><b>Métodos.</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Se emplean las siguientes librerías de Python:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;pandas</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;numpy</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;seaborn</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;matplotlib</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;sklearn</font></p> </blockquote>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Pandas </b>es una de las librerías de python más útiles para los científicos de datos. Las estructuras de datos principales en pandas son Series para datos en una dimensión y DataFrame para datos en dos dimensiones.</font></p>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Estas son las estructuras de datos más usadas en muchos campos tales como finanzas, estadística, ciencias sociales y muchas áreas de ingeniería. Pandas destaca por lo fácil y flexible que hace la manipulación de datos y el análisis de datos.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>NumPy </b>proporciona una estructura de datos universal que posibilita el análisis de datos y el intercambio de datos entre distintos algoritmos. Las estructuras de datos que implementa son vectores multidimensionales y matrices con capacidad para gran cantidad de datos. Además, esta librería proporciona funciones matemáticas de alto nivel que operan en estas estructuras de datos.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Seaborn </b>es una librería gráfica basada en matplotlib, especializada en la visualización de datos estadísticos. Se caracteriza por ofrecer un interfaz de alto nivel para crear gráficos estadísticos visualmente atractivos e informativos.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Seaborn considera la visualización como un aspecto fundamental a la hora de explorar y entender los datos. Se integra muy bien con la librería de manipulación de datos pandas.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Matplotlib </b>es la librería gráfica de python estándar y la más conocida. Se puede usar matplotlib para generar gráficos de calidad necesaria para publicarlas tanto en papel como digitalmente.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Con matplotlib se puede crear muchos tipos de gráficos: series temporales, histogramas, espectros de potencia, diagramas de barras, diagramas de errores, etc.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Scikit-learn </b>es una librería de python para Machine Learning y Análisis de Datos. Está basada en NumPy, SciPy y Matplotlib. Las ventajas principales de scikit-learn son su facilidad de uso y la gran cantidad de técnicas de aprendizaje automático que implementa.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Con scikit-learn se puede realizar aprendizaje supervisado y no supervisado. Podemos usarlo para resolver problemas tanto de clasificación y como de regresión.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Es muy fácil de usar y aprender porque tiene una interfaz simple y muy</font> <font face="Verdana, Arial, Helvetica, sans-serif" size="2">consistente. Se puede verificar que el interfaz es consistente cuando es posible cambiar de técnica de machine learning cambiando sólo una línea de código.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Otro punto a favor de scikit-learn es que los valores de los hiper-parámetros  tienen unos valores por defecto adecuados para la mayoría de los casos. Es una de las herramientas más eficientes que contiene muchas funciones incorporadas que se pueden usar para modelar en Python.</font></p>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Específicamente se utiliza la clase sklearn.linearmodel. Logistic Regression para implementar el modelo, el cual tiene los siguientes métodos:</font></p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fig. </b>1 Métodos de la clase Logistic Regression</font></p>     <p align="center"><img src="../img/revistas/riei/v12n1/a04_figura04.gif" width="925" height="337"></p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fuente: </b>Elaborado por: Sklearn</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">También es importante mencionar que las pruebas fueron realizadas en Google Colab.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Colab </b>es un servicio en la nube, basado en los Notebooks de Jupyter, que permite el uso gratuito de las GPUs y TPUs de Google, con librerías como: Scikit-learn, PyTorch, TensorFlow, Keras y OpenCV. Con Python 2.7 y 3.6, aún no está disponible para R y Scala.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Aunque tiene algunas limitaciones, es una herramienta ideal, no solo para</font> <font face="Verdana, Arial, Helvetica, sans-serif" size="2">practicar y mejorar nuestros conocimientos en técnicas y herramientas de Data Science y Machine Learning, sino también para el desarrollo de aplicaciones de deep learning, sin tener que invertir en recursos hardware o  en la nube.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Con Colab se pueden crear notebooks o importar los que ya tengamos  creados, además de compartirlos y exportarlos cuando queramos. Esta fluidez a la hora de manejar la información también es aplicable a las fuentes de datos que usemos en nuestros proyectos (notebooks), de modo que podremos trabajar con información contenida en nuestro propio Google Drive, unidad de almacenamiento local, github e incluso en otros sistemas de almacenamiento en la nube.</font></p>     <p align="justify">&nbsp;</p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="3"><b>Resultados y discusión </b></font></p>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Hipótesis</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Es muy útil e importante desarrollar algunas hipótesis en trabajos de aprendizaje automático, es necesario entender el problema a detalle entendiendo el enunciado del problema a fondo y antes de mirar los datos, con una lluvia de ideas de tantos factores como sea posible que puedan afectar el resultado</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Salario: </b>los solicitantes con altos ingresos deberían tener más posibilidades de aprobación del préstamo.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Historial previo: </b>los solicitantes que hayan pagado sus deudas anteriores deberían tener mayores posibilidades de aprobación del préstamo.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Monto del préstamo: </b>la aprobación del préstamo también debe depender del monto del préstamo. Si el monto del préstamo es menor, las posibilidades de aprobación del préstamo deben ser altas.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Plazo del préstamo: </b>el préstamo por un período de tiempo y una cantidad</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">menores debería tener mayores posibilidades de aprobación. </font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>EMI </b>(pago mensual estimado/cuota mensual): Cuanto menor sea la cantidad para pagar mensualmente para reembolsar el préstamo, mayores serán las posibilidades de aprobación del préstamo.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">El dataset tiene las siguientes características:</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>LoanJD: </b>ID de préstamo único</font></p>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Gender: </b>Genero (Masculino / Femenino)</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Married: </b>Estado civil (S / N)</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Dependents: </b>número de dependientes (0,1, 2, 3+)</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Education: </b>Educación del solicitante (graduado / no graduado)</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Self Employed: </b>Trabajadores por cuenta propia (S / N)</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Applicantlncome: </b>Ingresos del solicitante</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Coapplicantlncome: </b>Ingresos del garante</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>LoanAmount: </b>Monto del préstamo en miles de dólares</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Loan AmountTerm: </b>Plazo del préstamo</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Credit History: </b>Historial crediticio (S / N)</font></p>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Property Área: </b>área de ubicación del inmueble (Urbano / Semiurbano</font> <font face="Verdana, Arial, Helvetica, sans-serif" size="2">/ Rural)</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Loan Status: </b>Estado del préstamo (S / N) esta es la variable objetivo</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Las características de las variables del dataset son:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Características  categóricas:  estas  características  tienen   categorías (género, casado, autónomo, historial crediticio, estado del préstamo).</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Características ordinales: variables en características categóricas que tienen algún orden (dependientes, educación, área de propiedad).</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Características numéricas: estas características tienen valores numéricos (Ingreso del solicitante, Ingreso del garante, Monto del préstamo, Plazo del préstamo).</font></p> </blockquote>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Primero se realiza un análisis unitario de las variables, empezando por la variable objetivo LoanStatus que es categórica.</font></p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fig. 2</b> Tabla de solicitantes de préstamo aprobados y rechazados</font></p>     <p align="center"><img src="../img/revistas/riei/v12n1/a04_figura05.gif" width="362" height="235"></p>     ]]></body>
<body><![CDATA[<p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fuente: </b>Elaboración propia</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Donde se puede observar que, casi el doble de solicitantes es aprobado para el crédito.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Analizando las variables independientes categóricas se tiene:</font></p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fig.3 </b>Tablas de Genero, Casado, Autónomo e Historial crediticio del solicitante</font></p>     <p align="center"><img src="../img/revistas/riei/v12n1/a04_figura06.gif" width="616" height="318"></p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fuente: </b>Elaboración propia</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Se puede ver en los gráficos de barras anteriores que:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; El 80% de los solicitantes son hombres.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Alrededor del 65% de los solicitantes están casados.</font></p>       ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Alrededor del 15% de los solicitantes son autónomos.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Alrededor del 85% de los solicitantes tienen historial de crédito.</font></p> </blockquote>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Analizando las variables independientes ordinales se tiene:</font></p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fig. 4</b> Tabla de Dependientes, Educación y área de la propiedad del solicitante</font></p>     <p align="center"><img src="../img/revistas/riei/v12n1/a04_figura07.gif" width="603" height="184"></p>     <p align="center"><font face="Verdana, Arial, Helvetica, sans-serif" size="2"><b>Fuente: </b>Elaboración propia</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; La mayoría de los solicitantes no tienen dependientes.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Alrededor del 80% de los solicitantes son graduados.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; La mayoría de los solicitantes son del área semiurbana.</font></p> </blockquote>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Analizando las variables independientes numéricas que tiene:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;La mayoría de los datos en la distribución de los ingresos de los solicitantes están hacia la izquierda, lo que significa que no se distribuye normalmente.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;El diagrama de caja confirma la presencia de muchos valores atípicos / extremos.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;Lo más probable es que sea por la disparidad de ingresos en la sociedad.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Con el hecho de que estamos mirando a persona con diferentes niveles educativos.</font></p> </blockquote>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Analizando la distribución de la variable LoanAmount se tiene:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Se observa muchos valores atípicos en el diagrama de caja de esta variable.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; &nbsp;Pero la distribución es bastante normal.</font></p> </blockquote>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">El Historial crediticio contra estado de préstamo refleja:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Que las personas con historial crediticio tienen más probabilidades de obtener la aprobación de sus préstamos visto de otra manera al solicitar un préstamo la primera vez es difícil.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Vemos la correlación entre todas las variables numéricas donde:</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Vemos que las variables más correlacionadas son Ingreso del solicitante con monto del préstamo e historial crediticio con estado del préstamo.</font></p> </blockquote>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">En el tratamiento del dataset:</font></p>     <blockquote>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Hay menos valores perdidos en las características Sexo, Casado, Dependientes, Historial de crédito y Autónomo, por lo que podemos completarlos usando la moda de las características.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Usamos la mediana para completar los valores nulos, ya que antes vimos que el monto del préstamo tiene valores atípicos, por lo que la media no será el enfoque adecuado, ya que se ve muy afectada por la presencia de valores atípicos.</font></p>       <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Para manejar variables categóricas, existen otros métodos, como necesitamos convertir todas las variables categóricas en numéricas, se utilizará el método getdummies.</font></p> </blockquote>     ]]></body>
<body><![CDATA[<p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">En la construcción del modelo:</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Sklearn requiere la variable de destino en un conjunto de datos separado por lo que eliminamos nuestra variable de destino del conjunto de datos y la guardamos en otro conjunto de datos.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Después se crean variables ficticias para las variables categóricas. La variable ficticia convierte las variables categóricas en una serie de 0 y 1, lo que las hace mucho más fáciles de cuantificar y comparar.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Se entrena el modelo en el conjunto de datos de entrenamiento y se harán predicciones para el conjunto de datos de prueba. Una forma de hacerlo es</font> <font face="Verdana, Arial, Helvetica, sans-serif" size="2">dividir el conjunto de datos en dos partes: entrenamiento y validación.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Usando la función <b>train </b>test split de sklearn para dividir el conjunto de datos. Con LogisticRegression, fit () y precisionscore de sklearn ajustamos el modelo de regresión logística.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Se debe predecir LoanStatus y calcular su precisión con el método predict () y accuracyscore ().</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Donde las predicciones son casi un 80% precisas, es decir, se logró identificado correctamente el 80% del estado del préstamo.</font></p>     <p align="justify">&nbsp;</p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="3"><b>Metodología:</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Se empleo la metodología cuantitativa con diseño de investigación no experimental en el tipo de estudio correlacional.</font></p>     ]]></body>
<body><![CDATA[<p align="justify">&nbsp;</p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="3"><b>Conclusiones:</b></font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Hoy en día, el negocio de préstamos se vuelve cada vez más popular y muchas personas solicitan préstamos por diversas razones. Sin embargo, hay casos en los que las personas no devuelven la mayor parte del monto del préstamo al banco, lo que resulta en una gran pérdida financiera. Si se logra clasificar de manera eficiente a los solicitantes por adelantado, evitaría en gran medida la pérdida financiera.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">En este estudio, primero se limpió el conjunto de datos y se realizó el análisis de datos exploratorios. Se cubrieron las estrategias para abordar tanto los valores perdidos como los conjuntos de datos desequilibrados.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">A partir del análisis exploratorio de datos y evaluación individual de las variables, se puede generar información a partir de los datos y entender cómo se relaciona cada una de las variables individuales con la variable objetivo. También se puede notar que la librería de sklearn nos facilita el</font> <font face="Verdana, Arial, Helvetica, sans-serif" size="2">trabajo enormemente al permitir trabajar con hiper parámetros por defecto que por lo general son los más adecuados y en este caso se pudo obtener un resultado aceptable.</font></p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">Se pudo evaluar que no siempre las hipótesis pueden estar alineadas con el análisis y evaluación de los datos, por ejemplo, en este caso los solicitantes con más ingresos no necesariamente eran los que tenían mayor posibilidad de acceder al préstamo, por otro lado, la variable que más impacto tenía era el historial crediticio del solicitante.</font></p>     <p align="justify">&nbsp;</p>     <p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="3"><b>Referencias.</b></font></p>     <!-- ref --><p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Amat, J. (2016, 8). <i>Regresión logística simple y múltiple. </i>Retrieved from ciencia de datos: <a href="https://www.cienciadedatos.net/documentos/27_ regresion_logistica_simple_y_multiple" target="_blank">https://www.cienciadedatos.net/documentos/27_ regresion_logistica_simple_y_multiple</a></font>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scieloOrg/php/reflinks.php?refpid=S2415-2323202000010000500001&pid=S2415-23232020000100005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');"></a>&#160;]<!-- end-ref --><!-- ref --><p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Borrajo, D. (2006). <i>Aprendizaje automático. </i>Madrid.</font>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scieloOrg/php/reflinks.php?refpid=S2415-2323202000010000500002&pid=S2415-23232020000100005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');"></a>&#160;]<!-- end-ref --><!-- ref --><p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Fernandez, S. d. (2011). <i>Regresión logística. </i>Madrid.</font>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scieloOrg/php/reflinks.php?refpid=S2415-2323202000010000500003&pid=S2415-23232020000100005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');"></a>&#160;]<!-- end-ref --><!-- ref --><p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Garreta, R. (2013). Learning scikit-learn: Machine Learning in Python.</font>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scieloOrg/php/reflinks.php?refpid=S2415-2323202000010000500004&pid=S2415-23232020000100005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');"></a>&#160;]<!-- end-ref --><!-- ref --><p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Mitchel, T. (1997). Machine Learning. McGraw Hill.</font>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scieloOrg/php/reflinks.php?refpid=S2415-2323202000010000500005&pid=S2415-23232020000100005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');"></a>&#160;]<!-- end-ref --><!-- ref --><p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Murphy, K. (2012). <i>Machine Learning: A probabilistic perspective. </i>The MIT Press.</font>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scieloOrg/php/reflinks.php?refpid=S2415-2323202000010000500006&pid=S2415-23232020000100005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');"></a>&#160;]<!-- end-ref --><!-- ref --><p align="justify"><font face="Verdana, Arial, Helvetica, sans-serif" size="2">•&nbsp; &nbsp; Sklearn. (2020,12 2). <i>Logistic Regression. </i>Retrieved from scikit-learn: <a href="https://scikit-learn.org/stable/modules/generated/sklearn.linear_ model.LogisticRegression.html" target="_blank">https://scikit-learn.org/stable/modules/generated/sklearn.linear_ model.LogisticRegression.html</a></font>&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;&nbsp;[&#160;<a href="javascript:void(0);" onclick="javascript: window.open('/scieloOrg/php/reflinks.php?refpid=S2415-2323202000010000500007&pid=S2415-23232020000100005&lng=','','width=640,height=500,resizable=yes,scrollbars=1,menubar=yes,');"></a>&#160;]<!-- end-ref --><p align="justify">&nbsp;</p>     <p align="justify">&nbsp;</p>     <p align="justify">&nbsp;</p>     <p align="justify">&nbsp;</p>      ]]></body><back>
<ref-list>
<ref id="B1">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Amat]]></surname>
<given-names><![CDATA[J]]></given-names>
</name>
</person-group>
<source><![CDATA[Regresión logística simple y múltiple]]></source>
<year>2016</year>
<month>, </month>
<day>8</day>
</nlm-citation>
</ref>
<ref id="B2">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Borrajo]]></surname>
<given-names><![CDATA[D]]></given-names>
</name>
</person-group>
<source><![CDATA[Aprendizaje automático]]></source>
<year>2006</year>
<publisher-loc><![CDATA[Madrid ]]></publisher-loc>
</nlm-citation>
</ref>
<ref id="B3">
<nlm-citation citation-type="">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Fernandez]]></surname>
<given-names><![CDATA[S. d]]></given-names>
</name>
</person-group>
<source><![CDATA[Regresión logística]]></source>
<year>2011</year>
<publisher-loc><![CDATA[Madrid ]]></publisher-loc>
</nlm-citation>
</ref>
<ref id="B4">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Garreta]]></surname>
<given-names><![CDATA[R]]></given-names>
</name>
</person-group>
<source><![CDATA[Learning scikit-learn]]></source>
<year>2013</year>
<publisher-name><![CDATA[Machine Learning in Python]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B5">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Mitchel]]></surname>
<given-names><![CDATA[T]]></given-names>
</name>
</person-group>
<source><![CDATA[Machine Learning]]></source>
<year>1997</year>
<publisher-name><![CDATA[McGraw Hill.]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B6">
<nlm-citation citation-type="book">
<person-group person-group-type="author">
<name>
<surname><![CDATA[Murphy,]]></surname>
<given-names><![CDATA[K]]></given-names>
</name>
</person-group>
<source><![CDATA[Machine Learning: A probabilistic perspective.]]></source>
<year>2012</year>
<publisher-name><![CDATA[The MIT Press]]></publisher-name>
</nlm-citation>
</ref>
<ref id="B7">
<nlm-citation citation-type="">
<collab>Sklearn</collab>
<source><![CDATA[Logistic Regression]]></source>
<year>2020</year>
<month>,1</month>
<day>2 </day>
</nlm-citation>
</ref>
</ref-list>
</back>
</article>
