Hola, bienvenidas y bienvenidos a esta nueva clase del curso de minería de datos. En esta ocasión vamos a conversar sobre la parte correspondiente a las primeras fases del proceso KDD. En concreto vamos a conversar sobre la selección, la limpieza y la transformación de datos. En este sentido, entonces, a lo largo de todo este proceso, nosotros vamos a conversar sobre el dominio del problema y las Etapas selección, limpieza y transformación de datos. El objetivo de esta unidad, como ustedes ya saben, es comprender los fundamentos de la minería de datos, cada una de sus fases para el
descubrimiento de conocimiento en grandes bases de datos. Entonces, vamos a comenzar. Como habíamos comentado en la clase número uno del curso de minería de datos, antes de comenzar a ejecutar el proceso KDD, nosotros tenemos que llevar A cabo el paso previo. Este paso previo también se conoce como el dominio del problema. En este paso previo, lo que nosotros tenemos que realizar es enfrentarnos a este problema que queremos resolver y sobre todo comprender cómo esa información que está almacenada puede traducirse de alguna manera en datos entendibles para el computador. En este sentido, existen muchas recomendaciones para
poder trabajar con el paso previo. En este Contexto, nosotros vamos a conversar entonces en cuáles son esas preguntas clave que nosotros tendríamos que responder para llevar a cabo el proceso del paso previo. En este sentido, la primer pregunta que se suele realizar es, ¿cuál es el problema específico que estamos tratando de resolver? Es decir, si queremos predecir ventas de una tienda minorista en función de ciertos factores como el histórico de las ventas, el precio de los productos o la Inversión en publicidad, es decir, tener una idea de qué es lo que se requiere obtener o
qué es lo cuál es la idea que se tiene a partir de los datos que están disponibles en ese momento. La siguiente pregunta es, una vez que ya tenemos claro qué es lo que más o menos decíamos realizar, es ser conscientes de que esto que nosotros queremos alcanzar, será posible lograrlo con los datos que tenemos al momento disponible y en caso de que sea así, ¿cómo podemos Alcanzarlo? o en caso de que no sea así, cuáles son las estrategias de posibles soluciones para el efecto, ¿no? Entonces, en caso de que los datos que tengamos disponibles
para el ejemplo que hemos venido mencionando, es decir, se cuenta con datos históricos de esta tienda minorista en cuanto a ventas, entonces nosotros podríamos decir que sí tenemos la cantidad eh de datos disponibles para poder realizar este problema específico que mencionamos hace Un momento, ¿no? Ahora, ¿cómo podemos alcanzar esto? A partir de información histórica con datos sobre precios, inversión en publicidad, es decir, todo un contexto de información previa que nosotros podríamos considerar que es válida y que es suficiente para poder llevar a cabo el proceso que queremos resolver. en este caso y se los voy
a a resaltar, ¿no? Que en este caso sería el predecir Ventas, ¿no? Entonces, el objetivo, el problema que queremos resolver es un problema de predicción. Vamos a predecir las ventas a partir de procesos históricos, ¿no? Entonces, acá aparentemente con el ejemplo que estamos mencionando si es factible poder realizar el proceso de predicción de ventas, ya que contamos con un conjunto de datos históricos de las ventas. Muy bien. Entonces, como segundo como tercer, perdón, tercer Pregunta que podríamos nosotros contestar, estamos en presencia de los beneficiarios, es decir, a partir de nuestra eh intervención con el proceso
de minería de datos que queremos realizar, cuáles son los beneficiarios directos, si esta solución funciona, pero también es muy importante cuáles serían los problemas que se pueden presentar si esta solución falla. Es decir, en el caso del que estamos conversando, si se logra llevar a cabo La proyección de ventas, la tienda se va a beneficiar. Es decir, los dueños de la tienda minorista, al igual que los clientes, van a ser beneficiados porque por un lado podríamos optimizar su inventario y planificar campañas de marketing de forma más efectiva, ¿no? Lo que sin duda alguna va a
poder ayudar a mejorar las ventas de la empresa o las ganancias de la empresa. El problema es que si nuestra solución posible falla, entonces la tienda podría enfrentar Pérdidas financieras, ¿no? Y obviamente dificultades en cuanto al manejo del inventario. Entonces, siempre existe esa posibilidad y al principio de todo proceso de minería de datos es importante establecer, ¿no?, cuáles son los beneficios, pero cuáles serían los problemas si no podemos llevar a cabo de forma exitosa el proceso en este caso de predicción de datos, ¿no? Ahora viene una parte que ya es mucho más técnica, es la
pregunta número cuatro y tiene que Ver justamente con el tipo de problema que yo quiero resolver. Previamente en la clase uno les comentaba que en minería de datos existen algunas formas de abordar la minería de datos, pero en este contexto nosotros íbamos a conversar únicamente sobre dos tipos de minerías, la minería predictiva y la minería descriptiva. En este caso puntual, nosotros tenemos que indicar cuál tipo de minería queremos resolver para el problema. Estamos hablando de Una minería predictiva porque evidentemente hablamos de predecir ventas, ¿no? Ya que queremos de alguna manera estimar lo que va a
suceder en el futuro a partir de los datos históricos del set de datos que se menciona en el ejemplo que tiene disponible la la tienda o empresa minorista, ¿no? Ahora, en el caso de haber indicado que nosotros tenemos que realizar o vamos a realizar un problema de predicción, más adelante vamos a ir observando que la Predicción puede ser de dos tipos. Puede ser una predicción categórica puede ser una una predicción este continua o numérica, ¿no? Pero también tendemos otros tipos de minería. Entonces, si ya contestamos la pregunta cuatro y hablamos de ingeniería de datos predictiva,
entonces tendríamos que especificar cuál de esos tipos son, ¿no? En este caso concreto es el problema o el objetivo es el de la predicción. En otros casos podría ser el objetivo de Clasificación, ¿no? Que insisto, iremos de a poco eh comentando las diferencias y sobre todo llevando a la práctica estos dos tipos de problemas, ¿no? Tanto el predictivo a nivel de eh de regresión o de predicción como tal y en el caso de la clasificación. Pero más allá de eso, lo importante acá es que ustedes noten que en la pregunta cinco del paso previo, nosotros
tenemos que ser precisos en decir qué es lo que vamos a hacer, cuál es el objetivo, que en este Caso sería predecir las ventas. Como pregunta seis viene una parte muy importante que tiene que ver con la definición de las fuentes de datos, es decir, de dónde van a venir los datos, ¿sí? Y cuánto cuesta conseguir los datos. En el ejemplo, eh, aparentemente no es mucho problema. Los datos van a venir directamente desde la propia empresa porque eh la empresa tiene registrados estos registros, esto, perdón, esto, valga la redundancia, no, Esto información la tiene registrada,
pero eh en algunas ocasiones eso no es tan sencillo y en ese caso el tomador de decisión nos puede aportar con la información o nosotros como profesionales en el ámbito de la minería de datos tendríamos que buscar alternativas de dónde podríamos obtener este tipo de eh información o de datos, ¿no? Entonces, y también tenemos que especificar en este en este en este en esta pregunta cuánto va a costar Conseguirlo, ¿no? Si los datos van a ser de libre acceso, si los datos van a requerir que yo solicite a alguna empresa o alguna oficina eh acuerdos
de confidencialidad para poder acceder a esos datos. Si los datos yo los voy a tener que para obtener esos datos tengo que pagar una suscripción. Entonces, todo lo que conlleva eso de poder adquirir los datos eh tiene que estar eh claramente definido acá, ¿no? Y sobre todo en una primera instancia cuando Ustedes recién están tratando de entender el problema que se quiere resolver y sobre todo cómo se va a abordar ese problema, ¿no? Entonces, de alguna manera en estas primeras en estas preguntas ustedes lo que están haciendo es tratar de comprender qué es lo que
quiero hacer, para qué lo quiero hacer y sobre todo cuáles son los datos que yo voy a utilizar para poder llevar a cabo esa idea que yo tengo. Entonces, em dentro del paso previo, eh nosotros vamos a tener que definir cuáles son esos resultados esperados que yo voy a obtener a partir de el análisis que acabo de hacer, ¿no? posibles resultados esperados para este ejemplo puntual de predección de ventas, evidentemente son primero es la predecir las ventas de forma confiable, es decir, que si yo digo que en el próximo trimestre del año se van a
a incrementar las ventas en un 40%, esa situación va a ser así, se tiene que eh aproximar la predicción, ¿no? Eh, entonces yo tengo que ser consciente de que lo que yo estoy diciendo acá es un resultado esperado que yo yo quiero alcanzar, ¿no? las ventas, optimizar el inventario. Sí, es decir, si yo sé que voy a vender 100 unidades de un producto para el invierno, yo tengo que tener disponible las 100 unidades de ese producto. No puedo tener menos ni puedo tener mucho Más. Entonces, siempre tengo que tratar de ajustar con la predicción todas
estas situaciones. Punto tres, un posible un posible resultado esperado es mejorar las campañas de publicidad. En este sentido, eh yo voy a poder optimizar de alguna manera el presupuesto que tengo disponible. Y finalmente tomar decisiones más eh eficientes a partir de de tomar decisiones informadas, ¿sí? no tomar decisiones porque yo creo algo, porque Yo intuyo algo, no, sino tomar decisiones porque mis datos del proceso de minería de datos así me lo están diciendo, ¿no? Ya ha sido validado y es correcto, ¿no? Entonces todo este paso previo me sirve a mí para establecer esa idea inicial,
es decir, qué quiero hacer, cómo lo voy a hacer, de dónde vienen los datos y qué resultados yo espero alcanzar a partir de ellos. ¿Okay? Entonces, una vez que nosotros tenemos El paso previo, recordemos el flujo que nosotros tenemos para eh el proceso KDD. Entonces, yo tengo dominio del problema, que es el paso previo, y luego tengo la primera fase que hemos llamado selección, ¿sí? Que es la primera fase que está acá, ¿no? Entonces, en la primera fase, como yo ya tengo claro, o al menos yo ya definí de dónde van a venir los datos,
que quiero hacer, lo siguiente es profundizar en esa parte. es decir, profundizar en cuáles son los Datos que finalmente yo voy a utilizar, cuáles son esas fuentes de datos. Esas fuentes de datos en todo proyecto de minería de datos pueden ser fuentes internas o pueden ser fuentes externas. Las internas generalmente son más fáciles porque vienen directamente desde la empresa o del lugar donde yo voy a hacer el proceso de minería porque están almacenados habitualmente en un sistema, en una base de datos transaccional, que es lo que habitualmente sucede, ¿no? Pero también podemos definir cuáles son
las fuentes de datos externas, es decir, si esa información va a venir de repositorios abiertos, si esa información va a venir de eh redes sociales, por ejemplo, porque a pesar de que la red social es de la empresa, el acceso a es a esos datos de red social para análisis de minería de datos muchas veces están sujeto a una suscripción o a un pago mensual. Entonces yo tengo que de alguna manera definir de dónde voy a A tomar esos datos, ¿no? Internos seguramente no hay problema porque es la empresa, pero cuando ya son fuentes externas,
yo tengo que tener claro cómo voy a utilizar esa información y cómo voy a acceder a ellas. Ahora, dentro de esas fuentes de datos internas, como les mencionaba, tenemos como ejemplos las bases de datos transaccionales, los SQL, los eh MySQL, en fin, todas las bases de datos que ustedes imaginen y que son las que Habitualmente se utilizan en en la mayoría de las empresas, ¿no? Tenemos también los sistemas de e relaciones con con los clientes, los CRM, los ERP o inclusive los registros internos de los empleados, ¿no? Todo en síntesis es todo aquello que tenga
que ver con la con la data interna de la empresa, con los datos internos. Luego tenemos los repositorios externos, que además de redes sociales, nosotros tenemos la ventaja de contar con repositorios que Nos permiten poder llevar a cabo algunas tareas de minerías de datos. Estos repositorios eh contienen generalmente información o bases de datos que han sido almacenadas de forma gratuita por usuarios de diversas partes del mundo que contienen a veces información muy importante sobre algún problema puntual, ¿no? Si es un registro de venta, si es un un tema de de talento humano, es decir, es
información que viene de diversas partes, que es muy importante, Que es buena, pero que no siempre es confiable en todo caso, ¿no? y en muchas ocasiones puede ser confiable, pero para el problema que yo estoy resolviendo quizás no sea del todo interesante. Desde el punto de vista académico, sí son muy buenas estas bases de datos, principalmente eh las bases de datos eh las dos bases de datos que están acá de primero, que son la del repositorio de la Universidad de California en Irving y el repositorio CADER, que básicamente Son de alguna maneras las eh los
repositorios más académicos, ¿no? Aquí hay de todo tipo de información. a información de de todas las áreas del conocimiento, informática, ciencias de la salud, ciencias sociales, eh administración de todo tipo, ¿no? En cambio, en los repositorios que están acá abajo, el repositorio de Google Data Search, porque por si eh no lo saben, Google Data Search, o sea, Google además de ser un buscador también tiene su Google Data Search, que es básicamente una búsqueda de datos exclusiva, ¿no? y obviamente repositorio de Mendel que es otro muy común utilizado, ¿no? Entonces, solo para que tengan una referencia,
eh voy a ir analizando, voy a analizar uno de ellos, ¿no? Voy a analizar el repositorio de Melin. Sí, voy a dar clic acá y voy a visualizar eh voy a visualizar el contenido. Favor. Entonces, este es el repositorio de Méndele. Ustedes acá pueden observar los repositorios que se han publicado recientemente, ¿no? Acá, por ejemplo, en el primero, ah, bueno, en el segundo en realidad hablan de la calidad, datos de calidad del agua para el verano e en alguna parte del mundo o de algún condado, qué sé yo. Entonces, este es una un dataset que
si ustedes se dan cuenta, yo doy clic acá y me muestra información del mismo, ¿no? Eh, cómo se Ha agendado. Les quiero mostrar uno que trabajamos en un proyecto de investigación. Voy a hacer la búsqueda para ver si encontramos ese proyecto. Este proyecto era de eh imágenes, proyecto de imágenes de hojas de café. Si me acá está. Entonces, en la base de datos se llama rocole, que son los acrónimos de robusta cofilif, básicamente es imágenes de café robusta. Son imágenes completas donde ustedes tienen las fotografías, por Ejemplo, y cada fotografía corresponde a una e foto
de de de hoja de café, ¿no? Y esto es un proyecto que si regresamos un poco tenía también anotaciones, es decir, para cada una de esas hojas yo tenía disponible acá información sobre el tipo de estado de la hoja, ¿no? Si la hoja era una hoja sana, si era una hoja enferma y tenía segmentada esa imagen también, ¿no? Entonces, como ustedes se dan cuenta, acá está el nombre del set de datos, quiénes fueron los que Contribuyeron con este set de datos y una descripción de ese conjunto de datos, ¿no? Y me permite aquí descargar esos
archivos, ¿no? En este caso son 2 GB que yo podría descargar, ¿no? Entonces, es un es un ejemplo de un repositor externo que evidentemente para el problema que estábamos conversando sobre la predicción de ventas no me va a servir, pero quizás si yo estoy trabajando en un proyecto que tiene que ver con reconocimiento de imágenes o Enfermedades en imágenes de café, probablemente este me podría servir como una fuente de datos externa, ¿no? Entonces, vamos a regresar a la parte de la lámina y vamos a darnos cuenta que otro repositorio que podríamos visitar es el primero,
que también es muy académico. Damos clic acá y vamos a visualizar este repositorio. Excelente. Entonces, si se dan cuenta, este repositorio es mucho Más, como les mencionaba, mucho más académico. Acá tengo varias eh bases de datos. Y lo interesante con este repositorio al ser académico también, ¿no? Es que en el navegador, en el explorador de los conjuntos de datos, me va diciendo directamente el resumen, ¿no? Eh, la base de datos se llama Iris y acá me dice de qué trata, ¿no? dice en qué año fue aportado, que es muy este es este iris datasc datos
que ustedes la van a Encontrar en todos los ejemplos de minería de datos y de machine learning porque es una base de datos estándar, o sea, es muy común utilizar esta base de datos que es la que viene de alguna manera por defecto, ¿no? Lo interesante en este repositorio es que me va diciendo para cada base de datos el tipo de tarea que yo puedo aplicar. Si ustedes se fijan acá, yo tengo para el primer eh para el primer caso, yo estoy mostrando acá que es Iris Dataset. Es Para problemas de clasificación. Los tipos de
datos que contiene son datos tabulares y me dice adicionalmente que tiene 150 instancias, ¿okay? Y me dice que tiene cuatro características con instancias. habíamos conversado que las instancias corresponden a las eh a las filas del del set de datos. Si ustedes lo quieren ver como una hoja de Excel, serían las filas. Y las los features o características corresponden a las Variables. Es decir, que en este conjunto de datos yo tengo cuatro variables y tengo 150 registros o instancias, ¿no? En el caso e de acá de de una enfermedad enfermedad del corazón, yo tengo que es
adecuado para problemas de clasificación, que los datos son multivariados. tengo 303 instancias y tengo otra cantidad de eh de variables, ¿no? Está diciéndome acá que yo tengo 13 variables, ¿sí? Entonces, yo podría explorar todo esto Hacia acá abajo, ¿no? Y voy viendo que, por ejemplo, en el rendimiento de estudiantes, en el rendimiento de los estudiantes, yo tengo eh que este set de datos es bueno para clasificación y regresión, es decir, para las dos tareas. que yo les había mencionado al principio, ¿no?, que los datos son multivariados, que tengo instancias, etcétera. Si yo ingreso acá, si
yo ingreso, por ejemplo, a este rendimiento de estudiantes, doy clic acá y lo que va A hacer es mostrarme más información y lo interesante es que acá me va a decir, si cuál fue el artículo científico que lo introdujo y acá me da el diccionario de la base de datos, es decir, cuáles son las variables, los nombres de las variables, el tipo de variables, la descripción, las unidades y si yo tengo disponible o yo tengo en ese set de datos yo tengo el problema de los valores perdidos, los valores faltantes, que es algo que vamos
a ver más adelante En esta clase, ¿no? Entonces, yo tengo una visión muy general de todo lo que yo podría obtener con este set de datos, ¿no? Y al igual que sucedió con el caso anterior, yo también lo puedo descargar. Si ustedes se dan cuenta, acá en la parte que dice download, lo puedo descargar directamente. Puedo citar esto cuando que estoy trabajando con artículos o inclusive puedo hacer una importación en Python. Es decir, si doy clic acá, me voy a voy a generar el Código en Python para yo poder directamente desde Python utilizar y descargar
esta base de datos. Entonces, dicho eso, eh ustedes podrían explorar en mayor detalle cada uno de estos set de datos que aparecen acá como ejemplos, solo para que se den cuenta de un de de cuáles podrían ser posibles repositorios externos o fuentes externas de datos, ¿no? Pero en general el proceso de selección lo que busca es tratar de encontrar estas bases de Datos, ¿no? De de analizarlas. Ahora, también es importante que ustedes definan cuáles son eh los tipos de base de datos que yo voy a utilizar en este proceso, ¿no? Existen muchos tipos de bases
de datos. Eh, las principales son las relacionales, que quizás son las que la mayoría de ustedes quienes estén viendo esta clase eh tienen un poco de referencia porque eh se habla de relacionales cuando está trabajando con SQL, con MySQL, ¿no? Entonces, Probablemente ese tipo de base de datos la manejan bien, pero también podríamos encontrar bases de datos espaciales, bases de datos temporales, documentales e inclusive multimedia. En el caso de las espaciales son aquellas que contienen información, evidentemente, a nivel geográfico. Eh, acá tiene mucho que ver un concepto que se llama eh GIS o HIS, que
es eh Gis, ¿no? Geographic information System o sistemas de información Geográficas. Pero más allá de eso, lo importante es que ustedes conozcan que, por ejemplo, en el Ecuador eh para base de datos espaciales podemos encontrar información de pronto en el Semplades o de pronto en el mismo INEC, pero ustedes pueden explorar ese tipo de información. para las temporales, justamente son aquellas que hablan de información eh de en instantes de tiempo, ¿no? Generalmente, como ejemplos yo doy las bases de datos que tienen que ver con el Clima, con la predicción climática y en el Ecuador podíamos
hablar de base de datos que proporciona el INARI, ¿no? Luego tenemos las documentales, eh, y tenemos las multimedia. Las documentales son todas aquellas que tienen que ver justamente con documentos, con las personas que trabajan en investigación, por ejemplo, en en redes sociales como X. Entonces, obtener datos desde X, generar un corpus de texto, puede ser considerado un tipo de base de datos Documental. Y finalmente tenemos las bases de datos multimedia, que estas yo indico que siempre serían nuestras eh nuestros casos eh de ejemplo serían todos los videos en YouTube porque básicamente allí yo tengo imagen,
audio y video. Entonces, lo importante acá es definir o conocer cuáles son los tipos de base de datos que yo me puedo encontrar en la etapa de selección. E finalmente, una vez que yo ya he definido cuáles son eh esas fuentes, si Son internas o externas, y además de eso, yo ya definí cuáles son los tipos de base de datos que voy a utilizar, la otra parte es hacer una especie de eh selección interna de esos de esos datos, ¿no? Si por ejemplo recordemos la base de datos que estaba en el repositorio USI, que tenía
que ver con rendimiento de estudiantes. Si por ejemplo yo tenía 20 variables en esa base de datos, pero yo me doy cuenta que para el proceso que yo analicé en el dominio o en el en la Etapa previa del dominio del problema, yo no necesito las 20 bases, las 20, perdón, eh variables. Yo puedo hacer una selección, una selección interna ya antes de procesar. Yo voy a decir, ¿saben qué? Yo de esas 20 variables no voy a utilizar las 20, sino es que solamente voy a utilizar 10, por ejemplo, porque esas 10 son aquellas que
yo creo o considero que son útiles para el problema que quiero resolver. Y por tanto, eh el restante variable son Variables que yo voy a descartar porque no me aportan mayor eh información. Un ejemplo muy típico de esto tiene que ver con la eh el uso de, por ejemplo, de la variable o del campo número de cédula. Generalmente el número de su a mí no me aporta mayor información y por tanto yo lo descarto cuando estoy haciendo este tipo de análisis. Y esa sería un ejemplo de cuáles son las identificación de variables útiles y las
variables que pueden ser Descartadas. ¿Okay? Entonces, una vez que yo cumplí con esa etapa de selección de datos, con esos tres subetapas, yo tengo que hablar de la parte que consume mayor tiempo en los procesos de minería de datos y tiene que ver con la etapa de limpieza. Esta etapa de limpieza lo que busca es eliminar todos aquellos datos que son erróneos o inequívocos para obtener un conjunto de datos libre de inconsistencias. Existen muchas actividades que se pueden realizar Dentro de esta etapa. Sin embargo, las podríamos clasificar dentro de tres grandes grupos. Tenemos para la
limpieza, el proceso de integración, el proceso de enriquecimiento y el proceso de análisis exploratorio de datos. En la integración yo lo que tengo que tener claro es cómo todo ese proceso que yo e lo he analizado, lo he obtenido, esos datos que los he obtenido diversas fuentes, cómo yo los voy a integrar en un solo lugar. Okay, para eso tengo que Enfrentarme a tres desafíos que son los principales, ¿no? Esclarecer la identidad, es decir, buscar identificar de forma correcta cuáles son los objetos en cada una de las fuentes de datos para evitar que existan errores
al momento de unificar. En el caso de datos faltantes o inconsistentes, debo gestionar la presencia de atributos faltantes o inconsistentes entre todos los registros que yo tengo en las diversas fuentes de Datos que he venido manejando. Y finalmente, la unificación de formatos y medidas es que si yo tomo estos estas variables de diversas fuentes, generalmente cada una tiene su propio eh su propia estructura, cada una tiene su propio formato, tiene su propio idioma, incluso en algunas veces su propia forma de medirse. Entonces, tengo que lidiar con todo eso dentro de la etapa de integración. ¿Okay?
Si ustedes observan acá para cada uno de estos de estos tres Problemas, ¿no? Esclarecimiento de identidad, datos faltantes y unificación de formatos, yo tengo cómo identifico ese tipo de problemas y cuál sería una solución que yo voy a dar para ese problema. ¿Okay? Entonces, no voy a entrar en tanto detalle en esta parte porque lo tienen disponible en la lámina y pueden darse cuenta cómo se identifica el problema en cuestión y cuál es una posible solución. ¿Okay? Entonces voy a leer solamente este primero y en los Siguientes casos voy a pasar solamente para que quede
registro, pero ustedes ya lo van a comenzar a analizar, ¿no? Un problema para esclarecimiento de identidad se da cuando los registros del mismo objeto se manejan como entidades separadas. Por ejemplo, un cliente identificado en la fuente interna de una compañía como BO y un número que corresponde a su código de identidad y ese mismo cliente esté identificado en otra fuente de datos, Quizás interna o externa, con el mismo número de identidad, pero sin la V. Entonces, en el momento de hacer la integración, yo tengo que considerar esa situación. ¿Cuáles podrían ser unas posibles alternativas de
solución para aquello? Primero usar identificadores únicos. ¿Sí? Entonces, ¿cómo lo hago eh como identificador único? pues yo voy a descomponer esa clave, ¿no? Yo ya sé que el primer código debo comprender que hace referencia, por ejemplo, a un Vehículo, a una póliza, y la segunda parte, la identificación del cliente. Entonces, yo lo que podría hacer es que analizo el código, genero un scrit y digo, "Okay, todos aquellos formatos que tienen esta particularidad o este patrón corresponden a tal caso." Y lo de que viene después de eso corresponde al al número de cédula, al código de
identificación. Obviamente eso no es que yo lo hago porque me lo imagino. Yo tengo que tener Un dominio claro de esas variables y eso también es una situación que ustedes deben eh considerar al principio en el dominio del problema. En la clase uno se mencionaba sobre la característica principal del proceso KDD, que es recursivo y es iterativo. Es recursivo, perdón, e interactivo. Ser interactivo significa que yo también necesito la presencia de un experto que me esté retroalimentando constantemente. Y justamente en este tipo de situaciones Interviene el experto, ¿no? Porque, ¿quiénes manejan mejor los datos? Los
dueños de los datos. Entonces yo a a principio yo no podría saber qué significa B23, o sea, pero ya tengo que tener a mi lado al al personal técnico de la empresa donde estoy aplicando el proceso para que me dé ideas sobre esto, ¿no? Pero de esa forma yo podría eh resolver esta esta problemática. ¿Okay? Entonces, eso para el caso de esclarecimiento de identidad. También tenemos el caso de datos faltantes inconsistentes. Aquí se explica los problemas y posibles soluciones. Lo mismo pasa con la unificación de formatos y medidas, tal como ustedes ven acá en la
en la parte de la lámina, ¿no? Hay un ejemplo, eh, y hay una solución para ese problema, ¿no? Lo importante es que la integración se genere de forma correcta y para eso pueden aplicar las técnicas que se mencionaron hace un momento. Un segunda, una segunda parte del proceso de de limpieza es es justamente el enriquecimiento de los datos, que en términos generales es cuando yo tengo un dato que no está del todo claro, yo puedo agregar cierta información para enriquecer ese dato, es decir, para no perderlo y para darle más sentido a los a la
información que yo estoy obteniendo o mostrando en la base de datos. Entonces, acá tenemos eh ejemplos de tres tipos de enriquecimiento de datos, Que son el ejemplo demográfico, el ejemplo geográfico y el ejemplo de dominio. Entonces, acá tenemos para demográficos, por ejemplo, el cálculo de la edad. Es decir, yo puedo tener en mi base de datos únicamente registrada la variable fecha de nacimiento, pero no tengo la edad. Entonces, yo a partir de la fecha de nacimiento voy a enriquecer mi base de datos y voy a generar una nueva variable que se llame data, pero que
no es una variable que yo me Inventé, es una variable que surge como un proceso de enriquecimiento de otra variable. Entonces, eso es válido, no no estoy agregando información equivocada, sino por el contrario estoy tratando de enriquecer ese conjunto de datos. más casos pueden ustedes observar acá, clasificación socioeconómica de familiares, etcétera, ¿no? Eso para el caso demográfico. Para el caso geográfico también tenemos varios ejemplos en donde ustedes pueden Entender cómo es que yo podría enriquecer mi sec de datos a partir de esta situación. Y finalmente tenemos el el enriquecimiento de datos de dominio, en donde
para cada situación puntual se da una posible solución de enriquecimiento. ¿Okay? Ahora, consideren que no siempre yo en los procesos de minería tengo que hacer todo esto que está acá, ¿no? Todo va a depender del sec de datos, del problema que quiero resolver para partir De ello yo tomar decisiones. Sin embargo, acá en esta clase lo que tratamos es de que quede un poco claro la generalidad y algunos casos específicos de cómo ustedes podrían tomar acciones cuando se estén enfrentando a este tipo de situaciones. Luego venimos a la parte más demandante del proceso de limpieza
de datos y esto se llama análisis exploratorio de datos. El análisis exploratorio de datos por sus siglas era En inglés. Tiene como objetivo que yo como tomador de los datos, como experto en minería de datos, tengo una visión global de todas estas variables, ¿no? Y este es un paso obligatorio e indispensable para llevar a cabo el proceso de minería de datos. Yo acá voy a clasificar el análisis de exploratoria de datos, que en términos generales es una estadística descriptiva. Lo voy a clasificar en un análisis numérico y en un análisis Visual. En el análisis numérico,
yo tengo que hacer toda la estadística relacionada con medidas de tendencia central, medidas de dispersión, medidas de posición y para el caso visual también lo que son histogramas, diagramas de barra, de cajas, mapas de calor, etcétera. Entonces, vamos a ir analizando uno por uno para ir comprendiendo qué es lo que yo debo hacer en cada paso. ¿Okay? Entonces, en este caso del EDA, nosotros vamos a Considerar como ejemplo una base de datos sers sencilla que va a tener tres variables, que son la variable DC, la variable ingreso mensual y las variables la variable, perdón, horas
de trabajo. Y lo que nosotros buscamos acá es eh e información sobre personas relacionadas en un estudio laboral, ¿no? Tenemos las tres variables y lo que se nos dice acá como contexto de lo que está mostrándose en pantalla es realizar un análisis exploratorio de datos para Comprender mejor cada una de las características de las personas que han sido registradas en esta base de datos en cuanto a estas tres variables, ¿sí? Para detectar posibles patrones, distribuciones y valores atípicos que puedan existir en los datos. Entonces, si ustedes observan acá, yo tengo tres variables, pero tengo 2
4 6 8 10 instancias. Es decir, es una base de datos bastante pequeña, pero que nos va a permitir a nosotros poder llevar a Cabo el análisis curatorio de datos. Entonces, les había mencionado que lo primero que yo hago es un análisis numérico y con estas tres medidas de eh medidas descriptivas, ¿no? Entonces, vamos a ir viendo cómo con estas tres variables yo podría comenzar a aplicar para cada una de ellas, ¿no? Entonces, acá lo primero que yo hago como parte de las medidas de tendencia central, que insisto, esto es muy muy estadístico, yo tengo
que calcular la media, la mediana Y la moda, ¿no? En el ejemplo de la lámina está claramente definido cómo se calcula la edad, el ingreso y horas para el tema de la media, ¿no? Cómo calculo el promedio de esos de esas variables, ¿no? Ahí está definido. Luego está definido cómo calculo la mediana. Como esta parte es más estadística y asumimos que quienes ya están visualizando o están tomando el curso de minería ya manejan el concepto estadístico. No voy a entrar en detalles cómo se calcula a Pesar de que aquí está en la lámina cómo se
calcula. Okay. Entonces, tengo que calcular la media, la mediana y la moda. Sí, la moda eh creo que es una de las medidas más sencillas, ¿no? Es el valor que más se repite, que un problema puede ser multimodal, es decir, cuando eh existen muchas modas, es decir, más de un valor se repite eh muchas veces o la mayoría de las veces y el caso eh contrario es cuando yo no tengo moda y es decir que en ese caso ningún valor se Repite, ¿no? Eso para las eh los cálculos de estas medidas de tendencia eh central.
También tenemos las medidas de dispersión y acá hablamos del rango, hablamos de la varianza, eh también está un ejemplo de cómo se calcula y hablamos también de la desviación estándar, que también hay ejemplos de cómo se calcula cada una de ellas. ¿Okay? Luego hablamos también de los percentiles, hablamos también de los eh de los desiles y hablamos también de los Cuartiles. Insisto, para cada caso está la forma en detalle con su ecuación y paso a paso cómo se calcula, ¿no? Acá no hay tanta ciencia en realidad, esto ya es estadística, pero sí es importante que
eh analicen esto, ¿no? y vayan entendiendo cómo se calcula, ¿no? Eh, tenemos el caso de los cuartiles, cuartil 1, 2, 3 y 4, ¿no? El cuartil máximo, que es el valor máximo y que también sabemos que cómo se calcula cada uno de esos cursos, ¿no? Entonces, Se va generando de esa manera para finalmente pasar al análisis eh que finalmente es el que se suele mostrar en estos procesos, ¿no?, que es el análisis visual. Entonces, acá yo tengo un histograma que se utiliza para representar la distribución de variables continuas, como en este caso yo tengo la
variable considerado como variable continua, la dag en años y lo que hace un histograma es generar intervalos a Partir de esos valores, ¿no? Y comienza a generar esta gráfica, ¿no? Solo con esta gráfica nosotros podemos entender que para los datos con los cuales estamos trabajando en este proceso, la mayoría de personas suelen ser jóvenes porque si se dan cuenta, en primera instancia el valor más pequeño es 22. El valor más pequeño es 22, justamente, ¿sí? Eh, y el valor más grande es 42. Y la además de eso, la mayoría de personas del estudio se Quedan
dentro del primer rango, 22 a 27. Es decir, solo con el gráfico ya podemos darnos cuenta que en este conjunto de datos el estudio laboral que se está haciendo considera personas que en su mayoría son jóvenes. Entonces, de allí la importancia de hacer primero un análisis exploratorio de datos para ir comprendiendo desde el inicio cómo están distribuidos nuestros datos. Luego tenemos la el otro tipo de gráfico que es el gráfico de barras, que en Cambio se utiliza mejor para variables categóricas, como en este caso eh justamente una existen cuatro categorías para eh un el ejemplo
que se está viendo en la lámina, ¿no? Entonces, yo tendría eh cuatro clases o cuatro grupos dentro de esa variable, ¿no? Entonces, también es muy importante eh como parte del análisis que se suele hacer al principio, ¿no? Luego de eso tenemos el diagrama de cajas y bigotes, que quizás es uno de los diagramas más Importantes del análisis. ¿Por qué? Porque este diagrama a mí me muestra prácticamente toda la información que yo requiero. Me muestra cuáles son los mínimos, que son los que están acá abajo, ¿no? Los pequeñitos este bigote que está acá y este bigote
que está acá. Mínimos y máximos. me muestra la distribución de los datos. En su mayoría de los datos está en este grado, en este rango, ¿no? De 10000 a un poco más de 2,000. Y además me muestra aquí la Mediana. Es decir, de alguna manera este gráfico me está mostrando un resumen superdallado de cada uno de los valores que es que que contiene cada variable, ¿no? Acá tengo la variable D, la variable ingreso mensual y la variable horas de trabajo semanal. Entonces, ese gráfico también es muy importante para el proceso de limpieza de datos dentro
del análisis del probatorio. Luego tenemos el diagrama de dispersión, que es otro diagrama que se Utiliza para medir la relación entre variables cuantitativas. ¿Sí? En este caso la variable edad y la variable, perdón, la variable edad y la variable ingreso mensual, ¿no? Edad e ingreso mensual. Diagrama de dispersión. ¿Cómo se distribuyen los datos a nivel de los del cuadro? ¿No? Entonces, si nos damos cuenta, los datos se distribuyen entre 25 y 50 más o menos y hacia arriba, ¿no? A medida que van aumentando la edad, Aparentemente también aumenta el ingreso mensual. Entonces, si nosotros utilizamos
este gráfico como una herramienta para visualmente tratar de encontrar lo siguiente, ¿sí? Nosotros estamos hablando un gráfico de correlación, es decir, a partir del diagrama de dispersión, yo podría establecer de forma visual si aparentemente existe una correlación positiva, una correlación negativa o no existe correlación entre esas variables. Una correlación positiva se da cuando las dos variables en análisis del diagrama de dispersión tienen un comportamiento parecido. Es decir, cuando una tiende a subir, como ven ustedes en el caso de acá, cuando una tiende a subir, como es la variable X, ¿sí? A medida que X sube
o va aumentando su valor, la variable Y también va tiende a aumentar su valor. Entonces, en esos casos hablamos de una correlación positiva. ¿Sí? Si una sube, la otra También sube. Okay. Si una baja, la otra también baja. Entonces, eso sería una correlación positiva. En cambio, una correlación negativa es cuando se comportan de forma opuesta. Es decir, si esta sube como sucede acá, la otra baja. ¿Sí? ¿Qué es lo que está sucediendo acá? A medida que la variable x aumenta su valor, la variable y disminuye. Sí. Cuando pasa eso, estamos en presencia de una correlación
negativa, que de hecho podría ser al revés, podría decir cuando La primera sube, la otra baja o cuando la primera baja, la otra sube. Pero lo importante acá es que una correlación negativa es cuando se comportan de forma opuesta. Entonces diagrama de dispersión nos podría servir justamente para tratar de identificar esa situación. ¿Okay? Luego hablamos de los mapas de calor. Los mapas de calor son otra herramienta para visualizar el comportamiento o la correlación que pueden existir entre variables. ¿Y qué Es lo que les da esa particularidad? ¿Y por qué de calor? Porque claramente nosotros acá
tenemos una situación, perdón, tenemos una situación en donde tengo un gráfico que me dice que la intensidad de la correlación comienza en un tono como como café y llega hasta un tono rojo, ¿no? Tonos más rojizos hace referencia que existe una correlación más fuerte. Entonces, analizamos las tres variables en forma de una matriz cuadrada y decimos que Edad con edad, como es la misma variable, tiene una correlación de uno, por tanto, se pinta de rojo, 100% de correlación. Luego entre edad e ingreso mensual tenemos 070, una correlación medianamente alta, por eso está como por la
mitad del color. Y luego tenemos horas de trabajo que es un poquito más bajo y se comienza a hacer un poco más café. ¿Sí? Entonces, a medida que yo voy midiendo la correlación, los colores me están Indicando qué tan caliente es esa ese esa variable, ¿no? Por eso se llama hip mapa de calor. Entonces, entre más rojizos en este caso, mayor o más fuerte es la correlación de los datos. Entonces, esta es otra variable, eh, perdón, esta es otra otro gráfico muy importante dentro del proceso de análisis probatorio de datos, ¿no? Entonces, hacer todos estos
análisis lo que permite es que tengamos una idea general de cómo se va dando el Comportamiento de los datos. Luego tenemos una eh tercera fase que es la última que vamos a ver en esta en esta clase. En esta tercera nosotros vamos a hablar sobre transformación. ¿Qué es la transformación de datos? Es una etapa dentro del proceso KDD que cambia la forma como se muestra o representa la información sin alterar la naturaleza de la información. ¿Sí? Es decir, si yo analizo algo, yo digo, "Okay, una persona es mayor que otra persona." Entonces, yo tengo que
hacer una transformación después de cualquier tipo, pero yo voy a tener que seguir manteniendo la idea de que la primer persona es mayor que la otra persona. Lo que yo podría hacer en ese ejemplo que les estoy dando es que de pronto ya no los no hablo de valores numéricos, sino que hablo de generación. La generación A, la B, la C, la X, la Y, la Z. O sea, es una forma diferente de representar la información. Pero sigo manteniendo la Naturaleza de los mismos. Entonces, acá tenemos el ejemplo de eliminación de variables ausentes, que es
el primero, ¿no? ¿Qué es lo que se hace con eso? Que cuando yo tengo en una variable un valor que no está disponible, que se conoce generalmente como un NA, ¿sí? Como observan, perdón, ustedes acá. Entonces, cuando se observa como un NA, ¿okay? O cuando se observa como un NA, significa que no está disponible. o sencillamente cuando hay un espacio en Blanco en esa variable. Entonces yo en ese caso como transformación de datos lo que tengo que hacer o lo que yo puedo hacer es eliminar esas instancias, es decir, toda la fila que contiene SNA
va a ser eliminada, que es lo que sucede en el ejemplo que ustedes ven acá. Eso es una posible primera alternativa de transformación de datos, ¿no? Eliminar valores ausentes. La otra alternativa o la otra situación que se puede dar es a partir de la reducción de dimensiones. ¿Qué es la reducción de dimensiones? En términos simples es basar de muchas variables a pocas variables, pero no es eliminar variables por eliminar variables, es yo tengo que hacer un proceso que me permita eliminar las variables que no son relevantes para el problema que yo estoy resolviendo. En este
sentido, podríamos aplicar dos técnicas que son la selección de atributos o el análisis de componentes principales. Eh, eso lo vamos a ver en La próxima clase. Hechos, cómo se hace la selección de atributos y cómo se hace el análisis de componentes principales como parte de la estrategia, ¿no? Luego de la reducción de dimensión, en términos generales, yo lo que me lo que me voy a encontrar cuando haga esto es que paso de muchas variables a pocas variables, ¿no? En este ejemplo, yo paso de tres variables, edad, ingreso mensual, horas de trabajo a únicamente dos variables.
Lo que hice fue reducir la dimensión del problema, reducir la dimensión de los datos, que en términos más técnicos es reducir el número de variables. Entonces, como tercera e como tercera técnica o o proceso de transformación es el aumento de la dimensionalidad, es decir, al revés, ¿no? ¿Qué yo puedo hacer aquí? Proporcionar información, ¿sí? Que es un poco parecido al enriquecimiento, ¿no? Entonces, ¿cómo yo proporciono Información con aumento de dimensión? Pues claro, paso de horas de trabajo, perfecto. Y yo a partir de horas de trabajo puedo establecer una nueva variable que se llame jornada laboral
y me va a decir que es completa cuando tengo 40 horas y es parcial cuando tengo 20. Entonces, son alternativas que yo puedo eh considerar para el aumento de la dimensionalidad. Luego tenemos la discretización de atributos. La discretización de atributos lo que hace es que convierto una variable continua en una variable categórica dividiéndolos en rangos, ¿no? Entonces acá tengo, y esto es interesante, ¿no? Yo tengo solo una variable que es la variable edad. Y si yo discretizo la variable edad, yo podría tener dos variables adicionales en donde la primera sea tipo y sea una variable
de de categórica. Y la siguiente sería rango y es una variable Textual, ¿no?, que me está midiendo el rango, ¿no? Entonces, por ejemplo, en el caso de entre 20 y 25, yo voy a darle como valor joven entre 26 y 30 como valor adulto y de 60 a 65 como valor adulto mayor. Entonces, yo lo que hice fue discretizar mis valores pasándolos de un valor numérico a un valor categórico, ¿no? que en este caso sería tipo joven, ¿no? Entonces esa sería la idea de la discretización de atributos y esto es muy importante y de hecho
va a Tomar mucha más relevancia cuando estemos trabajando con la parte práctica. Luego de eso hablamos de la numerización de atributos, que esa pueden ser de dos tipos, de uno a uno y de uno a n. Entonces, la numerización de atributos es el caso contrario de la discretización. Yo voy a pasar en el caso de acá de una de una variable categórica a una variable categórica pero numerizada. Es decir, para el ejemplo, yo tengo una variable que se Llama categoría y que tiene con valores posibles niño, joven, adulto y anciano. ¿Okay? Cuando yo hago la
numerización de atributos, yo lo que hago es esa información la represento de forma numérica. Y si ustedes se dan cuenta, la categoría, la variable categoría tiene un orden porque está haciendo referencia a niño que es más pequeño que joven, que a su vez es más pequeño que adulto y que a su vez es más pequeño que anciano. Por eso, en el momento de categorizar, yo lo Que estoy dándole es un número que tenga coherencia, ¿no? El niño es uno, el joven es dos, el adulto es tres y el anciano es cuatro. Entonces, esa es una
es la numerización de atributos ordinal, uno a uno, ¿no? Luego tenemos otra que también es interesante, que pasamos de una variable que está eh una variable categórica que tiene diferentes eh niveles, ¿no? Valores, y lo llevamos a una variable numérica, pero de forma Binaria. ¿Cómo funciona esto? sencillo. Para cada valor de la variable original, yo genero una nueva variable. Si ustedes se dan cuenta, acá yo tengo cuatro valores diferentes. Tecnología es un valor, ¿okay? Ropa es otro valor, hogar es otro valor, que también acá está hogar, ¿no? Pero un valor es el mismo valor. Entonces,
tengo tecnología, ropa y hogar y luego libros. Por eso acá yo tengo cuatro variables, tecnología, ropa, Hogar y libros. ¿Sí? Y luego lo que hago es darle el valor de uno cuando en la variable original coincide con ese valor. Por ejemplo, tecnología. En la original coincide en la primera, por eso tiene uno, pero no coincide en ninguna de las demás, por eso tiene cero. Ropa en la primera no coincide, coincide en la segunda, por eso tiene uno. Y todas las demás tiene cero. En el caso de hogar no coincide la primera, no coincide la segunda,
coincide la Tercera. Sí, hogar con hogar, no coincide la cuarta y coincide la quinta, hogar con hogar. Por eso tengo el uno aquí y el uno acá. Y finalmente la variable libros no coincide en la primera, no coincide en la segunda, no coincide en la tercera, coincide en la cuarta. Por eso en la cuarta va el uno y en la quinta que no coincide va el cero. De esa manera yo ya he hecho el proceso de numerización de atributos, pero con el enfoque 1 a n. Es decir, para cada Valor categórico yo genero una nueva
variable que es de tipo binario, ¿no? Eso. Entonces, lo siguiente que se hace dentro de la transformación de datos es la normalización. Es decir, yo voy a pasar variables originales que están en una escala hacia otra escala, de modo que el contexto de la variable no se pierda. Repito, si algo en la variable original es pequeño, va a seguir siendo pequeño en el proceso de transformación, Pero en otra escala. Entonces, tenemos técnicas comunes de normalización, la normalización min max, la normalización Z, la logística y la logarítmica. No son las únicas, pero habitualmente son las que
más se utilizan dentro de minería de datos. Para el min max ecuación y yo lo aplico, no tengo. La ecuación es bastante sencilla, es el valor de la el primer valor, o sea, el valor de la variable que yo estoy analizando, el valor mínimo De todos los posibles valores de la variable y dividido para el máximo de todos los valores menos el mínimo de todos los valores. Entonces, hago eso de allá y hago el proceso normalizado. Bueno, aquí en la lámina hay un fe de ratas que hay que corregirla, no se preocupen, yo lo haré.
Pero aquí estos valores no están normalizados. Yo tendría que aplicar la la normalización. Por ejemplo, vamos a hacer el primero. Entonces, acá yo tengo 80, que es x. Tengo 80 menos el mínimo de la variable x, que sería el valor mínimo, sería 43. El valor mínimo es 43. Y todo eso lo voy a dividir por la resta entre el valor máximo de la variable, que en este caso el valor máximo es 80 menos el mínimo de la variable que habíamos dicho que era 43. Entonces yo realizo esta operación y el resultado de esta de esta
operación es El valor que iría aquí como el valor de la DA normalizada. Okay. Luego tendría que hacer lo mismo, pero en lugar de ubicar 80, yo ubicaría el valor de el valor de 50, porque es el segundo valor que yo voy a analizar. 50 - 43 en este caso, ¿no? 50 - 43 y 80 - 43 porque son los valores mínimos y máximos, ¿no? Entonces el resultado de esa operación iría acá, ¿okay? Y así para los demás casos, ¿no? Entonces esa es la forma de aplicar la normalización min max. Bueno, en la lámina les
digo que hay que corregir, no se preocupen, yo lo lo haré para que tengan como referencia. Luego de esto, nosotros disponemos de el siguiente la siguiente normalización que es la normalización Z, ¿no? La operación utiliza eh la ecuación, perdón, utiliza esta fórmula, ¿okay? la variable x menos el promedio De x divido para la deviación estándar de x, ¿no? En este caso sí se ha aplicado acá, ¿no? La normalizada es este valor, el de acá es este otro valor, etcétera, ¿no? Pero lo que quiero que noten acá y es lo que pasa en todas las normalizaciones,
¿no? Que cuando yo estoy eh normalizando en la variable original, el valor más alto era el primero, ¿sí? y el valor más pequeño era el tercero. Yo normalizo con la Normalización Z y el valor más alto sigue siendo el primero y el valor más pequeño sigue siendo el tercero. ¿Okay? Entonces, yo lo que hice fue mantener la naturaleza original en donde el primero era el mayor y el tercero era el menor, pero lo estoy haciendo en otra escala. Sí, justamente eso se llama normalización. ¿Okay? Entonces, entonces, Entonces luego de eso, nosotros tenemos la, perdón, la
normalización logística que también aplica este contexto. La diferencia es que la logística es mucho más sensible a valores pequeños, ¿no? Es decir, que yo eh como los valores logísticos son muy pequeños, generalmente valores que van entre 0 y un, entonces yo la escala que voy a obtener es bastante mínima, pero la puedo aplicar también, ¿no? Paso eh eh de esto a esto, ¿no? En la en El caso de la perdón, la logística. Finalmente tenemos la logarítmica, que es la que ustedes ven acá, ¿no? Es aplicar el logaritmo de x, o sea, aplicar logaritmo de x
de base 2 de lo que yo estoy haciendo, ¿no? Para obtener el nuevo valor normalizado. Entonces con eso nosotros estaremos haciendo el proceso de eh normalización, ¿no? Y con eso también concluimos esta clase. ¿Qué hicimos entonces o qué estudiamos en esta clase? En esta clase, perdón, primero hablamos del dominio del problema. Dentro del dominio del problema dejamos claramente definida cuáles son las preguntas clave que yo debo responder, que son las que se observan en la lámina. Y además de eso, esas estas preguntas y además de eso, nosotros trabajamos con las etapas de selección, limpieza y
transformación del proceso KDD antes de de llegar a la etapa de el la minería de datos como tal, ¿no? Dentro de la selección Hablamos que para la selección de datos tenemos que analizar cuáles son las fuentes internas y externas, cuáles son los tipos de bases de datos y cuál, cómo debemos identificar las variables que son relevantes o las variables que son irrelevantes para nuestro estudio. En una segunda fase hablamos de la limpieza de los datos y vimos que dentro de la limpieza de los datos teníamos integración de datos y teníamos enriquecimiento de datos y teníamos
el ERA. Para cada caso nosotros analizamos algunas situaciones con problemas que se pueden presentar, tipos de enriquecimiento y sobre todo las actividades que se deben realizar dentro del proceso de análisis exploratorio de datos. Finalmente, analizamos la etapa tres, que es la etapa de transformación de datos. Y dentro de ese proceso nosotros analizamos seis posibles eh transformaciones de datos que se pueden hacer a las variables para mejorar el Proceso de minería de datos. cuando lo vayamos a realizar, ¿no? Entonces, con esto nosotros estamos de alguna manera eh garantizando que los datos que yo estoy analizando tienen
que o van a ir de calidad cuando ingresen a la etapa siguiente, que es la etapa de minería de datos. Entonces, eso es muy importante para los objetivos que se tienen dentro de la de la del curso de minería de datos, ¿no? Entonces, con esto yo cierro y hasta aquí queda la clase número dos. Que tengan una excelente jornada.