Guía de Estudio de Minería de Datos


Cuestionario de Repaso

Responda a cada pregunta con 2-3 frases, basándose únicamente en el contexto proporcionado.

  1. ¿Cuáles son las principales diferencias entre los sistemas de bases de datos operacionales (OLTP) y los almacenes de datos (OLAP)?
  2. ¿Cuál es la suposición "ingenua" que hace el clasificador Bayesiano ingenuo y por qué se considera así?
  3. En una Máquina de Vectores de Soporte (SVM), ¿qué son los "vectores de soporte" y cuál es su función?
  4. Explique la diferencia fundamental entre los métodos de agrupamiento jerárquico aglomerativo y divisivo.
  5. Defina la propiedad A priori utilizada en la minería de conjuntos de ítems frecuentes y explique cómo se aprovecha para mejorar la eficiencia del algoritmo.
  6. Describa un almacén de datos (data warehouse) utilizando sus cuatro propiedades clave.
  7. ¿Qué es una "transacción nula" y por qué medidas de interés como lift y χ² son sensibles a ella, a diferencia de otras como all_confidence o Kulczynski?
  8. Explique el concepto del "truco del kernel" (kernel trick) en las SVM y por qué es útil para datos no linealmente separables.
  9. Describa los dos pasos principales del algoritmo de retropropagación (backpropagation) para entrenar una red neuronal.
  10. Diferencie entre un valor atípico global, un valor atípico contextual y un valor atípico colectivo.

Clave de Respuestas del Cuestionario

  1. Los sistemas OLTP están orientados a transacciones y son utilizados por empleados y clientes para la ejecución de operaciones diarias, manejando datos actuales. Por el contrario, los sistemas OLAP están orientados a la obtención de información empresarial, utilizados por trabajadores del conocimiento para el análisis de grandes cantidades de datos históricos con fines de toma de decisiones.
  2. El clasificador Bayesiano ingenuo asume la independencia condicional de clase, lo que significa que el efecto del valor de un atributo sobre una clase dada es independiente de los valores de los otros atributos. Esta suposición se considera "ingenua" porque se hace para simplificar los cálculos involucrados, aunque en la práctica a menudo funciona bien.
  3. Los vectores de soporte son las tuplas de entrenamiento "esenciales" que definen el hiperplano de separación de margen máximo (MMH). Son las tuplas más cercanas al hiperplano y, si se eliminaran, el MMH cambiaría, lo que demuestra su papel crucial en la construcción del clasificador SVM.
  4. Los métodos aglomerativos (ascendentes) comienzan con cada objeto en su propio clúster y fusionan iterativamente los clústeres más cercanos hasta que todos los objetos están en un solo clúster. Por el contrario, los métodos divisivos (descendentes) comienzan con todos los objetos en un único clúster y lo dividen repetidamente en clústeres más pequeños hasta que cada objeto forma su propio clúster.
  5. La propiedad Apriori establece que todos los subconjuntos no vacíos de un conjunto de ítems frecuente también deben ser frecuentes. Los algoritmos como Apriori utilizan este conocimiento previo para podar el espacio de búsqueda, generando candidatos de k+1-ítems solo a partir de conjuntos frecuentes de k-ítems, lo que evita la costosa tarea de comprobar candidatos que se sabe que no pueden ser frecuentes.
  6. Un almacén de datos es una colección de datos orientada a temas (organizada en torno a sujetos principales como clientes o ventas), integrada (construida a partir de múltiples fuentes heterogéneas), variante en el tiempo (almacena datos desde una perspectiva histórica) y no volátil (los datos no se actualizan en tiempo real, sino que se cargan y actualizan periódicamente).
  7. Una transacción nula es una transacción que no contiene ninguno de los conjuntos de ítems que se están examinando. Medidas como lift y χ² se ven fuertemente influenciadas por el número de transacciones nulas en el denominador de sus cálculos, lo que puede llevar a resultados inestables o engañosos. En cambio, medidas como all_confidence y Kulczynski son invariantes a nulos porque sus definiciones eliminan la influencia de estas transacciones.
  8. El truco del kernel permite a las SVM operar en un espacio de características de alta dimensión sin calcular explícitamente las coordenadas de los datos en ese espacio. Lo hace reemplazando el producto escalar de los vectores de características transformados por una función de kernel que calcula el producto escalar en el espacio de entrada original, lo que ahorra una enorme cantidad de cómputo y permite encontrar un hiperplano de separación para datos no linealmente separables.
  9. El primer paso es la propagación hacia adelante, donde la entrada de una tupla de entrenamiento se propaga a través de la red capa por capa para generar la salida de la red y compararla con el valor objetivo, calculando una pérdida. El segundo paso es la retropropagación del error, donde el error de la capa de salida se propaga hacia atrás a través de la red, permitiendo que los pesos y sesgos de cada unidad se actualicen para minimizar la pérdida.
  10. Un valor atípico global se desvía significativamente del resto del conjunto de datos. Un valor atípico contextual se desvía significativamente con respecto a un contexto específico (p. ej., una temperatura de 28°C en invierno). Un valor atípico colectivo es un subconjunto de objetos de datos que, como grupo, se desvían significativamente del conjunto de datos completo, aunque los objetos individuales pueden no ser atípicos por sí mismos.

Preguntas de Ensayo

Las siguientes preguntas están diseñadas para evaluar una comprensión más profunda y la capacidad de sintetizar información. No se proporcionan respuestas.

  1. Compare y contraste las tres categorías principales de algoritmos de minería de conjuntos de ítems frecuentes: algoritmos tipo Apriori, algoritmos basados en el crecimiento de patrones frecuentes (FP-growth) y algoritmos que utilizan el formato de datos vertical (Eclat). Discuta las ventajas y desventajas de cada enfoque.
  2. Discuta la "maldición de la dimensionalidad" y su impacto en el análisis de clústeres y la detección de valores atípicos. Explique al menos dos estrategias diferentes para manejar datos de alta dimensión en el contexto del agrupamiento, como el agrupamiento de subespacios (subspace clustering) y la reducción de dimensionalidad (dimensionality reduction).
  3. Explique las diferencias fundamentales entre el aprendizaje supervisado (como la clasificación) y el aprendizaje no supervisado (como el agrupamiento). Usando los árboles de decisión como ejemplo de un método supervisado y k-means como ejemplo de un método no supervisado, detalle sus respectivos procesos, objetivos y métodos de evaluación.
  4. El texto describe la minería de datos como una "confluencia de múltiples disciplinas". Elabore sobre esta afirmación explicando la relación y las contribuciones de al menos tres de los siguientes campos a la minería de datos: estadística, aprendizaje automático, tecnología de bases de datos y computación de alto rendimiento.
  5. Discuta el impacto social de la minería de datos, cubriendo tanto sus beneficios como los riesgos potenciales. Explique la importancia de la minería de datos que preserva la privacidad y describa brevemente un enfoque, como la privacidad diferencial, mencionado en el texto.

Glosario de Términos Clave

Término

Definición

Aprendizaje Supervisado (Supervised Learning)

Un proceso de aprendizaje en el que la supervisión proviene de los ejemplos etiquetados en el conjunto de datos de entrenamiento; es decir, se conoce la etiqueta de clase de cada tupla de entrenamiento. La clasificación es un ejemplo clásico.

Aprendizaje no Supervisado (Unsupervised Learning)

Un proceso de aprendizaje en el que los ejemplos de entrada no están etiquetados por clase. El análisis de clústeres es un ejemplo clásico.

Árbol de Decisión (Decision Tree)

Un modelo de clasificación con una estructura similar a un diagrama de flujo, donde cada nodo interno denota una prueba sobre un atributo, cada rama representa un resultado de la prueba y cada nodo hoja contiene una etiqueta de clase.

Asociación Multidimensional (Multidimensional Association)

Reglas de asociación que involucran dos o más dimensiones o predicados. Pueden ser interdimensionales (sin predicados repetidos) o híbrido-dimensionales (con predicados repetidos).

Backpropagation (Retropropagación)

Un algoritmo de descenso de gradiente para encontrar un conjunto de pesos en una red neuronal multicapa de alimentación directa que minimice el error cuadrático medio entre la predicción de la red y el valor objetivo conocido. Consta de una fase de propagación hacia adelante y una de retropropagación del error.

Biclustering

Un método de agrupamiento que agrupa simultáneamente objetos y atributos. Busca submatrices en una matriz de datos donde los elementos exhiben un comportamiento coherente.

Clasificación (Classification)

Un proceso de dos pasos: (1) un paso de aprendizaje donde se construye un modelo (clasificador) a partir de un conjunto de datos de entrenamiento con etiquetas de clase conocidas, y (2) un paso de clasificación donde el modelo se utiliza para predecir las etiquetas de clase para nuevos datos.

Clasificador Bayesiano Ingenuo (Naïve Bayesian Classifier)

Un clasificador probabilístico basado en el teorema de Bayes que asume la "independencia condicional de clase", es decir, que el efecto de un valor de atributo en una clase dada es independiente de los valores de los otros atributos.

Clúster (Cluster)

Una colección de objetos de datos que son similares entre sí dentro del mismo clúster y disímiles de los objetos en otros clústeres.

Confianza (Confidence)

Una medida de la certeza de una regla de asociación X ⇒ Y, calculada como la probabilidad condicional `P(Y

Conjunto de Ítems Frecuente (Frequent Itemset)

Un conjunto de ítems que aparece con frecuencia en un conjunto de datos de transacciones, superando un umbral de soporte mínimo especificado por el usuario.

Covarianza (Covariance)

Una medida para evaluar cuánto cambian juntos dos atributos numéricos. Un valor positivo indica que los atributos tienden a aumentar juntos.

Data Warehouse (Almacén de Datos)

Una colección de datos orientada a temas, integrada, variante en el tiempo y no volátil, organizada en apoyo de la toma de decisiones de gestión.

DBSCAN

Un algoritmo de agrupamiento basado en densidad que agrupa los objetos basándose en las nociones de objetos núcleo (core objects), alcanzabilidad por densidad (density-reachability) y conectividad por densidad (density-connectivity).

Esquema en Copo de Nieve (Snowflake Schema)

Una variante del esquema en estrella donde algunas tablas de dimensión están normalizadas, dividiendo aún más los datos en tablas adicionales, formando un gráfico similar a un copo de nieve.

Esquema en Estrella (Star Schema)

El paradigma más común de modelo multidimensional para un almacén de datos, que contiene una gran tabla central (tabla de hechos) y un conjunto de tablas de dimensión más pequeñas.

k-Means

Un algoritmo de agrupamiento por particionamiento que divide un conjunto de datos en k clústeres, donde cada objeto pertenece al clúster con la media más cercana (centroide del clúster).

k-Nearest-Neighbor (k-Vecinos más Cercanos)

Un clasificador que busca en el espacio de atributos las k tuplas de entrenamiento que están más cerca de una tupla desconocida y asigna la clase más común entre estos k vecinos a la tupla desconocida.

Máquina de Vectores de Soporte (Support Vector Machine - SVM)

Un clasificador que, para datos linealmente separables, busca el hiperplano de separación de margen máximo (MMH). Para datos no lineales, utiliza el truco del kernel para transformar los datos a una dimensión superior donde se pueda encontrar un separador lineal.

Medidas de Proximidad (Proximity Measures)

Medidas para evaluar la similitud o disimilitud entre objetos de datos, como la distancia euclidiana, la distancia de Manhattan o la similitud del coseno.

Minería de Datos (Data Mining)

El proceso de descubrir patrones y conocimientos interesantes a partir de cantidades masivas de datos. A menudo se le conoce como Descubrimiento de Conocimiento en Datos (KDD).

OLAP (Online Analytical Processing)

Sistemas utilizados por trabajadores del conocimiento (gerentes, ejecutivos, analistas) para el análisis de datos. Gestionan grandes cantidades de datos históricos y proporcionan facilidades para la resumen y agregación.

OLTP (Online Transaction Processing)

Sistemas que cubren la mayoría de las operaciones diarias de una organización, como compras, inventario y contabilidad. Están orientados a transacciones y gestionan datos actuales.

Patrón Interesante (Interesting Pattern)

Un patrón que es (1) fácilmente comprensible por los humanos, (2) válido en datos nuevos o de prueba con cierto grado de certeza, (3) potencialmente útil y (4) novedoso.

Red Neuronal Convolucional (CNN)

Un tipo de red neuronal de aprendizaje profundo especialmente eficaz para datos de tipo cuadrícula, como imágenes. Su operación clave es la convolución, que utiliza kernels para generar mapas de características.

Red Neuronal Recurrente (RNN)

Un tipo de red neuronal de aprendizaje profundo eficaz para datos secuenciales, como texto. Utiliza conexiones recurrentes para mantener un "estado oculto" que captura información de pasos de tiempo anteriores.

Reducción de Dimensionalidad (Dimensionality Reduction)

El proceso de reducir el número de atributos o variables aleatorias bajo consideración. Las técnicas incluyen el Análisis de Componentes Principales (PCA) y la selección de subconjuntos de atributos.

Regresión (Regression)

Una técnica de análisis predictivo que modela el valor de una variable de respuesta continua (dependiente) basándose en una o más variables predictoras (independientes).

Soporte (Support)

Una medida de la frecuencia de una regla de asociación X ⇒ Y, calculada como la probabilidad P(X ∪ Y), que es el porcentaje de transacciones que contienen tanto X como Y.

Valor Atípico (Outlier)

Un objeto de datos que se desvía significativamente del resto de los objetos, como si fuera generado por un mecanismo diferente.

Valor Atípico Colectivo (Collective Outlier)

Un subconjunto de objetos de datos que, en su conjunto, se desvían significativamente de todo el conjunto de datos, aunque los objetos de datos individuales pueden no ser atípicos.

Valor Atípico Contextual (Contextual Outlier)

Un objeto que se desvía significativamente con respecto a un contexto específico. Por ejemplo, una temperatura de 28°C es un valor atípico en el contexto del invierno en Toronto.

Vectores de Soporte (Support Vectors)

En una SVM, son las tuplas de entrenamiento que están más cerca del hiperplano de separación de margen máximo. Estos puntos son los únicos que determinan la posición del hiperplano.

Comentarios