// módulo extra / minería de datos
[DF] Data Frames & Minería de Datos
La tabla como objeto: el corazón del análisis de datos en R
¿Qué es un data frame?
Un data frame es la estructura más importante de R: una tabla donde cada columna es una variable (un vector) y cada fila es una observación. Es, literalmente, una hoja Excel viviendo dentro de R. Todo el análisis de datos —frecuencias, gráficos, correlación, modelos— opera sobre data frames.
La minería de datos es el proceso de descubrir patrones útiles en grandes volúmenes de datos: limpieza, exploración, agrupación, detección de atípicos y modelos predictivos. Aquí verás los primeros pasos con herramientas base de R.
Laboratorio · ejecuta cada bloque
Estas son las operaciones fundamentales de la ciencia de datos: crear tablas, filtrar, transformar, agrupar, limpiar y descubrir patrones. Todo corre con R real. Edita y presiona Ctrl + Enter.
011 · Anatomía de un data frame
Creamos una tabla, inspeccionamos su estructura y accedemos a filas y columnas.
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
022 · Seleccionar y filtrar
df[fila, columna] o df$columna. Filtramos con condiciones lógicas.
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
033 · Crear y transformar columnas
Agregamos variables derivadas, base de la ingeniería de características (feature engineering).
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
044 · Agrupar y resumir (group by)
aggregate() resume por grupos: el patrón split-apply-combine de la minería de datos.
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
055 · Limpieza de datos (NA y duplicados)
El 80% de la minería es limpiar. Detectamos y tratamos faltantes y duplicados.
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
066 · Exploración multivariada (EDA)
summary() y la matriz de correlación dan una foto completa de un dataset real.
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
077 · Detección de atípicos (minería)
Regla del rango intercuartílico (IQR) para marcar valores anómalos.
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
088 · Agrupamiento con k-means (minería)
k-means descubre grupos naturales sin etiquetas. Aquí, 3 clusters sobre iris.
salida // R>
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
▸ Ejercicios de minería
- Crea un data frame de 5 productos con precio y stock; agrega una columna 'valor = precio*stock'.
- Sobre
mtcars, calcula el mpg promedio agrupado por número de cilindros conaggregate(). - Detecta atípicos en
mtcars$hpcon la regla del IQR. - Aplica
kmeans()con 2 centros sobremtcars[,c('mpg','wt')]y grafica los grupos.