estadísticaR · terminal_estadistico iniciando…
// módulo extra / minería de datos

[DF] Data Frames & Minería de Datos

La tabla como objeto: el corazón del análisis de datos en R

¿Qué es un data frame?

Un data frame es la estructura más importante de R: una tabla donde cada columna es una variable (un vector) y cada fila es una observación. Es, literalmente, una hoja Excel viviendo dentro de R. Todo el análisis de datos —frecuencias, gráficos, correlación, modelos— opera sobre data frames.

La minería de datos es el proceso de descubrir patrones útiles en grandes volúmenes de datos: limpieza, exploración, agrupación, detección de atípicos y modelos predictivos. Aquí verás los primeros pasos con herramientas base de R.

Laboratorio · ejecuta cada bloque

Estas son las operaciones fundamentales de la ciencia de datos: crear tablas, filtrar, transformar, agrupar, limpiar y descubrir patrones. Todo corre con R real. Edita y presiona Ctrl + Enter.

011 · Anatomía de un data frame
Creamos una tabla, inspeccionamos su estructura y accedemos a filas y columnas.
df_anatomia.R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
022 · Seleccionar y filtrar
df[fila, columna] o df$columna. Filtramos con condiciones lógicas.
df_acceso.R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
033 · Crear y transformar columnas
Agregamos variables derivadas, base de la ingeniería de características (feature engineering).
df_mutar.R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
044 · Agrupar y resumir (group by)
aggregate() resume por grupos: el patrón split-apply-combine de la minería de datos.
df_agregar.R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
055 · Limpieza de datos (NA y duplicados)
El 80% de la minería es limpiar. Detectamos y tratamos faltantes y duplicados.
df_limpieza.R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
066 · Exploración multivariada (EDA)
summary() y la matriz de correlación dan una foto completa de un dataset real.
df_explorar.R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
077 · Detección de atípicos (minería)
Regla del rango intercuartílico (IQR) para marcar valores anómalos.
df_outliers.R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…
088 · Agrupamiento con k-means (minería)
k-means descubre grupos naturales sin etiquetas. Aquí, 3 clusters sobre iris.
df_clustering.R
datos: aún no cargas un archivo · usa el botón «cargar excel» o trabaja con datasets de R
salida // R>

    
El gráfico aparecerá aquí al usar plot(), hist(), barplot()…

▸ Ejercicios de minería

  1. Crea un data frame de 5 productos con precio y stock; agrega una columna 'valor = precio*stock'.
  2. Sobre mtcars, calcula el mpg promedio agrupado por número de cilindros con aggregate().
  3. Detecta atípicos en mtcars$hp con la regla del IQR.
  4. Aplica kmeans() con 2 centros sobre mtcars[,c('mpg','wt')] y grafica los grupos.