Manual Práctico de Análisis de Datos en Mac

De la Terminal al Histograma con Python y Pandas

Este manual contiene la secuencia exacta de pasos y comandos estructurados línea a línea que funcionaron con éxito para importar un archivo de Excel, corregir sus encabezados y realizar análisis estadístico descriptivo junto con un histograma.


FASE 1: Preparación del Archivo de Excel

Para evitar complicaciones con la lectura de los datos, ten en cuenta las siguientes pautas sobre la estructura del archivo:

  • ¿Debe tener encabezados? Sí, es altamente recomendado. Las tablas deben contar con una fila inicial que asigne nombres a las variables (como Año, Mes, Sueldo Bruto).
  • ¿Qué pasa si hay filas vacías arriba? Si el archivo contiene celdas combinadas, logos corporativos o filas vacías al inicio, Python desplazará los encabezados reales hacia las filas de datos internas (provocando errores de tipo KeyError). En este manual se incluye la solución exacta aplicada para corregir este desajuste.
  • Extensión del archivo: Si tu archivo posee la extensión antigua .xls, requiere la librería de soporte xlrd. Si es un archivo moderno .xlsx, requiere openpyxl.

Ubicación recomendada: Guarda el archivo con el nombre exacto mare.xls (o el nombre que corresponda) dentro de la carpeta Descargas (Downloads) de tu Mac.


FASE 2: Comandos en la Terminal de macOS

Líneas de comando ejecutadas desde la aplicación Terminal (identificadas por el símbolo % al inicio).

2. Instalar las librerías necesarias

Asegúrate de contar con el software requerido para procesar archivos de Excel antiguos y generar visualizaciones gráficas:

pip3 install pandas xlrd matplotlib

3. Iniciar el entorno interactivo de Python

Una vez instaladas las dependencias, accede al intérprete de comandos de Python:

python3

(Sabrás que ingresaste con éxito porque la línea de comandos cambiará su indicador a tres flechas consecutivas: >>>).


FASE 3: Comandos dentro de Python

Escribe o pega cada instrucción línea a línea en el indicador >>> y presiona Intro tras finalizar cada renglón para evitar fallas sintácticas.

1. Importar las librerías básicas

import pandas as pd
import os

2. Leer la tabla de Excel

Carga el archivo alojado en tu carpeta de descargas:

df = pd.read_excel('mare.xls')

3. Corregir y desplazar los encabezados atrapados

Dado que los títulos reales de las columnas quedaron ubicados por error en la primera fila de datos (Fila 0), ejecuta las siguientes tres líneas para reorganizar la estructura de la matriz y transformarla en valores numéricos calculables:

# 1. Copia las etiquetas de la primera fila y asígnalas como títulos de columnas
df.columns = df.iloc[0]

# 2. Remueve la fila 0 duplicada y restablece el índice numérico de la tabla
df = df[1:].reset_index(drop=True)

# 3. Fuerza la conversión de la columna a formato numérico para habilitar las operaciones estadísticas
df['Sueldo Bruto'] = pd.to_numeric(df['Sueldo Bruto'])

4. Ejecutar Estadística Descriptiva

Genera el resumen completo de métricas básicas junto a los estadísticos específicos de dispersión y tendencia central:

# Resumen general (Conteo, Media, Desviación Estándar, Mínimo, Máximo y Percentiles)
print(df['Sueldo Bruto'].describe())

# Moda (Identifica el sueldo con mayor frecuencia de repetición)
print("Moda:", df['Sueldo Bruto'].mode())

# Varianza (Mide el nivel de dispersión general de los datos numéricos)
print("Varianza:", df['Sueldo Bruto'].var())

5. Construcción y Despliegue del Histograma

Para generar el gráfico de distribución de frecuencias de los sueldos, ejecuta de manera secuencial la siguiente estructura de comandos:

import matplotlib.pyplot as plt

# Genera el histograma dividiendo los datos en 10 barras con bordes definidos
df['Sueldo Bruto'].hist(bins=10, edgecolor='black', color='skyblue')

# Define los títulos informativos y las etiquetas de los ejes correspondientes
plt.title('Distribución de Sueldo Bruto')
plt.xlabel('Sueldo Bruto')
plt.ylabel('Frecuencia (Cantidad de registros)')

# Despliega la interfaz gráfica nativa en tu Mac
plt.show()

Nota operativa: Al ejecutar plt.show(), emergerá una ventana independiente con el gráfico. La terminal suspenderá su ejecución hasta que cierres manualmente la ventana del histograma, momento en el cual se restablecerá el indicador >>> para seguir programando.