De la Terminal al Histograma con Python y Pandas
Este manual contiene la secuencia exacta de pasos y comandos estructurados línea a línea que funcionaron con éxito para importar un archivo de Excel, corregir sus encabezados y realizar análisis estadístico descriptivo junto con un histograma.
Para evitar complicaciones con la lectura de los datos, ten en cuenta las siguientes pautas sobre la estructura del archivo:
Año, Mes,
Sueldo Bruto).KeyError). En este
manual se incluye la solución exacta aplicada para corregir este
desajuste..xls, requiere la librería de soporte
xlrd. Si es un archivo moderno .xlsx, requiere
openpyxl.Ubicación recomendada: Guarda el archivo con el
nombre exacto mare.xls (o el nombre que corresponda) dentro
de la carpeta Descargas (Downloads) de tu
Mac.
Líneas de comando ejecutadas desde la aplicación
Terminal (identificadas por el símbolo %
al inicio).
Asegúrate de contar con el software requerido para procesar archivos de Excel antiguos y generar visualizaciones gráficas:
pip3 install pandas xlrd matplotlib
Una vez instaladas las dependencias, accede al intérprete de comandos de Python:
python3
(Sabrás que ingresaste con éxito porque la línea de comandos
cambiará su indicador a tres flechas consecutivas:
>>>).
Escribe o pega cada instrucción línea a línea en el
indicador >>> y presiona Intro
tras finalizar cada renglón para evitar fallas sintácticas.
import pandas as pd
import os
Carga el archivo alojado en tu carpeta de descargas:
df = pd.read_excel('mare.xls')
Dado que los títulos reales de las columnas quedaron ubicados por error en la primera fila de datos (Fila 0), ejecuta las siguientes tres líneas para reorganizar la estructura de la matriz y transformarla en valores numéricos calculables:
# 1. Copia las etiquetas de la primera fila y asígnalas como títulos de columnas
df.columns = df.iloc[0]
# 2. Remueve la fila 0 duplicada y restablece el índice numérico de la tabla
df = df[1:].reset_index(drop=True)
# 3. Fuerza la conversión de la columna a formato numérico para habilitar las operaciones estadísticas
df['Sueldo Bruto'] = pd.to_numeric(df['Sueldo Bruto'])
Genera el resumen completo de métricas básicas junto a los estadísticos específicos de dispersión y tendencia central:
# Resumen general (Conteo, Media, Desviación Estándar, Mínimo, Máximo y Percentiles)
print(df['Sueldo Bruto'].describe())
# Moda (Identifica el sueldo con mayor frecuencia de repetición)
print("Moda:", df['Sueldo Bruto'].mode())
# Varianza (Mide el nivel de dispersión general de los datos numéricos)
print("Varianza:", df['Sueldo Bruto'].var())
Para generar el gráfico de distribución de frecuencias de los sueldos, ejecuta de manera secuencial la siguiente estructura de comandos:
import matplotlib.pyplot as plt
# Genera el histograma dividiendo los datos en 10 barras con bordes definidos
df['Sueldo Bruto'].hist(bins=10, edgecolor='black', color='skyblue')
# Define los títulos informativos y las etiquetas de los ejes correspondientes
plt.title('Distribución de Sueldo Bruto')
plt.xlabel('Sueldo Bruto')
plt.ylabel('Frecuencia (Cantidad de registros)')
# Despliega la interfaz gráfica nativa en tu Mac
plt.show()
Nota operativa: Al ejecutar plt.show(), emergerá una
ventana independiente con el gráfico. La terminal suspenderá su
ejecución hasta que cierres manualmente la ventana del
histograma, momento en el cual se restablecerá el indicador
>>> para seguir programando.