# EJECUTAR UNA SOLA VEZ ANTES DEL PRIMER KNIT.
# Este bloque no se ejecuta durante la compilación (eval = FALSE) para que el
# informe no dependa de una descarga desde internet al momento de generarse.
# Para correrlo: abrir este archivo en RStudio y pulsar el botón de ejecutar
# del bloque, o copiar las dos líneas en la consola.
paquetes <- c("readxl", "ggplot2", "dplyr", "knitr", "scales")
install.packages(setdiff(paquetes, rownames(installed.packages())))

2. Resumen

La capacidad de ahorro es un indicador central de la estabilidad económica: cuando el gasto corriente supera de forma sostenida al ingreso, la persona queda expuesta al endeudamiento. Este trabajo realiza un Análisis Exploratorio de Datos (EDA) sobre una base de 100 observaciones y 11 variables que caracterizan el comportamiento económico de personas vinculadas a cuatro sectores productivos, con información demográfica, educativa, monetaria y de hábitos financieros. La metodología es exclusivamente descriptiva: se verificó la integridad de los datos, se clasificaron las variables según su naturaleza, se construyó la variable derivada ahorro como diferencia entre ingreso y gasto mensual, y se calcularon medidas de tendencia central, dispersión y posición, tablas de frecuencia y de contingencia, gráficos univariados y bivariados, y detección de valores atípicos mediante la regla del rango intercuartílico. Todo el procesamiento se realizó en R. Los resultados muestran que 15 de las 100 personas (15 %) presentan ahorro negativo, con un caso extremo cuyo gasto supera su ingreso en un 139 %; que ese grupo combina un ingreso mediano marcadamente menor con un gasto mediano mayor que el resto; y que, pese a ello, no exhibe un nivel de endeudamiento ni una satisfacción económica distintos de los del grupo con ahorro positivo. Se concluye que el déficit de ahorro responde a la coincidencia de ingreso bajo y gasto alto, y que las percepciones autorreportadas no reflejan esa vulnerabilidad objetiva.

3. Palabras clave

análisis exploratorio de datos; capacidad de ahorro; endeudamiento; estadística descriptiva; comportamiento económico.

4. Introducción

4.1 Contextualización del problema

El ahorro es la parte del ingreso que no se destina al consumo corriente, y cumple dos funciones a la vez: amortigua los gastos imprevistos y financia las decisiones de largo plazo, como estudiar, comprar vivienda o montar un negocio. Cuando esa parte se vuelve negativa, es decir, cuando el gasto mensual supera al ingreso mensual, la diferencia hay que cubrirla vendiendo activos o endeudándose. Si la situación se mantiene en el tiempo, la posición financiera del hogar se deteriora.

4.2 Importancia del tema

Comprender qué caracteriza a quienes gastan más de lo que ingresan es relevante tanto para el diseño de programas de educación financiera como para la gestión del riesgo de crédito. La literatura ha mostrado que las decisiones financieras dependen del nivel de ingreso, pero también del conocimiento financiero y de los hábitos de planeación (Lusardi y Mitchell, 2014). En el caso colombiano, las mediciones de capacidades financieras han evidenciado que las prácticas de manejo del dinero y de planeación futura no se distribuyen de manera uniforme entre la población (Gómez-González y Zamudio-Gómez, 2012).

4.3 Antecedentes

Tukey (1977) formalizó el Análisis Exploratorio de Datos como una etapa previa e independiente de la inferencia, cuyo propósito es describir la estructura de los datos, detectar anomalías y generar preguntas, no confirmar hipótesis. Sobre esa base metodológica, Lusardi y Mitchell (2014) documentan que la alfabetización financiera se asocia con mayores niveles de planeación y de acumulación de riqueza, y que los grupos con menor conocimiento financiero son precisamente los más expuestos a decisiones de endeudamiento costosas. Para el contexto colombiano, Gómez-González y Zamudio-Gómez (2012), con datos de la Encuesta de Carga Financiera y Educación de los Hogares, encuentran que las capacidades financieras de la población no dependen exclusivamente del conocimiento técnico, sino también de actitudes y comportamientos frente al manejo del dinero, lo que abre la posibilidad de que existan desfases entre la situación financiera objetiva de una persona y la percepción que tiene de ella. En cuanto a las herramientas, el análisis se apoya en el entorno estadístico R (R Core Team, 2025) y en la gramática de gráficos implementada en ggplot2 (Wickham, 2016), que permite construir visualizaciones por capas y reproducibles.

4.4 Pregunta problema

¿Qué perfil describe a las personas cuyo gasto mensual supera su ingreso mensual, y cómo se distribuyen el nivel de endeudamiento y la satisfacción económica en la muestra analizada?

4.5 Objetivo general

Describir el comportamiento económico de las personas incluidas en la base de datos, caracterizando el perfil de quienes presentan ahorro negativo y analizando la distribución del nivel de endeudamiento y de la satisfacción económica según sus principales atributos demográficos, educativos y sectoriales.

4.6 Objetivos específicos

  1. Verificar la integridad de la base y clasificar cada variable según su naturaleza estadística.
  2. Caracterizar las variables cuantitativas mediante medidas de tendencia central, dispersión y posición, y las cualitativas mediante tablas de frecuencia.
  3. Identificar y evaluar la presencia de valores atípicos.
  4. Contrastar el grupo con ahorro negativo frente al resto de la muestra en términos de ingreso, gasto, endeudamiento y satisfacción económica.

5. Marco teórico

5.1 Análisis exploratorio de datos

El EDA es un conjunto de técnicas gráficas y numéricas para describir unos datos antes de cualquier modelación. Sirve para ver la forma de las distribuciones, detectar errores y valores extremos y formular preguntas. No confirma hipótesis (Tukey, 1977). En este trabajo el EDA no es una etapa preliminar sino el método completo: todas las afirmaciones son descriptivas y se limitan a las 100 observaciones disponibles.

5.2 Variables cualitativas y cuantitativas

Una variable cualitativa registra atributos o categorías; si esas categorías admiten un orden natural se denomina ordinal, y si no, nominal. Una variable cuantitativa registra magnitudes numéricas; es discreta cuando solo toma valores aislados y continua cuando puede tomar cualquier valor dentro de un intervalo. En esta base, sector_economico es cualitativa nominal, nivel_educativo es cualitativa ordinal (Técnico < Universitario < Postgrado), ingreso_mensual es cuantitativa continua y nivel_endeudamiento es cuantitativa discreta medida en una escala de 1 a 10. Esta clasificación no es un formalismo: determina qué medidas pueden calcularse sobre cada variable y qué gráfico es apropiado para representarla.

5.3 Medidas de tendencia central

Resumen la posición típica de los datos. La media es el promedio aritmético y utiliza toda la información, pero se desplaza ante valores extremos. La mediana es el valor que deja el 50 % de los datos por debajo y es resistente a esos valores; por eso la comparación entre media y mediana informa sobre la asimetría de la distribución. La moda es el valor más frecuente; en variables continuas donde todos los valores son distintos, como el ingreso en esta base, la moda no es informativa y se reemplaza por la clase modal del histograma.

5.4 Medidas de dispersión

Cuantifican qué tan separados están los datos entre sí. El rango es la diferencia entre el máximo y el mínimo, y solo usa dos observaciones. La varianza es el promedio de los cuadrados de las desviaciones respecto a la media, y la desviación estándar es su raíz cuadrada, expresada en las unidades originales de la variable. El coeficiente de variación (CV) es el cociente entre la desviación estándar y la media, en porcentaje; al ser adimensional permite comparar la variabilidad relativa de variables medidas en unidades distintas, como pesos colombianos y puntos de una escala. En esta base esa comparación es indispensable.

5.5 Cuartiles y resumen de cinco números

Los cuartiles dividen la distribución ordenada en cuatro partes iguales: \(Q_1\) deja por debajo el 25 % de los datos, \(Q_2\) coincide con la mediana y \(Q_3\) deja por debajo el 75 %. El resumen de cinco números (mínimo, \(Q_1\), mediana, \(Q_3\) y máximo) describe la distribución completa sin suponer ninguna forma particular, y es la base sobre la que se construye el diagrama de caja.

5.6 Valores atípicos

Son observaciones alejadas del cuerpo central de los datos. El criterio empleado en este informe es el del rango intercuartílico:

\[RI = Q_3 - Q_1 \qquad L_i = Q_1 - 1{,}5\,RI \qquad L_s = Q_3 + 1{,}5\,RI\]

Todo valor situado fuera del intervalo \([L_i, L_s]\) se marca como atípico. Marcarlo no equivale a eliminarlo: primero debe determinarse si corresponde a un error de captura o a una observación válida pero infrecuente.

5.7 Tablas de frecuencia

Para variables cualitativas registran cuántas observaciones caen en cada categoría (frecuencia absoluta), qué proporción del total suponen (frecuencia relativa) y su equivalente porcentual. Cruzadas entre dos variables se llaman tablas de contingencia y describen cómo se distribuye una categoría dentro de otra.

5.8 Gráficos estadísticos

El histograma muestra la forma de la distribución de una variable continua agrupada en intervalos. El diagrama de caja dibuja el resumen de cinco números y señala los atípicos; es la mejor opción para comparar una variable numérica entre grupos. El gráfico de barras muestra las frecuencias de una variable cualitativa. Todos se construyen aquí con ggplot2 (Wickham, 2016).

6. Metodología

6.1 Origen de los datos

La base Base_Economia_Negocios.xlsx proviene del repositorio dispuesto por el docente para el taller (https://github.com/Kalbam/Data_Psicolog-a). Son datos ya recolectados y anonimizados; el grupo no participó en su recolección.

6.2 Población y muestra

La base no trae documentación sobre el marco muestral, el periodo de referencia ni cómo se seleccionaron los participantes. Por eso todos los resultados de este informe describen únicamente a las 100 observaciones disponibles y no se extrapolan a ninguna población más amplia. Hay un dato que refuerza la advertencia: sector_economico está perfectamente balanceada, con exactamente 25 observaciones en cada uno de los cuatro sectores. Ese balance exacto no es un hallazgo del análisis. Es un indicio de que la base se construyó por muestreo estratificado por cuotas o por simulación.

6.3 Observaciones, variables y su naturaleza

La base tiene 100 filas y 11 columnas originales, más tres variables derivadas. La Tabla 1 recoge el diccionario completo: nombre de cada variable, su naturaleza estadística, la unidad en que está medida y si es original o derivada.

Tabla 1. Diccionario de variables: naturaleza estadística, unidad de medida y origen.
Variable Naturaleza Unidad Origen
edad Cuantitativa continua Años Original
sexo Cualitativa nominal 3 categorías Original
nivel_educativo Cualitativa ordinal Técnico < Universitario < Postgrado Original
tiene_emprendimiento Cualitativa nominal (dicotómica) Sí / No Original
sector_economico Cualitativa nominal 4 categorías Original
maneja_presupuesto Cualitativa nominal (dicotómica) Sí / No Original
realiza_inversiones Cualitativa nominal (dicotómica) Sí / No Original
ingreso_mensual Cuantitativa continua Pesos colombianos (COP) Original
gasto_mensual Cuantitativa continua Pesos colombianos (COP) Original
nivel_endeudamiento Cuantitativa discreta (escala 1-10) Puntos (1 = mínimo, 10 = máximo) Original
satisfaccion_economica Cuantitativa discreta (escala 1-10) Puntos (1 = mínimo, 10 = máximo) Original
ahorro Cuantitativa continua Pesos colombianos (COP) Derivada
tasa_ahorro Cuantitativa continua Porcentaje del ingreso Derivada
grupo_ahorro Cualitativa nominal (dicotómica) Sí / No Derivada

6.4 Variables derivadas

Se construyeron tres variables a partir de las originales. Se declaran aquí de forma explícita para que nadie las lea como información independiente:

\[\text{ahorro} = \text{ingreso mensual} - \text{gasto mensual}\]

\[\text{tasa de ahorro} = \frac{\text{ahorro}}{\text{ingreso mensual}} \times 100\]

y grupo_ahorro, que clasifica cada observación según el signo del ahorro. Una consecuencia directa de esta definición es que el ahorro está correlacionado por construcción con el ingreso y con el gasto. Esas dos correlaciones son estructurales, no empíricas, y no se interpretan como hallazgos.

6.5 Procedimientos estadísticos

Verificación de valores faltantes y duplicados; clasificación y conversión de tipos, declarando nivel_educativo como factor ordenado; cálculo de medidas de tendencia central (media, mediana, moda), de dispersión (rango, varianza, desviación estándar y coeficiente de variación) y de posición (cuartiles y resumen de cinco números); tablas de frecuencia absoluta, relativa y porcentual; tablas de contingencia; detección de atípicos mediante la regla \(1{,}5 \times RI\); e histogramas, diagramas de caja y gráficos de barras. No se aplicó ninguna técnica inferencial. No se estimaron intervalos de confianza ni se contrastaron hipótesis, porque el alcance del taller es descriptivo.

6.6 Software

R (R Core Team, 2025) con los paquetes readxl (lee el Excel conservando la codificación UTF-8 de las tildes), dplyr (manipulación), ggplot2 (Wickham, 2016) (gráficos), scales (formato de ejes) y knitr (genera el informe reproducible en R Markdown).

6.7 Procesamiento aplicado

No se eliminó, imputó ni transformó ninguna observación. El único procesamiento fue convertir los tipos de variable y crear las tres variables derivadas.

7. Análisis Exploratorio de Datos

7.1 Características generales de la base

dim(datos)     # número de filas y de columnas (incluye las derivadas)
## [1] 100  14
names(datos)   # nombres de las variables
##  [1] "edad"                   "sexo"                   "nivel_educativo"       
##  [4] "tiene_emprendimiento"   "sector_economico"       "maneja_presupuesto"    
##  [7] "realiza_inversiones"    "ingreso_mensual"        "gasto_mensual"         
## [10] "nivel_endeudamiento"    "satisfaccion_economica" "ahorro"                
## [13] "tasa_ahorro"            "grupo_ahorro"
str(datos)     # tipo de dato de cada variable
## 'data.frame':    100 obs. of  14 variables:
##  $ edad                  : num  48 58 64 46 63 49 36 58 49 60 ...
##  $ sexo                  : Factor w/ 3 levels "Femenino","Masculino",..: 2 2 2 1 1 1 3 1 2 1 ...
##  $ nivel_educativo       : Ord.factor w/ 3 levels "Técnico"<"Universitario"<..: 2 3 1 1 1 2 2 2 1 1 ...
##  $ tiene_emprendimiento  : Factor w/ 2 levels "No","Sí": 2 1 2 1 1 2 2 1 2 2 ...
##  $ sector_economico      : Factor w/ 4 levels "Comercio","Manufactura",..: 2 4 4 3 1 3 4 1 2 4 ...
##  $ maneja_presupuesto    : Factor w/ 2 levels "No","Sí": 2 2 2 2 2 1 2 2 2 2 ...
##  $ realiza_inversiones   : Factor w/ 2 levels "No","Sí": 2 2 1 2 2 1 1 1 2 1 ...
##  $ ingreso_mensual       : num  1210940 1543294 3273144 3197859 2033090 ...
##  $ gasto_mensual         : num  1060354 1985951 2372897 965877 1894511 ...
##  $ nivel_endeudamiento   : num  1 4 10 4 9 6 10 4 5 1 ...
##  $ satisfaccion_economica: num  2 8 3 3 8 3 3 5 6 8 ...
##  $ ahorro                : num  150586 -442657 900247 2231982 138579 ...
##  $ tasa_ahorro           : num  12.44 -28.68 27.5 69.8 6.82 ...
##  $ grupo_ahorro          : Factor w/ 2 levels "Ahorro negativo",..: 2 1 2 2 2 2 2 2 2 2 ...
Tabla 2. Estructura de la base: tipo de dato y número de valores distintos por variable.
Variable Tipo_R N_Distintos
edad numeric 38
sexo factor 3
nivel_educativo ordered 3
tiene_emprendimiento factor 2
sector_economico factor 4
maneja_presupuesto factor 2
realiza_inversiones factor 2
ingreso_mensual numeric 100
gasto_mensual numeric 100
nivel_endeudamiento numeric 10
satisfaccion_economica numeric 10
ahorro numeric 100
tasa_ahorro numeric 100
grupo_ahorro factor 2

La base contiene 100 filas y 11 columnas originales, a las que se suman las tres variables derivadas. Las variables cualitativas quedaron declaradas como factor, y nivel_educativo como factor ordenado, de modo que las tablas y los gráficos respeten la jerarquía Técnico < Universitario < Postgrado en lugar de ordenarla alfabéticamente.

7.2 Valores faltantes

colSums(is.na(datos))    # conteo de NA por variable
##                   edad                   sexo        nivel_educativo 
##                      0                      0                      0 
##   tiene_emprendimiento       sector_economico     maneja_presupuesto 
##                      0                      0                      0 
##    realiza_inversiones        ingreso_mensual          gasto_mensual 
##                      0                      0                      0 
##    nivel_endeudamiento satisfaccion_economica                 ahorro 
##                      0                      0                      0 
##            tasa_ahorro           grupo_ahorro 
##                      0                      0
sum(is.na(datos))        # total de NA en la base
## [1] 0
sum(duplicated(datos))   # filas duplicadas exactas
## [1] 0

La base no presenta ningún valor faltante: el conteo de NA es cero en todas las variables. Tampoco se encontraron filas duplicadas (0). En consecuencia, no fue necesario tomar ninguna decisión de imputación ni de eliminación, y el análisis se realiza sobre las 100 observaciones completas. Conviene señalar que la ausencia total de datos faltantes es poco frecuente en encuestas reales y refuerza la advertencia metodológica sobre el posible origen simulado de la base.

7.3 Variables cuantitativas

7.3.1 Medidas de tendencia central, dispersión y posición

tabla_desc <- do.call(rbind, lapply(cuantitativas, function(v) {
  resumen_num(datos[[v]], v)
}))
Tabla 3. Medidas de tendencia central, dispersión y posición. Ingreso, gasto y ahorro en pesos colombianos (COP); endeudamiento y satisfacción en puntos (1-10); tasa de ahorro en porcentaje del ingreso.
Variable n Minimo Q1 Mediana Media Q3 Maximo Rango Desv_Est CV_pct
edad 100 23,0 33,0 45,0 45,0 56,2 65,0 42,0 13,2 29,3
ingreso_mensual 100 897.963,0 1.935.933,8 2.446.855,5 2.446.225,2 2.983.666,0 4.368.968,0 3.471.005,0 709.061,3 29,0
gasto_mensual 100 417.621,0 1.414.284,0 1.715.756,5 1.738.811,6 2.098.176,2 3.210.431,0 2.792.810,0 513.198,3 29,5
nivel_endeudamiento 100 1,0 3,0 6,0 5,5 9,0 10,0 9,0 3,1 56,3
satisfaccion_economica 100 1,0 3,0 6,0 5,6 8,0 10,0 9,0 2,7 47,5
ahorro 100 -1.248.776,0 163.453,0 646.861,0 707.413,6 1.274.429,0 3.479.199,0 4.727.975,0 846.198,8 119,6
tasa_ahorro 100 -139,1 9,0 30,2 22,1 43,2 86,0 225,1 36,0 162,8
Tabla 4. Varianza de las variables cuantitativas (notación científica por la magnitud de las variables monetarias).
Variable Varianza
edad 1.733e+02
ingreso_mensual 5.028e+11
gasto_mensual 2.634e+11
nivel_endeudamiento 9.726e+00
satisfaccion_economica 7.034e+00
ahorro 7.161e+11
tasa_ahorro 1.299e+03
# La moda solo resulta informativa en las variables discretas.
paste("Moda de edad:", paste(moda(datos$edad), collapse = " y "))
## [1] "Moda de edad: 64 y 65"
paste("Moda de nivel_endeudamiento:", paste(moda(datos$nivel_endeudamiento), collapse = " y "))
## [1] "Moda de nivel_endeudamiento: 9"
paste("Moda de satisfaccion_economica:", paste(moda(datos$satisfaccion_economica), collapse = " y "))
## [1] "Moda de satisfaccion_economica: 6"
# En ingreso y gasto los 100 valores son distintos: se reporta la clase modal.
h_ing <- hist(datos$ingreso_mensual, plot = FALSE)
k <- which.max(h_ing$counts)
paste0("Clase modal del ingreso: [", fmt(h_ing$breaks[k]), " ; ",
       fmt(h_ing$breaks[k + 1]), "] COP, con ", h_ing$counts[k], " observaciones.")
## [1] "Clase modal del ingreso: [2.500.000 ; 3.000.000] COP, con 24 observaciones."
# Resumen de cinco números de las tres variables monetarias.
fivenum(datos$ingreso_mensual)
## [1]  897963 1931200 2446856 2984597 4368968
fivenum(datos$gasto_mensual)
## [1]  417621 1412743 1715756 2101536 3210431
fivenum(datos$ahorro)
## [1] -1248776   159164   646861  1276912  3479199

7.3.2 Histogramas

Figura 1. Distribución del ingreso mensual.

Figura 1. Distribución del ingreso mensual.

Figura 2. Distribución del gasto mensual.

Figura 2. Distribución del gasto mensual.

Figura 3. Distribución del ahorro mensual.

Figura 3. Distribución del ahorro mensual.

Figura 4. Distribución de la edad.

Figura 4. Distribución de la edad.

Figura 5. Distribución de las escalas autorreportadas.

Figura 5. Distribución de las escalas autorreportadas.

7.3.3 Diagramas de caja

Figura 6. Diagramas de caja de las variables monetarias.

Figura 6. Diagramas de caja de las variables monetarias.

7.4 Variables cualitativas

tablas_cual <- lapply(cualitativas, function(v) tabla_frec(datos[[v]]))
names(tablas_cual) <- cualitativas
Tabla 5. Distribución por sexo.
Categoria Frec_Absoluta Frec_Relativa Porcentaje
Femenino 46 0.46 46
Masculino 45 0.45 45
Otro 9 0.09 9
Tabla 6. Distribución por nivel educativo.
Categoria Frec_Absoluta Frec_Relativa Porcentaje
Técnico 28 0.28 28
Universitario 52 0.52 52
Postgrado 20 0.20 20
Tabla 7. Distribución según tenencia de emprendimiento.
Categoria Frec_Absoluta Frec_Relativa Porcentaje
51 0.51 51
No 49 0.49 49
Tabla 8. Distribución por sector económico.
Categoria Frec_Absoluta Frec_Relativa Porcentaje
Comercio 25 0.25 25
Manufactura 25 0.25 25
Servicios 25 0.25 25
Tecnología 25 0.25 25
Tabla 9. Distribución según manejo de presupuesto.
Categoria Frec_Absoluta Frec_Relativa Porcentaje
75 0.75 75
No 25 0.25 25
Tabla 10. Distribución según realización de inversiones.
Categoria Frec_Absoluta Frec_Relativa Porcentaje
No 60 0.6 60
40 0.4 40
Figura 7. Distribución de las variables cualitativas.

Figura 7. Distribución de las variables cualitativas.

7.5 Valores atípicos

tabla_atip <- do.call(rbind, lapply(cuantitativas, function(v) {
  atipicos_ri(datos[[v]], v)
}))
Tabla 11. Detección de valores atípicos mediante la regla del rango intercuartílico (1,5 x RI).
Variable Q1 Q3 RI Lim_Inferior Lim_Superior N_Atipicos
edad 33,0 56,2 23,2 -1,9 91,1 0
ingreso_mensual 1.935.933,8 2.983.666,0 1.047.732,2 364.335,4 4.555.264,4 0
gasto_mensual 1.414.284,0 2.098.176,2 683.892,2 388.445,6 3.124.014,6 2
nivel_endeudamiento 3,0 9,0 6,0 -6,0 18,0 0
satisfaccion_economica 3,0 8,0 5,0 -4,5 15,5 0
ahorro 163.453,0 1.274.429,0 1.110.976,0 -1.503.011,0 2.940.893,0 1
tasa_ahorro 9,0 43,2 34,2 -42,4 94,6 3
# Identificación de las observaciones atípicas en el gasto mensual.
lim_gasto <- atipicos_ri(datos$gasto_mensual, "gasto_mensual")
obs_atip <- datos[datos$gasto_mensual > lim_gasto$Lim_Superior |
                  datos$gasto_mensual < lim_gasto$Lim_Inferior, ]
obs_atip[, c("edad", "sexo", "nivel_educativo", "sector_economico",
             "ingreso_mensual", "gasto_mensual", "ahorro")]
##    edad      sexo nivel_educativo sector_economico ingreso_mensual
## 33   56 Masculino   Universitario      Manufactura         2543013
## 43   65  Femenino   Universitario         Comercio         2025826
##    gasto_mensual   ahorro
## 33       3136120  -593107
## 43       3210431 -1184605
Figura 8. Detección de atípicos en el gasto mensual.

Figura 8. Detección de atípicos en el gasto mensual.

7.5.1 Decisión sobre los atípicos

La Tabla 11 reúne los límites \(L_i\) y \(L_s\) de cada variable y el número de observaciones que quedan fuera de ellos; la Figura 8 los muestra sobre el diagrama de caja del gasto mensual. Se detectaron 2 observaciones atípicas en gasto_mensual, una en ahorro (el ahorro más alto de la muestra) y tres en tasa_ahorro (las tres tasas negativas más extremas). Las variables edad, ingreso_mensual, nivel_endeudamiento y satisfaccion_economica no presentan ninguna. No se eliminó ninguna observación, por dos razones. Primero, los atípicos del gasto se sitúan apenas por encima del límite superior y corresponden a montos económicamente plausibles, no a errores de digitación ni a valores imposibles. Segundo, los atípicos del ahorro y de la tasa de ahorro son consecuencia aritmética de la definición de esas variables derivadas y constituyen precisamente el fenómeno que este trabajo busca describir: eliminarlos suprimiría el objeto de estudio.

7.6 Análisis bivariado

Figura 9. Ahorro mensual por sector económico.

Figura 9. Ahorro mensual por sector económico.

Figura 10. Ahorro mensual por nivel educativo.

Figura 10. Ahorro mensual por nivel educativo.

Tabla 12. Ahorro mensual (COP) y nivel de endeudamiento (puntos) por sector económico y por nivel educativo.
Agrupacion Categoria n Ahorro_mediano Ahorro_medio Endeud_mediano Con_ahorro_neg
Sector económico Comercio 25 455.907 611.477 6 4
Sector económico Manufactura 25 821.295 645.602 6 4
Sector económico Servicios 25 653.847 755.585 5 4
Sector económico Tecnología 25 900.247 816.991 3 3
Nivel educativo Técnico 28 573.815 593.013 5 5
Nivel educativo Universitario 52 707.982 774.880 6 7
Nivel educativo Postgrado 20 823.255 692.161 4 3
Figura 11. Ingreso y gasto según el signo del ahorro.

Figura 11. Ingreso y gasto según el signo del ahorro.

Figura 12. Endeudamiento y satisfacción según el signo del ahorro.

Figura 12. Endeudamiento y satisfacción según el signo del ahorro.

Tabla 13. Comparación de medianas entre el grupo con ahorro negativo y el resto. Ingreso y gasto en pesos colombianos (COP); endeudamiento y satisfacción en puntos (1-10).
grupo_ahorro n Ingreso_mediano Gasto_mediano Endeud_mediano Satisf_mediana
Ahorro negativo 15 1.568.994 2.108.254 6 6
Ahorro no negativo 85 2.612.191 1.622.634 6 6
# Tablas de contingencia entre variables cualitativas de interés.
tc1 <- table(Maneja_presupuesto = datos$maneja_presupuesto,
             Realiza_inversiones = datos$realiza_inversiones)

tc2 <- table(Tiene_emprendimiento = datos$tiene_emprendimiento,
             Sector = datos$sector_economico)

tc3 <- table(Grupo_ahorro = datos$grupo_ahorro,
             Maneja_presupuesto = datos$maneja_presupuesto)
Tabla 14. Manejo de presupuesto por realización de inversiones: frecuencias absolutas con totales marginales (n.º de personas).
No Sum
No 15 10 25
45 30 75
Sum 60 40 100
Tabla 15. Distribución porcentual por fila de la Tabla 14: dentro de cada grupo de manejo de presupuesto, porcentaje que realiza o no inversiones.
No
No 60 40
60 40
Tabla 16. Tenencia de emprendimiento por sector económico (n.º de personas).
Comercio Manufactura Servicios Tecnología
No 17 9 13 10
8 16 12 15
Tabla 17. Signo del ahorro por manejo de presupuesto (n.º de personas).
No
Ahorro negativo 6 9
Ahorro no negativo 19 66
# Correlaciones de Pearson, con propósito exclusivamente descriptivo.
vars_cor <- c("edad", "ingreso_mensual", "gasto_mensual",
              "nivel_endeudamiento", "satisfaccion_economica")
matriz_cor <- round(cor(datos[, vars_cor]), 3)
Tabla 18. Matriz de correlaciones de Pearson entre las variables cuantitativas originales. Se excluyen las variables derivadas porque su correlación con el ingreso y el gasto es aritmética, no empírica.
edad ingreso_mensual gasto_mensual nivel_endeudamiento satisfaccion_economica
edad 1.000 0.016 0.162 -0.024 0.036
ingreso_mensual 0.016 1.000 0.069 -0.114 -0.167
gasto_mensual 0.162 0.069 1.000 -0.003 0.032
nivel_endeudamiento -0.024 -0.114 -0.003 1.000 -0.032
satisfaccion_economica 0.036 -0.167 0.032 -0.032 1.000

8. Resultados e interpretación

8.1 Estructura e integridad de la base

La base está completa: 0 valores faltantes y 0 filas duplicadas sobre 100 observaciones (Tabla 2). Ningún resultado de este informe está condicionado por decisiones de imputación o de eliminación, lo cual simplifica la interpretación pero, como se advirtió en la metodología, constituye un comportamiento atípico para datos de encuesta reales.

8.2 Distribución de las variables cuantitativas

Las medidas de tendencia central, dispersión y posición de las siete variables cuantitativas se presentan en la Tabla 3, y sus varianzas en la Tabla 4, separadas porque la magnitud que alcanzan en las variables monetarias las hace ilegibles junto al resto. Los tres diagramas de caja de la Figura 6 permiten comparar de un vistazo el recorrido de ingreso, gasto y ahorro sobre una misma escala. Esa figura es, precisamente, la representación gráfica del resumen de cinco números calculado en 7.3.1: el mínimo y el máximo marcan los extremos de los bigotes, y \(Q_1\), la mediana y \(Q_3\) delimitan la caja.

El ingreso mensual (Figura 1) se concentra en la parte central de su recorrido: la mediana es de 2.446.856 COP y la media de 2.446.225 COP. La coincidencia casi exacta entre ambas medidas indica una distribución simétrica, sin la asimetría a la derecha que suele caracterizar a las distribuciones de ingreso reales, donde unos pocos ingresos muy altos arrastran la media por encima de la mediana. El coeficiente de variación es de 29,0 %, es decir, variabilidad moderada: la dispersión equivale a poco menos de un tercio del valor promedio.

El gasto mensual (Figura 2) presenta un patrón semejante, con mediana 1.715.756 COP y coeficiente de variación de 29,5 %. En conjunto, los datos describen personas cuyo gasto típico se sitúa en torno al 70 % de su ingreso típico.

El ahorro (Figura 3) es la variable con mayor variabilidad relativa de toda la base: su coeficiente de variación alcanza 119,6 %, muy por encima del de sus dos componentes. Esto ocurre porque el ahorro es una diferencia entre dos magnitudes de tamaño similar, de modo que la dispersión relativa se amplifica. Su mediana es de 646.861 COP y la tasa mediana de ahorro es de 30,2 % del ingreso.

Las modas confirman esa lectura y muestran dónde se acumulan efectivamente los datos. En el ingreso, donde los 100 valores son distintos, la moda carece de sentido y se reemplaza por la clase modal del histograma: el intervalo entre 2.500.000 y 3.000.000 COP concentra 24 personas, el tramo más poblado de la distribución. En las variables discretas sí es informativa: el endeudamiento tiene moda 9 puntos (16 personas), en la zona alta de la escala, mientras que la satisfacción tiene moda 6 puntos (15 personas), justo en la mitad. En la satisfacción la moda coincide con la mediana (6 puntos), mientras que en el endeudamiento la moda queda tres puntos por encima de su mediana (6): hay una acumulación en la parte alta de la escala que la mediana por sí sola no deja ver. La edad resulta bimodal, con moda en 64 y 65 años (6 personas en cada valor), lo que refleja que ningún año concentra un número apreciable de casos.

La edad (Figura 4) se reparte entre los 23 y los 65 años, con una mediana de 45 años y un coeficiente de variación de 29,3 %. El histograma no muestra una concentración marcada en ningún tramo etario: la muestra cubre de forma amplia todo el rango laboral activo, lo que evita que los resultados queden dominados por un solo grupo de edad.

8.3 El grupo con ahorro negativo

15 de las 100 personas (15 %) gastan más de lo que ingresan. El caso más extremo registra un ahorro de -1.248.776 COP, esto es, un gasto superior a su ingreso en un 139 %.

La Figura 11 y la Tabla 13 muestran que el déficit no viene de una sola causa sino de dos que coinciden. Quienes tienen ahorro negativo registran un ingreso mediano de 1.568.994 COP frente a 2.612.191 COP del resto, cerca de un 40 % menos. Al mismo tiempo gastan una mediana de 2.108.254 COP frente a 1.622.634 COP, alrededor de un 30 % más. No son personas de bajos ingresos que gastan poco, ni personas de altos ingresos que gastan mucho: son las que cargan con las dos condiciones a la vez. Este es el hallazgo central del análisis y responde directamente a la pregunta problema.

El único atributo declarado que acompaña a este grupo es el manejo del presupuesto (Tabla 17). Entre las 75 personas que afirman llevarlo, 9 presentan ahorro negativo (12 %); entre las 25 que no lo llevan, son 6 (24 %). La proporción se duplica en el grupo que no presupuesta. Conviene, sin embargo, no sobreinterpretar el dato: descansa sobre apenas 6 casos, y con ese tamaño la diferencia podría desaparecer en otra muestra. Se describe la asociación observada sin atribuirle carácter causal ni proyectarla más allá de estas 100 observaciones.

8.4 Percepciones autorreportadas frente a la situación objetiva

En el conjunto de la muestra, ni el endeudamiento ni la satisfacción se concentran en un tramo definido (Figura 5). Las dos reparten sus frecuencias a lo largo de los diez puntos posibles, con coeficientes de variación del 56 % y el 48 %. En dispersión relativa son las variables originales menos homogéneas de la base.

El resultado más llamativo es negativo. Según la Figura 12 y la Tabla 13, el grupo con ahorro negativo declara una mediana de endeudamiento de 6 puntos frente a 6 del resto, y una mediana de satisfacción económica de 6 puntos frente a 6. Las dos escalas autorreportadas son casi indistinguibles entre los grupos. Quienes gastan más de lo que ingresan de forma sistemática no se perciben ni más endeudados ni menos satisfechos que quienes ahorran.

Caben dos lecturas y un diseño descriptivo no permite separarlas. Puede haber un desfase real entre la situación financiera y la percepción que se tiene de ella, lo que coincidiría con lo que documentan Gómez-González y Zamudio-Gómez (2012) sobre la distancia entre conocimiento financiero y comportamiento efectivo. También puede ser que las escalas se generaran sin relación con las variables monetarias, algo coherente con el origen simulado que sugiere el balance exacto de los sectores. Se deja constancia del hecho y de las dos lecturas, sin escoger entre ellas.

8.5 Variables cualitativas

La Figura 7 resume en un solo panel la distribución de las seis variables cualitativas, y las Tablas 5 a 10 recogen sus frecuencias absolutas, relativas y porcentuales.

El sexo se reparte de forma casi equitativa entre femenino (46 %) y masculino (45 %), con un 9 % en la categoría “Otro” (Tabla 5). El nivel educativo se concentra en Universitario (52 %), seguido de Técnico (28 %) y Postgrado (20 %) (Tabla 6); no aparece ninguna categoría de educación básica o media, lo que delimita el tipo de población representada y debe tenerse presente al leer los resultados. El sector económico está perfectamente balanceado con 25 observaciones por categoría (Tabla 8), rasgo ya identificado como propiedad del diseño y no como hallazgo.

Tres de cada cuatro personas afirman manejar presupuesto (75 %, Tabla 9), pero solo el 40 % realiza inversiones (Tabla 10). El cruce de ambas variables (Tablas 14 y 15) revela la brecha: de las 75 personas que presupuestan, 45 no invierten. Existe además un grupo de 10 personas que invierte sin manejar presupuesto. En esta base, declarar el manejo de un presupuesto no viene acompañado de decisiones de inversión.

Algo más de la mitad de la muestra declara tener un emprendimiento (51 personas, Tabla 7). Su distribución por sector no es uniforme (Tabla 16): se concentra en Manufactura y Tecnología, con 16 y 15 de las 25 personas de cada sector, y es minoritaria en Comercio, donde solo 8 de 25 lo declaran.

8.6 Ahorro según sector económico y nivel educativo

La Figura 9 y la Tabla 12 comparan el ahorro entre los cuatro sectores. El sector Comercio registra la mediana más baja (455.907 COP) y Tecnología la más alta (900.247 COP). La distancia entre ambos es de aproximadamente 444.340 COP mensuales, pero las cajas de los cuatro sectores se superponen ampliamente y cada uno contiene entre tres y cuatro personas con ahorro negativo. La diferencia entre sectores es, por tanto, pequeña frente a la variabilidad que existe dentro de cada uno.

El sector Tecnología presenta además la mediana de endeudamiento más baja de los cuatro (3 puntos frente a 6 en los más endeudados, Tabla 12). Es la única diferencia sectorial apreciable de toda la base.

Por nivel educativo (Figura 10) las medianas de ahorro siguen el orden esperado: 573.815 COP en Técnico, 707.982 COP en Universitario y 823.255 COP en Postgrado. Eso sugeriría un gradiente que crece con la formación. El gradiente no se sostiene al mirar las medias, que son 593.013, 774.880 y 692.161 COP: ahí el grupo Universitario supera al de Postgrado. Que la mediana y la media ordenen los grupos de forma distinta indica que la diferencia es frágil y depende de la dispersión interna, no del nivel educativo. Queda el patrón anotado, con la advertencia de que no debe leerse como una relación establecida.

8.7 Relaciones entre variables cuantitativas

La matriz de correlaciones (Tabla 18) muestra asociaciones lineales prácticamente nulas entre todas las variables originales. La más alta en valor absoluto es la que vincula el ingreso con la satisfacción económica (r = -0,167), y la correlación entre ingreso y gasto es apenas de 0,069.

Este último valor merece comentario. En datos reales cabe esperar que ingreso y gasto estén fuertemente correlacionados, porque quien más gana suele gastar más en términos absolutos. Que aquí resulten esencialmente independientes es, en sí mismo, un resultado que apunta al carácter simulado de la base. La ausencia de asociación se reporta como resultado, sin forzar ninguna interpretación causal. Las correlaciones del ahorro con el ingreso y con el gasto se excluyen deliberadamente de esta lectura porque son consecuencia aritmética de su definición, tal como se advirtió en la metodología.

8.8 Síntesis de los patrones observados

La Tabla 19 recoge las respuestas a las preguntas que el numeral 13 de la guía exige contestar sobre cada resultado.

Tabla 19. Síntesis de los patrones observados, organizada según las preguntas del numeral 13 de la guía.
Pregunta Qué muestran los datos
¿Dónde se concentran los datos? Las tres variables monetarias son casi simétricas y sus medias y medianas coinciden. La edad se reparte entre los 23 y los 65 años sin acumularse en ningún tramo.
¿Hay alta o baja variabilidad? Moderada y muy parecida en ingreso, gasto y edad, con CV cercano al 29 %. Alta en endeudamiento y satisfacción, con 56 % y 48 %. Extrema en el ahorro, por encima del 100 %, por ser una diferencia.
¿Qué categorías predominan? Nivel universitario, manejo de presupuesto afirmativo y ausencia de inversiones.
¿Existen valores faltantes? Ninguno en las 11 variables originales.
¿Existen valores atípicos? Dos en el gasto mensual, uno en el ahorro y tres en la tasa de ahorro. Todos conservados y justificados en 7.5.1.
¿Qué significa en el contexto? El riesgo financiero se concentra en un 15 % que junta ingreso bajo con gasto alto y que no se distingue del resto por lo que declara.

9. Conclusiones

  1. El déficit de ahorro afecta a una minoría identificable y nace de dos condiciones que coinciden. 15 de las 100 personas analizadas gastan más de lo que ingresan. Su perfil no se explica solo por ingresos bajos ni solo por gastos altos, sino por la suma de los dos: un ingreso mediano de 1.568.994 COP frente a 2.612.191 COP del resto, junto con un gasto mediano de 2.108.254 COP frente a 1.622.634 COP. Esto responde de forma directa a la pregunta problema.

  2. Lo que la gente declara no refleja su situación financiera real. El endeudamiento y la satisfacción económica que reporta el grupo con ahorro negativo son casi iguales a los del resto. Un criterio de identificación basado solo en la autopercepción no detectaría al grupo en riesgo.

  3. Llevar presupuesto no lleva a invertir. El 75 % de la muestra afirma manejar presupuesto, pero 45 de esas 75 personas no realiza inversiones, y hay 10 que invierten sin presupuestar. Adoptar una práctica financiera no arrastra a las demás.

  4. El ahorro varía mucho más que sus componentes. El ingreso y el gasto tienen coeficientes de variación cercanos al 29 %; el del ahorro supera el 100 %. Como es la diferencia entre dos magnitudes parecidas, cualquier variación pequeña en una de las dos se amplifica. Eso hace del ahorro un indicador muy sensible para seguir la situación financiera de una persona.

  5. Las características de la base limitan hasta dónde llegan estos hallazgos. No hay ningún dato faltante, el balance por sector es exactamente de 25 observaciones y las correlaciones entre variables que en la realidad sí están asociadas, como el ingreso y el gasto, son casi nulas. Todo apunta a datos construidos con fines pedagógicos. Los resultados describen esta base y no se extrapolan a ninguna población. Reconocerlo hace parte del análisis.

10. Bibliografía

Gómez-González, E., y Zamudio-Gómez, N. E. (2012). Las capacidades financieras de la población colombiana (Borradores de Economía N.º 725). Banco de la República. https://www.banrep.gov.co/es/borrador-725

Lusardi, A., y Mitchell, O. S. (2014). The economic importance of financial literacy: Theory and evidence. Journal of Economic Literature, 52(1), 5–44. https://doi.org/10.1257/jel.52.1.5

R Core Team. (2025). R: A language and environment for statistical computing. R Foundation for Statistical Computing. https://www.R-project.org/

Tukey, J. W. (1977). Exploratory data analysis. Addison-Wesley.

Wickham, H. (2016). ggplot2: Elegant graphics for data analysis (2.ª ed.). Springer. https://doi.org/10.1007/978-3-319-24277-4

11. Declaración sobre el uso de Inteligencia Artificial

Aspecto Información
Uso de IA
Herramienta LucIA Herramienta Uninorte
Finalidad Construccion de graficas en R y Refinamiento de los argumentos y conclusiones
Porcentaje estimado 55 %

Anexo. Información de la sesión

sessionInfo()
## R version 4.6.1 (2026-06-24)
## Platform: x86_64-pc-linux-gnu
## Running under: Ubuntu 24.04.4 LTS
## 
## Matrix products: default
## BLAS:   /usr/lib/x86_64-linux-gnu/openblas-pthread/libblas.so.3 
## LAPACK: /usr/lib/x86_64-linux-gnu/openblas-pthread/libopenblasp-r0.3.26.so;  LAPACK version 3.12.0
## 
## locale:
##  [1] LC_CTYPE=C.UTF-8       LC_NUMERIC=C           LC_TIME=C.UTF-8       
##  [4] LC_COLLATE=C.UTF-8     LC_MONETARY=C.UTF-8    LC_MESSAGES=C.UTF-8   
##  [7] LC_PAPER=C.UTF-8       LC_NAME=C              LC_ADDRESS=C          
## [10] LC_TELEPHONE=C         LC_MEASUREMENT=C.UTF-8 LC_IDENTIFICATION=C   
## 
## time zone: UTC
## tzcode source: system (glibc)
## 
## attached base packages:
## [1] stats     graphics  grDevices utils     datasets  methods   base     
## 
## other attached packages:
## [1] scales_1.4.0  knitr_1.51    dplyr_1.2.1   ggplot2_4.0.3 readxl_1.5.0 
## 
## loaded via a namespace (and not attached):
##  [1] vctrs_0.7.3        cli_3.6.6          rlang_1.3.0        xfun_0.60         
##  [5] generics_0.1.4     S7_0.2.2           jsonlite_2.0.0     labeling_0.4.3    
##  [9] glue_1.8.1         htmltools_0.5.9    sass_0.4.10        rmarkdown_2.31    
## [13] grid_4.6.1         cellranger_1.1.0   tibble_3.3.1       evaluate_1.0.5    
## [17] jquerylib_0.1.4    fastmap_1.2.0      yaml_2.3.12        lifecycle_1.0.5   
## [21] compiler_4.6.1     RColorBrewer_1.1-3 pkgconfig_2.0.3    rstudioapi_0.19.0 
## [25] farver_2.1.2       digest_0.6.39      viridisLite_0.4.3  R6_2.6.1          
## [29] tidyselect_1.2.1   pillar_1.11.1      magrittr_2.0.5     bslib_0.11.0      
## [33] withr_3.0.3        tools_4.6.1        gtable_0.3.6       cachem_1.1.0