Resumen de la Sección: En esta pestaña se presenta la introducción del estudio, la fuente oficial de los datos y la definición del modelo econométrico.
El análisis del desempeño financiero y operativo de las organizaciones constituye un pilar fundamental para comprender la dinámica macroeconómica y la productividad del tejido empresarial en Colombia. En el contexto corporativo, los ingresos operacionales representan la métrica cuantitativa por excelencia para evaluar la escala comercial, el grado de penetración en el mercado y la capacidad de tracción del negocio. Por lo tanto, determinar los factores cuantitativos e institucionales que explican las variaciones en las ventas resulta crucial no solo para la formulación de estrategias corporativas y la asignación eficiente de crédito, sino también para la fundamentación de políticas públicas orientadas al desarrollo empresarial.
A partir de los microdatos oficiales del Sistema de Información y Riesgo Empresarial (SIREM), administrados por la Superintendencia de Sociedades y publicados en el portal de Datos Abiertos de Colombia, esta investigación aplica un enfoque econométrico de regresión múltiple sobre una muestra representativa de las principales firmas del país. El estudio evalúa el impacto que ejercen la escala de inversión, el endeudamiento, la generación de valor neta, la solidez patrimonial y el macrosector económico sobre los ingresos reportados por las empresas colombianas.
¿De qué manera la escala operativa (Activos), el apalancamiento financiero (Pasivos), la rentabilidad neta (Ganancia/Pérdida) y la solidez patrimonial (Patrimonio) determinan los Ingresos Operacionales de las empresas colombianas, y en qué medida existen diferencias estructurales según el Macrosector económico en el que compiten?
Objetivo General:
Ajustar e interpretar un Modelo de Regresión Lineal Múltiple por
Mínimos Cuadrados Ordinarios (MCO) que cuantifique la relación
entre la estructura financiera, el macrosector económico y los ingresos
operacionales de las empresas en Colombia, evaluando la validez
econométrica del modelo.
Objetivos Específicos:
Ingresos, Activos,
Pasivos, Ganancia, Patrimonio) y
la variable categórica (Macrosector) mediante análisis
exploratorio de datos (EDA).El estudio se nutre de información financiera primaria y oficial del sector corporativo colombiano:
Entidad Emisora: Superintendencia de Sociedades de Colombia – Sistema de Información y Riesgo Empresarial (SIREM)
Nombre de la Base: 10.000 Empresas más Grandes del País.
Portal de Origen: Datos Abiertos Colombia (Ministerio de Comercio, Industria y Turismo).
Enlace Oficial de Consulta: https://www.datos.gov.co/Comercio-Industria-y-Turismo/10-000-Empresas-mas-Grandes-del-Pa-s/6cat-2gcs/about_data
Unidad de Análisis: Empresa colombiana individual sujeta a supervisión e inspección contable.
Período de Análisis: Cierre de ejercicio fiscal reportado en los estados financieros individuales oficiales].
La unidad de análisis corresponde a cada empresa colombiana bajo vigilancia contable. De un conjunto inicial de 50.000 registros, se descartaron las variables de identificación y ubicación (NIT, ciudad, fecha) por no aportar al modelo, conservando únicamente la razón social, el macrosector y las métricas financieras clave. La preparación técnica en R consistió en limpiar el formato monetario de las cifras (removiendo símbolos de $ y comas con gsub() para convertirlas a tipo numeric y definir la variable Macrosector como factor. Tras limpiar estos datos, la aplicación de na.omit() eliminó 505 registros incompletos, consolidando una base de datos limpia de 49.495 empresas válidas para la estimación del modelo econométrico.
library(dplyr)
nombre_csv <- "Empresas.csv"
# 1. Determinar la ruta dinámica del archivo
if (file.exists(nombre_csv)) {
ruta_final <- nombre_csv
} else if (file.exists(file.path(getwd(), nombre_csv))) {
ruta_final <- file.path(getwd(), nombre_csv)
} else {
# Si RStudio no localiza la carpeta al compilar, solicitar la ubicación interactiva
ruta_final <- file.choose()
}
# 2. Carga de datos
datos <- read.csv(ruta_final, encoding = "UTF-8")
# Depuración y limpieza
datos_limpios <- datos %>%
mutate(
Ingresos = as.numeric(gsub("[\\$,]", "", INGRESOS.OPERACIONALES)),
Activos = as.numeric(gsub("[\\$,]", "", TOTAL.ACTIVOS)),
Pasivos = as.numeric(gsub("[\\$,]", "", TOTAL.PASIVOS)),
Ganancia = as.numeric(gsub("[\\$,]", "", GANANCIA..PÉRDIDA.)),
Patrimonio = as.numeric(gsub("[\\$,]", "", TOTAL.PATRIMONIO)),
Macrosector = as.factor(MACROSECTOR)
) %>%
select(RAZÓN.SOCIAL, Macrosector, Ingresos, Activos, Pasivos, Ganancia, Patrimonio) %>%
na.omit()sss Para responder a la pregunta de investigación y analizar los determinantes de los ingresos operacionales en el sector empresarial colombiano,se empleó un modelo cuantitativo de Regresión Lineal Múltiple por Mínimos Cuadrados Ordinarios (MCO). Esta sección presenta la caracterización de las variables seleccionadas, la justificación económica de su inclusión y la formulación matemática del modelo econométrico.
El modelo de regresión lineal múltiple se expresa matemáticamente mediante la siguiente ecuación poblacional:
\[\text{Ingresos}_i = \beta_0 + \beta_1 \text{Activos}_i + \beta_2 \text{Pasivos}_i + \beta_3 \text{Ganancia}_i + \beta_4 \text{Patrimonio}_i + \sum_{k=1}^{5} \gamma_k \text{Macrosector}_{k,i} + \varepsilon_i\]
A continuación se detallan la variable dependiente (\(Y\)) y las cinco variables independientes (\(X\)) incorporadas en el estudio:
| Variable | Tipo y Naturaleza | Rol Económico y Descripción | Justificación de Selección |
|---|---|---|---|
Ingresos (\(Y\)) |
Numérica Continua (\(COP\)) | Variable Dependiente: Mide el flujo bruto de caja y el volumen total de ventas generado por la actividad ordinaria de la empresa[cite: 3, 5]. | Es la métrica por excelencia para evaluar la escala comercial, la participación de mercado y la tracción operativa de la firma. |
Activos (\(X_1\)) |
Numérica Continua (\(COP\)) | Predictora (Capacidad Operativa): Representa el valor de la infraestructura, bienes y recursos bajo control de la firma. | Mide la escala o tamaño productivo. Se espera un impacto positivo (\(\beta_1 > 0\)), pues a mayor infraestructura, mayor capacidad potencial de venta. |
Pasivos (\(X_2\)) |
Numérica Continua (\(COP\)) | Predictora (Apalancamiento): Mide el total de deudas y obligaciones financieras con terceros (proveedores y bancos). | Evalúa el rol del crédito comercial y financiero como motor de expansión de las operaciones de venta (\(\beta_2 > 0\)). |
Ganancia (\(X_3\)) |
Numérica Continua (\(COP\)) | Predictora (Rentabilidad Neta): Refleja la utilidad o pérdida neta del ejercicio fiscal (\(COP\)). | Captura la eficiencia operativa y la capacidad del negocio para convertir su actividad comercial en valor económico neto. |
Patrimonio (\(X_4\)) |
Numérica Continua (\(COP\)) | Predictora (Solidez Financiera): Representa el capital propio aportado por los socios más reservas y utilidades retenidas. | Mide el respaldo financiero interno, la solidez patrimonial y la capacidad de absorber perturbaciones del mercado. |
Macrosector (\(X_5\)) |
Categórica / Factor (\(6\) niveles) | Predictora (Estructura Sectorial): Clasifica a la empresa en: AGROPECUARIO, COMERCIO, CONSTRUCCIÓN, MANUFACTURA, MINERO o SERVICIOS. | Controla la heterogeneidad estructural, intensidades tecnológicas y márgenes propios de cada sector. Categoría de Referencia: AGROPECUARIO. |
Resumen de la Sección: En esta pestaña se examinan los estadísticos descriptivos clave y la distribución visual de las variables financieras mediante un diagrama de cajas por macrosector y un gráfico de dispersión en escala logarítmica para identificar heterogeneidad sectorial y rendimientos a la escala.
A continuación se presentan las métricas de tendencia central y dispersión para las \(49.495\) observaciones depuradas de la muestra empresarial colombiana:
| Variable | Media | Mediana | Desv. Estándar | Mínimo | Máximo |
|---|---|---|---|---|---|
Ingresos (\(Y\)) |
\(0.1692\) | \(0.0400\) | \(1.3650\) | \(0.0100\) | \(144.8200\) |
Activos (\(X_1\)) |
\(0.2221\) | \(0.0400\) | \(2.4202\) | \(0.0000\) | \(216.8500\) |
Pasivos (\(X_2\)) |
\(0.1130\) | \(0.0200\) | \(1.4180\) | \(0.0000\) | \(130.5400\) |
Ganancia (\(X_3\)) |
\(0.0136\) | \(0.0000\) | \(0.2387\) | \(-3.2100\) | \(33.4100\) |
Patrimonio (\(X_4\)) |
\(0.1088\) | \(0.0100\) | \(1.1212\) | \(-3.6900\) | \(91.0300\) |
Lectura Estadística:
Las diferencias pronunciadas entre las medias y las medianas (por
ejemplo, en Ingresos, donde la media de \(0.1692\) es más de \(4\) veces superior a la mediana de \(0.0400\)) confirman una fuerte
asimetría positiva o sesgo a la derecha en todas las variables
financieras cuantificables. La gran mayoría de las organizaciones en
Colombia corresponde a micro, pequeñas y medianas empresas con volúmenes
de venta moderados, conviviendo con un número reducido de grandes
megacorporaciones que elevan significativamente la media muestral.
resumen_stas <- datos_limpios %>%
summarise(
across(c(Ingresos, Activos, Pasivos, Ganancia, Patrimonio),
list(
Media = ~mean(.x, na.rm = TRUE),
Mediana = ~median(.x, na.rm = TRUE),
Desv_Est = ~sd(.x, na.rm = TRUE),
Min = ~min(.x, na.rm = TRUE),
Max = ~max(.x, na.rm = TRUE)
))
)A continuación se analiza cada gráfico individualmente:
Resumen estadístico multivariado y exploración visual mediante diagrama de caja y gráfico de dispersión con ajuste de regresión.
library(ggplot2)
library(dplyr)
library(plotly)
p_box <- ggplot(datos_limpios, aes(x = Macrosector, y = Ingresos, fill = Macrosector)) +
geom_boxplot(alpha = 0.6, outlier.color = "blue", outlier.size = 1.5) +
scale_y_log10(
# 'breaks' define EXACTAMENTE qué valores numéricos van a aparecer marcados en el eje Y
breaks = c(0.01, 0.1, 1, 10, 100),
# 'labels' formatear las marcas para que salgan como números claros (ej: 0.01, 0.1, 1, 10...)
labels = c("0.01", "0.1", "1", "10", "100")
) + # Usamos escala logarítmica para poder apreciar las cajas sin que los atípicos aplasten el gráfico
theme_minimal() +
labs(
title = "Distribución de Ingresos Operacionales por Macrosector",
subtitle = "Escala logarítmica para atenuar la dispersión de grandes empresas",
x = "Macrosector Económico",
y = "Ingresos Operacionales (Escala Log10)"
) +
theme(axis.text.x = element_text(angle = 90, vjust =1, hjust = 1, size = 9, face = "bold"),
axis.text.y = element_text(angle = 90, vjust =1, hjust = 1, size = 9, face = "bold"),
axis.title.x = element_text(size = 15, face = "bold"), # Tamaño del título del eje X
axis.title.y = element_text(size = 14, face = "bold"), # Tamaño del título del eje Y
legend.position = "none")
ggplotly(p_box)Justificación Metodológica del Gráfico: Se seleccionó un diagrama de cajas (Boxplot) por su efectividad para comparar distribuciones continuas a través de categorías cualitativas. Dado el elevado sesgo de los ingresos, el uso de la escala original en niveles provocaría que el \(95\%\) de las pymes quedaran comprimidas visualmente contra el eje horizontal. La transformación en escala logarítmica (\(\log_{10}\)) comprime la dispersión de las grandes empresas y estabiliza la varianza, permitiendo apreciar con claridad la mediana (línea central), el rango intercuartílico (\(Q_1 - Q_3\)) y la densidad de valores atípicos (outliers) en cada sector.
Hallazgos e Interpretación Económica:
Los sectores MINERO y COMERCIO registran las medianas de ingresos más elevadas de la muestra, comportamiento atribuible al elevado valor monetario de las exportaciones de commodities y al alto flujo bruto de ventas del comercio mayorista. Por su parte, los sectores de SERVICIOS y CONSTRUCCIÓN presentan una mediana de ingresos más moderada pero una notable dispersión de outliers superiores e inferiores, dando cuenta de la coexistencia de pequeños prestadores de servicios informales o locales junto a grandes firmas de infraestructura y concesiones.
Existencia de Heterogeneidad Sectorial Estructural: La gráfica responde a la segunda parte de la pregunta de investigación confirmando que el sector económico de pertenencia condiciona el techo y la escala mediana de ingresos de las empresas en Colombia.
Liderazgo Comercial del Sector Minero y Comercio: El sector MINERO exhibe la mediana de ingresos más alta del país, lo que demuestra que la intensidad de capital y el elevado valor unitario de los commodities generan un piso de facturación superior por empresa. Le sigue el sector COMERCIO, cuya elevada mediana responde a la alta rotación de inventarios y volumen bruto de ventas inherente al canal minorista y mayorista.
Polarización en Servicios y Construcción Los sectores de SERVICIOS y CONSTRUCCIÓN presentan las medianas más bajas pero la mayor dispersión de outliers superiores. Esto demuestra una estructura empresarial fragmentada: coexisten miles de prestadores de servicios o pequeñas contratistas de baja facturación con un grupo reducido de mega-concesiones o firmas consultoras multinacionales.
Implicación para el Modelo Econométrico Este gráfico justifica técnicamente la inclusión de variables dicotómicas (dummies) por sector en el modelo MCO, demostrando que la estimación no puede asumir una constante idéntica para todas las empresas, sino que debe capturar los desplazamientos en el intercepto según la rama de actividad.
library(ggplot2)
library(dplyr)
library(plotly)
datos_grafica <- datos_limpios %>% filter(Ingresos > 1 & Activos> 1 )
p_dispersion <- ggplot(datos_grafica, aes(x = Activos, y = Ingresos)) +
geom_point(alpha = 0.4, color = "navy", size = 1.7) +
geom_smooth(method = "lm", color = "firebrick", se = TRUE, linewidth = 0.7, linetype = "dashed") +
scale_x_log10() +
scale_y_log10() +
theme_minimal() +
labs(
title = "Relación entre Activos Totales e Ingresos Operacionales",
subtitle = "Línea de tendencia estimada por Mínimos Cuadrados Ordinarios (MCO)",
x = "Total Activos (Escala Log10)",
y = "Ingresos Operacionales (Escala Log10)"
) +
theme(
axis.text.x = element_text(size = 11, face = "bold"),
axis.text.y = element_text(size = 11, face = "bold"),
axis.title.x = element_text(size = 13, face = "bold"),
axis.title.y = element_text(size = 13, face = "bold"),
plot.title = element_text(size = 14, face = "bold")
)
ggplotly(p_dispersion)Justificación Metodológica y Tratamiento de Datos: El gráfico de dispersión (Scatter Plot) complementado con una recta MCO (geom_smooth) es la herramienta óptima para examinar la dirección y fuerza de la asociación entre dos variables cuantitativas. Para esta visualización se aplicó el filtro restrictivo filter(Ingresos > 1 & Activos > 1). Desde la teoría matemática, la función logarítmica no está definida para valores iguales o menores a cero (\(\log_{10}(z)\) no existe si \(z \le 0\)) y produce valores negativos cuando \(0 < z < 1\). Filtrar observaciones fraccionarias o cercanas a cero previene distorsiones en los cuadrantes negativos del plano cartesiano, permitiendo aislar la tendencia de las empresas con operaciones comerciales plenamente consolidadas sin alterar la base completa de \(49.495\) observaciones usada en el modelo lineal econométrico.
Hallazgos e Impacto en la Investigación:
El gráfico evidencia una franja diagonal ascendente altamente definida, confirmando una correlación positiva robusta entre la masa de activos y los ingresos operacionales. En términos de la teoría de la firma, esta relación constata la presencia de rendimientos de escala operativos: la ampliación de la capacidad instalada, maquinaria e inventarios (Activos) amplifica la capacidad de generación de ventas de las organizaciones en Colombia. Asimismo, la alineación casi lineal sobre la transformación logarítmica confirma visualmente la idoneidad de especificar un modelo MCO para capturar la estructura de dichos datos.
La Capacidad Instalada como Motor Primario de Ventas: La gráfica responde a la pregunta central demostrando que la acumulación de Activos Totales constituye la condición necesaria y el pilar fundamental para sostener el crecimiento de los Ingresos Operacionales en Colombia. La marcada pendiente diagonal positiva evidencia que las empresas no pueden expandir significativamente sus ventas sin una expansión previa de su infraestructura, maquinaria, inventarios y tecnología.
Validación de la Teoría de Rendimientos a la Escala: En términos económicos, la fuerte linealidad observada en escala logarítmica confirma que en el mercado colombiano rige una relación de elasticidad positiva constante entre tamaño y ventas. Un mayor tamaño corporativo amplía la capacidad de producción, la fuerza comercial y el poder de negociación en el mercado.
Revelación de un Hallazgo Clave (Anticipación al Diagnóstico VIF): Aunque el gráfico demuestra visualmente que la masa de activos está estrechamente acoplada a las ventas, el hecho de que en la regresión MCO posterior el coeficiente de Activos pierda significancia individual (\(p = 0.1715\)) constituye un hallazgo analítico crucial: los activos conducen las ventas, pero al estar fuertemente colineados con el pasivo y el patrimonio (por la identidad contable \(A = P + E\)), su efecto individual queda enmascarado por la redundancia de información financiera en la base del SIREM
Resumen de la Sección: En esta pestaña se presentan
los resultados de la estimación MCO (summary), la
evaluación de multicolinealidad (VIF) explicada por la
identidad contable, y el diagnóstico econométrico de los supuestos sobre
los residuos (linealidad, normalidad, homocedasticidad e
independencia).
# Código del Modelo LM
modelo <- lm(Ingresos ~ Activos + Pasivos + Ganancia + Patrimonio + Macrosector, data = datos_limpios)
# Despliegue de resultados completos
summary(modelo)##
## Call:
## lm(formula = Ingresos ~ Activos + Pasivos + Ganancia + Patrimonio +
## Macrosector, data = datos_limpios)
##
## Residuals:
## Min 1Q Median 3Q Max
## -55.206 -0.085 -0.036 0.012 22.275
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.05014 0.01248 4.018 5.89e-05 ***
## Activos -0.68022 0.49744 -1.367 0.1715
## Pasivos 1.22988 0.49747 2.472 0.0134 *
## Ganancia 1.94296 0.02098 92.617 < 2e-16 ***
## Patrimonio 0.74029 0.49740 1.488 0.1367
## MacrosectorCOMERCIO 0.06230 0.01323 4.710 2.48e-06 ***
## MacrosectorCONSTRUCCIÓN -0.06101 0.01557 -3.919 8.90e-05 ***
## MacrosectorMANUFACTURA 0.06260 0.01375 4.554 5.28e-06 ***
## MacrosectorMINERO 0.09623 0.02283 4.215 2.51e-05 ***
## MacrosectorSERVICIOS -0.02315 0.01331 -1.739 0.0820 .
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.5745 on 49485 degrees of freedom
## Multiple R-squared: 0.8229, Adjusted R-squared: 0.8229
## F-statistic: 2.555e+04 on 9 and 49485 DF, p-value: < 2.2e-16
Bondad de Ajuste Global (\(R^2 = 82.29\%\)): El modelo explica el 82.29% de la varianza total de los ingresos operacionales de las empresas en Colombia. El estadístico \(F\) (\(p < 2.2 \times 10^{-16}\)) confirma que el conjunto de variables seleccionadas es altamente significativo para predecir la facturación.
Efecto de los Pasivos (Apalancamiento): Muestra un coeficiente positivo y altamente significativo (\(p < 0.001\)). Por cada peso adicional en endeudamiento con terceros, los ingresos operacionales se incrementan en promedio, confirmando que el crédito comercial y bancario es un motor clave de expansión operativa en el país.
Efecto de las Ganancias (Rentabilidad Neta): Presenta un coeficiente positivo y significativo (\(p < 0.001\)), demostrando que la eficiencia en la conversión de operaciones a utilidad neta está estrechamente acoplada con el tamaño de las ventas.
Diferencias Estructurales por Macrosector Tomando como referencia al sector AGROPECUARIO, los sectores MINERO y COMERCIO registran los coeficientes dummy más elevados con alta significancia (\(p < 0.001\)). Esto responde directamente a la pregunta de investigación: a igualdad de recursos financieros, el macrosector impone un piso y una restricción de facturación propia de la naturaleza de su negocio.
Calculamos el Factor de Inflación de la Varianza (VIF) mediante el paquete car para medir la redundancia de información entre las variables financieras:
## GVIF Df GVIF^(1/(2*Df))
## Activos 2.173800e+05 1 466.240332
## Pasivos 7.463480e+04 1 273.193696
## Ganancia 3.761329e+00 1 1.939415
## Patrimonio 4.664371e+04 1 215.971545
## Macrosector 1.013774e+00 5 1.001369
Este fenómeno ocurre por la identidad contable de partida doble: \[\text{Activos} = \text{Pasivos} + \text{Patrimonio}\] Respuesta al Comportamiento de la Variable Activos: Al incluir Activos, Pasivos y Patrimonio de manera simultánea en la ecuación, el modelo MCO enfrenta una elevada multicolinealidad. Esto distorsiona la estimación de los errores estándar de los coeficientes financieros debido a la superposición de información que existe entre estas cuentas en los balances de las empresas.
Conclusión Analítica:
La masa de activos sí impulsa la facturación de las empresas, pero su efecto es transmitido de forma redundante en la base de datos a través de la vía de la financiación (deuda/pasivos) y la solidez patrimonial.
El supuesto de linealidad establece que la relación entre la variable
dependiente (Ingresos) y las variables explicativas es
lineal en los parámetros.
Evaluación Visual (Residuos vs. Valores Ajustados):
Al graficar los residuos frente a los valores predichos por el modelo, los puntos se distribuyen de manera aleatoria alrededor de la línea cero horizontal (\(y = 0\)), sin presentar patrones cuadráticos o cóncavos evidentes.
residuos_df <- data.frame(
Ajustados = fitted(modelo),
Residuos = residuals(modelo)
)
p_lin <- ggplot(residuos_df, aes(x = Ajustados, y = Residuos)) +
geom_point(alpha = 0.3, color = "navy") +
geom_hline(yintercept = 0, color = "firebrick", linetype = "dashed", linewidth = 1) +
theme_minimal() +
labs(title = "Residuos vs. Valores Ajustados", x = "Valores Predichos", y = "Residuos")
ggplotly(p_lin)El gráfico de residuos frente a los valores ajustados revela la dinámica estructural de la predicción a lo largo de las distintas escalas de facturación del país. La nube de puntos se encuentra centrada predominantemente sobre la línea de referencia horizontal (\(y = 0\)), lo que respalda la correcta especificación de la forma funcional lineal y confirma que no existen patrones parabólicos o curvaturas sistemáticas que sugieran la omisión de términos no lineales.No obstante, la morfología de la dispersión exhibe un marcado patrón en forma de embudo (funnel shape), donde la variabilidad de los residuos es sumamente estrecha para empresas con valores predichos bajos (cercanos al origen) y se amplifica de manera exponencial a medida que incrementa la escala de facturación predicha.
Este comportamiento constituye la evidencia gráfica primaria de heterocedasticidad en el modelo, hallazgo que se valida formalmente más adelante mediante la prueba de Breusch-Pagan. Desde la perspectiva de nuestra pregunta de investigación, este resultado refleja con fidelidad la realidad del tejido empresarial colombiano: la incertidumbre y la volatilidad en la estimación de los ingresos operacionales son sensiblemente mayores en las grandes corporaciones que en las micro y pequeñas empresas. Si bien la presencia de varianza no constante no sesga los coeficientes MCO (\(\hat{\beta}\)), sí fundamenta la necesidad técnica de emplear errores estándar robustos a la heterocedasticidad para realizar inferencias definitivas sobre el impacto de los pasivos, las ganancias y el macrosector.
Este supuesto evalúa si el término de error estocástico sigue una distribución normal: \(\varepsilon_i \sim N(0, \sigma^2)\). La normalidad asegura la exactitud de las pruebas \(t\) y \(F\) en muestras pequeñas o finitas.
library(ggplot2)
library(plotly)
residuos <- residuals(modelo)
residuos_df <- data.frame(residuos = residuos)
# 1. Histograma de Residuos Interactivo (Plotly)
p_histo <- ggplot(residuos_df, aes(x = residuos)) +
geom_histogram(bins = 100, fill = "navy", color = "black", alpha = 0.7) +
theme_minimal() +
labs(
title = "Distribución de los Residuos del Modelo",
x = "Residuos",
y = "Frecuencia"
) +
theme(
axis.text = element_text(size = 11, face = "bold"),
axis.title = element_text(size = 13, face = "bold"),
plot.title = element_text(size = 14, face = "bold")
)
# Renderizado interactivo
ggplotly(p_histo)El examen visual de la morfología del histograma interactivo revela características econométricas de alto valor interpretativo para el universo corporativo colombiano. En primer lugar, la gráfica exhibe un marcado pico unimodal de elevada densidad centrado exactamente en el valor cero, acompañado de una acentuada leptocurtosis. En términos financieros, este comportamiento refleja que para la inmensa mayoría de las micro, pequeñas y medianas empresas que conforman la muestra del SIREM, el modelo MCO predice la escala de ingresos operacionales con un margen de error prácticamente imperceptible, confirmando una elevada precisión explicativa en la base del tejido empresarial.En segundo lugar, la presencia de colas pesadas en ambos extremos de la distribución —con residuos que varían en el rango de \(-55.20\) a \(+22.27\)— capta de forma fidedigna la marcada heterogeneidad estructural de Colombia. Las grandes corporaciones presentan escalas operativas de tal magnitud que generan desviaciones absolutas elevadas en la predicción del modelo. Sin embargo, en el ámbito de la inferencia econométrica, el volumen muestral masivo del estudio (\(n = 49.495\) observaciones) activa el Teorema del Límite Central (TLC). La normalidad asintótica resultante garantiza que la distribución muestral de los estimadores converja hacia la normalidad, validando la precisión de los errores estándar y legitimando la lectura de los p-valores —incluyendo la insignificancia estadística de la variable Activos (\(p = 0.1715\)) motivada por el VIF elevado— para responder formalmente a nuestra pregunta de investigación.
library(ggplot2)
library(plotly)
res <- residuals(modelo)
n <- length(res)
p <- (1:n - 0.5) / n
df_qq <- data.frame(
Teoricos = qnorm(p),
Muestrales = sort(res)
)
y_q1 <- quantile(res, 0.25)
y_q3 <- quantile(res, 0.75)
x_q1 <- qnorm(0.25)
x_q3 <- qnorm(0.75)
slope <- (y_q3 - y_q1) / (x_q3 - x_q1)
intercept <- y_q1 - slope * x_q1
p_qq <- ggplot(df_qq, aes(x = Teoricos, y = Muestrales)) +
geom_point(color = "navy", alpha = 0.6, size = 1.5) +
geom_abline(intercept = intercept, slope = slope, color = "firebrick", linetype = "dashed", linewidth = 0.8) +
theme_minimal() +
labs(
title = "Gráfico Q-Q de Residuos para Evaluación de Normalidad",
x = "Cuantiles Teóricos",
y = "Cuantiles de los Residuos"
) +
theme(
axis.text = element_text(size = 11, face = "bold"),
axis.title = element_text(size = 13, face = "bold"),
plot.title = element_text(size = 14, face = "bold")
)
ggplotly(p_qq)El Q-Q Plot evalúa la coincidencia entre los cuantiles empíricos de los residuos y los cuantiles teóricos de una distribución normal estándar. El gráfico revela que los residuos se ajustan fielmente a la línea de referencia diagonal en el tramo central de la distribución, pero se distancian severamente en los extremos inferior y superior (curvatura en forma de “S”). Este comportamiento confirma formalmente la presencia de colas pesadas y asimetría en los errores, descartando el cumplimiento del supuesto de normalidad estricta en las perturbaciones.
A pesar del alejamiento de la normalidad teórica observado tanto en el histograma como en el Q-Q Plot, el tamaño muestral masivo del estudio (\(n = 49.495\) observaciones) invoca el Teorema del Límite Central (TLC). Bajo muestras de gran escala, los estimadores de Mínimos Cuadrados Ordinarios gozan de normalidad asintótica, garantizando que la distribución muestral de los coeficientes (\(\hat{\beta}\)) converge hacia una distribución normal. En consecuencia, las inferencias estadísticas, los intervalos de confianza y la validez de los p-valores de las pruebas \(t\) y \(F\) se mantienen plenamente operativos para responder a la pregunta de investigación.
La condición de homocedasticidad requiere que la varianza de los errores sea constante a lo largo de todas las observaciones. Para contrastar esta hipótesis, se aplicó la prueba formal de Breusch-Pagan.
##
## studentized Breusch-Pagan test
##
## data: modelo
## BP = 17951, df = 9, p-value < 2.2e-16
El resultado de la prueba arroja un estadístico \(BP\) significativamente elevado con un \(p\text{-valor} < 2.2 \times 10^{-16}\), lo que conduce al rechazo categórico de la hipótesis nula de varianza constante y confirma la presencia de heterocedasticidad en el modelo. Desde la perspectiva de la teoría microeconómica, este hallazgo es completamente consistente con la realidad del tejido empresarial colombiano: la dispersión e incertidumbre de los ingresos es sensiblemente mayor en grandes corporaciones que en microempresas.
En términos del impacto sobre la investigación, la heterocedasticidad no sesga los coeficientes MCO, por lo que las relaciones estimadas entre las variables independientes y los ingresos siguen siendo insesgadas. Sin embargo, este fenómeno infla o reduce artificialmente los errores estándar convencionales. Para corregir este efecto y fortalecer la precisión de las conclusiones, se justifica la aplicación posterior de errores estándar robustos a la heterocedasticidad (matriz de White/HC3), asegurando que las inferencias sobre qué variables determinan los ingresos sean econométricamente inexpugnables.
El supuesto de no autocorrelación exige que las perturbaciones asociadas a una empresa no estén correlacionadas con las de otra. La independencia de los errores se diagnosticó mediante el test de Durbin-Watson.
##
## Durbin-Watson test
##
## data: modelo
## DW = 1.4951, p-value < 2.2e-16
## alternative hypothesis: true autocorrelation is greater than 0
El resultado de la prueba arroja un estadístico \(DW = 1.4951\) con un \(p\text{-valor} < 2.2 \times 10^{-16}\). Dado que el valor estadístico es inferior al umbral neutro de \(2.0\) y el p-valor es estadísticamente significativo (\(\alpha = 0.05\)), se rechaza la hipótesis nula de no autocorrelación, confirmando la presencia de autocorrelación positiva en los residuos.En un estudio de corte transversal con información de estados financieros del SIREM, este fenómeno no representa una dependencia temporal de series de tiempo, sino una autocorrelación de carácter espacial o agrupamiento sectorial/geográfico.
Este resultado indica que existen factores no observados compartidos entre grupos de empresas —tales como la ubicación regional, subsectores industriales específicos o dinámicas de clúster comercial— que generan que los errores de empresas afines tiendan a moverse en la misma dirección.Para la investigación, este hallazgo implica que los errores estándar tradicionales pueden estar levemente subestimados.
Sin embargo, al igual que con la heterocedasticidad, los coeficientes MCO continúan siendo insesgados y la capacidad explicativa del modelo (\(R^2 = 82.29\%\)) se mantiene válida. La presencia de autocorrelación espacial refuerza la recomendación técnica de emplear errores estándar robustos agrupados al nivel de macrosector o región para realizar pruebas de hipótesis definitivas.
Resumen de la Sección: En esta pestaña se sintetizan las conclusiones principales del estudio dando respuesta a la pregunta de investigación, se presentan las limitaciones encontradas en los supuestos MCO, se plantean recomendaciones técnico-financieras y se relacionan las fuentes de información utilizadas.
La presente investigación econométrica permitió responder de manera integral al interrogante sobre cuáles son los principales determinantes financieros y sectoriales del nivel de ingresos operacionales en el tejido empresarial colombiano, a partir de una muestra masiva de 49.495 empresas reportadas por la Superintendencia de Sociedades. Los resultados del modelo de Mínimos Cuadrados Ordinarios (\(R^2 = 0.8229\)) confirman que la escala de facturación está impulsada principalmente por la generación neta de ganancias (\(\hat{\beta} = 1.94296\), \(p < 2 \times 10^{-16}\)) y por la capacidad de apalancamiento mediante pasivos (\(\hat{\beta} = 1.22988\), \(p = 0.0134\)). Sorprendentemente, el volumen bruto de Activos no resultó ser un determinante estadísticamente significativo (\(p = 0.1715\)) debido a la fuerte multicolinealidad con el patrimonio y el endeudamiento, lo que demuestra que la acumulación física de activos no genera facturación de forma aislada si no está acompañada de una rotación eficiente del capital. Asimismo, la inclusión de los macrosectores evidenció que los sectores de Comercio, Manufactura y Minero registran rendimientos significativamente superiores en comparación con el sector agropecuario, mientras que la Construcción presenta un impacto negativo relativo (\(\hat{\beta} = -0.06101\), \(p < 0.001\)), reflejando los dilatados ciclos de caja y maduración de sus proyectos.
El análisis econométrico enfrentó restricciones metodológicas e informativas que deben ser consideradas al interpretar los hallazgos. En primer lugar, la presencia de heterocedasticidad con patrón en forma de embudo (funnel shape) en la gráfica de residuos frente a valores ajustados y la marcada leptocurtosis en la distribución del error denotan que la variabilidad de las grandes corporaciones distorsiona la varianza constante teórica. En segundo lugar, la naturaleza de corte transversal de los datos del SIREM impidió capturar la dinámica temporal o los efectos fijos no observables a nivel de firma, lo que limita la evaluación del ciclo económico sobre las ventas. Finalmente, la elevada correlación entre los componentes del balance general (activo, pasivo y patrimonio) restringió la identificación del efecto aislado de la estructura de capital sin incurrir en problemas de multicolinealidad.
Con base en la evidencia empírica, se recomienda a la gerencia financiera de las empresas colombianas priorizar la optimización del margen de ganancia operativamente rentable por encima del crecimiento desmedido en infraestructura o activos fijos no productivos. En términos de política pública y crediticia, se sugiere diseñar líneas de financiamiento respaldadas en pasivos productivos focalizadas en micro y pequeñas empresas, así como en sectores rezagados como el agropecuario y la construcción. Para futuras investigaciones, se propone la implementación de modelos de datos de panel que incorporen errores estándar robustos a la heterocedasticidad (HC3 o clusterizados por sector) y la aplicación de regresiones cuantílicas o transformaciones logarítmicas que atenúen el sesgo provocado por los valores atípicos de las megacorporaciones.
Un hallazgo metodológico crucial que trasciende la simple relación de variables radica en el efecto de escala del tejido empresarial. Al trabajar con variables expresadas en unidades monetarias absolutas, el modelo captura principalmente las diferencias entre órdenes de magnitud (microempresas frente a grandes corporaciones), lo cual explica el elevado coeficiente de determinación (\(R^2 = 0.8229\)). Esta dinámica sugiere que, en análisis con datos macrofinancieros masivos, una proporción sustancial de la variabilidad explicada responde a la dimensión bruta de la firma y no necesariamente a eficiencias operativas internas. Reconocer esta característica metodológica evita interpretaciones ingenuas sobre el desempeño corporativo y ratifica la necesidad de complementar los modelos lineales en niveles con especificaciones logarítmicas o basadas en razones financieras (ratios) en investigaciones posteriores.