Santiago de Cali más conocida como la Sucursal del Cielo, ubicada en el Valle del Cauca Pacifico Colombiano. Según el DANE en 2018 tuvo un total de 2.227.642 habitantes siendo la tercera ciudad más poblada de Colombia. Cali es conocida por su diversidad cultural, su importancia económica y comercial en la región. La cual también cuenta con diferentes instituciones de educación superior, alrededor de 540 para el año 2018, como también contaba con al menos 63.000 empresas, estos dos factores traen diferentes personas promoviendo al crecimiento de habitantes y al crecimiento de transporte por la movilidad de un trayecto a otro.
Debido a la movilidad de estudiantes el consumo de servicios públicos o privados crece entre los meses de febrero a junio para el primer semestre, y agosto a diciembre para el segundo semestre. Este comportamiento se puede observar visiblemente en el uso del transporte MIO, la congestión que hay cuando se está estudiando es mayor, como también aumenta el uso de servicios de taxis u otros.
Otra parte fundamental en la movilidad de Cali, es el turismo, Cali cuenta con diferentes festividades y la más importante es la Feria de Cali que se realiza en Diciembre entre los días 25 al 31. Hay otras festividades o encuentros culturales como el Festival Petronio Álvarez, Festival Cultural y Musical que se realiza en agosto, el festival de macetas, donde se regalan dulces tradicionales caleños a los ahijados de las diferentes familias de la ciudad, celebrado en el mes de junio.
Además de contar con una gran población, la cantidad de visitantes tanto nacionales como extranjeros genera un crecimiento en la movilidad y por ende los taxistas cuentan con más servicios. Pero la movilidad en Cali se ve afectada por la congestión vehicular, la infraestructura vial que constantemente los semaforos estan dañados, generando altos tiempos de un punto a otro y afectando el costo del servicio de taxis, y muchos usuarios también deciden pedir servicios en algunas plataformas las cuales han influido significativamente en la dinámica del mercado de taxis en la ciudad.
Además del transporte MIO, usuarios acceden a transporte colectivo que es una alternativa que resulta más económica para los usuarios generalmente el mismo precio del MIO, pero estos transportes aunque no son legales cubren rutas de un punto a otro y los usuarios acceden a ellos por comodidad, economía y aunque no dejan en el punto exacto permite tener cercanía a su destino.
Es por eso que para mejorar el servicio de Taxis de una empresa se decide analizar y predecir la demanda, para ello se utilizó el modelo ARIMA y se tomó el número de servicios brindados en el segundo semestre del 2018. Esto permite conocer patrones de demanda y poder planificar un mejor servicio, generando satisfacción de los clientes, disminuyendo tiempos de espera, optimizar eficiencia operativa, mejor asignación de recursos y rutas, mejorando cada vez el servicio. Además al mejorar cada vez el servicio genera más ganancias, permitiendo adquirir e invertir en tecnologías u otras oportunidades que permitan crecer a la empresa.
Las series de tiempo son secuencias de datos recolectados y registrados en intervalos cronológicos. Estas series se caracterizan por mostrar tendencias crecientes o decrecientes, patrones repetitivos en intervalos regulares, conocidos como estacionales, y fluctuaciones a largo plazo denominadas ciclos.
Analizar series de tiempo es crucial para entender cómo un fenómeno evoluciona con el tiempo y para prever su comportamiento futuro.
El modelo ARIMA (AutoRegressive Integrated Moving Average) es una herramienta utilizada para el pronóstico de series de tiempo. Se compone de tres componentes principales, expresados como ARIMA (p, d, q), donde:
AutoRegressive (AR): Utiliza observaciones pasadas para predecir valores futuros. El parámetro p determina el orden de esta componente.
Integrated (I): Diferencia la serie temporal para hacerla estacionaria, eliminando tendencias y valores sistemáticos. Este proceso está representado por d, que indica el grado de la primera diferenciación.
Moving Average (MA): Considera la relación entre un valor y un error residual de la predicción, capturando patrones de ruido o fluctuaciones aleatorias. El parámetro q determina el orden de esta componente.
La fórmula del modelo ARIMA se expresa como: \[ y_t = c + \phi_1 y_{t-1} + \cdots + \phi_p y_{t-p} + \theta_1 \epsilon_{t-1} + \cdots + \theta_q \epsilon_{t-q} + \epsilon_t \]
El modelo ARIMA es esencial para predecir valores futuros basándose en datos pasados, proporcionando una predicción precisa al capturar patrones complejos en los datos. Este modelo permite identificar tendencias y estacionalidades a través de sus componentes AR e I, y se adapta a diferentes tipos de series de tiempo, ajustándose a las características específicas de los datos analizados.
En este informe, se analizará una ventana de 180 datos comprendida entre el 5 de julio y el 31 de diciembre de 2018 sobre el servicio de taxis en la Ciudad de Cali. Este análisis permitirá estudiar el comportamiento del servicio de taxis durante el segundo semestre de 2018 utilizando el modelo ARIMA.
La demanda de la movilidad de los ciudadanos en Cali es cubierta por diferentes entidades tanto públicas como el MÍO y Taxis y privadas ofrecidas por diferentes plataformas y también vehículos propios sirviendo como colectivos y otros conocidos coloquialmente “piratas”. Por ende los taxistas tienen gran competencia en movilidad y se estima que en 2018 habían registrados 16.000 taxis aproximadamente. Los servicios de taxis solicitados para el segundo semestre del 2018 se muestran en la siguiente gráfica.
Como se puede observar en el gráfico que muestra los diferentes servicios de taxis en el segundo semestre de 2018, se evidencia que cada día presenta un número variable de servicios. Para analizar correctamente esta variabilidad, es fundamental considerar los días festivos y los días sin carro y moto, ya que en estas fechas suele aumentar el uso del transporte público, incluido los taxis. Las personas que asisten a fiestas, reuniones y otros eventos incrementan la demanda de estos servicios.
Por lo tanto, es crucial tener en cuenta estos días especiales al desarrollar un modelo que prediga la demanda de servicios de taxis. De esta manera, se puede determinar la tendencia en un día normal y asignar eficientemente la cantidad de taxis necesarios para satisfacer la demanda esperada, considerando el margen de error previsto.
Los datos de la estadística descriptiva que se obtuvieron a partir de la ventana de 180 días seleccionada son como se muestra en la tabla.
| Estadística | Valor | Fecha |
|---|---|---|
| Media | 3941.6111 | |
| Desviación Estándar | 857.7679 | |
| Mínimo | 1491.0000 | 2018-08-07 |
| Máximo | 7317.0000 | 2018-09-22 |
El sábado 22 de septiembre de 2018, se registraron 7,317 servicios de taxis en Santiago de Cali siendo este el valor máximo. Este aumento se puede atribuir al hecho de que fue un día sin carro y sin moto en la ciudad, lo que hizo que el transporte público fuera esencial desde las 6:00 am hasta las 6:00 pm. Esta situación benefició considerablemente a los taxistas.
Y el martes 7 de agosto de 2018, se registraron 1,491 servicios de taxis siendo el valor mínimo**. Esta baja demanda podría estar relacionada con la conmemoración de la explosión de 1956, que devastó 41 manzanas y causó la muerte de más de 4,000 personas. En memoria de este trágico evento, es posible que las personas eviten ciertas zonas de la ciudad.
Estos valores extremos muestran una considerable variabilidad en la demanda de servicios de taxis en diferentes días, reflejando las condiciones específicas de cada fecha en la ciudad.
El 7 de diciembre de 2018, se registraron 6,222 servicios de taxis. Este aumento se puede explicar por la celebración del Día de las Velitas, un evento que atrae a muchas personas a diferentes barrios para admirar las luces, y el siguiente día, 8 de diciembre, es festivo, lo que incrementa el uso del transporte público.
El valor medio de servicios de taxis durante el segundo semestre de 2018 fue de aproximadamente 3,941.61, lo que proporciona una visión general del comportamiento de la demanda en ese periodo. La desviación estándar fue de aproximadamente 857.77, indicando el grado de dispersión o variabilidad de la demanda en torno a la media.
A continuación, se presentan los resultados del análisis del modelo ARIMA aplicado a los datos de servicios de taxis. Se podrá evidenciar la serie de tiempo y el pronóstico para futuros días del año 2019.
En el gráfico de autocorrelación anterior, se observan varios rezagos, con la excepción del lag 19. Este rezago no cruza los límites de significancia, lo que resulta en una autocorrelación de cero. Sin embargo, podemos considerar este valor como atípico en comparación con los otros, ya que estos muestran una autocorrelación distinta de cero. Esto sugiere que los servicios de taxis durante el mes de julio podrían influir en los meses siguientes, posiblemente debido al aumento de uso de este servicio durante días festivos o fines de semana.
## Warning in adf.test(ventana): p-value smaller than printed p-value
##
## Augmented Dickey-Fuller Test
##
## data: ventana
## Dickey-Fuller = -4.198, Lag order = 5, p-value = 0.01
## alternative hypothesis: stationary
En este gráfico se puede examinar como es la serie de tiempo sin tendencia, es decir cómo cambian los servicios de taxis diariamente en el periodo correspondiente, por lo que se puede percibir con mayor claridad, los diversos picos y caídas que ocurren al tomar los servicios de taxis, estas caídas se pueden deber al clima, manifestaciones entre otros factores que afectan el servicio de taxis, por lo que se puede afirmar de que la serie de tiempo tiene cierta estacionalidad, como se evidencio en el gráfico anterior del ACF. Igualmente se puede apreciar que los fines de semana suele haber una caída en el número de servicios de taxis, esto puede deberse a que los fines de semana no hay pico y placa en la Ciudad Santiago de Cali.
En el gráfico se puede analizar como al tener diferencias entre valores, que ocurre al aplicar el ACF, este nos muestra como los servicios de taxis tienen ciertos rezagos, aunque en este caso ya no son tan comunes como en el primer gráfico del ACF, debido a que la tendencia no se está teniendo en cuenta, al tener los cambios netos de un dia respecto al otro, hace que la serie pierda estacionalidad, por lo que no se pueden percibir las correlaciones que están más a largo plazo, más sin embargo, el gráfico mantiene una autocorrelación significativa en los pocos rezagos que se mantienen, aunque de menos significancia que en comparación al primer gráfico de ACF.
## Warning in adf.test(conjunto): p-value smaller than printed p-value
##
## Augmented Dickey-Fuller Test
##
## data: conjunto
## Dickey-Fuller = -11.644, Lag order = 5, p-value = 0.01
## alternative hypothesis: stationary
El análisis de autocorrelación indica la presencia de varios picos significativos en diferentes rezagos, como en los lags 1, 2, 5 y 21. Los valores fuera de las líneas de confianza sugieren la presencia de autocorrelaciones en estos lags. De manera similar, la función de autocorrelación parcial (PACF) muestra cortes significativos en los lags 1, 2, 3, 5, 6 y 12, indicando autocorrelaciones significativas en estos puntos.
La prueba de Dickey-Fuller Aumentada (ADF) arroja un valor de estadístico de -11.766 y un valor p de 0.01. Dado que el valor p es menor que el nivel de significancia típico de 0.05, se rechaza la hipótesis nula de no estacionariedad. Por lo tanto, se concluye que la serie temporal es estacionaria.
Dado que la serie es estacionaria según el test ADF, no es necesario realizar diferenciación para alcanzar la estacionariedad. Para el modelo ARIMA, al ser la serie estacionaria, el valor de d es 0. Según la PACF, los lags más significativos son 2 y 5, lo que sugiere un valor de p de 2 o 5. Además, el lag 1 es significativo en la función de autocorrelación simple, lo que indica un valor de q de 1 para el modelo ARIMA.
## Series: conjunto
## ARIMA(0,0,2) with zero mean
##
## Coefficients:
## ma1 ma2
## -0.6060 -0.2842
## s.e. 0.0753 0.0739
##
## sigma^2 = 470717: log likelihood = -1422.75
## AIC=2851.5 AICc=2851.64 BIC=2861.06
## Series: conjunto
## ARIMA(5,1,5)
##
## Coefficients:
## Warning in sqrt(diag(x$var.coef)): Se han producido NaNs
## ar1 ar2 ar3 ar4 ar5 ma1 ma2 ma3
## 0.3257 0.0036 -0.9278 0.0897 -0.1889 -2.1046 1.1315 1.1072
## s.e. 0.0261 0.0923 0.0525 0.0911 0.0836 NaN NaN NaN
## ma4 ma5
## -1.9109 0.7768
## s.e. 0.1886 0.1077
##
## sigma^2 = 400658: log likelihood = -1403.76
## AIC=2829.52 AICc=2831.11 BIC=2864.52
El modelo ARIMA(5,1,5) aplicado a la serie temporal muestra coeficientes significativos para los términos autorregresivos y de media móvil, con ar3 y ma1 indicando impactos importantes de valores y errores pasados. Sin embargo, la presencia de NaNs en algunos errores estándar sugiere problemas de estimación, posiblemente debido a multicolinealidad o inestabilidad del modelo.
La varianza residual (sigma^2 = 400658) es considerable, y aunque el log-likelihood (-1403.76) junto con los criterios AIC (2829.52), AICc (2831.11) y BIC (2864.52) proporcionan un equilibrio entre ajuste y complejidad.
## Series: conjunto
## ARIMA(5,0,1) with non-zero mean
##
## Coefficients:
## ar1 ar2 ar3 ar4 ar5 ma1 mean
## -0.1347 -0.4138 -0.2661 -0.2503 -0.3543 -0.5144 6.9352
## s.e. 0.1256 0.0870 0.0955 0.0780 0.0812 0.1290 9.8649
##
## sigma^2 = 434621: log likelihood = -1413.27
## AIC=2842.54 AICc=2843.38 BIC=2868.03
El modelo ARIMA(5,0,1) con media distinta de cero aplicado a la serie temporal “conjunto” presenta una estructura autoregresiva significativa y una componente de media móvil. Los coeficientes autorregresivos (AR) tienen valores negativos, destacando ar2 (-0.4138) y ar5 (-0.3543), sugiriendo una influencia decreciente de los valores pasados.
El coeficiente de media móvil (ma1) es -0.5144, indicando una influencia significativa de los errores pasados en el modelo. La media estimada del modelo es 6.9352, con una desviación estándar considerable (9.8649), reflejando una alta variabilidad en los datos. La varianza residual (sigma^2 = 434621) es menor comparada con el modelo anterior, lo que sugiere un mejor ajuste. Los criterios de información (AIC = 2842.54, AICC = 2843.38, BIC = 2868.03) son menores, indicando una mejora en el equilibrio entre la complejidad y el ajuste del modelo.
##
## Ljung-Box test
##
## data: Residuals from ARIMA(5,1,5)
## Q* = 13.006, df = 3, p-value = 0.004623
##
## Model df: 10. Total lags used: 13
## ME RMSE MAE MPE MAPE MASE ACF1
## Training set 45.95781 613.2183 458.1872 81.08887 141.5313 0.7350444 0.009416155
El análisis de los residuos del modelo ARIMA(5,1,5) revela un valor del test Ljung-Box de 13.006 con un p-valor de 0.004623, lo que sugiere que hay una autocorrelación residual significativa en los primeros 13 rezagos. La gráfica de residuos muestra fluctuaciones alrededor de cero sin una tendencia obvia, aunque algunas autocorrelaciones están presentes.
Las métricas de precisión del modelo ARIMA(5,1,5) indican un error absoluto medio porcentual (MAPE) de aproximadamente 45.96%, lo que significa que, en promedio, las predicciones se desvían un 45.96% de los valores reales. El error absoluto medio (MAE) es de 458.19, y la raíz del error cuadrático medio (RMSE) es de 81.09. El error medio (ME) es 141.53, lo que sugiere un sesgo en las predicciones del modelo. El error absoluto medio escalado (MASE) es 0.735, lo que implica que el modelo tiene un rendimiento relativamente bueno en comparación con un modelo de referencia simple. La autocorrelación en el primer rezago (ACF1) es muy baja (0.0094), lo que indica que la mayoría de la autocorrelación se ha eliminado.
En conjunto, el modelo ARIMA(5,1,5) proporciona un ajuste razonable para los datos de la serie temporal analizada.
##
## Ljung-Box test
##
## data: Residuals from ARIMA(5,0,1) with non-zero mean
## Q* = 7.5858, df = 4, p-value = 0.108
##
## Model df: 6. Total lags used: 10
## ME RMSE MAE MPE MAPE MASE
## Training set -4.155319 646.2387 480.3693 94.49923 141.4083 0.7706299
## ACF1
## Training set -0.01668299
El análisis de los residuos del modelo ARIMA(5,0,1) con media distinta de cero revela un valor del test Ljung-Box de 7.5858, con un p-valor de 0.108, lo que sugiere que no hay evidencia suficiente para rechazar la hipótesis nula de que los residuos no están correlacionados. Las métricas de precisión indican un error medio (ME) de -4.16, lo que sugiere un pequeño sesgo en las predicciones del modelo. El error cuadrático medio (RMSE) es de 646.24 y el error absoluto medio (MAE) es de 480.37.
El error porcentual medio (MPE) es de 94.50%, lo que indica que, en promedio, las predicciones están desviadas un 94.50% de los valores reales. El error absoluto medio porcentual (MAPE) es de 141.41%. El error absoluto medio escalado (MASE) es de 0.77, lo que implica que el modelo tiene un rendimiento relativamente bueno en comparación con un modelo de referencia simple. La autocorrelación en el primer rezago (ACF1) es negativa, lo que sugiere una pequeña autocorrelación negativa residual.
En general, el modelo ARIMA(5,0,1) proporciona un ajuste razonable para los datos de la serie temporal analizada.
## Point Forecast Lo 95 Hi 95
## 15465601 888.43452 -403.687 2180.556
## 15552001 317.34516 -1223.150 1857.840
## 15638401 -28.71046 -1625.887 1568.466
## 15724801 -49.56030 -1647.868 1548.747
## 15811201 -122.63181 -1722.310 1477.047
El pronóstico generado por el modelo ARIMA(5,0,1) con una media distinta de cero indica que la cantidad de servicios de taxi aumentará gradualmente en los próximos cinco períodos. Inicialmente, se estima un punto de pronóstico de aproximadamente 15,465,601 servicios, con un intervalo de confianza del 95% que varía entre 888.43 y 2,180.56 servicios. Los siguientes cuatro períodos muestran una tendencia similar de aumento, aunque con una ligera disminución en el punto de pronóstico y un incremento en la amplitud de los intervalos de confianza. Esto sugiere cierta incertidumbre en las predicciones a medida que se proyecta más hacia el futuro.
## Point Forecast Lo 95 Hi 95
## 15465601 871.76459 -378.7176 2122.247
## 15552001 501.31237 -1074.5037 2077.128
## 15638401 55.11544 -1546.4558 1656.687
## 15724801 -171.28918 -1780.0834 1437.505
## 15811201 -349.80020 -1961.4893 1261.889
El pronóstico generado por el modelo ARIMA(5,1,5) sugiere un aumento gradual en la cantidad de servicios de taxi en los próximos cinco períodos. El pronóstico inicial estima alrededor de 15,465,601 servicios, con un intervalo de confianza del 95% que varía entre 871.76 y 2,122.25 servicios. A medida que se avanza en el tiempo, se observa una disminución gradual en el valor del pronóstico, junto con un incremento en la amplitud de los intervalos de confianza, lo que indica una mayor incertidumbre en las predicciones a medida que se proyecta más hacia el futuro.
En la gráfica generada por el modelo ARIMA(5,0,1) con una media distinta
de cero, se observa una tendencia ascendente en la cantidad de servicios
de taxi a lo largo del tiempo. Esto sugiere un aumento constante en la
demanda de servicios de taxi durante el período analizado. Además, la
variabilidad considerable en los datos, reflejada en las oscilaciones
alrededor de la tendencia general, puede atribuirse a factores
estacionales como cambios en la demanda debido a eventos específicos o
condiciones climáticas.
Los intervalos de confianza más amplios en las predicciones a largo plazo indican una mayor incertidumbre en las estimaciones futuras. Esto destaca la importancia de monitorear de cerca los datos para comprender mejor las tendencias y patrones subyacentes.
Cali es una ciudad con una gran población y una notable afluencia de estudiantes y turistas, este movimiento poblacional y las festividades propias de la ciudad pueden generar el aumento de usos de servicios de taxi.
Las diferentes empresas de taxis podrían tomar decisiones basadas en la demanda pronosticada, lo que podría reducir costos en días con menor demanda de servicios, así como también el modelo estadístico podría adaptarse a diferentes problemas planteados.
Aunque el modelo ARIMA se utiliza comúnmente para pronosticar series temporales, en este caso se analizó una serie de datos bastante volátiles. Debido a esta volatilidad, los datos pasados no tienen una influencia directa sobre los datos futuros. Por lo tanto, un modelo basado en una muestra demasiado grande puede ser menos preciso en este contexto.
El análisis realizado con el modelo ARIMA proporciona información valiosa sobre la demanda de servicios de taxi en Santiago de Cali durante el segundo semestre de 2018. La combinación de datos históricos y análisis de series temporales permite comprender los patrones de demanda, identificar tendencias y estacionalidades, y pronosticar futuros niveles de demanda con cierto grado de precisión. Sin embargo, es esencial tener en cuenta la complejidad y la incertidumbre inherentes a la naturaleza de los datos. Además, es importante considerar factores externos que puedan influir en la demanda para desarrollar estrategias efectivas de gestión y operación en el sector del transporte.