olor: orange; } h6 { color: teal; } body { font-family: 'Arial', sans-serif; }

Introduccion.

En la ciudad de Cali la demanda en el servicio de taxi ha tenido una variabilidad en los años del 2000 al 2017 bastante notoria ya que del año 2000 al 2005 tuvo un incremento del 9,4% , del 2005 al 2014 se mantuvo constante y a partir del 2015 la demanda empezó a disminuir y una de las causas más grandes fue la llegada de la plataforma de uber, ya que aunque esta plataforma llegó a colombia en el 2013 pero no fue sino hasta el 2015 que se establece oficialmente la plataforma en la ciudad de cali, con un efecto significativo ya que esta competencia de los taxis tradicionales con algunas mejoras en la calidad del servicio. Esto a lo largo de los años ha provocado protestas y descontento por los taxis a estas nuevas plataformas que ofrecen un servicio a un precio más asequible generando que la ciudadanía caleña prefiera este servicio, así mismo, disminuyendo la demanda del servicio de taxi. Sin embargo hay que considerar que antes de la llegada de estas plataformas en cali existe una ineficiencia en la prestación del servicio de transporte público, que se veía reflejado en los servicios prestados por los taxis que generaba ineficiencia en la movilidad, lo que afectaba directamente a la ciudadanía caleña que necesita desplazamiento para diligencias personales esto fue lo que le dio lugar a organizaciones ilegales que prestan un mejor servicio.

Al analizar y predecir la demanda de los servicios de taxi para la planificación se descubren patrones importantes como lo son las horas del día con una mayor demanda, los lugares más solicitados y que factores influyen en estos mismos patrones sean las condiciones climáticas o eventos especiales en la ciudad de Cali; Si se predice la demanda nos ayuda a tomar decisiones informadas como la disponibilidad de taxis que se deben tener según la hora y el día, evitando la espera de los usuarios y optimizando el uso de transporte público.

Metodologia.

Una serie de tiempo es una secuencia de datos u observaciones, generalmente tomadas en tiempos sucesivos separados de manera regular, las series pueden tener periodicidad anual, semestral, trimestral, mensual, etc., según los periodos de tiempo en los que están recogidos los datos. En este caso es trimestral.Las series se utilizan para saber el comportamiento de una variable a lo largo de un periodo. Un ejemplo de esto sería; las ventas anuales de una empresa, el precio de las acciones, producción anual de una fábrica.

Una serie de tiempo es fundamental para muchas ramas, como; la economía, las finanzas y la ingeniería entre otras más, esto debido a que permiten el análisis de patrones históricos y la realización de pronósticos.

Un pronóstico es una estimación o predicción de valores futuros de una serie de tiempo basándose así en los datos históricos, el objetivo principal del pronóstico es predecir la futura trayectoria de la serie temporal para la toma de decisiones informadas.

Un pronóstico es una estimación o predicción de valores futuros de una serie de tiempo basándose así en los datos históricos, el objetivo principal del pronóstico es predecir la futura trayectoria de la serie temporal para la toma de decisiones informadas.

A lo largo del estudio se busca predecir lo que va a suceder con los servicios de taxis en la ciudad de Cali durante un periodo de tiempo de 180 días, el pronóstico se realizará a través de un modelo ARIMA (p, d, q), el cual es una técnica estadística ampliamente utilizada para el análisis y pronóstico de series temporales. Se utiliza para describir y predecir series temporales que pueden tener tanto componentes estacionarios como no estacionarios.

Primeramente, se evalúa si la serie es estacionaria (la estacionariedad de la serie garantiza mayor precisión en las predicciones) a través de la gráfica ACF y la prueba de hipótesis Dickey-Fuller. Para analizar la gráfica ACF nos fijamos en los rezagos de esta, si los rezagos son significativos significa que existe tendencia en la serie, de lo contrario, si los rezagos no son significativos, se sugiere que la serie es estacionaria. No obstante, el análisis visual muchas veces resulta confuso e impreciso, en consecuencia, la prueba Dickey-Fuller nos ayuda a definir si existe o no tendencia en la serie; para esta prueba de hipótesis tenemos:

  • Ho: La serie no es estacionaria.

  • H1: La serie es estacionaria.

En caso de tener una serie no estacionaria, es necesario realizar una diferenciación de la serie para volverla estacionaria.

Una vez se tiene la serie diferenciada y estacionaria se procede a armar el modelo ARIMA (p,d,q), donde para obtener sus componentes se tiene en cuenta:

  • Valor p Auto regresivo(AR): Indica el número de términos auto regresivos. Esto significa que el modelo utiliza las dependencias lineales entre un valor y sus valores anteriores. Para determinar el valor p, hay que buscar cuantos rezagos son significativos en el gráfico de la función de autocorrelación parcial estimada (PACF), siempre y cuando el ACF tenga una tendencia decadente o sinusoidal. Se toma el orden de p como el número de barras que pasan el límite de significancia.

  • Valor d: Hace referencia a cuantas veces la serie fue diferenciada.

  • Valor q Media móvil(MA):Indica el número de términos de media móvil. Esto significa que el modelo utiliza la relación entre el valor de la serie y los errores residuales de un modelo de media móvil aplicado a los valores pasados. Para determinar el valor del parámetro de q, se sigue el mismo método que con el parámetro p, pero aplicándolo en la función de autocorrelación simple (ACF).

Por lo anterior, no hay un método fijo o criterio único el cual indique cómo construir un modelo ARIMA, pues la construcción del modelo depende de cómo el estadístico en cuestión interprete las gráficas ACF y PACF, además, existen casos donde los valores de p y q pueden corresponder a rezagos que no son significativos. Por esta razón, es muy importante construir varios modelos y realizar comparaciones entre ellos para decidir cuál será el modelo óptimo.

Existen 3 criterios de comparación, accuracy, distribución de residuos y el valor AICC; el análisis de estos criterios se realiza de la siguiente manera:

  • Accuracy:Se puede interpretar como el porcentaje de error del modelo, en cuanto a la comparación de modelos, se escoge el valor mínimo de porcentaje de error.

  • Distribución de residuos: A través de una prueba de hipótesis se busca comprobar independencia por parte de los residuos del modelo, donde: H0: los errores no son independientes, H1: los errores son independientes.

Este criterio de comparación es importante en cuanto a la aplicación del modelo, puesto que los errores independientes son un buen indicio para hacer inferencia sobre la población.

  • Valor AICC: El modelo con valor AICC más bajo es el óptimo; este criterio de comparación representa un ajuste adecuado del modelo y entre menor sea, más equilibrado será.

Después de haber escogido el modelo óptimo se realizan las predicciones correspondientes a los 5 días posteriores de la serie y para evaluar la precisión del modelo se compara con los datos reales. Por último, es necesario discutir los impactos, causas o implicaciones de los resultados obtenidos.

Descripcion de la serie temporal.

Analisis descriptivo.

ggplotly(ggplot(Taxis,
       aes(x = date, 
           y = Servicios)) +
  geom_point(color= "steelblue") +
  geom_smooth(method = "lm") +
  labs(title = "Dispersion de datos en la serie", xlab="Fecha",ylab="Servicios"))

En la gráfica se puede observar la cantidad de servicios requeridos en el periodo julio- abril donde los datos que se obtuvieron no fueron tan dispersos como se pensaba que iba a ocurrir, esto debido a diferentes factores dentro de los distintos meses, la recta que se ve en la gráfica garantiza como se relacionan ambas variables, esta con un sentido positivo(creciente) lo que da a entender que a medida de que el tiempo pase los servicios obtenidos van a ir aumentando progresivamente ya que no es una recta con una pendiente alta, interpretándose así de esa de esa manera, la fuerza que tiene esta relación de variables es dominante debido a que gran cantidad de puntos que se ven en la gráfica está sobre la recta lo que proporciona que no están tan dispersos unos con otros.

Por otra parte, hubo dos datos atípicos durante este periodo, el primero que se identifica es finalizando el mes de septiembre con una cantidad de servicios mayor a 6000, esto se debe a que en dicho día hubo más demanda de lo habitual del servicio ocasionando que este valor sobrepasara el dato máximo. El siguiente dato atípico que se logra encontrar en la gráfica es iniciando el mes de junio con una cantidad de servicios menor a 2000, superando el dato mínimo de servicios que puede haber en un día, se identifica que la demanda del servicio fue execrable en dicha fecha lo que ocasionó este dato irregular.

Grafico de la serie temporal.

ggplotly(ggplot(Taxis, aes(x = Taxis$date , y = Taxis$Servicios)) +
  geom_line(color = "indianred3", 
            size=1 ) +
  geom_smooth() +
  scale_x_date(labels = date_format("%b-%y")) +
  labs(title = "Servicios de Taxis",
       subtitle = "2018-2019",
       x = "fecha",
       y = "servicios") +
  theme_minimal())

En la gráfica se observa la cantidad de servicios requeridos en el periodo julio 2018- abril 2019, donde se evidencia cómo varía el servicio de taxis según el mes, por ejemplo en octubre del 2018 se generó un pico en los servicios de taxis esto porque para esta fecha la alcaldía de cali brindó un espacio de 40 horas de clase, donde se graduaron 1.000 taxistas profesionales educados en seguridad vial, ética y cultura, esto causó un aumento considerable en el servicio de taxis. Otro pico evidente en la gráfica es la caída del servicio para finales de abril del 2019 dado por varios factores como lo son: - Protestas: Los taxistas realizaron movilizaciones contra plataformas como Uber y Didi, alegando competencia desleal.

  • Calidad del Servicio: Hubo quejas sobre el profesionalismo de algunos conductores, el estado de los vehículos y las tarifas variables.

  • Competencia: Las plataformas digitales ofrecían una alternativa popular por su percepción de mejor servicio y tarifas más transparentes.

Este gráfico también ilustra una línea de tendencia según los servicios de taxis y sus periodos; la pendiente es positiva en el periodo de julio 2018 hasta finales de este año indicando una tendencia alta en los datos a lo largo de este tiempo, pero se genera una pendiente negativa en enero del 2019 hasta abril de este mismo año indicando una tendencia baja y aunque la línea de tendencia no siempre refleja precisión en el comportamiento futuro de los datos es muy útil para identificar patrones que nos ayudan a tomar decisiones futuras.

Resultados del modelo ARIMA.

Se realizó un análisis a partir de la serie de tiempo proporcionada donde se interpreta de manera visual que puede ser implícitamente no estacionaria, para confirmar dicha afirmación se procede a analizar la gráfica ACF y una prueba de hipótesis.

Grafica ACF y Dickey-Fuller Test.

## 
##  Augmented Dickey-Fuller Test
## 
## data:  ventana
## Dickey-Fuller = -2.3636, Lag order = 5, p-value = 0.4249
## alternative hypothesis: stationary

Visualmente nos damos cuenta que los rezagos de la serie son significativos, lo que quiere decir que la serie no es estacionaria, por otra parte, en la prueba Dickey-Fuller donde H0 equivale a la hipótesis de que la serie no es estacionaria, asimismo, H1 equivale a la hipótesis de que la serie es estacionaria. En este caso el valor P es de 0.4249 lo que indica que no se rechaza H0 y de esta manera la serie es no estacionaria.

En consecuencia, la serie debe ser diferenciada tantas veces sea necesario con el objetivo de volverla estacionaria.

A continuación, se diferencia una vez y se analizan sus resultados:

Aparentemente podemos inferir que la serie es estacionaria pues no se nota ninguna tendencia, sin embargo, para complementar de mejor manera el análisis se comprueba dicha afirmación con el test usado anteriormente.

## 
##  Augmented Dickey-Fuller Test
## 
## data:  mibase
## Dickey-Fuller = -11.457, Lag order = 5, p-value = 0.01
## alternative hypothesis: stationary

A pesar de que la gráfica muestra algunos rezagos que sobresalen de la línea azul, (es decir que son significativos) la mayoría de los rezagos no tienen significancia, es por esto que la prueba Dickey-Fuller toma gran importancia pues el panorama proporcionado por la gráfica ACF no es posible tomar una conclusión sobre la estacionariedad. El valor P para la serie diferenciada es de 0.01, por lo cual se rechaza H0 y se acepta H1. En resumen, la serie es estacionaria.

Con base a esta serie diferenciada procedemos a crear un modelo ARIMA (p,d,q) el cual nos sirve para analizar y predecir series temporales.

El primer modelo creado fue hecho bajo la recomendación de R studio, como se muestra a continuación:

## Series: ventana 
## ARIMA(2,0,4) with non-zero mean 
## 
## Coefficients:
##           ar1      ar2     ma1     ma2     ma3     ma4       mean
##       -0.4226  -0.9442  0.9466  1.3972  0.6820  0.3394  4082.2918
## s.e.   0.0479   0.0528  0.0871  0.1038  0.0924  0.0875   102.3598
## 
## sigma^2 = 491904:  log likelihood = -1201.04
## AIC=2418.08   AICc=2419.09   BIC=2442.22

No obstante, no se debe de confiar en el modelo recomendado por R, pues se pueden encontrar mejores modelos a partir de la gráfica ACF y de la gráfica PACF, además la recomendación de R no está exenta de errores como en este caso; recordemos que el valor d equivale a la cantidad de veces que la serie fue diferenciada lo cual por parte del modelo auto.arima es un error pues la serie fue diferenciada una vez y el modelo auto.arima no tuvo en cuenta esta consideración.

Por lo anterior, se obtuvieron los siguientes modelos:

modelo1 <- Arima(ventana, order = c(2,0,4)) 

modelo2 <- Arima(ventana, order = c(2,1,2))
modelo3 <- Arima(ventana, order = c(5,1,2))
modelo4 <- Arima(ventana, order = c(2,1,5))

modelo5 <- Arima(ventana, order = c(1,1,1)) 
modelo6 <- Arima(ventana, order = c(3,1,5)) 

modelo7 <- Arima(ventana, order = c(5,1,10)) 
modelo8 <- Arima(ventana, order = c(3,1,5)) 
modelo9 <- Arima(ventana, order = c(3,1,3)) 
modelo10 <- Arima(ventana, order = c(5,1,4))
modelo11 <- Arima(ventana, order = c(5,1,5))
modelo12 <- Arima(ventana, order = c(5,1,6))
modelo13<- Arima(ventana, order = c(5,1,0))
modelo14 <- Arima(ventana, order = c(6,1,5))
modelo15 <- Arima(ventana, order = c(4,1,5))

Con fines prácticos se decidió realizar una tabla con el propósito de tener un panorama más amplio que permita analizar los 3 criterios de evaluación (AICC, Checkresiduals, Accuracy).

## New names:
## • `` -> `...1`
## # A tibble: 15 × 4
##    ...1      AICC    `RESIDUOS ( p-value)` `ACCURACY(MAPE)`
##    <chr>     <chr>   <chr>                            <dbl>
##  1 Modelo 1  2419.09 1.768E-3                          14.8
##  2 Modelo 2  2410.24 5.7080000000000004E-3             15.8
##  3 Modelo 3  2371.1  0.007594                          11.9
##  4 Modelo 4  2395.01 2.2169999999999999E-2             14.0
##  5 Modelo 5  2415.3  2.3939999999999999E-6             16.5
##  6 Modelo 6  2397.21 9.9029999999999995E-4             14.0
##  7 Modelo 7  2380.79 0.003963                          11.7
##  8 Modelo 8  2397.21 9.9029999999999995E-4             14.0
##  9 Modelo 9  2394.41 9.2870000000000001E-3             14.2
## 10 Modelo 10 2372.86 0.02209                           12.4
## 11 Modelo 11 2365.03 0.03048                           11.6
## 12 Modelo 12 2366.94 0.02642                           11.5
## 13 Modelo 13 2403.56 4.8180000000000001E-2             14.9
## 14 Modelo 14 2367.21 0.1081                            11.5
## 15 Modelo 15 2362.71 0.03603                           11.6

La tabla de los modelos indica que el modelo óptimo es modelo 14, pues evaluando los criterios de comparación se obtiene un valor de accurarcy menor respecto a los demás modelos; este valor accuracy se puede interpretar como el margen de error del modelo.

En adición, el criterio CheckResiduals indica que modelo14 a diferencia de los demás, es el único modelo donde sus errores son independientes (al tener un valor p mayor a 0.05 no se rechaza H0); lo anterior cobra importancia en un modelo predictivo ya que implica que el modelo no solo es apto para predecir los servicios de taxis de Cali en los años estudiados, sino también, es posible realizar inferencia sobre la población.

## 
##  Ljung-Box test
## 
## data:  Residuals from ARIMA(6,1,5)
## Q* = 6.0724, df = 3, p-value = 0.1081
## 
## Model df: 11.   Total lags used: 14
Por último, el valor AICC de modelo 14 a pesar de no ser el menor de todos, posee un valor muy cercano al valor mínimo de los AICC encontrados, no obstante, al tener mejores resultados en los demás criterios de comparación, se decide optar por modelo 14 para realizar los pronósticos.

El pronóstico fue realizado a partir de los últimos 80 datos reales y el modelo ARIMA se encarga de realizar su predicción en un intervalo de confianza del 95% para los 5 días posteriores, entregando así los siguientes resultados:

##     Point Forecast    Lo 95    Hi 95
## 152       4006.386 2828.788 5183.983
## 153       3593.926 2336.335 4851.516
## 154       3434.170 2164.555 4703.785
## 155       3746.945 2389.784 5104.105
## 156       3983.922 2454.410 5513.435

Point Forecast hace referencia al pronóstico que el modelo entrega como el resultado más probable, Lo 95 se refiere al límite inferior del cual el modelo con un error del 5% está asegurando que la cantidad de servicios no va a ser menor a dicho límite, en consecuencia, Hi 95 significa el valor más alto de servicios en ese día considerando un error del 5%

A partir de la ubicación del pronóstico proporcionado, identificó la cantidad de servicios reales de los días correspondientes.

##            [,1]
## 2018-11-29 4407
## 2018-11-30 5418
## 2018-12-01 5137
## 2018-12-02 3734
## 2018-12-03 5123

Es aqui donde se observa incongruencias por parte del modelo, puesto que los intervalos que proporciono no fueron acertados en dos ocasiones, especificamente en los dias 30 de noviembre del 2018 y 1 de diciembre de 2018.

Como se mencionó anteriormente, el modelo arroja predicciones erróneas y fuera del intervalo de confianza, visualmente dichas predicciones se ven reflejadas en la parte sombreada de azul de la gráfica.

Sin embargo, es aceptable que el modelo presente este tipo de problemas a la hora de pronosticar a causa de que no tiene en cuenta el contexto real; en este caso fechas particulares en las que ocurren ciertos eventos inusuales, como por ejemplo, días de pagos de nómina, festividades, manifestaciones sociales, entre otros.

Conclusiones.

El método para encontrar el modelo ARIMA óptimo suele ser un poco impredecible, por lo cual hay que asegurarse de realizar la mayor cantidad de modelos posibles y elegir el modelo que mejores resultados brinda en por lo menos dos de los tres criterios.

En el caso de nuestro intervalo de tiempo pronosticado se observó anomalías frente a la predicción en dos días particulares, lo que quiere decir que el modelo es poco efectivo frente a este tipo de situaciones pues no toma un contexto real, se basa simplemente en el input proporcionado y no es capaz de reconocer hechos inéditos.

Para trabajos posteriores se enmarca la posibilidad de aumentar las ventanas establecidas para el input de datos, haciendo necesario la utilización de bases de datos más precisas y con mayor cantidad de datos. Seguramente si se implementa la medida mencionada anteriormente la variabilidad frente a hechos inéditos bajará levemente.

La empresa de Taxis tiene la capacidad de tomar decisiones frente a la posible demanda pronosticada, teniendo en cuenta demás factores que se hacen relevantes, lo que genera minimización de costos para los días que suelen tener baja cantidad de servicios. Por otra parte, el modelo se puede adaptar para distintos tipos de problemas que sean planteados por parte de la empresa, y de esta manera mejorar el servicio en un amplio sentido.

Bibliografia.

  1. La propuesta de Uber para lograr su legalización en Colombia. (s. f.). Portafolio.co. https://www.portafolio.co/negocios/empresas/la-propuesta-de-uber-para-lograr-su-legalizacion-en-colombia-528818

  2. Cali contará con más de 1.200 Taxistas PRO, al finalizar 2018. (s. f.). https://www.cali.gov.co/movilidad/publicaciones/141599/cali-contara-con-mas-de-1200-taxistas-pro-al-finalizar-2018/

  3. Mejia, D. F. (2023). Análisis de la Prestación del Servicio de Transporte Público en Santiago de Cali,. Cali. https://repository.unad.edu.co/bitstream/handle/10596/58258/DFNI%C3%91OM.pdf?sequence=3&isAllowed=y

  4. RPubs - Series de tiempo y pronósticos. (s. f.). https://rpubs.com/Jhon-07/1125980