El creador del EDIT es el DANE que tiene como prioridad generar y difundir la información estadística de interés general para colombia con la finalidad de la toma de decisiones de las entidades fundamentales, esta encuesta contiene información estratégica para mejorar la innovación de la industria manufacturera ya que los resultados abarcan actividades de innovación y de desarrollo tecnológico que permiten generar decisiones basadas en datos para la creación de políticas hacia el desarrollo del país , siendo importante ya que en colombia, la política económica en general y la política de competitividad reconocen que las soluciones novedosas por parte de las empresas influyen positivamente en la productividad, competitividad de la economía nacional y el crecimiento económico. Por lo tanto la encuesta es de gran relevancia ya que de estas serie de preguntas logramos identificar las empresas con más innovación siendo estas también las más significativas para la economía de Colombia, tanto así que esta encuesta ha sido reconocida en un manifiesto por el departamento nacional de Planeación en el documento “Bases del Plan Nacional de Desarrollo 2018-2022: en su capítulo “Pacto por la Ciencia, la Tecnología y la Innovación”.
Por lo tanto este trabajo tiene como objetivo clasificar por medio de un modelo KNN (K-Nearest Neighbors) y un modelo árbol de decisión las empresas innovadoras y no innovadoras a través de unas variables que van a ser explicadas junto a su relación con la EDIT:
Tipo de empresa: variable cualitativa la cual indica si la empresa es innovadora o no innovadora
Total personal ocupado promedio con nivel de educación superior involucrado en actividades científicas, tecnológicas y de innovación total: variable cuantitativa que indica el número de personas con nivel educativo superior en las empresas; se espera que el personal con educación superior aporte a la innovación a las empresas a partir de sus conocimientos especializados en la tecnología, ciencia e ingeniería.
Exportaciones totales 2020 (Miles de pesos corrientes):se refieren al valor total de bienes y servicios que un país vende a otros países en un período de tiempo determinado. Esto incluye todo, desde productos manufacturados hasta materias primas y servicios. Un mayor nivel de innovación y desarrollo tecnológico puede impulsar la competitividad de los productos y servicios colombianos en el mercado global, potencialmente aumentando las exportaciones totales del país.
Producción total: Personal ocupado promedio que participó en actividades científicas, tecnológicas y de innovación en una empresa.
Ingresos o ventas nacionales totales 2020 (Miles de pesos corrientes): se refieren al valor total de todas las transacciones comerciales que ocurren dentro de un país en un período de tiempo determinado. Esto incluye todas las ventas de bienes y servicios realizadas por empresas y particulares dentro de las fronteras nacionales. Al analizar los ingresos o ventas nacionales totales en relación con los datos de la Encuesta EDIT, se puede examinar cómo la innovación y el desarrollo tecnológico en Colombia afectan la capacidad de las empresas para generar ingresos o ventas.
Bienes o servicios nuevos en el mercado nacional (Ya existían en el mercado internacional). Si-1, No=2: productos o servicios que son introducidos por primera vez en el mercado de un país. Estos pueden ser innovaciones tecnológicas, productos completamente nuevos o mejoras significativas en productos existentes.La innovación y el desarrollo tecnológico en Colombia contribuyen a la introducción de nuevos productos o servicios al mercado nacional.
Número total de innovaciones en bienes o servicios nuevos en el mercado nacional 2019-2020: la cantidad de nuevas ideas, mejoras o desarrollos tecnológicos que se introducen en productos o servicios dentro de un país. Al analizar el número total de innovaciones en bienes o servicios nuevos en el mercado nacional en relación con los datos de la Encuesta EDIT, se puede evaluar el nivel de actividad innovadora en Colombia y cómo contribuye al desarrollo y la competitividad de la economía nacional.
Bienes o servicios nuevos en el mercado internacional. Si-1, No=2: son productos o servicios que se introducen por primera vez en el mercado global, es decir, que se ofrecen a consumidores o empresas fuera de las fronteras nacionales. Se puede evaluar cómo la innovación y el desarrollo tecnológico en Colombia impactan la capacidad de las empresas para competir en el mercado global.
Número total de innovaciones en bienes o servicios nuevos en el mercado internacional en 2019-2020: la cantidad de nuevas ideas, mejoras o desarrollos tecnológicos que se introducen en productos o servicios y se ofrecen en el mercado global. Se puede evaluar cómo la innovación y el desarrollo tecnológico en Colombia impactan la capacidad de las empresas para competir y destacarse en el mercado global. Esto proporciona información valiosa sobre la posición de Colombia en la economía mundial y su capacidad para generar productos o servicios innovadores que atraigan a los mercados internacionales.
Con el objetivo de clasificar empresas innovadoras y no innovadoras, se plantea un estudio de aprendizaje supervisado, el cual consta con una variable objetivo más conocida como (output) y otras variables predictoras también nombrada como él (input), para entrenar el modelo y posteriormente evaluar su rendimiento con el conjunto de prueba que es el testeo. Inicialmente se usa la base de datos EDIT_X_2019_2020, donde son seleccionadas las variables expuestas anteriormente para luego ser analizadas. Originalmente la variable tipo estaba constituida por 5 categorias diferentes, de las cuales la categoria NOINNO fue renombrada como NO INNOVA, mientras que las categorias restantes se catalogaron como INNOVA. Cabe de recalcar que hubo variables que se utilizaron para el año 2020 y de igual forma variables con el periodo 2019-2020, basándose más en el año 2020; donde estas contribuyeron también al análisis y desarrollo de este aprendizaje supervisado. Dicho lo anterior el aprendizaje supervisado consta de dos modelos, los cuales son: KNN y ARBOL DE CLASIFICACION, los modelos son de clasificación ya que la variable objetivo es de tipo categórica, en ambos modelos se pueden encontrar la misma cantidad de variables que se requiere analizar, tanto las predictora como la de objetivo. Las variables de tipo input abarcan aspectos empresariales, como; costos, ingresos, producciones, también relaciona el mercado nacional e internacional, ademas se asocian unas con las otras; para determinar su innovación en el mercado, es esencial considerarlas. La variable tipo output se utilizará para entrenar ambos modelos y también para el testeo de estos mismos, de igual manera todas las variables. En ambos modelos se utilizó la misma semilla para poder encontrar similitud con los resultados obtenidos, pero esto no se ve afectado ya que son dos modelos distintos, por tanto, su precisión no se ve muy afectado por este factor. Finalmente, se hallará un K optimo que es la cantidad de vecino más cercanos a usar para el modelo KNN para poder obtener un mejor resultado en este mismo, y posteriormente se construirá un diagrama de árbol para observar como se relacionan las variables, esto con el fin de que en ambos modelos se pueda crear una matriz de confusión las cuales se darán a conocer.
grafico_torta <- plot_ly(labels = names(recuento_tipo),
values = recuento_tipo,
type = "pie") %>%
layout(title = "Distribución de Tipos",
xaxis = list(showgrid = FALSE, zeroline = FALSE, showticklabels = FALSE),
yaxis = list(showgrid = FALSE, zeroline = FALSE, showticklabels = FALSE),
showlegend = TRUE,
legend = list(title = "Tipo"))
# Convertir el gráfico de ggplot a interactivo
grafico_interactivo <- ggplotly(grafico_torta)
# Mostrar el gráfico interactivo
grafico_interactivo
A partir de los resultados obtenidos se puede observar que la moda dentro de la variable TIPO corresponde a la categoría No innova con el 68.1% de repeticiones, el 31.9% restante de los datos corresponden a la categoría de empresas que innovadoras, categoría en la cual se albergaron anteriormente 4 categorías en una. Respecto a una perspectiva internacional, el porcentaje de empresas innovadoras es fundamental para ubicar a Colombia en el sexto puesto del ranking de paises mas innovadores de la region, por debajo de Chile, Mexico, Costa Rica, Brasil y Uruguay y en el puesto numero 67 de 132 paises en el año 2020.
ventas_tipo <- tabla_filtrada %>%
group_by(TIPO) %>%
summarize(n = n(),
mean = mean(VENTAS_NACIONALES),
sd = sd(VENTAS_NACIONALES),
se = sd/sqrt(n))
pd <- position_dodge(0.2)
ggplotly(ggplot(ventas_tipo,
aes(x = factor(TIPO,
labels = c("Empresa innovadora",
"Empresa no innovadora")),
y = mean,
group=TIPO,
color=TIPO)) +
geom_point(position=pd,
size = 3) +
geom_line(position = pd,
size = 1) +
geom_errorbar(aes(ymin = mean - se,
ymax = mean + se),
width = .1,
position = pd,
size = 1) +
scale_y_continuous(label = scales::dollar) +
scale_color_brewer(palette="Set1") +
theme_minimal() +
labs(title = "Ventas a nivel nacional según tipo de empresa",
subtitle = "(mean +/- standard error)",
x = "",
y = "",
color = "Tipo de empresa"))
## Warning: Using `size` aesthetic for lines was deprecated in ggplot2 3.4.0.
## ℹ Please use `linewidth` instead.
## This warning is displayed once every 8 hours.
## Call `lifecycle::last_lifecycle_warnings()` to see where this warning was
## generated.
Tratando de relacionar la innovación de las empresas con el crecimiento económico, el gráfico nos muestra como el tipo de empresa ( si es innovadora o no lo es ) afecta en las ventas a nivel nacional, en este caso, la gráfica nos muestra la media de ventas nacionales de las empresas con su respectiva desviación estándar, sin embargo, es muy notable la diferencia entre las empresas innovadoras ( empresas tipo 2 ) respecto a las empresas no innovadoras. Esta brecha se debe muy seguramente a la capacidad de mejorar procesos continuamente por parte de las empresas innovadoras, lo que permite optimizar procesos en menor cantidad de tiempo y usando los insumos mínimos, por tanto su capacidad de producción tiende a ser más alta en cuanto a las empresas que no innovan. Por otro lado, la diferenciación de productos y servicios es un factor fundamental en esta disparidad, pues las empresas innovadoras se caracterizan por abordar problemas que el mercado aún no ha resuelto, lo cual resulta más atractivo para atraer nuevos clientes y aumentar sus ventas.
ggplotly(ggplot(tabla_filtrada, aes(x = TIPO, y = EXPORTACIONES, fill = factor(TIPO))) +
geom_bar(stat = "identity") +
labs(x = "Tipo de Empresa", y = "Exportaciones", fill = "Tipo") +
scale_fill_manual(values = c("red", "blue"), labels = c("No Innovadora", "Innovadora")) +
scale_y_continuous(labels = scales::label_number(scale = 1e-6, suffix = "M")) + # Cambia la escala a millones
theme_minimal())
La gráfica ilustra una situación bastante clara, las empresas que tienen bajo su nómina personal con educación superior involucrado en actividades científicas, de tecnología e ingeniería son las empresas de tipo innovador . Las empresas que deseen innovar sus procesos deben de tener en cuenta que necesitan un personal capacitado para lograrlo, por tal razón, el personal capacitado se encuentra ubicado en las empresas tipo 2. No obstante, una de las razones por la cual las empresas no innovadoras (empresas tipo 1) no tienen registro de personal con educación superior se debe muy seguramente a la competitividad; como se observó en el gráfico 1. Existe una brecha importante entre la media de ingresos de ventas de cada tipo de empresa, es decir, las empresas innovadoras al tener mayores ingresos pueden permitirse pagar sueldos más altos que una empresa no innovadora.
ggplotly(ggplot(tabla_filtrada, aes(x = TIPO, y = PERSONAL_EDUSUPERIOR, fill = factor(TIPO))) +
geom_point(stat = "identity") +
labs(x = "Tipo de Empresa", y = "Personal con educacion superior", fill = "Tipo") +
scale_fill_manual(values = c("#00FFFF", "#FF00FF"), labels = c("No Innovadora", "Innovadora")) +
scale_y_continuous() +
theme_minimal())
Las empresas innovadoras tienden a tener un número de personal con educacion superior en ambitos de tecnologia, ciencia e ingenieria sobresaliente respecto a las empresas no innovadoras, las cuales no tienen personal con estas caracteristicas. Esto se debe principalmente a que como se evidencio anteriormente las empresas innovadoras que suelen tener mayores ingresos, tienen mayor posibilidad para contratar este tipo de personal y de esta manera continuar con el crecimiento de la empresa. Por otra parte, esta variable decide sobre las demas variables para catalogar una empresa innovadora o no innovadora, repercutiendo en el modelo de arbol de clasificacion.
valores_no_cero <- tabla_filtrada$NUM_BIENES_NACIONAL[ tabla_filtrada$NUM_BIENES_NACIONAL != 0]
barplot(valores_no_cero,
main = "Cantidad de Bienes Innovadores Lanzados al Mercado Nacional",
xlab = "Empresas",
ylab = "Cantidad",
names.arg = 1:length(valores_no_cero),
col = "skyblue",
border = "black",
las = 2)
En esta grafica se puede observar la cantidad de bienes o servicios lanzados al mercado por las únicas 32 empresas que lo hicieron ya que el resto ninguna lanzo algunos de estos. se logra apreciar que la empresa 16 se destaco en cuanto a las demás esta con 7 bienes o servicios lanzado durante este periodo, lo cual esto la convierte como la mejor empresa innovadora en dichpo periodo
valores_no_cero2 <- tabla_filtrada$NUM_BIENES_INTERNACIONAL[ tabla_filtrada$NUM_BIENES_INTERNACIONAL != 0]
bb <- barplot(valores_no_cero2,
main = "Cantidad de Bienes Innovadores Lanzados al Mercado Interacional",
xlab = "Empresas",
ylab = "Cantidad",
names.arg = 1:length(valores_no_cero2),
col = "skyblue",
border = "black",
las = 2)
Esta grafica se observa la cantidades de bienes o servicios lanzados al mercado internacional las cuales fueron 7 empresas que lanzaron estos, donde la empresa 3 prevalece con una cantidad de 10, lo que la convierte como las mas innovadoras lanzando bien o servicios innovadores en dicho periodo
El desarrollo del modelo KNN se elaboró primeramente con la asignación de la semilla, la cual tiene como función generar una serie de números aleatorios, la semilla que elegimos fue la numero 30, con esto nos aseguramos que siempre se repliquen los mismos números aleatorios al ser ejecutado el código, en nuestro caso la población total a estudiar es de 6798 datos, de los cuales se tomo una muestra aleatoria de 5439 datos, correspondiente al 80% de la población destinados al conjunto de entrenamiento, el 20% restante que son 1359 datos corresponde directamente al conjunto de test o prueba. El entrenamiento del modelo se encarga de tomar los 8 primeros atributos como input y la última columna será el output, en nuestro caso la variable Tipología que fue renombrada anteriormente como “TIPO”. Posteriormente se declaran las variables que serán utilizadas para la fase de prueba en donde nuevamente el input está conformado por los primeros 8 atributos y el output por nuestra variable “TIPO” en la cual se alberga información acerca de la innovación o no innovación de las empresas.
A continuación, haciendo uso de la librería class que nos permite la ejecución de la función Knn sin mayor problema se procede a asignar los datos de entrenamiento para crear el modelo, con el modelo propuesto tomara los datos de test para predecir el output para nuestros datos de prueba, asignando un numero de vecinos de 23, que mas adelante se hará la aclaración de la razón por la cual se eligio justamente 23 vecinos para el modelo. De esta manera el modelo arroja la predicción a partir de los datos que ingresamos, ahora se procede a calcular el porcentaje de aciertos del modelo frente al output del test con el fin de saber la exactitud del modelo.
mean(modelo_knn == tablafill_test_output)
## [1] 0.7262693
Por otra parte realizamos una tabla que contenga el resumen de los datos en una matriz de confusión y observar asi cuantos valores predichos fueron iguales a los reales.
table (modelo_knn, tablafill_test_output)
## tablafill_test_output
## modelo_knn INNOVA NO INNOVA
## INNOVA 155 96
## NO INNOVA 276 832
Ahora bien la explicación por la cual se eligio un numero de vecinos de 23 recae principalmente en que se definio según la exactitud o accuracy que fuera mas alta para cada uno de los vecinos, en nuestro k va desde 1 a 5439.
Con base en estos resultados nos damos cuenta desde el grafico interactivo o tambien desde la tabla de exactitud de que el numero optimo de vecinos corresponde a 23
Continuando con la obtención de resultados de nuestro modelo hacemos uso de la libraría caret, se crea una nueva columna llamada “TIPO” y se le asigna valores a esta columna basados en una condición. Si el valor en la columna “TIPO” es “Innova”, entonces se asigna “Innova” a la nueva columna “TIPO”; de lo contrario, se asigna “No Innova”. Y convierte la columna “TIPO” en un factor.
library(caret)
tabla_filtrada <- tabla_filtrada %>%
rename(TIPO = TIPO) %>%
mutate(TIPO = ifelse(TIPO == "INNOVA", "Innova", "No Innova")) %>%
mutate_at(c("TIPO"), ~as.factor(.))
Luego se define un vector llamado niveles que contiene los niveles “Innova” y “No Innova”. Luego, se utiliza la función factor() para convertir dos variables, modelo_knn y tablafill_test$TIPO, en factores con los niveles especificados en el vector niveles. Esto se realiza para asegurarse de que las variables categóricas tengan los mismos niveles en los conjuntos de datos modelo_knn y tablafill_test.
Por ultimo se calcula la matriz de confusión
que arroja los siguientes resultados:
Accuracy: La precisión del modelo es del 74.47%, lo que indica que el modelo clasifica correctamente el 74.47% de todas las muestras.
El intervalo de confianza: 95% para la precisión va desde 72.06% hasta 76.77%.
Tasa de información nula: La tasa de información nula es del 69.02%, lo que representa la precisión que se lograría si se predijera siempre la clase más frecuente.
Kappa: el valor de kappa no es muy alto, lo que sugiere que la concordancia no es muy fuerte. Se considera que un valor de kappa entre 0.20 y 0.40 indica una concordancia justa a moderada.
La sensibilidad (tasa positiva verdadera) del modelo es del 38.48%, lo que indica la proporción de casos “Innova” que el modelo predijo correctamente.
La especificidad (tasa negativa verdadera) del modelo es del 90.62%, lo que indica la proporción de casos “No Innova” que el modelo predijo correctamente.
El valor predictivo positivo es del 64.80%, lo que indica la probabilidad de que un caso predicho como “Innova” sea realmente “Innova”.
El valor predictivo negativo es del 76.65%, lo que indica la probabilidad de que un caso predicho como “No Innova” sea realmente “No Innova”.
La prevalencia de la clase “Innova” en el conjunto de datos es del 30.98%.
La tasa de detección del modelo es del 11.92%, lo que indica la proporción de todos los casos “Innova” que el modelo identificó correctamente.
La exactitud equilibrada del modelo es del 64.55%, que es el promedio de sensibilidad y especificidad. Representa la capacidad del modelo para predecir correctamente ambas clases.
Para realizar el arbol de clasificacion, se uso la misma semilla, los mismos datos de entreno y test que en el modelo anterior, con el fin de realizar comparaciones entre modelos distintos. Luego se instalaron las siguientes librerias:
library(rpart): Sirve para construir modelos de arbol de clasificacion.
library(rpart.plot) : Una vez ajustado el modelo con la libreria rpart, se visualiza el arbol de manera legible.
library(rpart)
## Warning: package 'rpart' was built under R version 4.3.3
library(rpart.plot)
## Warning: package 'rpart.plot' was built under R version 4.3.3
Seguidamente, nombramos el modelo arbol_1 el cual sera ejecutado con la siguiente linea de codigo:
arbol_1 <- rpart(formula = TIPO ~ ., data = tablafill_entrena)
Una vez se ha construido el modelo, procedemos a visualizar el arbol de clasificacion.
rpart.plot(arbol_1)
Como se observa en el arbol de clasificacion, la unica variable que es tomada en cuenta para la clasificacion de una empresa como innovadora o no innovadora es PERSONAL_EDUSUPERIOR, esto se debe a que la cantidad de personal con educacion superior ( especializado en tecnologia, ciencia e ingenieria) influye de manera directa con las soluciones novedosas de las empresas.
Posteriormente se crea un factor llamado predicciones el cual tendra como funcion predecir en nuestro modelo de arbol si una empresa es innovadora o no.
predicciones <- predict(
arbol_1,
newdata = tablafill_test,
type = "class"
)
Luego realizamos la matriz de confusion.
Accuracy: La precisión del modelo es del 0.933%, lo que indica que el modelo clasifica correctamente el 93.3% de todas las muestras.
El intervalo de confianza: 95% para la precisión va desde 91.84% hasta 94.57%.
Tasa de información nula: La tasa de información nula es del 69.02%, lo que representa la precisión que se lograría si se predijera siempre la clase más frecuente.
Kappa: el valor de kappa no es de 83.35%, lo que sugiere que la concordancia es moderadamente fuerte.
La sensibilidad (tasa positiva verdadera) del modelo es del 78.38%, lo que indica la proporción de casos “Innova” que el modelo predijo correctamente.
La especificidad (tasa negativa verdadera) del modelo es del 100%, lo que indica la proporción de casos “No Innova” que el modelo predijo correctamente, que en este caso fue perfecto.
El valor predictivo positivo es del 100%, lo que indica la probabilidad de que un caso predicho como “Innova” sea realmente “Innova”.
El valor predictivo negativo es del 91.16%, lo que indica la probabilidad de que un caso predicho como “No Innova” sea realmente “No Innova”.
La prevalencia de la clase “Innova” en el conjunto de datos es del 30.98%.
La tasa de detección del modelo es del 24.28%, lo que indica la proporción de todos los casos “Innova” que el modelo identificó correctamente.
La exactitud equilibrada del modelo es del 89.19%, que es el promedio de sensibilidad y especificidad. Representa la capacidad del modelo para predecir correctamente ambas clases, en este caso es un valor considerablemente alto.
A partir de las metricas de rendimiento obtenidas para el modelo actual se puede concluir que en un contexto real de toma de decisiones considerando los datos e implicaciones reales, se puede confiar de manera considerable en los resultados del modelo.
Por ultimo, graficamos la curva ROCR, esta es una herramienta utilizada para el analisis del rendimiento de un modelo predictivo, mostrando la relacion entre la tasa de verdaderos positivos y la tasa de falsos positivos, es util para comparar el rendimiento de diferentes modelos y entender como el modelo maneja el equilibrio entre la sensibilidad y la especificidad.
La curva ROCR esta bien ajustada ya que se desplaza hacia el rincon superior izquierdo del grafico, lo que representa que el modelo tiene una tasa alta de verdaderos positivos y una baja de falsos positivos, expresando que tan acertado es la clasificacion del modelo, en este caso indica que el modelo acierta de manera adecuada.
A partir de los modelos implementados a la data proporcionada EDIT se pudo observar un comportamiento que se aplica directamente a la variable de Personal con educación superior, cuanto mayor proporción de ingresos se obtenga, mayor posibilidad de tener un equipo de trabajo capacitado, lo cual genera posibilidades de sacar al mercado productos Innovadores, y por ende esto genera un ciclo repetitivo de crecimiento económico.
Utilizando la misma semilla para el modelo del árbol se logra apreciar que este tuvo una precisión del 93% de eficacia, donde se identifica que clasifica correctamente los casos positivos y negativos.
Se identificó un valor de k óptimo el cual fue de 23 con una precisión de 74,44% esto considerando la matriz de confusión a partir del modelo, se puede decir que prevalece la correcta predicción de los casos verdaderos negativos y tiene una poca capacidad limitada para identificar correctamentes los verdaderos positivos, esto pues se debe a la sensibilidad y especificidad.
Ambos modelos mostraron una alta precisión, pero el modelo de árbol de decisión superó al modelo KNN en términos de sensibilidad y precisión global. La sensibilidad del modelo de árbol de decisión (78.38%) indica que es capaz de identificar con mayor precisión las empresas innovadoras en comparación con el modelo KNN (38.48%). Además, el valor Kappa del modelo de árbol de decisión (0.8335) indica una concordancia sustancial entre las predicciones del modelo y las clases reales, lo que lo convierte en el mejor modelo para este conjunto de datos.
Las empresas pueden clasificarse como innovadoras y no innovadoras, lo que hace que haya dentro de estas personas con educación superior o por lo contrario no tienen. Estas se pueden identificar si son o no lo son, a partir de la cantidad de personas con educación que haya dentro de estas, si es mayor que 1 es innovadora o por lo contrario si no tienen pues no son innovadoras.
Las empresas innovadoras tienden a tener más ventas nacionales ya que con sus bienes y servicios producidos innovadores pueden llegar a causar un impacto positivo en los hogares, las cuales hacen que ellos sigan accediendo a estos y por ello influye positivamente en la economía de esta empresa a comparación de las ventas en las empresas no innovadoras son un 25% de todas las ventas nacionales en respectivo periodo.
Basado en los resultados obtenidos, se concluye que el modelo de árbol de decisión es el más adecuado para clasificar empresas innovadoras y no innovadoras en la industria manufacturera colombiana utilizando los datos de la Encuesta EDIT I-X 2019-2020. Su mayor sensibilidad y precisión general hacen que sea más efectivo para identificar patrones de innovación en comparación con el modelo KNN
United Nations. (s/f). Human Development Index. Human Development Reports. Recuperado el 28 de octubre de 2023, de (https://n9.cl/m88kc)
Descubra el algoritmo KNN : un algoritmo de aprendizaje supervisado. (2021, diciembre 28). Formation Data Science | Datascientest.com. (https://n9.cl/er1mcz)
Capítulo 10 Aprendizaje Supervisado. (2020, junio 26). Bookdown.org. (https://n9.cl/y7or9)
profesorDATA. (2020, agosto 7). Evaluando los modelos de Clasificación en Aprendizaje Automático: La matriz de confusión. profesordata.com. (https://n9.cl/zkn60)
Colombia, puesto 67 de economías más innovadoras entre 132 países (https://www.portafolio.co/innovacion/economia-colombia-posicion-del-pais-en-el-indice-mundial-de-de-la-ompi-557181)