## Loading required package: ggplot2
## Loading required package: lattice
brindados específicamente de la EDIT (Encuesta de Desarrollo e Innovación Tecnológica en la industria manufacturera) realizada para los años 2019-2020, en la cual fueron utilizados para la recolección de datos, censos a las grandes empresas del sector industrial.
La EDIT es una encuesta realizada en Colombia la cual es llevada a cabo por el Departamento Administrativo Nacional de Estadística (DANE), que es la entidad responsable de la planeación, levantamiento, procesamiento, análisis y difusión de las estadísticas oficiales de Colombia. La EDIT tiene como objetivo principal recopilar información acerca del desarrollo y la innovación tecnológica en el sector manufacturero de las industrias colombianas, con el fin de fortalecer la capacidad técnica de las empresas, crear un tejido empresarial conformado por firmas dinámicas, diversificar la producción, aumentar la complejidad de las exportaciones y generar bienes y servicios con mayor valor agregado y alta tecnología.
Esta encuesta es fundamental para poder entrar en el contexto de la innovación mientras que al tiempo se vuelve una clave importante gracias a la información brindada para la toma de decisiones en cuanto a las políticas públicas, el crecimiento económico, inclusión social y el desarrollo sostenible.
Para el estudio, se utilizaron 8 variables, de las cuales 2 son cualitativas y 6 cuantitativas, cabe resaltar que se implementa modelos de Aprendizaje Supervisado, donde específicamente se utilizó el algoritmo knn (K-Nearest Neighbors) y el árbol de clasificación con los cuales se logra obtener el análisis de la relación entre las variables escogidas y el desarrollo e innovación de las industrias manufactureras Colombianas.
Para la obtención de resultados principalmente se llevaron a cabo pruebas con dos conjuntos, el de entrenamiento y uno de prueba, donde mediante las matrices de confusión, curvas ROC y la precisión, se logró evaluar la efectividad de los dos modelos.
Relación de las variables
Se debe clasificar las empresas industriales colombianas teniendo en cuenta que su clasificación industrial internacional de todas las actividades económicas son innovadoras o no innovadoras usando las variables que se escogieron considerando los años 2019 y 2020 y sin datos que falten.
Esta variable es una encuesta que se le hizo a los empresarios si durante el periodo 2019 - 2020 su empresa incluyó algún bien o servicio nuevo, los cuales ya existían en el mercado nacional y/o en el internacional marcado el número 1 como “SI” o el número 2 como “NO”.
Esta variable está relacionada con la variable anterior, pues, a las empresas que respondieron “SI” deben indicar el número de innovaciones que le hicieron a su empresa con ese bien o servicio nuevo que introdujeron.
De igual manera, esta variable es otra encuesta en donde cada empresario debe señalar si durante los años 2019 y 2020 incluyeron a su empresa algún producto que se trate de un bien, un servicio nuevo o mejorado o si implementó un proceso mejorado.
Asimismo, esta variable tiene una correlación con la variable anterior, debido a que a los empresarios que respondieron “SI” deben indicar el número de innovaciones que le hicieron su empresa con ese bien, servicio o proceso que introdujeron mejorado.
Esta variable indica el número total de innovaciones de las empresas que introdujeron métodos de distribución, entrega o sistemas logísticos nuevos o mejorados, entre el 2019 y 2020.
De manera análoga, esta variable señala todas las innovaciones de las empresas que incluyeron métodos de procesamiento de información o comunicación nuevos o mejorados en su empresa también en el periodo antes mencionado.
Esta variable indica el número de personal ocupado promedio que participó en la realización de actividades científicas, tecnológicas y de innovación los cuales tienen una especialización en el año 2019.
Igualmente, esta variable señala el personal ocupado en promedio que estuvo implicado en el desarrollo de actividades científicas, tecnológicas y de innovación que cuentan con el máximo nivel educativo en el 2019.
A continuación se mostrarán las estadísticas descriptivas tales como dato mínimo y máximo, el primer cuartil, mediana, tercer cuartil y la media, considerando la clasificación de las empresas industriales colombianas si son innovadoras o no innovadoras teniendo en cuenta las variables antes mencionadas.
Bienes o servicios nuevos únicamente para su empresa que ya existían en el mercado nacional y/o en el internacional Si=1, No=2
Se puede evidenciar que en las empresas no innovadoras como era de esperarse ningún empresario indicó que en su empresa haya algún bien o servicio nuevo o mejorado, sin embargo, en las empresas innovadoras curiosamente también hubo algunas que no introdujeron bienes o servicios recientes en periodo 2019-2020.
Número total de innovaciones en bienes o servicios nuevos únicamente para su empresa 2019-2020
Se puede observar que en las empresas innovadoras el número máximo de innovaciones es 34 a pesar de que algunas no tuvieron ninguna, de la misma forma y como ya se había respondido en la encuesta ninguna impresa no innovadora tuvo alguna innovación.
Bienes o servicios mejorados para su empresa que ya existían en el mercado nacional y/o en el internacional Si=1, No=2
Así como en la variable I1R1C1N hubo empresas de categoría innovadora las cuales no tuvieron ningún bien o servicio mejorado, y las empresas no innovadoras ninguna tuvo alguna innovación por cual en ambas categorías hubo un mínimo de 1.
Número total de innovaciones en bienes o servicios mejorados para su empresa 2019-2020
Se puede observar que el número máximo de innovaciones en la clasificación de las empresas innovadoras es de 146, mientras que en las empresas no innovadoras no hubo ninguna.
Número total de innovaciones que introdujo métodos de distribución, entrega o sistemas logísticos nuevos o mejorados en su empresa en 2019-2020
A pesar de que en las empresas no innovadoras no hubo ninguna innovación, en las de categoría innovadora que implementaron los métodos de distribución, entrega o sistemas logísticos nuevos o mejorados hubo un máximo de 10 innovaciones.
Número total de innovaciones que introdujo métodos de procesamiento de información o comunicación nuevos o mejorados en su empresa en 2019-2020
La cantidad máxima de innovaciones en las empresas colombianas de clasificación industrial internacional innovadora es de 9, mientras que en las de no innovadoras no hubo ninguna innovación.
Personal ocupado promedio que tiene especialización en 2019
Se puede analizar que en las empresas industriales de clasificación industrial internacional innovadora en el año 2019 existe más personal que cuenta con especialización que haya participado en actividades científicas, tecnológicas o innovadoras hubo un máximo de 131 de este personal mientras que en las no innovadoras tenía un máximo de 80 personas con especialización.
Personal ocupado promedio que tiene titulo profesional en 2019
Se puede evidenciar que las empresas colombianas de clasificación industrial innovadora hubo más personal en promedio que cuenta título profesional que haya participado en actividades científicas, tecnológicas o innovadoras en el año 2019 en donde hubo un máximo de 788 personas mientras que en las no innovadoras tenía un máximo de 374 personas con título aunque de igual manera es un número alto.
Se usó para este informe dos tipos de modelos, el modelo kNN y el modelo árbol de clasificación
KNN es un algoritmo que busca K vecinos (observaciones más cercanas) en un tabla de datos de entrenamiento a un nuevo punto de datos y luego se hace la clasificación en base a esas observaciones o datos, en donde se esperaría que los vecinos cercanos sean similares al nuevo punto de datos.
Se puede evidenciar que la gráfica va de forma descendente, sin embargo analizando más en detalle se puede encontar una explicación a este resultado.
SP_knnEntrenado
## k-Nearest Neighbors
##
## 1936 samples
## 8 predictor
## 2 classes: 'INNO', 'NOINNO'
##
## No pre-processing
## Resampling: Bootstrapped (25 reps)
## Summary of sample sizes: 1936, 1936, 1936, 1936, 1936, 1936, ...
## Resampling results across tuning parameters:
##
## k Accuracy Kappa
## 5 0.7148020 0.4291147
## 7 0.7040094 0.4075248
## 9 0.6938101 0.3872321
## 11 0.6871089 0.3738529
## 13 0.6844073 0.3683828
## 15 0.6799884 0.3595671
## 17 0.6786439 0.3568641
## 19 0.6739437 0.3475107
## 21 0.6731312 0.3459200
## 23 0.6707552 0.3413035
## 25 0.6698199 0.3394396
## 27 0.6671796 0.3341099
## 29 0.6645976 0.3288419
## 31 0.6638031 0.3273330
## 33 0.6610728 0.3218373
## 35 0.6601030 0.3198953
## 37 0.6585040 0.3167843
## 39 0.6569036 0.3135849
## 41 0.6570159 0.3137971
## 43 0.6550196 0.3097753
## 45 0.6524746 0.3046322
## 47 0.6525808 0.3048725
## 49 0.6514214 0.3025149
## 51 0.6492965 0.2982568
## 53 0.6471560 0.2938896
## 55 0.6459782 0.2915123
## 57 0.6450277 0.2896353
## 59 0.6459035 0.2914406
## 61 0.6439278 0.2874885
## 63 0.6441466 0.2878676
## 65 0.6421285 0.2838462
## 67 0.6418599 0.2832908
## 69 0.6407364 0.2809878
## 71 0.6418407 0.2832343
## 73 0.6395425 0.2785523
## 75 0.6402178 0.2800724
## 77 0.6396742 0.2789694
## 79 0.6385521 0.2767566
## 81 0.6375670 0.2747884
## 83 0.6383297 0.2762719
## 85 0.6383810 0.2763884
## 87 0.6390520 0.2777724
## 89 0.6386200 0.2769480
## 91 0.6379972 0.2756571
## 93 0.6368990 0.2734728
## 95 0.6365162 0.2726659
## 97 0.6352621 0.2701067
## 99 0.6357012 0.2709373
## 101 0.6353569 0.2703165
## 103 0.6331270 0.2658471
## 105 0.6312645 0.2620903
## 107 0.6315300 0.2626516
## 109 0.6310256 0.2616533
## 111 0.6303379 0.2603121
## 113 0.6299019 0.2594454
## 115 0.6276101 0.2549073
## 117 0.6279991 0.2556732
## 119 0.6262023 0.2520419
## 121 0.6252933 0.2501962
## 123 0.6256507 0.2509041
## 125 0.6250267 0.2496606
## 127 0.6258595 0.2513290
## 129 0.6256349 0.2508327
## 131 0.6268142 0.2532495
## 133 0.6260295 0.2516839
## 135 0.6255735 0.2508263
## 137 0.6258512 0.2513541
## 139 0.6246863 0.2491178
## 141 0.6239685 0.2476487
## 143 0.6237691 0.2472476
## 145 0.6239220 0.2475876
## 147 0.6244386 0.2486837
## 149 0.6244134 0.2486579
## 151 0.6243165 0.2484312
## 153 0.6230036 0.2459201
## 155 0.6214769 0.2427993
## 157 0.6196595 0.2391749
## 159 0.6192772 0.2384234
## 161 0.6192873 0.2385070
## 163 0.6189354 0.2377615
## 165 0.6187945 0.2375063
## 167 0.6194779 0.2389220
## 169 0.6194797 0.2389067
## 171 0.6193059 0.2386154
## 173 0.6179695 0.2359381
## 175 0.6179076 0.2358081
## 177 0.6181226 0.2362545
## 179 0.6185005 0.2370812
## 181 0.6175503 0.2351583
## 183 0.6171615 0.2343778
## 185 0.6166627 0.2333540
## 187 0.6180390 0.2360929
## 189 0.6183883 0.2367629
## 191 0.6181534 0.2362967
## 193 0.6173147 0.2346758
## 195 0.6169824 0.2340529
## 197 0.6171512 0.2344219
## 199 0.6166939 0.2336194
## 201 0.6155523 0.2313459
## 203 0.6163230 0.2329104
## 205 0.6162567 0.2328350
## 207 0.6156100 0.2316049
## 209 0.6152593 0.2308858
## 211 0.6152917 0.2309161
## 213 0.6158891 0.2321200
## 215 0.6151523 0.2306341
## 217 0.6165778 0.2334630
## 219 0.6157522 0.2318725
## 221 0.6149494 0.2302214
## 223 0.6154682 0.2313163
## 225 0.6166826 0.2337401
## 227 0.6167249 0.2338765
## 229 0.6170600 0.2345153
## 231 0.6166746 0.2338217
## 233 0.6152300 0.2309934
## 235 0.6154012 0.2313749
## 237 0.6155189 0.2315801
## 239 0.6138284 0.2282854
## 241 0.6135829 0.2278172
## 243 0.6139163 0.2284430
## 245 0.6140241 0.2286153
## 247 0.6128885 0.2264282
## 249 0.6127618 0.2262328
## 251 0.6130696 0.2269659
## 253 0.6129550 0.2267314
## 255 0.6136907 0.2281908
## 257 0.6139196 0.2286175
## 259 0.6130836 0.2269475
## 261 0.6135164 0.2278203
## 263 0.6130862 0.2269629
## 265 0.6139648 0.2287691
## 267 0.6136870 0.2283199
## 269 0.6114191 0.2238079
## 271 0.6112554 0.2235023
## 273 0.6111419 0.2233922
## 275 0.6119249 0.2249917
## 277 0.6117068 0.2245803
## 279 0.6116578 0.2243970
## 281 0.6116676 0.2244539
## 283 0.6111041 0.2233550
## 285 0.6121147 0.2253336
## 287 0.6128625 0.2267758
## 289 0.6111690 0.2234574
## 291 0.6108162 0.2227781
## 293 0.6121334 0.2254426
## 295 0.6125155 0.2262245
## 297 0.6105554 0.2223030
## 299 0.6099423 0.2211069
## 301 0.6089968 0.2192740
## 303 0.6077478 0.2167830
## 305 0.6086350 0.2185135
## 307 0.6082452 0.2177113
## 309 0.6087725 0.2187478
## 311 0.6061868 0.2135377
## 313 0.6062419 0.2136477
## 315 0.6065752 0.2143868
## 317 0.6071956 0.2156119
## 319 0.6074030 0.2160307
## 321 0.6053053 0.2118863
## 323 0.6058492 0.2129935
## 325 0.6046358 0.2105533
## 327 0.6032853 0.2078509
## 329 0.6041795 0.2096681
## 331 0.6060536 0.2134438
## 333 0.6062063 0.2138096
## 335 0.6061421 0.2137303
## 337 0.6063881 0.2141778
## 339 0.6076162 0.2166434
## 341 0.6080272 0.2173880
## 343 0.6079167 0.2171166
## 345 0.6087433 0.2187677
## 347 0.6089067 0.2190876
## 349 0.6104026 0.2219939
## 351 0.6107711 0.2227033
## 353 0.6087328 0.2186615
## 355 0.6081593 0.2175001
## 357 0.6077643 0.2167094
## 359 0.6096171 0.2203946
## 361 0.6111667 0.2235242
## 363 0.6108443 0.2228716
## 365 0.6099283 0.2210850
## 367 0.6093762 0.2200427
## 369 0.6105108 0.2222466
## 371 0.6103904 0.2220881
## 373 0.6097083 0.2207377
## 375 0.6092950 0.2199191
## 377 0.6089391 0.2191842
## 379 0.6098023 0.2209171
## 381 0.6103085 0.2220061
## 383 0.6100212 0.2214558
## 385 0.6093262 0.2200521
## 387 0.6086509 0.2187015
## 389 0.6070228 0.2154730
## 391 0.6068485 0.2151615
## 393 0.6065671 0.2145715
## 395 0.6062439 0.2139427
## 397 0.6050764 0.2115762
## 399 0.6040508 0.2095494
## 401 0.6041036 0.2096673
## 403 0.6036639 0.2088142
##
## Accuracy was used to select the optimal model using the largest value.
## The final value used for the model was k = 5.
Al obtener estos resultados, es importante recalcar que se usaron 1936 muestras para las 8 variables que se escogieron y las dos categorías que se utilizan para la tipología de las empresas colombianas son innovadoras y no innovadoras, se realizó un método estadístico de remuestreo (Bootstrapped) de 25 repeticiones, y se puede evidenciar que tiene 5 vecinos “k”
Es la proporción de predicciones correctas realizadas por un modelo en relación con el total de predicciones, es decir la exactitud para cada valor de “k”, la cual se puede calcular dividiendo el número de predicciones correctas sobre el número total de predicciones.
Es una medida que evalúa la concordancia entre las predicciones de un modelo y los valores reales y se tiene en cuenta que las predicciones correctas puede que se hayan producido por casualidad, en otras palabras, ajusta la exactitud observada en función de la exactitud esperada al azar.
En nuestros resultados al ser los datos más cercanos a 0 que a 1 indica un acuerdo similar al esperado por casualidad.
Un árbol de clasificación es un método de aprendizaje supervisado que se utiliza para clasificar datos en diferentes categorías. Se representa como una estructura jerárquica en forma de árbol, donde cada nodo representa una decisión y las ramas representan los posibles resultados de esa decisión.
Empleando la función “tree” de R, se construye un árbol de decisión para la clasificación. Posteriormente, se analizan los resultados obtenidos y presentados en la consola de R.
Podemos observar que dentro de esta función establecimos que el tamaño mínimo de los nodos terminales del árbol serán 10. Las variables que realmente se utilizaron para la construcción del modelo fueron “I1R1C1N” “I1R1C1M” “I1R9C2” “I1R8C2” “IV1R3C1”, las cuales serán las de mayor aporte de acuerdo al modelo. Adicionalmente se indica que el número de nodos terminales es 6.
Se refiere a una medida del error que queda en un árbol de clasificación después de su construcción, una medida que evalua la calidad del ajuste del modelo. Se calcula como la suma de los residuos divididos por el número de observaciones menos el número de nodos terminales del árbol. En este caso el valor de 0.7911 indica que el modelo no está capturando perfectamente la relación entre las variables predictoras y la variable objetivo; Es decir que pueden existir errores en las predicciones realizadas por el árbol y que podría haber espacio para mejorar su rendimiento.
Es una medida del rendimiento del árbol de clasificación que indica la proporción de observaciones que el árbol clasifica incorrectamente. Se puede observar que el valor es del 0.1874 que nos indica que tiene una tasa de error de clasificación del 18,74% ; Es decir que aproximadamente 363 observaciones mal clasificadas de 1936 observaciones , lo cual significa que el modelo tiene un margen de mejora en cuanto a su precisión.
El árbol de clasificación nos indica inicialmente la decisión que se toma para poder clasificar las empresas manufactureras del país entre sí se considera innovadora o no, esto mediante ciertas variables las cuales fueron las más importantes para poder clasificarlas.
Para comenzar, se puede ver que se muestra que las empresas incluyen algún bien o servicio nuevo los cuales ya existían en el mercado nacional y/o internacional, la empresa se considera innovadora si es menor a 1.5 . En caso de que las empresas señalan que no se incluyó lo mencionado, se procede a verificar si adquirieron bienes o servicios mejorados para la empresa los cuales ya existían en el mercado nacional y/o internacional, en caso de que la respuesta sea si; es decir menor al 1,5 , la empresa se considera innovadora, pero si por el contrario la respuesta es no, se verificará otra variable para poder clasificarla.
Ahora a la empresa se le verificará si el número total de innovaciones que introdujo métodos de procesamiento, información o comunicación nuevos o mejorados en su empresa en el año 2019-2020 es mayor a 0.5, si es así,la empresa si será innovadora, pero si es menor, se deberá comprobar si el número total de innovaciones que introdujo métodos de distribución, entrega o sistemas logísticos nuevos o mejorados en su empresa en 2019-2020 es mayor a 0.5 para que sea considerada innovadora, si es menor, ya se considerará definitivamente que la empresa no es innovadora, puesto que finalmente la única variable que queda para la toma de decisión, es verificar si el número total del personal ocupado promedio que tiene especialización en 2019 es menor o mayor de 9.5, indica que sin importar si este dato es mayor o menor, será considerada no innovadora.
La matriz de confusión o matriz de error permite tener visualización del rendimiento de un algoritmo, cada fila son las instancias de una clase predicha, y las columnas las instancias en una clase real. Esta matriz arroja los datos de reference, accuracy, 95% CI, No information rate, P-Value [Acc > NIR], Kappa, Mcnermar’s Test P-Value, Sensitivity, Specificity, Pos pred Value, Neg pred Value, prevalence, detection rate, detection prevalence, Balanced accuracy y positive class, a continuación se dará una breve explicación de cada uno.
Se refiere a lo cercano que está el resultado de una predicción del valor verdadero. Por tanto, es la división entre los casos positivos bien clasificados por el modelo y el total de predicciones positivas.
Como antes se mencionó accuracy o precisión es la exactitud para cada valor de “k”.
Hace referencia a un intervalo de confianza del 95% el cual permite estimar el rango de valores dentro del cual es probable que se encuentre el verdadero valor de los datos (considerando todos los datos posibles).
También llamada como Tasa de no información se refiere al rendimiento base que esperarías de un clasificador aleatorio. Representa la probabilidad de que un clasificador clasifique correctamente una instancia solo por azar.
Indica el valor p de una prueba estadística que compara la precisión (accuracy) de tu modelo con la Tasa de Información Nula (NIR).
Igualmente, como se mencionó anteriormente Kappa es una medida de acuerdo entre dos clasificadores o evaluadores categóricos. Se utiliza en R para evaluar el rendimiento de un modelo de clasificación cuando se trabaja con datos nominales (categóricos) y múltiples clases.
Se aplica específicamente a datos pareados en el análisis de clasificación binaria, es decir, se utiliza para comparar dos clasificaciones binominales realizadas sobre el mismo conjunto de datos, en donde indica la probabilidad de observar una distribución tan extrema o más extrema en la tabla de contingencia, suponiendo que no haya una diferencia real entre las clasificaciones.
También conocida como el verdadero positivo, es la proporción de casos positivos reales que fueron identificados correctamente por el modelo.
También conocida como el verdadero negativo, es la proporción de casos negativos reales que fueron identificados correctamente por el modelo.
También llamado valor predictivo positivo, es la probabilidad de que un individuo tenga una condición específica dado un resultado de prueba positivo, es decir, la proporción de casos positivos predichos que son realmente positivos.
También llamado valor predictivo negativo, es la probabilidad de que un individuo tenga una condición específica dado un resultado de prueba negativa o en otra palabras es la proporción de casos negativos predichos que son realmente negativos.
Es la proporción de personas en una población que tienen una condición específica en un momento dado de valores predictivos positivos y negativos o la proporción de casos positivos en el conjunto de datos
La tasa de detección es la proporción de casos positivos que el modelo identifica correctamente en relación con el total de casos positivos reales en otras palabras es la proporción de verdaderos positivos en el conjunto de datos.
La prevalencia de detección es la proporción de casos positivos que el modelo identifica en relación con el total de casos positivos y negativos identificados por el modelo, o sea la proporción de predicciones positivas en el conjunto de datos.
Es el promedio de la sensibilidad y la especificidad. Se utiliza cuando las clases están desbalanceadas, es decir, hay más casos en una clase que en la otra.
Es la clase que se quiere que el modelo identifique o prediga correctamente, a pesar de que la matriz de confusión por sí sola muestra los resultados de clasificación para todas las clases presentes en tu conjunto de datos, dependiendo de la aplicación específica, puede haber una clase que sea más interesante que otras. Al especificar la “positive class”, se puede obtener métricas de rendimiento más enfocadas y relevantes para el problema.
## Confusion Matrix and Statistics
##
## Reference
## Prediction INNO NOINNO
## INNO 239 43
## NOINNO 171 376
##
## Accuracy : 0.7419
## 95% CI : (0.7106, 0.7713)
## No Information Rate : 0.5054
## P-Value [Acc > NIR] : < 2.2e-16
##
## Kappa : 0.4819
##
## Mcnemar's Test P-Value : < 2.2e-16
##
## Sensitivity : 0.5829
## Specificity : 0.8974
## Pos Pred Value : 0.8475
## Neg Pred Value : 0.6874
## Prevalence : 0.4946
## Detection Rate : 0.2883
## Detection Prevalence : 0.3402
## Balanced Accuracy : 0.7402
##
## 'Positive' Class : INNO
##
Se puede observar en la matriz la fila “INNO” la cual significa las predicciones de las empresas innovadoras y la fila “NOINNO” que se refiere a las predicciones de las empresas no innovadoras, la columna “INNO” es la clase real de estas empresas innovadoras y la columna “NOINNO” es la clase real de las empresas no innovadoras.
Se puede evidenciar que el modelo predijo la variable “INNO” 240 veces de manera correcta y 40 veces incorrecta, y la variable “NOINNO” 379 veces de manera correcta y 170 veces incorrecta, su precisión (accuracy) fue del 74,67% lo que indica que realmente no es tan preciso, sin embargo fue más de la mitad, su intervalo de confianza del 95% se encuentra entre 0.7156 y 0.776 el cual no es tan amplio, su tasa de no información es de 0.5054 lo cual implica que si se asigna aleatoriamente etiquetas de clase a los puntos de datos, se esperaría una precisión de aproximadamente 50.54%. Esto significa que adivinar al azar resultaría en que aproximadamente la mitad de las instancias se clasificarían correctamente.
Por otra parte, el valor P-Value es de <2.2e-16 al ser un número tan pequeño (generalmente menor a 0.05) se considera estadísticamente significativo. Esto significa que hay evidencia muy fuerte para rechazar la hipótesis nula (que la precisión del modelo no es mayor que la NIR) y aceptar la hipótesis alternativa. Es decir, sugiere que la diferencia observada en la precisión entre el modelo y un clasificador aleatorio es poco probable que haya ocurrido por azar. Hay una fuerte indicación de que el modelo está realmente aprendiendo patrones y haciendo mejores predicciones que una adivinanza aleatoria.
El índice Kappa tiene un valor de 0.4916 lo que se podría analizar es que se tiene una probabilidad de 0.0084 más de tener una concordancia que se esperaría solo por casualidad que a la de tener una concordancia perfecta. El valor p de McNemar es menor que 2.2e-16 lo cual permite afirmar, con alta seguridad estadística, que existe una diferencia significativa entre las empresas innovadora y no innovadoras.
El verdadero positivo tuvo un valor de 0.5854 lo que indica que hubo un 58.54% de casos positivos reales que se identificaron correctamente en la clasificación “INNO”, por otra parte, el verdadero negativo fue de 0.9045, es decir, 90.45% de casos negativos reales que se identificaron correctamente de la clasificación “NOINNO”. El valor predicitvo positivo tuvo un valor de 0.8571 lo que significa que hubo un 85.71% de casos predichos positivos que en realidad si son positivos en la categoria “INNO”, y el valor predictivo negativo tuvo 0.6903 o un 69.03% de casos predicho negativos que si son negativos en la categoría “NOINNO”.
También, hubo una prevalencia de 0.4946 lo que indica una proporción de casos positivos del 49.46% y una tasa de detección de 0.2895 que significa una proporción de casos positivos que el modelo identifica correctamente en relación con el total de casos positivos reales del 28.95% en la categoria “INNO” (empresas innovadoras), la prevalencia de detección fue de 0.3378 de lo cual se puede analizar que hubo un 33.78% de casos positivos que identificó el modelo con respecto al total de casos.
La exactitud equilibrada (Balanced Accuracy) tuvo un valor de 0.7450, lo que se refiere a un promedio de 74.50% de la sensibilidad y especificidad del modelo y la clase positiva es “INNO” la cual se considera la de mayor interés, en donde las métricas de rendimiento de la matriz de confusión se centrarán en cómo de bien el modelo identifica o predice correctamente las instancias que pertenecen a la clase “INNO”, o sea las empresas innovadoras.
## Confusion Matrix and Statistics
##
## Reference
## Prediction INNO NOINNO
## INNO 446 0
## NOINNO 226 711
##
## Accuracy : 0.8366
## 95% CI : (0.816, 0.8557)
## No Information Rate : 0.5141
## P-Value [Acc > NIR] : < 2.2e-16
##
## Kappa : 0.6699
##
## Mcnemar's Test P-Value : < 2.2e-16
##
## Sensitivity : 0.6637
## Specificity : 1.0000
## Pos Pred Value : 1.0000
## Neg Pred Value : 0.7588
## Prevalence : 0.4859
## Detection Rate : 0.3225
## Detection Prevalence : 0.3225
## Balanced Accuracy : 0.8318
##
## 'Positive' Class : INNO
##
Inicialmente la matriz de confusión muestra la cantidad de predicciones correctas e incorrectas realizadas por el modelo a comparación de los resultados reales. En este caso se puede observar que la primera fila que tiene por nombre “INNO” hace referencia a las predicciones de las empresas innovadoras mientras que la segunda fila “NOINNO” indica las predicciones de las empresas no innovadoras. En la columna “INNO” es la clase real de las empresas innovadoras y de la misma manera la segunda columna “NOINNO” representa la clase real de las empresas no innovadoras. Se puede observar que el modelo predijo la variable “ INNO” 446 veces de manera correcta mientras que que no hubo predicciones incorrectas en este caso y la variable “NOINNO” tuvo 226 predicciones correctas y 771 incorrectas. Su precisión (accuracy) fue del 83,66% lo que nos indica una precisión moderada, un poco más alto que el modelo KNN, su intervalo de confianza del 95% se encuentra entre 0.816 y 0.8557 el cual no es tan extenso, su tasa de no información es de 0.5141 lo que indica que si se asigna aleatoriamente etiquetas de clase a puntos de datos se esperará una precisión del 51,41%; Es decir que al momento de pronosticar al azar resulta en que alrededor de la mitad serían correctas.
No obstante el valor P-Value es de <2.2e-16, al ser un número tan pequeño, menor al 0.05 generalmente es significativo, lo que nos indicará que hay evidencia suficiente para rechazar la la hipótesis nula (que la precisión del modelo no supera la de NIR), se acepta la hipótesis alternativa. Esto implica que la diferencia en precisión entre el modelo y un clasificador aleatorio es poco probable que sea aleatoria. Hay una fuerte evidencia de que el modelo está aprendiendo patrones y realizando predicciones mejores que una previsión aleatoria.
Se puede visualizar que el índice Kappa tiene un valor de 0.6699 lo que significa que tiene una probabilidad de 0.1699 más cercano a 1 hay mayor posibilidad de tener una concordancia perfecta. El valor p de McNemar es menor que 2.2e-16 lo que nos permite confirmar que hay una diferencia importante entre las empresas innovadoras y las no innovadoras.
Se puede apreciar que el verdadero positivo tuvo un valor de 0.6637 que indica que hay un 66.37% de casos positivos reales que se identificaron correctamente en la clasificación de “INNO” adicionalmente el valor negativo fue de 1.000, es decir del 100% casos negativos reales que se identificaron correctamente en la clasificación “NOINNO” .
Por otra parte el valor predictivo positivo tuvo un valor del 100% de igual manera lo que nos indica que se predijeron correctamente todos los casos predichos positivos que son positivos en la categoría “INNO” mientras que el valor negativo tuvo un 75,88% de casos predichos negativos que si son negativos dentro la categoría “NOINNO”.
De igual manera hubo una prevalencia que significa una proporción del 48,59% de casos positivos y una tasa de detección de 32,25% que nos indica que el modelo identificó correctamente en relación con el total de casos positivos reales en la categoría de empresas innovadoras. La prevalencia de detección con un valor de 0.3225 lo cual nos indica que hay 32,25% de casos positivos que identificó el modelo con respecto al total de casos.
La exactitud equilibrada tuvo un valor de 83,18 el cual hace referencia a un promedio de la sensibilidad y especificidad del modelo donde la clase positiva es “INNO” la cual es la mas relevante, en las que las métricas de rendimiento de la matriz de confusión se van a guiar en que tan adecuado el modelo predice correctamente las instancias que pertenecen a la categoría de las empresas innovadoras es decir “INNO”.
La curva ROCR es una herramienta de evaluación gráfica la cual se utiliza para evaluar el rendimiento de un modelo de clasificación binaria, la cual representa lo que es la tasa de de falsos positivos en función de la tasa de verdaderos positivos.
Para comprender bien qué quiere decir la gráfica, hay que tener en cuenta que si la curva se acerca más a la esquina superior izquierda, esto indica un mejor rendimiento del modelo, lo cual significa que el modelo es capaz de distinguir con mayor precisión entre las instancias positivas y negativas.
En este caso la curva ROCR se encuentra cerca a la esquina superior izquierda lo cual indica que está bien ajustada, esto señala que hay una tasa alta de lo que son los verdaderos positivos y por el contrario hay una tasa baja de falsos positivos.
De los análisis descriptivos, se puede concluir que las empresas innovadoras introdujeron bienes o servicios nuevos o mejorados durante el período 2019-2020, mientras que las no innovadoras no lo hicieron. Incluso dentro de las empresas innovadoras, algunas no introdujeron ningún bien o servicio nuevo durante el período evaluado, adicionalmente las empresas innovadoras tuvieron un número máximo de 34 innovaciones, mientras que las no innovadoras, como era de esperar, no tuvieron ninguna.
De igual manera existe una amplia variabilidad en el número de mejoras implementadas por las empresas innovadoras. Si bien algunas alcanzaron un máximo de 146 innovaciones, otras no registraron ninguna durante el período evaluado. Las empresas no innovadoras, como era de esperarse, no presentaron ninguna mejora en ninguna de las categorías evaluadas.
En la innovación en métodos de distribución y logística de También dentro de las empresas innovadoras, la implementación de nuevos o mejorados métodos de distribución, entrega o sistemas logísticos estuvo limitada a un máximo de 10 innovaciones.
Sin embargo, hubo una diferencia entre el personal con título profesional las empresas innovadoras colombianas registraron un mayor promedio de personal con título profesional que haya participado en actividades científicas, tecnológicas o innovadoras en el año 2019, con un máximo de 788 personas. Las empresas no innovadoras, por su parte, tuvieron un máximo de 374 personas con título profesional, se puede apreciar una diferencia significativa de 414. Las diferencias en el personal especializado y con título profesional entre las empresas innovadoras y no innovadoras podrían ser un factor que explique, al menos parcialmente, las brechas observadas en su actividad innovadora.
Los datos sugieren que la innovación es un proceso heterogéneo dentro de las empresas colombianas, incluso entre aquellas clasificadas como innovadoras. Dentro de las empresas consideradas innovadoras, algunas no presentaron ninguna innovación durante el período evaluado. Además, existe una gran variación en la cantidad de innovaciones implementadas por estas empresas. Esto podría sugerir que dentro de la categoría de empresas innovadoras, hay diferentes niveles de compromiso o capacidad para innovar.
Se puede observar que el modelo árbol de clasificación tuvo una mayor precisión del 83.66%, comparado con el modelo KNN el cual tuvo una precisión del 74,67%, a pesar de que los dos modelos en realidad son muy útiles, nos llamó la atención el modelo árbol de clasificación debido a esta precisión, podemos observar que en el modelo de clasificación del árbol se tuvo una precisión del 100% en los casos positivos donde se clasificacion correctamente 446 veces, y ninguna vez incorrectamente mientras que en el modelo KNN se clasificaron 240 correctamente y 40 veces incorrectamente. Sin embargo en los casos negativos se clasificaron 226 bien mientras que 771 incorrectamente, esto nos indica que no tiene una gran precisión para clasificar los casos negativos, mientras que en el modelo KNN hubo una mejor clasificación en los casos negativos con 69,03 para concluir observamos que el modelo de árbol de clasificación tiene una mayor precisión a comparación del modelo KNN.
Por último, se puede concluir de la curva ROCR que el modelo tiene un rendimiento bueno, una asertividad adecuada, una alta sensibilidad y especificidad.
Colombia - Encuesta de Desarrollo e Innovación Tecnológica en la industria manufacturera – EDIT I - X - 2019-2020. (2023, January 26). https://microdatos.dane.gov.co/index.php/catalog/779/study-description
Colombia - Encuesta de Desarrollo e Innovación Tecnológica en la industria manufacturera – EDIT I - X - 2019-2020. (n.d.). https://microdatos.dane.gov.co/index.php/catalog/779/data-dictionary/F42?file_name=Estructura_EDIT_X_2019_2020
Awan, A. A. (2023, June 14). K-Nearest Neighbors (KNN) Classification with R Tutorial. https://www.datacamp.com/tutorial/k-nearest-neighbors-knn-classification-with-r-tutorial#rdl
Jauregui, A. F. (2022, August 19). Programar algoritmo kNN desde cero en R. Ander Fernández. https://anderfernandez.com/blog/programar-knn-r/
Autor: Mg. Daniel Paredes Inilupu. (2020, June 26). Capítulo 10 Aprendizaje Supervisado | Data Science con R. https://bookdown.org/dparedesi/data-science-con-r/aprendizaje-supervisado.html