Foram escolhidos para a pesquisa os três cursos mais frequentes de cada área, com algumas observações. Para as áreas I, II e III, não houve complicações na seleção dos cursos. No entanto, para a área IV, devido à semelhança entre os componentes curriculares de todos os cursos, optou-se por considerá-los como um único grupo. Já na área V, como há uma segunda etapa para ingresso além do ENEM, esse conjunto foge da regra de admissão exclusivamente via ENEM.

Após estudos e análises, observou-se que qualquer análise realizada no contexto geral — incluindo todos os cursos — reflete os mesmos padrões quando feita individualmente para cada área. Dessa forma, não se faz necessário repetir os resultados para todas as áreas. Áreas e cursos selecionados:

Análises preliminares

As seguintes variáveis foram analisadas:

A seguir as análises gerais:

Distribuição por Sexo
Sexo Frequência Porcentagem
Feminino 3061 53.60%
Masculino 2650 46.40%
Distribuição por Cor/Raça
Cor/Raça Frequência Porcentagem
Não declarado 2099 36.75%
Branca 609 10.66%
Preta 3003 52.58%
Distribuição por Intervalos de Idade
Intervalos de Idade Frequência Porcentagem
17~20 779 13.64%
21~24 2649 46.38%
25~30 1619 28.35%
31-84 664 11.63%
Distribuição por Situação
Situação Frequência Porcentagem
Cursando 4551 79.69%
Matrícula Trancada 249 4.36%
Evadido 342 5.99%
Formado 569 9.96%

A partir das tabelas e gráficos apresentados, observa-se que a maioria dos discentes possui perfil de etnia preta, está na faixa etária de 21 a 24 anos, são mulheres e encontram-se atualmente cursando a graduação.


O uso do método de Kaplan-Meier é fundamental para a análise, pois permite avaliar o tempo até a ocorrência de um evento, no caso, o tempo de formação dos discentes. Como nem todos os estudantes se formaram e há casos de trancamento, evasão ou continuidade nos cursos, o método possibilita lidar com dados censurados e estimar as probabilidades de não formação ao longo do tempo para diferentes grupos.

Ajustado o gráfico

A análise dos gráficos mostra que, durante os primeiros quatro anos, todas as áreas apresentam probabilidades de sobrevivência acadêmica semelhantes. No entanto, após esse período, a Área IV é a primeira a apresentar uma queda na probabilidade de sobrevivência, seguida pela Área III e, por fim, pela Área II. A Área I se mantém com uma probabilidade de sobrevivência superior às demais por mais tempo. Entre seis e oito anos, todas as áreas convergem para a mesma probabilidade de sobrevivência.

Após o Kaplan-Meier o teste de logrank irá comparar as curvas das áreas.

## Call:
## survdiff(formula = Surv(Tempo, Censura) ~ Area, data = ufba2019, 
##     rho = 0)
## 
## n=5427, 284 observations deleted due to missingness.
## 
##                  N Observed Expected (O-E)^2/E (O-E)^2/V
## Area=area_I   1144       94    124.2      7.34     12.74
## Area=area_II  2021      203    213.8      0.55      1.21
## Area=area_III 1865      201    170.3      5.54     10.69
## Area=area_IV   397       46     35.7      2.99      4.23
## 
##  Chisq= 21.9  on 3 degrees of freedom, p= 7e-05
Número de Formaturas Observadas e Esperadas
Área de Estudo Formaturas Observadas Formaturas Esperadas
Área I 94.0 124.2
Área II 203.0 213.8
Área III 201.0 170.3
Área IV 46.0 35.7

Resultados esperados e observados por área

Com relação ao p-valor, por estar abaixo de 0,05, rejeita-se a hipótese nula de que todas as áreas possuem a mesma curva de sobrevivência. Esse resultado indica que há diferença estatisticamente significativa nas taxas de formação entre as áreas.


Agora, serão ajustados modelos probabilísticos (Exponencial, Weibull, Lognormal). Além disso, será realizado o teste de Log-Rank para comparar as curvas de sobrevivência das áreas.

## Call:
## survreg(formula = Surv(Tempo, Censura) ~ 1, data = ufba2019, 
##     dist = "exponential")
## 
## Coefficients:
## (Intercept) 
##    3.571041 
## 
## Scale fixed at 1 
## 
## Loglik(model)= -2600.9   Loglik(intercept only)= -2600.9
## n=5462 (249 observations deleted due to missingness)
## (Intercept) 
##     35.5536
## Call:
## survreg(formula = Surv(Tempo, Censura) ~ 1, data = ufba2019, 
##     dist = "weibull")
## 
## Coefficients:
## (Intercept) 
##    1.964613 
## 
## Scale= 0.09851287 
## 
## Loglik(model)= -1232.9   Loglik(intercept only)= -1232.9
## n=5462 (249 observations deleted due to missingness)
##                 gama    alpha
## (Intercept) 10.15096 7.132149
## Call:
## survreg(formula = Surv(Tempo, Censura) ~ 1, data = ufba2019, 
##     dist = "lognorm")
## 
## Coefficients:
## (Intercept) 
##    1.944182 
## 
## Scale= 0.1806408 
## 
## Loglik(model)= -1316.2   Loglik(intercept only)= -1316.2
## n=5462 (249 observations deleted due to missingness)
Modelo Tempo_Medio Gama Log_Verossimilhanca
Exponencial 35.55 NA -2600.9
Weibull 7.13 10.15 -1232.9
Lognormal 6.99 NA -1316.2

O modelo exponencial assume que a taxa de risco é constante ao longo do tempo. Como o coeficiente estimado é aproximadamente 3.57, obtém-se 35.55 como o tempo médio de sobrevivência estimado. O valor da log-verossimilhança é -2600.9, um valor relativamente alto, já que, teoricamente, quanto menos negativo, melhor o ajuste.

A distribuição de Weibull generaliza a exponencial ao permitir que o risco varie com o tempo. O coeficiente estimado é aproximadamente 1.96, com o parâmetro de escala igual a 7.13. O parâmetro de forma é 10.15, o que indica que a taxa de risco aumenta ao longo do tempo. Isso sugere que, conforme os alunos passam mais tempo na faculdade, a chance de se formarem cresce. O valor da log-verossimilhança é -1232.9, maior (menos negativo) que o do modelo exponencial, indicando um ajuste significativamente melhor.

No modelo lognormal, assume-se que o logaritmo do tempo de sobrevivência segue uma distribuição normal. O coeficiente estimado é aproximadamente 1.94, e o tempo médio de sobrevivência corresponde a 6.99. O valor da log-verossimilhança é -1316.2, melhor que o do modelo exponencial, mas inferior ao do modelo de Weibull.

Logo pode-se conluir que o modelo Weibull obteve o melhor ajuste, com o maior log-verossimilhança e um parâmetro positivo, indicando que a taxa de conclusão aumento no decorrer do tempo.