## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr     1.2.1     ✔ readr     2.2.0
## ✔ forcats   1.0.1     ✔ stringr   1.6.0
## ✔ ggplot2   4.0.3     ✔ tibble    3.3.1
## ✔ lubridate 1.9.5     ✔ tidyr     1.3.2
## ✔ purrr     1.2.2     
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag()    masks stats::lag()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
## 
## Attaching package: 'modelr'
## 
## 
## The following object is masked from 'package:broom':
## 
##     bootstrap

Dados da CAPES sobre avaliação da pós-graduação

A CAPES é um órgão do MEC que tem a atribuição de acompanhar a pós-graduação na universidade brasileira. Uma das formas que ela encontrou de fazer isso e pela qual ela é bastante criticada é através de uma avaliação quantitativa a cada x anos (era 3, mudou para 4).

Usaremos dados da penúltima avaliação da CAPES:

cacc_tudo = read_projectdata()

glimpse(cacc_tudo)
## Rows: 73
## Columns: 31
## $ Instituição                  <chr> "UNIVERSIDADE FEDERAL DO AMAZONAS", "UNIV…
## $ Programa                     <chr> "INFORMÁTICA (12001015012P2)", "CIÊNCIA D…
## $ Nível                        <int> 5, 4, 3, 3, 3, 5, 4, 3, 3, 3, 5, 3, 3, 3,…
## $ Sigla                        <chr> "UFAM", "UFPA", "UFMA", "UEMA", "FUFPI", …
## $ `Tem doutorado`              <chr> "Sim", "Sim", "Não", "Não", "Não", "Sim",…
## $ `Docentes colaboradores`     <dbl> 0.25, 5.50, 3.00, 6.25, 1.75, 2.00, 1.00,…
## $ `Docentes permanentes`       <dbl> 24.75, 14.00, 10.00, 14.00, 9.50, 20.75, …
## $ `Docentes visitantes`        <dbl> 0.00, 0.00, 0.00, 0.00, 0.00, 0.75, 0.50,…
## $ `Resumos em conf`            <int> 20, 23, 15, 5, 4, 10, 6, 136, 0, 24, 27, …
## $ `Resumos expandidos em conf` <int> 25, 24, 7, 10, 1, 68, 9, 13, 4, 6, 16, 5,…
## $ `Artigos em conf`            <int> 390, 284, 115, 73, 150, 269, 179, 0, 120,…
## $ Dissertacoes                 <int> 108, 77, 50, 25, 31, 75, 60, 129, 45, 3, …
## $ Teses                        <int> 14, 0, 0, 0, 0, 24, 5, 0, 0, 0, 29, 0, 0,…
## $ periodicos_A1                <int> 15, 19, 5, 1, 7, 21, 21, 0, 3, 8, 44, 0, …
## $ periodicos_A2                <int> 19, 21, 11, 1, 4, 32, 13, 0, 9, 2, 23, 2,…
## $ periodicos_B1                <int> 19, 38, 7, 3, 6, 26, 16, 2, 6, 4, 32, 4, …
## $ periodicos_B2                <int> 1, 12, 2, 6, 0, 0, 11, 0, 0, 2, 1, 0, 0, …
## $ periodicos_B3                <int> 3, 16, 2, 2, 3, 16, 15, 0, 4, 6, 9, 0, 2,…
## $ periodicos_B4                <int> 0, 4, 0, 3, 3, 0, 1, 3, 1, 6, 0, 0, 4, 5,…
## $ periodicos_B5                <int> 10, 16, 8, 4, 12, 4, 16, 2, 6, 2, 11, 0, …
## $ periodicos_C                 <int> 9, 34, 12, 5, 2, 3, 11, 9, 5, 10, 16, 1, …
## $ periodicos_NA                <int> 7, 15, 8, 11, 12, 6, 19, 31, 7, 14, 19, 0…
## $ per_comaluno_A1              <int> 4, 1, 0, 0, 1, 7, 5, 0, 1, 0, 10, 0, 0, 2…
## $ per_comaluno_A2              <int> 5, 5, 5, 0, 2, 15, 3, 0, 3, 0, 3, 0, 0, 1…
## $ per_comaluno_B1              <int> 4, 2, 5, 2, 2, 14, 6, 0, 2, 0, 17, 0, 1, …
## $ per_comaluno_B2              <int> 0, 1, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0,…
## $ per_comaluno_B3              <int> 2, 2, 0, 1, 0, 7, 9, 0, 2, 0, 4, 0, 0, 1,…
## $ per_comaluno_B4              <int> 0, 0, 0, 0, 2, 0, 1, 0, 1, 3, 0, 0, 2, 0,…
## $ per_comaluno_B5              <int> 5, 0, 4, 0, 8, 3, 6, 0, 4, 0, 4, 0, 2, 5,…
## $ per_comaluno_C               <int> 6, 5, 3, 1, 2, 3, 7, 1, 2, 4, 8, 0, 11, 3…
## $ per_comaluno_NA              <int> 6, 14, 2, 2, 9, 3, 6, 4, 5, 1, 10, 0, 17,…

Produção e produtividade de artigos

Uma das maneiras de avaliar a produção dos docentes que a CAPES utiliza é quantificando a produção de artigos pelos docentes. Os artigos são categorizados em extratos ordenados (A1 é o mais alto), e separados entre artigos em conferências e periódicos. Usaremos para esse lab a produção em periódicos avaliados com A1, A2 e B1.

cacc = cacc_tudo %>%
  transmute(
    docentes = `Docentes permanentes`,
    producao = (periodicos_A1 + periodicos_A2 + periodicos_B1),
    produtividade = producao / docentes,
    mestrados = Dissertacoes,
    doutorados = Teses,
    tem_doutorado = tolower(`Tem doutorado`) == "sim",
    mestrados_pprof = mestrados / docentes,
    doutorados_pprof = doutorados / docentes
  )

cacc_md = cacc %>% 
  filter(tem_doutorado)

EDA

skimr::skim(cacc)
Data summary
Name cacc
Number of rows 73
Number of columns 8
_______________________
Column type frequency:
logical 1
numeric 7
________________________
Group variables None

Variable type: logical

skim_variable n_missing complete_rate mean count
tem_doutorado 0 1 0.47 FAL: 39, TRU: 34

Variable type: numeric

skim_variable n_missing complete_rate mean sd p0 p25 p50 p75 p100 hist
docentes 0 1 20.63 12.27 8.25 11.25 16.75 25.75 67.25 ▇▃▁▁▁
producao 0 1 58.03 65.44 0.00 18.00 42.00 67.00 355.00 ▇▂▁▁▁
produtividade 0 1 2.36 1.37 0.00 1.40 2.27 3.20 5.66 ▆▇▇▅▂
mestrados 0 1 75.79 63.23 0.00 39.00 58.00 103.00 433.00 ▇▃▁▁▁
doutorados 0 1 14.96 30.98 0.00 0.00 0.00 14.00 152.00 ▇▁▁▁▁
mestrados_pprof 0 1 3.66 1.81 0.00 2.57 3.58 4.88 8.19 ▂▇▇▃▂
doutorados_pprof 0 1 0.43 0.73 0.00 0.00 0.00 0.57 2.69 ▇▁▁▁▁
cacc %>% 
  ggplot(aes(x = docentes)) + 
  geom_histogram(bins = 15, fill = paleta[1])

cacc %>% 
  ggplot(aes(x = producao)) + 
  geom_histogram(bins = 15, fill = paleta[2])

cacc %>% 
  ggplot(aes(x = produtividade)) + 
  geom_histogram(bins = 15, fill = paleta[3])

Se quisermos modelar o efeito do tamanho do programa em termos de docentes (permanentes) na quantidade de artigos publicados, podemos usar regressão.

Importante: sempre queremos ver os dados antes de fazermos qualquer modelo ou sumário:

cacc %>% 
  ggplot(aes(x = docentes, y = producao)) + 
  geom_point()

Parece que existe uma relação. Vamos criar um modelo então:

modelo1 = lm(producao ~ docentes, data = cacc)

tidy(modelo1, conf.int = TRUE, conf.level = 0.95)
glance(modelo1)

Para visualizar o modelo:

cacc_augmented = cacc %>% 
  add_predictions(modelo1) 

cacc_augmented %>% 
  ggplot(aes(x = docentes)) + 
  geom_line(aes(y = pred), colour = "brown") + 
  geom_point(aes(y = producao)) + 
  labs(y = "Produção do programa")

Se considerarmos que temos apenas uma amostra de todos os programas de pós em CC no Brasil, o que podemos inferir a partir desse modelo sobre a relação entre número de docentes permanentes e produção de artigos em programas de pós?

Normalmente reportaríamos o resultado da seguinte maneira, substituindo VarIndepX e todos os x’s e y’s pelos nomes e valores de fato:

Regressão múltipla foi utilizada para analisar se VarIndep1 e VarIndep2 tem uma associação significativa com VarDep. Os resultados da regressão indicam que um modelo com os 2 preditores no formato VarDep = XXX.VarIndep1 + YYY.VarIndep2 explicam XX,XX% da variância da variável de resposta (R2 = XX,XX). VarIndep1, medida como/em [unidade ou o que é o 0 e o que é 1] tem uma relação significativa com o erro (b = [yy,yy; zz,zz], IC com 95%), assim como VarIndep2 medida como [unidade ou o que é o 0 e o que é 1] (b = [yy,yy; zz,zz], IC com 95%). O aumento de 1 unidade de VarIndep1 produz uma mudança de xxx em VarDep, enquanto um aumento…

Produza aqui a sua versão desse texto, portanto:

Análise da Regressão Linear Simples


Regressão linear foi utilizada para analisar se o número de docentes (permanentes) tem uma associação significativa com a produção do programa. Os resultados da regressão indicam que um modelo no formato \(\text{producao} = -41{,}27 + 4{,}81 \cdot \text{docentes}\) explica 81,46% da variância da variável de resposta (\(R^2 = 0{,}8146\)). A variável docentes, medida em número de professores permanentes no programa, tem uma relação significativa com a produção (\(b = 4{,}81\); IC 95% \([4{,}27; 5{,}36]\)). O aumento de 1 unidade de docentes produz um aumento de 4,81 artigos na produção do programa.


Dito isso, o que significa a relação que você encontrou na prática para entendermos os programas de pós graduação no Brasil? E algum palpite de por que a relação que encontramos é forte?


Na prática, essa relação significa que a capacidade de produção em um programa é fortemente afetada pelo número de docentes. Isso possivelmente ocorre devido a existência de um incentivo ou uma exigência de que docentes mantenham-se publicando frequentemente.


Mais fatores

modelo2 = lm(producao ~ docentes + mestrados_pprof + doutorados_pprof + tem_doutorado, 
             data = cacc_md)

tidy(modelo2, conf.int = TRUE, conf.level = 0.95)
glance(modelo2)

E se considerarmos também o número de alunos?

modelo2 = lm(producao ~ docentes + mestrados + doutorados, data = cacc)

tidy(modelo2, conf.int = TRUE, conf.level = 0.95)
glance(modelo2)

Visualizar o modelo com muitas variáveis independentes fica mais difícil

para_plotar_modelo = cacc %>% 
  data_grid(producao = seq_range(producao, 10), # Crie um vetor de 10 valores no range
            docentes = seq_range(docentes, 4),  
            # mestrados = seq_range(mestrados, 3),
            mestrados = median(mestrados),
            doutorados = seq_range(doutorados, 3)) %>% 
  add_predictions(modelo2)

glimpse(para_plotar_modelo)
## Rows: 120
## Columns: 5
## $ producao   <dbl> 0.00000, 0.00000, 0.00000, 0.00000, 0.00000, 0.00000, 0.000…
## $ docentes   <dbl> 8.25000, 8.25000, 8.25000, 27.91667, 27.91667, 27.91667, 47…
## $ mestrados  <int> 58, 58, 58, 58, 58, 58, 58, 58, 58, 58, 58, 58, 58, 58, 58,…
## $ doutorados <dbl> 0, 76, 152, 0, 76, 152, 0, 76, 152, 0, 76, 152, 0, 76, 152,…
## $ pred       <dbl> 3.199123, 79.257725, 155.316327, 72.026777, 148.085378, 224…
para_plotar_modelo %>% 
  ggplot(aes(x = docentes, y = pred)) + 
  geom_line(aes(group = doutorados, colour = doutorados)) + 
  geom_point(data = cacc, aes(y = producao, colour = doutorados))

Considerando agora esses três fatores, o que podemos dizer sobre como cada um deles se relaciona com a produção de um programa de pós em CC? E sobre o modelo? Ele explica mais que o modelo 1?

Explicação

Regressão múltipla foi utilizada para analisar se docentes, mestrados e doutorados têm uma associação significativa com a producao total do programa. Os resultados da regressão indicam que um modelo com os 3 preditores no formato \(\text{producao} = -14{,}37 + 3{,}50 \cdot \text{docentes} - 0{,}19 \cdot \text{mestrados} + 1{,}00 \cdot \text{doutorados}\) explica 87,07% da variância da variável de resposta (\(R^2 = 0{,}8707\)).A variável docentes, medida em número de professores permanentes, tem uma relação significativa com a produção (\(b = 3{,}50\); IC 95% \([2{,}58; 4{,}42]\)). A variável mestrados, medida pelo total de dissertações, apresenta associação negativa significativa (\(b = -0{,}19\); IC 95% \([-0{,}36; -0{,}03]\)). Por fim, a variável doutorados, medida pelo total de teses defendidas, tem uma relação positiva significativa com a produção (\(b = 1{,}00\); IC 95% \([0{,}64; 1{,}37]\)).Controlando-se os demais fatores, o aumento de 1 docente permanente produz um aumento estimado de 3,50 artigos na produção, a conclusão de 1 tese de doutorado adiciona 1,00 artigo, enquanto o aumento de 1 dissertação de mestrado associa-se a uma redução ligeira de 0,19 artigo na produção total.

Agora Trabalhando com Produtividade

Diferente de medirmos produção (total produzido), é medirmos produtividade (produzido / utilizado). Abaixo focaremos nessa análise. Para isso crie um modelo que investiga como um conjunto de fatores que você julga que são relevantes se relacionam com a produtividade dos programas. Crie um modelo que avalie como pelo menos 3 fatores se relacionam com a produtividade de um programa. Pode reutilizar fatores que já definimos e analizamos para produção. Mas cuidado para não incluir fatores que sejam função linear de outros já incluídos (ex: incluir A, B e um tercero C=A+B)

Produza abaixo o modelo e um texto que comente (i) o modelo, tal como os que fizemos antes, e (ii) as implicações - o que aprendemos sobre como funcionam programas de pós no brasil?.

Nova Variável

Decidi incluir o número de artigos publicados em conferências por docente como variável preditora.Quero avaliar se essa produção atua como complemento ou substituto da publicação em periódicos.

cacc = cacc_tudo %>%
  transmute(
    docentes = `Docentes permanentes`,
    producao = (periodicos_A1 + periodicos_A2 + periodicos_B1),
    produtividade = producao / docentes,
    
    tem_doutorado = tolower(`Tem doutorado`) == "sim",
    mestrados_pprof = Dissertacoes / docentes,
    doutorados_pprof = Teses / docentes,
    
    # Novas métricas sugeridas
    # nível = ----- má ideia
    artigos_conf_pprof = `Artigos em conf` / docentes,
    
    # má ideias...
    #orientacoes_pprof = (Dissertacoes + Teses) / docentes,
    #prop_com_aluno = (per_comaluno_A1 + per_comaluno_A2 + per_comaluno_B1) / ifelse(producao == 0, 1, producao)
  )
# evitei escolher produção e número de docentes
# Já que o cálculo de produtividade depende desses fatores.
modelo_produtividade = lm(
  produtividade ~ tem_doutorado + mestrados_pprof + doutorados_pprof + artigos_conf_pprof, 
  data = cacc
)


tidy(modelo_produtividade, conf.int = TRUE, conf.level = 0.95)
glance(modelo_produtividade)

Podemos notar aqui que o fator “mestrados_pprof” não afeta muito na produção…

Observação

  1. Exclusão de nivel: Considerei incluir o nível do programa, mas como ele é definido (imagino) tendo a própria produtividade como critério de avaliação da CAPES, poderia cair no caso de ser uma função linear de outra.

Resultado

Uma regressão linear múltipla foi utilizada para analisar a associação entre a estrutura do programa (tem_doutorado, mestrados_pprof, doutorados_pprof, artigos_conf_pprof) e a sua produtividade em periódicos. O modelo final é:

\[\text{produtividade} = 0,30 + 0,76 \cdot \text{tem_doutorado} - 0,07 \cdot \text{mestrados_pprof} + 0,77 \cdot \text{doutorados_pprof} + 0,14 \cdot \text{artigos_conf_pprof}\]

O modelo é estatisticamente significativo (\(F(4) = 35,48\), \(p < 0,001\)) e explica 67,6% da variância total da produtividade em periódicos (\(R^2 = 0,676\), \(R^2 \text{ ajustado} = 0,657\)).

  • tem_doutorado: Programas que possuem doutorado (TRUE) têm uma relação positiva e estatisticamente significativa com a produtividade (\(b = 0,76\), \(\text{IC}_{95\%} = [0,26; 1,26]\), \(p = 0,0035\)), apresentando em média 0,76 artigo por docente a mais que programas que oferecem apenas mestrado.
  • doutorados_pprof: O número de teses de doutorado concluídas por docente apresentou forte associação positiva (\(b = 0,77\), \(\text{IC}_{95\%} = [0,44; 1,11]\), \(p < 0,001\)).
  • artigos_conf_pprof: A publicação em conferências por docente também mostrou associação positiva estatisticamente relevante com a produção em periódicos (\(b = 0,14\), \(\text{IC}_{95\%} = [0,09; 0,19]\), \(p < 0,001\)).
  • mestrados_pprof: A taxa de dissertações de mestrado por docente não apresentou relação estatisticamente significativa com a produtividade em periódicos (\(b = -0,07\), \(\text{IC}_{95\%} = [-0,18; 0,04]\), \(p = 0,213\)).

Concluindo: A presença de doutorado (tem_doutorado = TRUE), uma maior taxa de formação de doutores (doutorados_pprof) e uma alta atividade em conferências (artigos_conf_pprof) são os principais fatores associados a um aumento na produtividade de periódicos. Cada tese defendida por docente adiciona em média 0,77 artigo/docente, enquanto cada artigo publicado em conferência por docente se associa a um incremento de 0,14 artigo/docente em periódicos. Por outro lado, o volume de formações de mestrado não produz alteração relevante na produtividade de periódicos.

Implicações

  1. O doutorado é o “motor da produtividade”: A presença do curso de doutorado eleva significativamente e, por consequência, de um grande número de teses de alunos defendidas por orientador aumentam o número de produções por docentes.

  2. Conferências e Periódicos são complementares: Publicar em conferências não prejudica as publicações em periódicos. Programas com alta atividade em conferências também tendem a ser mais produtivos em periódicos.

  3. O mestrado possivelmente foca em formação, deixando a publicação de artigos em períodicos de lado.