EDA

Data summary
Name data
Number of rows 4918
Number of columns 44
_______________________
Column type frequency:
character 3
factor 1
numeric 40
________________________
Group variables None

Variable type: character

skim_variable n_missing complete_rate min max empty n_unique whitespace
field 20 1.00 3 51 0 148 0
from 36 0.99 2 58 0 172 0
career 46 0.99 2 77 0 218 0

Variable type: factor

skim_variable n_missing complete_rate ordered n_unique top_counts
dec 0 1 FALSE 2 no: 2873, yes: 2045

Variable type: numeric

skim_variable n_missing complete_rate mean sd p0 p25 p50 p75 p100 hist
iid 0 1.00 274.67 183.91 1.00 88.00 273.00 431.00 552.0 ▇▁▅▅▅
gender 0 1.00 0.50 0.50 0.00 0.00 1.00 1.00 1.0 ▇▁▁▁▇
order 0 1.00 9.26 5.67 1.00 4.00 9.00 14.00 22.0 ▇▆▅▃▂
pid 10 1.00 274.98 183.97 1.00 88.00 273.00 431.00 552.0 ▇▁▅▅▅
int_corr 72 0.99 0.19 0.31 -0.73 -0.03 0.21 0.43 0.9 ▁▅▇▇▂
samerace 0 1.00 0.41 0.49 0.00 0.00 0.00 1.00 1.0 ▇▁▁▁▆
age_o 61 0.99 25.79 3.35 18.00 23.00 25.00 28.00 39.0 ▃▇▆▁▁
age 52 0.99 25.78 3.35 18.00 23.00 25.00 28.00 39.0 ▃▇▆▁▁
race 20 1.00 2.73 1.22 1.00 2.00 2.00 4.00 6.0 ▇▁▃▁▁
sports 36 0.99 6.40 2.57 1.00 5.00 7.00 8.00 10.0 ▂▅▆▇▆
tvsports 36 0.99 4.53 2.82 1.00 2.00 4.00 7.00 10.0 ▇▆▅▅▃
exercise 36 0.99 6.12 2.33 1.00 5.00 6.00 8.00 10.0 ▂▃▇▇▃
dining 36 0.99 7.69 1.79 1.00 7.00 8.00 9.00 10.0 ▁▁▃▇▇
museums 36 0.99 6.88 2.08 0.00 6.00 7.00 8.00 10.0 ▁▂▃▇▅
art 36 0.99 6.59 2.29 0.00 5.00 7.00 8.00 10.0 ▁▃▅▇▅
hiking 36 0.99 5.77 2.56 0.00 4.00 6.00 8.00 10.0 ▃▆▇▇▅
gaming 36 0.99 4.02 2.67 0.00 2.00 4.00 6.00 14.0 ▇▇▅▁▁
clubbing 36 0.99 5.73 2.45 0.00 4.00 6.00 8.00 10.0 ▃▅▆▇▃
reading 36 0.99 7.64 2.02 1.00 7.00 8.00 9.00 13.0 ▁▂▇▇▁
tv 36 0.99 5.29 2.45 1.00 3.00 6.00 7.00 10.0 ▅▅▇▇▂
theater 36 0.99 6.72 2.25 0.00 5.00 7.00 8.00 10.0 ▁▃▅▇▆
movies 36 0.99 7.98 1.67 0.00 7.00 8.00 9.00 10.0 ▁▁▂▇▇
concerts 36 0.99 6.82 2.10 0.00 6.00 7.00 8.00 10.0 ▁▂▆▇▅
music 36 0.99 7.78 1.84 1.00 7.00 8.00 9.00 10.0 ▁▁▃▇▇
shopping 36 0.99 5.48 2.57 1.00 3.00 6.00 7.00 10.0 ▆▅▇▆▅
yoga 36 0.99 4.21 2.71 0.00 2.00 4.00 6.00 10.0 ▇▅▅▃▂
attr 118 0.98 6.06 1.95 0.00 5.00 6.00 7.00 10.0 ▁▃▇▇▂
sinc 161 0.97 7.05 1.81 0.00 6.00 7.00 8.00 10.0 ▁▁▅▇▃
intel 166 0.97 7.27 1.59 0.00 6.00 7.00 8.00 10.0 ▁▁▃▇▃
fun 197 0.96 6.29 1.98 0.00 5.00 6.00 8.00 10.0 ▁▂▇▇▂
amb 421 0.91 6.70 1.83 0.00 6.00 7.00 8.00 10.0 ▁▂▇▇▃
shar 643 0.87 5.32 2.16 0.00 4.00 5.00 7.00 10.0 ▂▅▇▅▁
like 122 0.98 6.05 1.85 0.00 5.00 6.00 7.00 10.0 ▁▂▇▇▂
prob 156 0.97 5.02 2.17 0.00 4.00 5.00 7.00 10.0 ▃▅▇▅▁
match_es 460 0.91 3.17 2.36 0.00 2.00 3.00 4.00 10.0 ▇▆▂▁▁
attr3_s 2874 0.42 7.08 1.55 3.00 7.00 7.00 8.00 10.0 ▂▂▇▇▂
sinc3_s 2874 0.42 7.99 1.52 3.00 7.00 8.00 9.00 10.0 ▁▁▃▆▇
intel3_s 2874 0.42 8.21 1.22 4.00 8.00 8.00 9.00 10.0 ▁▁▂▇▇
fun3_s 2874 0.42 7.57 1.63 3.00 7.00 8.00 9.00 10.0 ▁▂▇▇▇
amb3_s 2874 0.42 7.59 1.78 3.00 7.00 8.00 9.00 10.0 ▂▂▅▃▇
## Warning: Removed 52 rows containing non-finite values (`stat_bin()`).

———–

A pesquisa abrange uma ampla faixa etária, com a maioria dos participantes sendo jovens entre 21 e 30 anos. A maioria dos participantes se identifica como Europeu/Caucasiano-Americano (2) ou Asiático/Ilhéu do Pacífico/Asiático-Americano (4), enquanto uma minoria se identifica como Negro/Afro-Americano (1), Latino/Hispano-Americano (3) ou outros. É importante notar que não há participação de nativos americanos (5) no estudo.

Modelo geral

Diversas variáveis são analisadas no estudo, representando a percepção dos integrantes entre si. Para essa análise, foram escolhidas as seguintes:
  • attr : quão atraente p1 achou p2
  • sinc : quão sincero p1 achou p2
  • intel : quão inteligente p1 achou p2
  • fun : quão divertido p1 achou p2
  • amb : quão ambicioso p1 achou p2
  • shar : quanto p1 achou que compartilha interesses e hobbies com p2
## # A tibble: 7 × 6
##   term        estimate std.error statistic conf.low conf.high
##   <chr>          <dbl>     <dbl>     <dbl>    <dbl>     <dbl>
## 1 (Intercept)  0.00607    0.243    -21.0    0.00375   0.00971
## 2 attr         1.75       0.0285    19.7    1.66      1.86   
## 3 sinc         0.879      0.0315    -4.11   0.826     0.935  
## 4 intel        1.01       0.0385     0.179  0.934     1.09   
## 5 fun          1.29       0.0307     8.41   1.22      1.38   
## 6 shar         1.38       0.0242    13.4    1.32      1.45   
## 7 amb          0.824      0.0305    -6.35   0.776     0.875

Através desse modelo podemos perceber que as seguintes variáveis tem um impacto positivo na decisão de match dos participantes:
* O aumento de 1 unidade em atração (attr) produz um aumento de 75% na chance de um match
* O aumento de 1 unidade em hobbies compartilhados (shar) produz um aumento de 38% na chance de um match
* O aumento de 1 unidade em diversão (fun) produz um aumento de 29% na chance de um match
* O aumento de 1 unidade em inteligencia (intel) produz um aumento de 0,006% na chance de um match
Enquanto as proximas variáveis tem um impacto negativo nessa decisão:
* O aumento de 1 unidade de ambição (amb) produz um decréscimo de 18% na chance de um match
* O aumento de 1 unidade de sinceridade (sinc) produz um decréscimo de 13% na chance de um match
Esses resultados sugerem que, para os participantes desta pesquisa, a atração física, os hobbies compartilhados e a diversão são os fatores mais importantes na decisão de match. É interessante notar que a inteligência (intel) tem um impacto positivo muito pequeno nessa decisão, com um aumento de apenas 0,006% na chance de um match para cada aumento de 1 unidade nessa variável.

Modelos separados por genero

Gênero masculino

## # A tibble: 7 × 6
##   term        estimate std.error statistic conf.low conf.high
##   <chr>          <dbl>     <dbl>     <dbl>    <dbl>     <dbl>
## 1 (Intercept)  0.00558    0.346     -15.0   0.00279    0.0108
## 2 attr         1.58       0.0395     11.7   1.47       1.71  
## 3 sinc         0.855      0.0428     -3.67  0.786      0.929 
## 4 intel        1.11       0.0557      1.92  0.998      1.24  
## 5 fun          1.25       0.0423      5.29  1.15       1.36  
## 6 shar         1.41       0.0348      9.92  1.32       1.51  
## 7 amb          0.839      0.0424     -4.14  0.772      0.911

Gênero feminino

## # A tibble: 7 × 6
##   term        estimate std.error statistic conf.low conf.high
##   <chr>          <dbl>     <dbl>     <dbl>    <dbl>     <dbl>
## 1 (Intercept)  0.00536    0.352     -14.8   0.00265    0.0106
## 2 attr         1.93       0.0421     15.6   1.78       2.09  
## 3 sinc         0.888      0.0470     -2.53  0.810      0.973 
## 4 intel        0.942      0.0544     -1.10  0.846      1.05  
## 5 fun          1.33       0.0452      6.30  1.22       1.45  
## 6 shar         1.37       0.0341      9.14  1.28       1.46  
## 7 amb          0.819      0.0448     -4.45  0.750      0.894


Por fim, analisando os generos de maneira separada, podemos perceber que, assim como visto no modelo geral, tanto para os participantes masculinos quanto para os femininos desta pesquisa, a atração física é o fator mais importante na decisão de match. Ser divertido e ter hobbies compartilhados também são fatores importantes para ambos os gêneros. A sinceridade e a ambição têm impactos negativos moderados para ambos os gêneros. Já a inteligência não parece ter um impacto significativo na decisão de match para nenhum dos gêneros, apesar de parecer ser mais relevante para o grupo masculino.
É interessante notar que existem algumas diferenças entre os gêneros em termos da importância relativa das variáveis. Por exemplo, a atração física é ainda mais importante para as mulheres do que para os homens, enquanto ter hobbies compartilhados é mais importante para os homens do que para as mulheres.
Contudo, é importante resaltar que esses resultados são específicos para esta pesquisa e podem não ser generalizáveis para outras populações ou contextos.