Wstęp

W ramach niniejszego projektu przeprowadzona zostanie eksploracyjna analiza danych (EDA) dotycząca sklepu rowerowego. Celem analizy jest zrozumienie charakterystyk nabywców rowerów oraz identyfikacja czynników, które mogą wpływać na decyzję o zakupie roweru. Dostępny zestaw danych obejmuje informacje o 1000 klientach, w tym szczegółowe cechy demograficzne i behawioralne, a także kategoryczną zmienną wyjściową informującą, czy dana osoba dokonała zakupu roweru. Ponieważ dane zawierają brakujące wartości (NA), konieczne będzie ich odpowiednie przetworzenie, co stanowi istotny element procesu analizy danych.

W ramach projektu zostaną wykonane następujące kroki:

  1. Data Cleansing, Wrangling

  2. Wizualizację Danych

  3. Analizę Opisową

  4. Wnioskowanie (testy statystyczne)

  5. Podsumowanie i wnioski końcowe

Opis zmiennych:

Tabela 1: Przykładowe dane klientów sklepu rowerowego
ID Marital Status Gender Income Children Education Occupation Home Owner Cars Commute Distance Region Age Purchased Bike
12496 Married Female 40000 1 Bachelors Skilled Manual Yes 0 0-1 Miles Europe 42 No
24107 Married Male 30000 3 Partial College Clerical Yes 1 0-1 Miles Europe 43 No
14177 Married Male 80000 5 Partial College Professional No 2 2-5 Miles Europe 60 No
24381 Single NA 70000 0 Bachelors Professional Yes 1 5-10 Miles Pacific 41 Yes
25597 Single Male 30000 0 Bachelors Clerical No 0 0-1 Miles Europe 36 Yes
13507 Married Female 10000 2 Partial College Manual Yes 0 1-2 Miles Europe 50 No
27974 Single Male 160000 2 High School Management NA 4 0-1 Miles Pacific 33 Yes
19364 Married Male 40000 1 Bachelors Skilled Manual Yes 0 0-1 Miles Europe 43 Yes
22155 NA Male 20000 2 Partial High School Clerical Yes 2 5-10 Miles Pacific 58 No
19280 Married Male NA 2 Partial College Manual Yes 1 0-1 Miles Europe NA Yes

Czyszczenie danych

Czyszczenie danych to proces usuwania, poprawiania lub imputacji brakujących, błędnych i niezgodnych wartości w zbiorze danych. Jest kluczowe dla zapewnienia jakości analizy, ponieważ błędne lub niepełne dane mogą prowadzić do fałszywych wniosków.

## Ilość brakujących wartości: 53

Interpretacja wykresu:

Podsumowanie brakujących danych

  • Najwięcej braków występuje w kolumnach Education, Occupation, Commute_Distance, Region, Home_Owner, Income, Marital_Status, itp.
  • Niektóre zmienne często występują razem jako brakujące, co sugeruje, że te braki mogą być powiązane (np. jeśli brakuje informacji o dochodzie, może również brakować danych o statusie mieszkaniowym).
  • Występowanie pojedynczych braków – kilka zmiennych ma pojedyncze braki, co można łatwo uzupełnić imputacją.

Analiza brakujących danych w relacji dochód-wiek

Opis wykresu

Wykres przedstawia rozkład danych w relacji między dochodem (oś X) a wiekiem (oś Y), z uwzględnieniem statusu kompletności danych (“Obecne” lub “Brakujące”). Dane zostały podzielone na trzy regiony: - Europa - Ameryka Północna - Pacyfik

Kolor zielony oznacza dane obecne, natomiast kolor pomarańczowy wskazuje na dane brakujące.

Kluczowe obserwacje

  1. Podział na regiony:
    • Dane zostały przedstawione w trzech panelach odpowiadających regionom (Europa, Ameryka Północna, Pacyfik).
    • Każdy region charakteryzuje się różnym rozkładem punktów, co wskazuje na regionalne różnice w relacji dochód-wiek.
  2. Status danych:
    • Dane kompletne (zielony) dominują w całym zbiorze.
    • Dane brakujące (pomarańczowy) występują sporadycznie, jednak są widoczne w określonych przedziałach wiekowych i dochodowych.
  3. Charakterystyka poszczególnych regionów:
    • Europa:
      • Rozkład jest bardziej rozproszony.
      • Dochody są generalnie niższe niż w pozostałych regionach.
      • Brakujące dane występują głównie w niższych przedziałach dochodowych.
    • Ameryka Północna:
      • Dane skoncentrowane w środkowych przedziałach wiekowych (20-60 lat) i dochodowych (50,000-100,000).
      • Liczba brakujących danych jest minimalna.
    • Pacyfik:
      • Dane są rozproszone, podobnie jak w Europie.
      • Braki danych występują w dolnych zakresach dochodów oraz wśród młodszych grup wiekowych.
  4. Rozkład wiekowy i dochodowy:
    • Największa liczba obserwacji znajduje się w grupach wiekowych 30-60 lat oraz dochodowych 50,000-100,000.
    • Brakujące dane są zauważalne w dolnych przedziałach dochodowych i w młodszych grupach wiekowych.

Wnioski

  • Braki danych są niewielkie i raczej nie powinny znacząco wpłynąć na analizę ogólną. Mogą jednak mieć znaczenie w określonych przedziałach (np. niski dochód w Europie i Pacyfiku).
  • Regionalne różnice w rozkładach sugerują konieczność odrębnej analizy dla każdego regionu, aby uwzględnić lokalne specyfiki.

1. Brakujące dane w podziale na poziom wykształcenia W pierwszej analizie dane zostały podzielone według poziomu wykształcenia, a następnie przeanalizowano rozkład brakujących wartości w różnych kategoriach. Wyniki wskazują, że:

Najwięcej brakujących wartości odnotowano w zmiennych Age (Wiek), Children (Dzieci) oraz Cars (Samochody). Szczególnie wysokie braki dotyczą grupy Partial High School oraz Graduate Degree, gdzie niektóre zmienne osiągają poziom braków przekraczający 2,5% obserwacji. Braki w zmiennych takich jak Income (Dochód) oraz Marital Status (Stan cywilny) są bardziej rozproszone, lecz zauważalne w kilku grupach wykształcenia.

2. Brakujące dane w podziale na regiony W drugiej analizie dane zostały podzielone według regionów (Europe, North America, Pacific). Obserwacje wskazują na następujące wnioski:

Najwięcej braków odnotowano w kategorii Income (Dochód) w regionie Pacific, gdzie poziom braków jest najwyższy (powyżej 2,5%). Znaczące luki występują także w kategoriach Gender (Płeć) oraz Cars (Samochody) w Europie, co sugeruje potencjalne błędy w zbieraniu danych w tym regionie.

Braki w pozostałych kategoriach, takich jak Marital Status (Stan cywilny) czy Commute Distance (Dystans dojazdu), są mniej istotne, jednak nadal widoczne w różnych regionach.

3. Brakujące dane w podziale na płeć Ostatnia analiza dotyczyła rozkładu braków danych w zależności od płci. Wyniki wskazują, że:

Najwięcej brakujących danych dotyczy osób, dla których nie określono płci (NA). Szczególnie duże luki występują w kategoriach Age (Wiek), Children (Dzieci) oraz Cars (Samochody), gdzie brakujące wartości osiągają poziom powyżej 7,5%. W grupach Female i Male braki danych są znacznie mniejsze, ale widoczne są w zmiennych Marital Status oraz Income. Możliwe, że brak określenia płci wiąże się z problemami w rejestracji danych lub ich późniejszym przetwarzaniu, co wymaga dalszej weryfikacji.

4. Wnioski i rekomendacje Na podstawie powyższej analizy można sformułować następujące wnioski:

Braki danych są szczególnie widoczne w zmiennych związanych z wiekem, dziećmi oraz dochodem, co może wpłynąć na jakość przyszłych analiz i prognoz. Warto zwrócić uwagę na grupę osób bez określonej płci (NA), gdyż w tej kategorii braki są znacznie większe niż w pozostałych grupach.

Region Pacific wyróżnia się pod względem brakujących wartości w dochodach, co może wskazywać na trudności w zbieraniu tych danych w tym obszarze. W dalszych krokach zaleca się weryfikację źródeł brakujących danych oraz ewentualne zastosowanie metod imputacji, aby poprawić kompletność zbioru danych.

Wypełnienie braków danych

## W naszym pliku nie ma już braków danych

Reguły walidacyjne dla danych

Lista reguł walidacyjnych dla danych
Zmienna Reguła
ID większe niż 0
Marital Status Married lub Single
Gender Male lub Female
Income większe niż 0
Children większe lub równe 0
Education Bachelors, Partial College, High School, Partial High School lub Graduate Degree
Occupation Skilled Manual, Clerical, Professional, Manual, lub Management
Home Owner Yes lub No
Cars większe lub równe 0
Commute Distance 0-1 Miles, 1-2 Miles, 10+ Miles, 2-5 Miles lub 5-10 Miles
Region Europe, Pacific lub North America
Age większe niż 0
Age mniejsze lub równe 120
Purchased Bike Yes lub No
Podsumowanie
Wszystkie reguły zostały spełnione. Brak błędów.

Wizualizacja

Analiza odłegość od pracy, a zakup roweru

Interpretacja wyników

Wykres ilustruje zależność pomiędzy odległością od miejsca pracy (oś X, przedstawiona w milach) a liczbą osób, które zdecydowały się na zakup roweru (oś Y).

Kluczowe obserwacje

  1. Najczęstsze zakupy rowerów:
    • Najwięcej osób, które zakupiło rower, mieszkało w odległości 0-1 mili od miejsca pracy.
    • Liczba zakupów spada w grupie osób mieszkających 1-2 mile od pracy.
  2. Nietypowe wzorce w średnich odległościach:
    • W przedziale 2-5 mil liczba zakupów wzrasta w porównaniu do osób mieszkających bliżej pracy (1-2 mile).
    • W przedziale 5-10 mil liczba zakupów rowerów ponownie spada do wartości podobnych jak w grupie 1-2 mile.
  3. Najrzadsze zakupy rowerów:
    • Osoby mieszkające w odległości powyżej 10 mil od miejsca pracy najrzadziej decydują się na zakup roweru.

Wnioski

  • Największy potencjał sprzedaży rowerów istnieje wśród osób pokonujących krótkie odległości do pracy (0-1 mila).
  • Osoby mieszkające 2-5 mil od pracy stanowią interesującą grupę, w której liczba zakupów jest wyższa niż w innych grupach średnich odległości.

Analiza zakupu roweru w zależności od typu zawodu z podziałem na płeć

Interpretacja wyników

Wykres przedstawia liczbę zakupów rowerów w podziale na typ zawodu (oś X) oraz płeć klientów. Na osi poziomej (X) uwzględniono kategorie zawodów: Clerical, Management, Manual, Professional, Skilled Manual. Oś pionowa (Y) reprezentuje liczbę osób, które zakupiły rower.
- Różowe słupki: reprezentują kobiety.
- Niebieskie słupki: reprezentują mężczyzn.

Kluczowe obserwacje

  1. Największa liczba zakupów:
    • Najwięcej rowerów zakupiono w grupie zawodów Professional, zarówno wśród kobiet, jak i mężczyzn.
    • W tej grupie mężczyźni wyraźnie dominują liczbowo.
  2. Grupa zawodów z wysokimi kwalifikacjami manualnymi (Skilled Manual):
    • Jest drugą pod względem liczby zakupów.
    • Liczba zakupów rowerów jest tutaj stosunkowo równomiernie rozłożona między kobiety a mężczyzn.
  3. Mniejsze liczby zakupów:
    • W zawodach Clerical (biurowych) odnotowano przewagę kobiet nad mężczyzn.
    • Grupa Manual charakteryzuje się niższymi wartościami zakupów niż grupy “Professional” i “Skilled Manual”.
  4. Najmniej zakupów w grupie “Management”:
    • W tej kategorii liczba zakupów jest najniższa dla obu płci.
    • Może to wynikać z preferencji osób na wyższych stanowiskach do korzystania z samochodów jako środka transportu.

Wnioski

  • Zawody z kategorii Professional oraz Skilled Manual stanowią kluczowe grupy klientów pod względem zakupu rowerów.
  • Niska liczba zakupów w grupie Management może wskazywać na ograniczone zainteresowanie rowerami wśród osób o wyższych dochodach, które preferują inne środki transportu.

Wnioski

Analiza wskazuje, że nie ma znaczącej różnicy w zainteresowaniu zakupem rowerów między kobietami a mężczyznami. Obydwie grupy dokonują zakupu w niemal równych proporcjach. Można z tego wywnioskować, że strategie marketingowe powinny być kierowane w sposób równomierny do obu płci, bez konieczności istotnej personalizacji ze względu na różnice w zainteresowaniu.

Analiza zakupu rowerów w zależności od wieku

Interpretacja wyników

Załączony wykres przedstawia liczbę zakupów rowerów w różnych grupach wiekowych. Najważniejsze obserwacje to:
- Najwięcej zakupów dokonują osoby w przedziale wiekowym 30-50 lat, z wyraźnym szczytem w okolicach 40. roku życia.
- Po 50. roku życia zainteresowanie zakupem rowerów stopniowo maleje.
- Osoby młodsze, poniżej 30. roku życia, kupują rowery w mniejszym stopniu niż grupy średniowieku.
- Po 70. roku życia liczba zakupów jest marginalna.

Wnioski i rekomendacje

  • Segment klientów w wieku 30-50 lat powinien być główną grupą docelową w kampaniach marketingowych.
  • Warto rozważyć działania promocyjne skierowane do młodszych konsumentów (20-30 lat), np. oferty dla studentów czy kampanie podkreślające korzyści zdrowotne i ekologiczne rowerów.
  • Możliwe jest również wprowadzenie specjalnych modeli dostosowanych do potrzeb osób starszych (np. rowery elektryczne).

Analiza zakupu rowerów w zależności od regionu zamieszkania

Interpretacja wyników

Drugi wykres przedstawia liczbę zakupów rowerów w trzech regionach: Europa, Ameryka Północna i Pacyfik. Główne obserwacje:
- Najwięcej zakupów dokonano w Ameryce Północnej, gdzie liczba ta przekracza 500.
- Europa znajduje się na drugim miejscu, z wynikiem około 300 zakupów.
- Region Pacyfiku wykazuje najniższą liczbę zakupów, wynoszącą około 200.

Wnioski i rekomendacje

  • Ameryka Północna stanowi kluczowy rynek dla sprzedaży rowerów, dlatego warto skupić na nim główne działania marketingowe.
  • Europa również stanowi istotny rynek, jednak można wprowadzić dodatkowe strategie zwiększające sprzedaż, np. promocje lub rozwój sieci dystrybucyjnej.
  • Region Pacyfiku wykazuje niższe zainteresowanie rowerami, co może wynikać z mniejszej infrastruktury rowerowej lub preferencji transportowych. Warto przeanalizować czynniki wpływające na niższą sprzedaż i dostosować ofertę do lokalnych potrzeb.

Podsumowanie

Przeprowadzona analiza pokazuje, że głównymi nabywcami rowerów są osoby w wieku 30-50 lat oraz mieszkańcy Ameryki Północnej. Dla firm zajmujących się sprzedażą rowerów kluczowe będzie dostosowanie działań marketingowych do tych grup docelowych. Jednocześnie istnieje potencjał do zwiększenia sprzedaży wśród młodszych konsumentów oraz na rynkach europejskim i pacyficznym.

Analiza zakupu rowerów w zależności od zarobków z odstającymi wartościami

Interpretacja wyników

Powyższy wykres przedstawia rozkład zarobków w dwóch grupach: osób, które zdecydowały się na zakup roweru (“Yes”), oraz tych, które roweru nie kupiły (“No”). Wykres skrzynkowy umożliwia ocenę mediany, kwartylów, a także identyfikację wartości odstających w obu grupach. - Mediany zarobków w obu grupach są zbliżone, co wskazuje na brak istotnych różnic w przeciętnych zarobkach między osobami, które kupiły rower, a tymi, które tego nie zrobiły. - Rozpiętość zarobków, reprezentowana przez wąsy skrzynki, również jest podobna dla obu grup, co sugeruje, że poziom zarobków nie jest głównym czynnikiem wpływającym na decyzję o zakupie roweru. - W obu grupach zaobserwowano wartości odstające, które wskazują na obecność osób o skrajnie wysokich zarobkach. Wartości te nie wpływają jednak na główny trend wykresu.

Wnioski i rekomendacje

Analiza wykresu nie wskazuje na wyraźną zależność między poziomem zarobków a decyzją o zakupie roweru. Z racji braku wyraźnej korelacji z zarobkami, lepiej byłby zająć się prowadzeniem kampanii marketingowych skierowanych do szerokiego spektrum klientów, nie ograniczając ich do osób o określonym poziomie dochodów.

Statystyki Opisowe

Analiza statystyk opisowych nabywców rowerów

W ramach analizy statystycznej przeprowadzono obliczenia podstawowych miar opisowych dotyczących wieku, dochodu, liczby dzieci oraz liczby posiadanych samochodów wśród klientów sklepu rowerowego.

Statystyka income children cars age
Średnia 56210.00 1.91 1.46 44.21
Odchylenie standardowe 31017.70 1.63 1.12 11.36
Mediana 60000.00 2.00 1.00 43.00
Przycięta średnia 53612.50 1.79 1.37 43.52
Mediana bezwzględnego odchylenia 29652.00 1.48 1.48 11.86
Minimum 10000.00 0.00 0.00 25.00
Maksimum 170000.00 5.00 4.00 89.00
Zakres 160000.00 5.00 4.00 64.00
Skośność 0.75 0.39 0.41 0.52
Kurtoza 0.51 -1.03 -0.40 -0.28
Błąd standardowy 980.87 0.05 0.04 0.36

Analiza statystyk opisowych dotyczących klientów sklepu rowerowego. Analiza opiera się na zmiennych: dochody, liczba dzieci, liczba samochodów oraz wiek. Skośność na poziomie 0.75 wskazuje na lekko prawostronny rozkład dochodów, co oznacza, że większość klientów ma dochody poniżej maksymalnej wartości. Oferta powinna być zdywersyfikowana, aby przyciągnąć klientów z różnych grup dochodowych. Warto rozważyć ekonomiczne modele rowerów dla klientów z niższymi dochodami oraz modele premium dla bardziej zamożnych.

Dochody klientów

Większość klientów ma dochody oscylujące w granicach 60 000 PLN. Odchylenie standardowe równe 31 017,70 PLN wskazuje na znaczną różnorodność dochodów. Dochody mieszczą się w przedziale od 10.000 PLN do 170.000 PLN. Skośność na poziomie 0.75 wskazuje na lekko prawostronny rozkład dochodów, co oznacza, że większość klientów ma dochody poniżej maksymalnej wartości. Oferta powinna być zdywersyfikowana, aby przyciągnąć klientów z różnych grup dochodowych. Warto rozważyć ekonomiczne modele rowerów dla klientów z niższymi dochodami oraz modele premium dla bardziej zamożnych.

Liczba dzieci

Większość klientów to osoby posiadające rodziny z medianą równą 2. Liczba dzieci waha się od 0 do 5, a odchylenie standardowe wynosi 1,63, co wskazuje na umiarkowaną różnorodność w tej kategorii. Sklep powinien skupić się na promowaniu oferty rodzinnej, takiej jak rowery dziecięce, foteliki rowerowe, przyczepki dla dzieci czy akcesoria dla rodzin.

Liczba samochodów

Większość klientów posiada jeden samochód. Maksymalna liczba samochodów wynosi 4, a skośność 0,41 wskazuje na lekką przewagę klientów z większą liczbą pojazdów. Można promować rowery jako alternatywę dla transportu samochodowego, podkreślając korzyści ekologiczne i zdrowotne.

Oferta powinna uwzględniać potrzeby różnych grup wiekowych i wprowadzić:

  • Rowery trekkingowe i rekreacyjne dla osób w wieku średnim,

  • Lekkie i wygodne modele dla starszych klientów,

  • Sportowe modele dla młodszych.

Wiek klientów

Większość klientów to osoby w wieku około 40 lat. Minimalny wiek wynosi 25 lat, a maksymalny 89 lat. Odchylenie standardowe to 11,36, co wskazuje na umiarkowaną różnorodność wiekową.

Testy statystyczne

Hipoteza zerowa: Dane posiadają rozkład normalny.

Hipoteza alternatywna: Dane nie posiadają rozkładu normalnego.

Wartość p jest mniejsza niż 0.05, dlatego odrzucamy hipotezę zerową na rzecz hipotezy alternatywnej. Dane nie posiadają rozkładu normalnego.

Histogramy z funkcją rozkładu normalnego

Interpretacja wyników

Histogram dla zmiennej income

Średni dochód klientów to 56 267,61, a mediana dochodu wynosi 60 000. Mediana jest nieco wyższa od średniej, co sugeruje, że wśród klientów znajduje się pewna liczba osób o niższych dochodach, które obniżają średnią wartość. Rozkład dochodów badanej grupy jest prawoskośny, co oznacza, że większość osób osiąga niższe dochody, podczas gdy wyższe dochody występują rzadziej. Tak jak zostało podane wyżej - średni dochód wynosi 56 267,61, a odchylenie standardowe to 31,017.7, co wskazuje na dużą zmienność w dochodach. Dane nie są zgodne z rozkładem normalnym.

Interpretacja wyników

Histogram dla zmiennej age

Średni wiek kupujących rowery wynosi około 44 lata, natomiast mediana wieku to 43 lata, co oznacza, że połowa klientów ma mniej niż 43 lata, a połowa więcej. To potwierdza wcześniejsze wnioski, że głównymi nabywcami rowerów są osoby w przedziale 30-50 lat. Rozkład wieku badanej grupy jest lekko prawoskośny, z koncentracją osób w wieku około 44 lat (średnia wynosi 44.21, a odchylenie standardowe to 11.36). Wartości są bardziej skupione wokół średniej, co czyni rozkład zbliżonym do normalnego, choć występują niewielkie odchylenia widoczne na ogonie wykresu po prawej stronie.

Interpretacja wyników

Histogram dla zmiennej children

Średnia liczba dzieci wynosi 1,91, a odchylenie standardowe to 1.63. Ze względu na dyskretny charakter zmiennej dane nie odpowiadają rozkładowi normalnemu. Natomiast mediana to 2, co sugeruje, że większość klientów to osoby posiadające jedno lub dwoje dzieci. Może to mieć wpływ na preferencje dotyczące wyboru roweru, np.większe zainteresowanie rowerami rodzinnymi czy dziecięcymi.

Interpretacja wyników*

Histogram dla zmiennej cars

Klienci posiadają średnio 1,46 samochodu, a odchylenie standardowe to 1.12. Rozkład tej zmiennej jest dyskretny i odbiega od kształtu rozkładu normalnego. Natomiast mediana to 1, co oznacza, że większość klientów posiada przynajmniej jedno auto. Warto zastanowić się nad strategiami promocyjnymi skierowanymi do osób, które mogą traktować rower jako alternatywny środek transportu.

Wnioski

Na podstawie analizy histogramów zmiennych income, children, cars oraz age można stwierdzić, że rozkłady badanych cech w większości różnią się od rozkładu normalnego, z wyraźną dyskretnością w przypadku liczby dzieci i samochodów, podczas gdy zmienne income i age są bardziej zbliżone do rozkładów ciągłych, choć wykazują pewne odchylenia w postaci skośności. Dane potwierdzają, że główną grupę nabywców rowerów stanowią osoby w wieku 30-50 lat, co powinno być brane pod uwagę w strategiach marketingowych. Dochód klientów jest na umiarkowanym poziomie, co oznacza, że w ofercie warto uwzględnić zarówno modele premium, jak i bardziej budżetowe rowery. Znaczna część klientów to osoby posiadające dzieci, co sugeruje potencjał w rozwijaniu segmentu rowerów rodzinnych. Wielu klientów posiada samochody, co może wskazywać na potrzebę promowania rowerów jako alternatywnego środka transportu.

Test Shapiro-Wilka

Hipoteza zerowa: Dane posiadają rozkład normalny.

Hipoteza alternatywna: Dane nie posiadają rozkładu normalnego.

Wartość p jest mniejsza niż 0.05, dlatego odrzucamy hipotezę zerową na rzecz hipotezy alternatywnej. Dane nie posiadają rozkładu normalnego.

##    Zmienna    Wartosc_p Test_Wynik
## 1   income 5.069623e-19  Odrzucamy
## 2 children 5.871451e-26  Odrzucamy
## 3     cars 2.504447e-26  Odrzucamy
## 4      age 1.447033e-13  Odrzucamy

Regresja

## 
## Call:
## lm(formula = purchased_bike ~ marital_status + log(income) + 
##     children + cars, data = zbior)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -0.8239 -0.4490 -0.2082  0.4679  0.8258 
## 
## Coefficients:
##                       Estimate Std. Error t value Pr(>|t|)    
## (Intercept)          -0.821837   0.265987  -3.090  0.00206 ** 
## marital_statusSingle  0.122642   0.030874   3.972 7.63e-05 ***
## log(income)           0.134907   0.025323   5.327 1.23e-07 ***
## children             -0.026227   0.009944  -2.637  0.00849 ** 
## cars                 -0.106271   0.014846  -7.158 1.58e-12 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 0.4799 on 995 degrees of freedom
## Multiple R-squared:  0.08207,    Adjusted R-squared:  0.07837 
## F-statistic: 22.24 on 4 and 995 DF,  p-value: < 2.2e-16

Model jest statystycznie istotny, ponieważ wartość p dla F-statystyki wynosi:

< 2.2e-16

Na tej podstawie możemy stwierdzić, że przynajmniej jedna ze zmiennych w modelu jest istotnie powiązana z decyzją o zakupie roweru.

Jeżeli dochód wzrośnie o 10% to zwiększa się prawdopobieństwo zakupu roweru o 1.35%. Przydatne byłoby rozważenie wprowadzenia oferty premium dla osób z większym dochodem.

Co interesujące posiadanie dzieci ma ujemny wpływ na zakup roweru, może to wynikać z innych priorytetów, które mają osoby z dziećmi lub potrzeby większego środka transportu jakim jest samochód, gdy ma się dziecko. Dla zwiększenia sprzedaży wśród osób z dziećmi pomocne mogłoby się okazać wprowadzenie oferty z rowerami rodzinnymi.

Posiadanie samochodu również ma negatywny wpływ na zakup roweru,w związku z zwiększeniem liczby samochodów o 1, zmniejsza się prawdopdobieństwo zakupu roweru o 10.63%. Kampania promująca rower jako alternatywny środek transportu dla samochodu podczas np. jazdy do pracy, mógłby wpłynać na zwiększenie sprzedaży wśród tej grupy osób.

Test Kołmogorowa-Smirnowa

Hipoteza zerowa: Dane posiadają rozkład normalny.

Hipoteza alternatywna: Dane nie posiadają rozkładu normalnego.

Wartość p jest mniejsza niż 0.05, dlatego odrzucamy hipotezę zerową na rzecz hipotezy alternatywnej. Dane nie posiadają rozkładu normalnego.

## Wyniki dla zmiennej: age 
## 
##  Asymptotic one-sample Kolmogorov-Smirnov test
## 
## data:  standardized_data
## D = 0.020066, p-value = 0.8155
## alternative hypothesis: two-sided
## Wyniki dla zmiennej: car 
## 
##  Asymptotic one-sample Kolmogorov-Smirnov test
## 
## data:  standardized_data
## D = 0.16993, p-value < 2.2e-16
## alternative hypothesis: two-sided
## Wyniki dla zmiennej: children 
## 
##  Asymptotic one-sample Kolmogorov-Smirnov test
## 
## data:  standardized_data
## D = 0.18152, p-value < 2.2e-16
## alternative hypothesis: two-sided
## 
## 
## Wyniki dla zmiennej: income 
## 
##  Asymptotic one-sample Kolmogorov-Smirnov test
## 
## data:  standardized_data
## D = 0.10518, p-value = 4.914e-10
## alternative hypothesis: two-sided

Intepretacja wyników

Wyniki dla zmiennej age Wartość statystyki D wynosi 0.026729, a p-wartość = 0.4726. Ponieważ p-wartość jest większa od poziomu istotności 0.05, brak podstaw do odrzucenia hipotezy zerowej. Oznacza to, że rozkład zmiennej age jest najbardziej zbliżony do rozkładu normalnego.

Wyniki dla zmiennej car Wartość statystyki D wynosi 0.1563, a p-wartość jest mniejsza niż 2.2e-16. Odrzucamy hipotezę zerową na poziomie istotności 0.05. Wynik wskazuje, że rozkład zmiennej car istotnie różni się od rozkładu normalnego.

Wyniki dla zmiennej children Wartość statystyki D wynosi 0.18055, a p-wartość jest mniejsza niż 2.2e-16. Odrzucamy hipotezę zerową na poziomie istotności 0.05. Wynik wskazuje, że rozkład zmiennej children istotnie różni się od rozkładu normalnego.

Wyniki dla zmiennej income Wartość statystyki D wynosi 0.11337, a p-wartość wynosi 1.372e-11. Odrzucamy hipotezę zerową na poziomie istotności 0.05. Wynik wskazuje, że rozkład zmiennej income istotnie różni się od rozkładu normalnego.

Wnioski

Spośród analizowanych zmiennych, tylko zmienna age wykazuje zgodność z rozkładem normalnym. Pozostałe zmienne (car, children, income) istotnie odbiegają od rozkładu normalnego, co zostało już wcześniej przedstawione w formie histogramów.