Statystyka w pracy dyplomowej — przewodnik krok po kroku

Analiza statystyczna w pracy dyplomowej sprowadza się do siedmiu decyzji podejmowanych zawsze w tej samej kolejności: jakie masz zmienne, jak je opisać, czy rozkład jest normalny, jaki test wybrać, jak zmierzyć siłę związku, czy narzędzie jest rzetelne i jak to wszystko zapisać. Ta strona prowadzi przez te decyzje po kolei i linkuje do szczegółowych tekstów przy każdym kroku.

Nie musisz znać statystyki, żeby przejść tę ścieżkę. Musisz tylko konsekwentnie odpowiadać na pytania w podanej kolejności — bo każdy kolejny krok wynika z poprzedniego.


Zanim policzysz cokolwiek

Trzy rzeczy trzeba mieć ustalone przed otwarciem arkusza z danymi. Cofanie się do nich później oznacza zwykle przeliczanie wszystkiego od nowa.

  1. Hipotezy zapisane w formie, którą da się sprawdzić liczbowo. „Kobiety mają wyższy poziom stresu niż mężczyźni” da się przetestować. „Stres jest ważnym problemem” — nie. Zobacz: hipoteza badawcza oraz cel i pytania badawcze.
  2. Operacjonalizacja, czyli sposób pomiaru każdej zmiennej. Który konkretnie wynik którego kwestionariusza jest „poziomem stresu”? Zobacz: operacjonalizacja zmiennych.
  3. Wielkość i sposób doboru próby. Liczebność wyznacza się analizą mocy — bezpłatnie policzysz ją w programie G*Power. Zobacz: próba badawcza.

Dopiero mając te trzy elementy, ma sens pytanie „jaki test wybrać”.

Krok 1. Ustal typ każdej zmiennej

To najważniejsza decyzja w całej analizie, bo typ zmiennej przesądza o wszystkim, co możesz z nią zrobić — jakie statystyki opisowe podasz, jaki wykres narysujesz, jaki test zastosujesz.

Skala pomiarowa Przykład Co wolno policzyć
Nominalna płeć, kierunek studiów, stan cywilny liczebność, procent, dominanta
Porządkowa wykształcenie, pozycja w rankingu, pojedyncza pozycja skali Likerta dodatkowo mediana, kwartyle
Ilościowa (przedziałowa i ilorazowa) wiek, wynik kwestionariusza, czas reakcji dodatkowo średnia, odchylenie standardowe

Szczegóły: rodzaje zmiennych.

Najczęstsza wątpliwość dotyczy skali Likerta. Pojedyncza pozycja („zdecydowanie się zgadzam” … „zdecydowanie się nie zgadzam”) jest porządkowa. Suma kilkunastu pozycji tworzących skalę jest w praktyce badawczej traktowana jak zmienna ilościowa i analizowana testami parametrycznymi — to konwencja szeroko przyjęta, choć wciąż dyskutowana w metodologii. Zobacz: skala Likerta.

Krok 2. Opisz dane, zanim je przetestujesz

Statystyki opisowe idą do pracy zawsze — także wtedy, gdy testy nie wyjdą. To one pokazują, jak wygląda badana grupa.

Przydatne uzupełnienia: percentyl, współczynnik zmiennościkurtoza.

Krok 3. Sprawdź rozkład

Testy parametryczne (t-Studenta, ANOVA, korelacja Pearsona) zakładają w przybliżeniu normalny rozkład zmiennej zależnej w grupach. Sprawdzenie tego założenia jest osobnym akapitem w rozdziale badawczym.

  • Test Shapiro-Wilka to standard w pracach dyplomowych. Najlepiej działa przy próbach kilkudziesięcioosobowych; poniżej mniej więcej 20–30 obserwacji jego moc jest niska, więc wynik nieistotny niczego nie dowodzi — oznacza tylko, że test nie wykrył odstępstwa. Zobacz: test Shapiro-Wilka.
  • Uwaga na duże próby. Realne dane nigdy nie są dokładnie normalne, więc przy kilkuset obserwacjach test reaguje na odstępstwa nieistotne praktycznie i zwykle wypada istotnie, choć rozkład jest wystarczająco zbliżony do normalnego. Wtedy oceń rozkład dodatkowo przez histogram, wykres kwantylowy oraz skośność i kurtozę.
  • Normalność sprawdzaj osobno w każdej porównywanej grupie, nie na całej próbie łącznie.
  • Jeśli rozkład wyraźnie odbiega od normalnego, przechodzisz na testy nieparametryczne — kolumna po prawej w tabeli poniżej.

Normalność to nie jedyne założenie. Test t i ANOVA zakładają dodatkowo jednorodność wariancji w porównywanych grupach — sprawdza się ją testem Levene’a. Istotny wynik testu Levene’a nie oznacza jeszcze przejścia na test nieparametryczny: wystarczy użyć wersji testu t dla nierównych wariancji (test Welcha), którą programy statystyczne podają w tym samym oknie wyników. Trzecim założeniem jest niezależność obserwacji — jedna osoba, jeden pomiar w danej grupie.

Krok 4. Dobierz test

Co porównujesz Rozkład normalny Rozkład nienormalny lub skala porządkowa
Dwie niezależne grupy test t-Studenta test U Manna-Whitneya
Dwa pomiary tych samych osób test t dla prób zależnych test Wilcoxona
Trzy lub więcej grup niezależnych ANOVA test Kruskala-Wallisa

Pełna ścieżka decyzyjna z przykładami: jaki test statystyczny wybrać.

Testy nieparametryczne nie są testami median. Test U Manna-Whitneya porównuje całe rozkłady rang, a nie wprost mediany — interpretacja „różnica median” jest uprawniona tylko przy podobnym kształcie rozkładów w obu grupach. Zapisuj więc wynik jako istotną różnicę między grupami, a mediany z kwartylami podawaj jako opis. Test Wilcoxona zakłada dodatkowo w miarę symetryczny rozkład różnic między pomiarami.

Po istotnej ANOVA potrzebny jest test post hoc. Sama ANOVA mówi tylko, że któraś z grup różni się od pozostałych; który to układ, pokazuje dopiero test post hoc (np. Tukeya lub z poprawką Bonferroniego, a dla testu Kruskala-Wallisa — test Dunna). Nie zastępuj tego serią testów t dla wszystkich par: z każdym kolejnym porównaniem rośnie ryzyko wyniku fałszywie istotnego.

Zmienne jakościowe to osobna ścieżka. Związek dwóch zmiennych nominalnych bada test chi-kwadrat; normalności się tu nie sprawdza, bo dla takich zmiennych nie ma ona zastosowania. Warunkiem są dostatecznie duże liczebności oczekiwane (nie obserwowane — te mogą wynosić zero). Zgodnie z regułą Cochrana test jest wiarygodny, gdy żadna liczebność oczekiwana nie spada poniżej 1, a co najmniej 80% komórek ma wartość oczekiwaną 5 lub więcej; w tabelach 2×2 przyjmuje się, że wszystkie cztery komórki powinny mieć co najmniej 5. Gdy warunek nie jest spełniony, stosuje się dokładny test Fishera. Gdy tę samą osobę badasz dwukrotnie zmienną dwuwartościową (przed i po), właściwy jest test McNemara.

Krok 5. Zbadaj związki między zmiennymi

Porównywanie grup to nie wszystko. Jeśli pytasz „czy im wyższe X, tym wyższe Y”, potrzebujesz innego zestawu narzędzi.

  • Korelacja — siła i kierunek związku dwóch zmiennych. Współczynnik Pearsona mierzy związek liniowy, dlatego przed jego obliczeniem trzeba obejrzeć wykres rozrzutu: przy zależności krzywoliniowej potrafi wyjść bliski zeru mimo silnego związku. Stosuje się go do zmiennych ilościowych, a rozkład zbliżony do normalnego jest warunkiem wiarygodności testu istotności. Współczynnik Spearmana mierzy związek monotoniczny i pasuje do zmiennych porządkowych, rozkładów skośnych oraz danych z obserwacjami odstającymi.
  • Regresja liniowa — przewidywanie zmiennej ilościowej na podstawie jednej lub kilku innych.
  • Regresja logistyczna — gdy zmienna wyjaśniana jest dwuwartościowa (zdał / nie zdał, choruje / nie choruje).
  • Analiza czynnikowa — badanie struktury kwestionariusza. Eksploracyjna (EFA) służy do odkrycia, w ile wymiarów układają się pozycje, gdy nie masz hipotezy o strukturze; konfirmacyjna (CFA) sprawdza, czy dane pasują do struktury założonej przez autorów narzędzia.

Korelacja nie oznacza przyczynowości i to zdanie musi znaleźć się w dyskusji wyników, jeśli Twoje badanie jest przekrojowe.

Krok 6. Sprawdź rzetelność narzędzia

Jeśli używasz kwestionariusza — własnego albo gotowej skali — recenzent oczekuje informacji o jego rzetelności w Twojej próbie.

Standardem jest alfa Cronbacha, czyli wskaźnik zgodności wewnętrznej. Progi pochodzą od Nunnally’ego (1978) i były sformułowane warunkowo: 0,70 wystarcza przy narzędziu dopiero konstruowanym, około 0,80 to poziom oczekiwany od gotowej skali w badaniach naukowych, a 0,90 i więcej wymagane jest tam, gdzie na podstawie wyniku podejmuje się decyzje wobec konkretnej osoby. To konwencja, nie norma — komentarz jest ważniejszy niż sama liczba.

Trzy rzeczy warto wiedzieć. Przy tej samej przeciętnej korelacji między pozycjami alfa rośnie wraz z długością skali, ale dorzucanie pytań nie jest sposobem na podniesienie rzetelności: pozycja słabo skorelowana z resztą alfę obniża. Przed obliczeniem trzeba odwrócić punktację pozycji odwróconych — bez tego alfa zostanie zaniżona, a przy kilku takich pozycjach potrafi wyjść nawet ujemna. Wreszcie alfę liczy się osobno dla każdej podskali, a jej wysoka wartość nie dowodzi, że skala mierzy jedną cechę; z tego powodu coraz częściej raportuje się obok niej omegę McDonalda. Szczegóły: alfa Cronbacha.

Jeśli korzystasz z gotowej skali psychometrycznej, sprawdź jej opis w naszym katalogu testów psychologicznych — znajdziesz tam strukturę, sposób punktowania i dane o rzetelności.

Krok 7. Opisz wyniki

Tu przepada najwięcej punktów, bo studenci wklejają zrzuty ekranu z programu statystycznego zamiast napisać zdanie po polsku.

Schemat, który działa zawsze: najpierw zdanie opisujące wynik po polsku, potem statystyki w nawiasie, na końcu zdanie o kierunku różnicy.

Kobiety uzyskały istotnie wyższy wynik nasilenia stresu (M = 21,4; SD = 5,2) niż mężczyźni (M = 18,1; SD = 4,9); t(98) = 3,27; p = 0,002; d = 0,65; 95% CI dla różnicy średnich [1,29; 5,31]. Różnica ma umiarkowaną wielkość efektu.

Cztery zasady:

  • Podawaj dokładne p, na przykład p = 0,002, a nie samo „p < 0,05″. Wartości bardzo małe zapisuje się jako p < 0,001.
  • Zawsze dołączaj wielkość efektu. Istotność mówi tylko tyle, że przy założeniu braku różnicy w populacji taki wynik byłby mało prawdopodobny; nie mówi, jak duża jest różnica. Odpowiada na to dopiero wielkość efektu. Orientacyjnie dla d Cohena: 0,2 — mały, 0,5 — umiarkowany, 0,8 — duży.
  • Podawaj przedział ufności obok wielkości efektu. Standard APA (wyd. 7) wymaga obu, a przedział pokazuje, jak precyzyjnie oszacowano różnicę.
  • Nie interpretuj w podrozdziale z wynikami. Wyniki relacjonują, dyskusja tłumaczy.

Zapis powyżej odpowiada konwencji polskiej. W standardzie APA elementy statystyki oddziela się przecinkami, a przy wartościach, które nie mogą przekroczyć jedności (p, r, R²), pomija się zero przed przecinkiem dziesiętnym. Sprawdź, którą konwencję przyjmuje Twoja uczelnia, i stosuj ją konsekwentnie w całej pracy.

Więcej: jak opisać wyniki badań własnych, istotność statystyczna, estymacjajak zrobić wykres do pracy. Całość rozdziału opisuje tekst rozdział badawczy.

Najczęstsze błędy

  1. Wybór testu przed sprawdzeniem typu zmiennej. Test dobiera się do danych, nie odwrotnie.
  2. Test parametryczny przy wyraźnie nienormalnym rozkładzie i bez żadnego komentarza w pracy.
  3. Brak wielkości efektu. Sama istotność nie mówi, czy różnica ma znaczenie praktyczne.
  4. Interpretowanie „p > 0,05″ jako dowodu braku różnicy. Brak istotności oznacza brak podstaw do odrzucenia hipotezy zerowej, nie potwierdzenie jej.
  5. Alfa Cronbacha liczona bez odwrócenia pozycji odwróconych.
  6. Wnioski przyczynowe z badania korelacyjnego.
  7. Seria testów t zamiast ANOVA z testem post hoc. Przy wielu porównaniach rośnie ryzyko przypadkowego wyniku istotnego.
  8. Pominięcie testu Levene’a i klasyczny test t przy wyraźnie nierównych wariancjach, zamiast testu Welcha.
  9. Zrzuty ekranu z programu statystycznego zamiast tabel. Tabela w pracy ma zawierać tylko potrzebne liczby, z podpisem i odwołaniem w tekście — zobacz spis tabel i rysunków.

FAQ

Jaki test statystyczny wybrać do pracy dyplomowej?

Wybór zależy od trzech rzeczy: typu zmiennej zależnej, liczby porównywanych grup i tego, czy grupy są niezależne. Dla dwóch niezależnych grup i rozkładu normalnego stosuje się test t-Studenta, przy braku normalności — test U Manna-Whitneya. Dla trzech i więcej grup odpowiednio ANOVA lub test Kruskala-Wallisa, a dla dwóch zmiennych jakościowych test chi-kwadrat.

Czy do pracy licencjackiej wystarczy statystyka opisowa?

Zwykle tak, jeśli praca ma charakter diagnostyczny i nie stawia hipotez o różnicach lub związkach. Jeśli jednak formułujesz hipotezy, sama statystyka opisowa ich nie zweryfikuje — potrzebne są testy. Wymagania określa promotor i standard przyjęty na kierunku.

Ile osób musi wziąć udział w badaniu?

Wielkość próby wyznacza się analizą mocy, a nie regułą kciuka. Zależy ona od planowanego testu, przyjętej mocy (zwykle 0,80), poziomu istotności i spodziewanej siły efektu. Dla porównania dwóch grup testem t przy tych założeniach wykrycie efektu umiarkowanego (d = 0,50) wymaga około 64 osób w każdej grupie, a efektu słabego (d = 0,20) — blisko 400. Krążąca po uczelniach liczba „30 osób w grupie” nie wynika z rachunku mocy, tylko z reguły kciuka o centralnym twierdzeniu granicznym, i wystarcza jedynie do wykrycia efektów dużych. Liczebność wyznacza się analizą mocy w bezpłatnym oprogramowaniu do tego przeznaczonym.

Co zrobić, gdy rozkład nie jest normalny?

Masz trzy możliwości: zastosować odpowiednik nieparametryczny testu, przekształcić zmienną albo — przy dużej próbie i umiarkowanej skośności — pozostać przy teście parametrycznym z komentarzem uzasadniającym tę decyzję. Wybraną drogę trzeba opisać w części metodologicznej.

Jaka wartość alfy Cronbacha jest wystarczająca?

Progi pochodzą od Nunnally’ego (1978): 0,70 dla narzędzia dopiero konstruowanego, około 0,80 dla gotowej skali w badaniach naukowych, 0,90 i więcej tam, gdzie na podstawie wyniku podejmuje się decyzje wobec konkretnej osoby. Niższe wartości nie dyskwalifikują pracy, ale wymagają komentarza — szczególnie przy krótkich podskalach, gdzie niska alfa wynika często z małej liczby pozycji, a nie z wadliwego narzędzia.

Czy w pracy trzeba podawać wielkość efektu?

Tak. Standardy APA (wyd. 7) i większość czasopism naukowych wymagają podania wielkości efektu wraz z 95% przedziałem ufności — dla różnicy średnich, dla d Cohena albo dla współczynnika korelacji. Wielkość efektu odpowiada na pytanie, którego nie rozstrzyga sama istotność: jak duża jest różnica. Przedział ufności pokazuje, jak precyzyjnie ją oszacowano.

Czy mogę użyć testu t-Studenta do skali Likerta?

Do pojedynczej pozycji skali — raczej nie, bo jest to zmienna porządkowa. Do wyniku sumarycznego złożonego z kilkunastu pozycji — tak, i jest to praktyka powszechnie stosowana w badaniach, choć część metodologów ją kwestionuje. Warto wtedy dodać w metodologii jedno zdanie uzasadniające przyjęte podejście.

Kiedy stosować test chi-kwadrat, a kiedy dokładny test Fishera?

Kryterium dotyczy liczebności oczekiwanych, nie obserwowanych. Zgodnie z regułą Cochrana chi-kwadrat jest wiarygodny, gdy żadna liczebność oczekiwana nie spada poniżej 1, a co najmniej 80% komórek ma wartość oczekiwaną 5 lub więcej; w tabelach 2×2 przyjmuje się, że wszystkie cztery komórki powinny mieć co najmniej 5. Gdy warunek nie jest spełniony, właściwym wyborem jest dokładny test Fishera. Liczebności oczekiwane programy statystyczne pokazują w opcjach tabeli krzyżowej — trzeba je włączyć.


Nie chcesz robić analizy samodzielnie? Zobacz analizę statystyczną, analizę statystyczną do pracyanalizę do publikacji naukowej. Kolejne przewodniki: metodologia badań, skale psychometrycznejak pisać pracę dyplomową.