Statystyka w pracy dyplomowej — przewodnik krok po kroku
Analiza statystyczna w pracy dyplomowej sprowadza się do siedmiu decyzji podejmowanych zawsze w tej samej kolejności: jakie masz zmienne, jak je opisać, czy rozkład jest normalny, jaki test wybrać, jak zmierzyć siłę związku, czy narzędzie jest rzetelne i jak to wszystko zapisać. Ta strona prowadzi przez te decyzje po kolei i linkuje do szczegółowych tekstów przy każdym kroku.
Nie musisz znać statystyki, żeby przejść tę ścieżkę. Musisz tylko konsekwentnie odpowiadać na pytania w podanej kolejności — bo każdy kolejny krok wynika z poprzedniego.
Zanim policzysz cokolwiek
Trzy rzeczy trzeba mieć ustalone przed otwarciem arkusza z danymi. Cofanie się do nich później oznacza zwykle przeliczanie wszystkiego od nowa.
- Hipotezy zapisane w formie, którą da się sprawdzić liczbowo. „Kobiety mają wyższy poziom stresu niż mężczyźni” da się przetestować. „Stres jest ważnym problemem” — nie. Zobacz: hipoteza badawcza oraz cel i pytania badawcze.
- Operacjonalizacja, czyli sposób pomiaru każdej zmiennej. Który konkretnie wynik którego kwestionariusza jest „poziomem stresu”? Zobacz: operacjonalizacja zmiennych.
- Wielkość i sposób doboru próby. Liczebność wyznacza się analizą mocy — bezpłatnie policzysz ją w programie G*Power. Zobacz: próba badawcza.
Dopiero mając te trzy elementy, ma sens pytanie „jaki test wybrać”.
Krok 1. Ustal typ każdej zmiennej
To najważniejsza decyzja w całej analizie, bo typ zmiennej przesądza o wszystkim, co możesz z nią zrobić — jakie statystyki opisowe podasz, jaki wykres narysujesz, jaki test zastosujesz.
| Skala pomiarowa | Przykład | Co wolno policzyć |
|---|---|---|
| Nominalna | płeć, kierunek studiów, stan cywilny | liczebność, procent, dominanta |
| Porządkowa | wykształcenie, pozycja w rankingu, pojedyncza pozycja skali Likerta | dodatkowo mediana, kwartyle |
| Ilościowa (przedziałowa i ilorazowa) | wiek, wynik kwestionariusza, czas reakcji | dodatkowo średnia, odchylenie standardowe |
Szczegóły: rodzaje zmiennych.
Najczęstsza wątpliwość dotyczy skali Likerta. Pojedyncza pozycja („zdecydowanie się zgadzam” … „zdecydowanie się nie zgadzam”) jest porządkowa. Suma kilkunastu pozycji tworzących skalę jest w praktyce badawczej traktowana jak zmienna ilościowa i analizowana testami parametrycznymi — to konwencja szeroko przyjęta, choć wciąż dyskutowana w metodologii. Zobacz: skala Likerta.
Krok 2. Opisz dane, zanim je przetestujesz
Statystyki opisowe idą do pracy zawsze — także wtedy, gdy testy nie wyjdą. To one pokazują, jak wygląda badana grupa.
- Dla zmiennych ilościowych: średnia, odchylenie standardowe, mediana, minimum i maksimum, liczebność. Zobacz średnią arytmetyczną, odchylenie standardowe, wariancję i medianę.
- Dla zmiennych nominalnych i porządkowych: liczebność i procent, ewentualnie dominanta.
- Przy rozkładach silnie skośnych mediana opisuje grupę uczciwiej niż średnia — porównanie obu miar znajdziesz w tekście dominanta, mediana i średnia.
Przydatne uzupełnienia: percentyl, współczynnik zmienności i kurtoza.
Krok 3. Sprawdź rozkład
Testy parametryczne (t-Studenta, ANOVA, korelacja Pearsona) zakładają w przybliżeniu normalny rozkład zmiennej zależnej w grupach. Sprawdzenie tego założenia jest osobnym akapitem w rozdziale badawczym.
- Test Shapiro-Wilka to standard w pracach dyplomowych. Najlepiej działa przy próbach kilkudziesięcioosobowych; poniżej mniej więcej 20–30 obserwacji jego moc jest niska, więc wynik nieistotny niczego nie dowodzi — oznacza tylko, że test nie wykrył odstępstwa. Zobacz: test Shapiro-Wilka.
- Uwaga na duże próby. Realne dane nigdy nie są dokładnie normalne, więc przy kilkuset obserwacjach test reaguje na odstępstwa nieistotne praktycznie i zwykle wypada istotnie, choć rozkład jest wystarczająco zbliżony do normalnego. Wtedy oceń rozkład dodatkowo przez histogram, wykres kwantylowy oraz skośność i kurtozę.
- Normalność sprawdzaj osobno w każdej porównywanej grupie, nie na całej próbie łącznie.
- Jeśli rozkład wyraźnie odbiega od normalnego, przechodzisz na testy nieparametryczne — kolumna po prawej w tabeli poniżej.
Normalność to nie jedyne założenie. Test t i ANOVA zakładają dodatkowo jednorodność wariancji w porównywanych grupach — sprawdza się ją testem Levene’a. Istotny wynik testu Levene’a nie oznacza jeszcze przejścia na test nieparametryczny: wystarczy użyć wersji testu t dla nierównych wariancji (test Welcha), którą programy statystyczne podają w tym samym oknie wyników. Trzecim założeniem jest niezależność obserwacji — jedna osoba, jeden pomiar w danej grupie.
Krok 4. Dobierz test
| Co porównujesz | Rozkład normalny | Rozkład nienormalny lub skala porządkowa |
|---|---|---|
| Dwie niezależne grupy | test t-Studenta | test U Manna-Whitneya |
| Dwa pomiary tych samych osób | test t dla prób zależnych | test Wilcoxona |
| Trzy lub więcej grup niezależnych | ANOVA | test Kruskala-Wallisa |
Pełna ścieżka decyzyjna z przykładami: jaki test statystyczny wybrać.
Testy nieparametryczne nie są testami median. Test U Manna-Whitneya porównuje całe rozkłady rang, a nie wprost mediany — interpretacja „różnica median” jest uprawniona tylko przy podobnym kształcie rozkładów w obu grupach. Zapisuj więc wynik jako istotną różnicę między grupami, a mediany z kwartylami podawaj jako opis. Test Wilcoxona zakłada dodatkowo w miarę symetryczny rozkład różnic między pomiarami.
Po istotnej ANOVA potrzebny jest test post hoc. Sama ANOVA mówi tylko, że któraś z grup różni się od pozostałych; który to układ, pokazuje dopiero test post hoc (np. Tukeya lub z poprawką Bonferroniego, a dla testu Kruskala-Wallisa — test Dunna). Nie zastępuj tego serią testów t dla wszystkich par: z każdym kolejnym porównaniem rośnie ryzyko wyniku fałszywie istotnego.
Zmienne jakościowe to osobna ścieżka. Związek dwóch zmiennych nominalnych bada test chi-kwadrat; normalności się tu nie sprawdza, bo dla takich zmiennych nie ma ona zastosowania. Warunkiem są dostatecznie duże liczebności oczekiwane (nie obserwowane — te mogą wynosić zero). Zgodnie z regułą Cochrana test jest wiarygodny, gdy żadna liczebność oczekiwana nie spada poniżej 1, a co najmniej 80% komórek ma wartość oczekiwaną 5 lub więcej; w tabelach 2×2 przyjmuje się, że wszystkie cztery komórki powinny mieć co najmniej 5. Gdy warunek nie jest spełniony, stosuje się dokładny test Fishera. Gdy tę samą osobę badasz dwukrotnie zmienną dwuwartościową (przed i po), właściwy jest test McNemara.
Krok 5. Zbadaj związki między zmiennymi
Porównywanie grup to nie wszystko. Jeśli pytasz „czy im wyższe X, tym wyższe Y”, potrzebujesz innego zestawu narzędzi.
- Korelacja — siła i kierunek związku dwóch zmiennych. Współczynnik Pearsona mierzy związek liniowy, dlatego przed jego obliczeniem trzeba obejrzeć wykres rozrzutu: przy zależności krzywoliniowej potrafi wyjść bliski zeru mimo silnego związku. Stosuje się go do zmiennych ilościowych, a rozkład zbliżony do normalnego jest warunkiem wiarygodności testu istotności. Współczynnik Spearmana mierzy związek monotoniczny i pasuje do zmiennych porządkowych, rozkładów skośnych oraz danych z obserwacjami odstającymi.
- Regresja liniowa — przewidywanie zmiennej ilościowej na podstawie jednej lub kilku innych.
- Regresja logistyczna — gdy zmienna wyjaśniana jest dwuwartościowa (zdał / nie zdał, choruje / nie choruje).
- Analiza czynnikowa — badanie struktury kwestionariusza. Eksploracyjna (EFA) służy do odkrycia, w ile wymiarów układają się pozycje, gdy nie masz hipotezy o strukturze; konfirmacyjna (CFA) sprawdza, czy dane pasują do struktury założonej przez autorów narzędzia.
Korelacja nie oznacza przyczynowości i to zdanie musi znaleźć się w dyskusji wyników, jeśli Twoje badanie jest przekrojowe.
Krok 6. Sprawdź rzetelność narzędzia
Jeśli używasz kwestionariusza — własnego albo gotowej skali — recenzent oczekuje informacji o jego rzetelności w Twojej próbie.
Standardem jest alfa Cronbacha, czyli wskaźnik zgodności wewnętrznej. Progi pochodzą od Nunnally’ego (1978) i były sformułowane warunkowo: 0,70 wystarcza przy narzędziu dopiero konstruowanym, około 0,80 to poziom oczekiwany od gotowej skali w badaniach naukowych, a 0,90 i więcej wymagane jest tam, gdzie na podstawie wyniku podejmuje się decyzje wobec konkretnej osoby. To konwencja, nie norma — komentarz jest ważniejszy niż sama liczba.
Trzy rzeczy warto wiedzieć. Przy tej samej przeciętnej korelacji między pozycjami alfa rośnie wraz z długością skali, ale dorzucanie pytań nie jest sposobem na podniesienie rzetelności: pozycja słabo skorelowana z resztą alfę obniża. Przed obliczeniem trzeba odwrócić punktację pozycji odwróconych — bez tego alfa zostanie zaniżona, a przy kilku takich pozycjach potrafi wyjść nawet ujemna. Wreszcie alfę liczy się osobno dla każdej podskali, a jej wysoka wartość nie dowodzi, że skala mierzy jedną cechę; z tego powodu coraz częściej raportuje się obok niej omegę McDonalda. Szczegóły: alfa Cronbacha.
Jeśli korzystasz z gotowej skali psychometrycznej, sprawdź jej opis w naszym katalogu testów psychologicznych — znajdziesz tam strukturę, sposób punktowania i dane o rzetelności.
Krok 7. Opisz wyniki
Tu przepada najwięcej punktów, bo studenci wklejają zrzuty ekranu z programu statystycznego zamiast napisać zdanie po polsku.
Schemat, który działa zawsze: najpierw zdanie opisujące wynik po polsku, potem statystyki w nawiasie, na końcu zdanie o kierunku różnicy.
Kobiety uzyskały istotnie wyższy wynik nasilenia stresu (M = 21,4; SD = 5,2) niż mężczyźni (M = 18,1; SD = 4,9); t(98) = 3,27; p = 0,002; d = 0,65; 95% CI dla różnicy średnich [1,29; 5,31]. Różnica ma umiarkowaną wielkość efektu.
Cztery zasady:
- Podawaj dokładne p, na przykład p = 0,002, a nie samo „p < 0,05″. Wartości bardzo małe zapisuje się jako p < 0,001.
- Zawsze dołączaj wielkość efektu. Istotność mówi tylko tyle, że przy założeniu braku różnicy w populacji taki wynik byłby mało prawdopodobny; nie mówi, jak duża jest różnica. Odpowiada na to dopiero wielkość efektu. Orientacyjnie dla d Cohena: 0,2 — mały, 0,5 — umiarkowany, 0,8 — duży.
- Podawaj przedział ufności obok wielkości efektu. Standard APA (wyd. 7) wymaga obu, a przedział pokazuje, jak precyzyjnie oszacowano różnicę.
- Nie interpretuj w podrozdziale z wynikami. Wyniki relacjonują, dyskusja tłumaczy.
Zapis powyżej odpowiada konwencji polskiej. W standardzie APA elementy statystyki oddziela się przecinkami, a przy wartościach, które nie mogą przekroczyć jedności (p, r, R²), pomija się zero przed przecinkiem dziesiętnym. Sprawdź, którą konwencję przyjmuje Twoja uczelnia, i stosuj ją konsekwentnie w całej pracy.
Więcej: jak opisać wyniki badań własnych, istotność statystyczna, estymacja i jak zrobić wykres do pracy. Całość rozdziału opisuje tekst rozdział badawczy.
Najczęstsze błędy
- Wybór testu przed sprawdzeniem typu zmiennej. Test dobiera się do danych, nie odwrotnie.
- Test parametryczny przy wyraźnie nienormalnym rozkładzie i bez żadnego komentarza w pracy.
- Brak wielkości efektu. Sama istotność nie mówi, czy różnica ma znaczenie praktyczne.
- Interpretowanie „p > 0,05″ jako dowodu braku różnicy. Brak istotności oznacza brak podstaw do odrzucenia hipotezy zerowej, nie potwierdzenie jej.
- Alfa Cronbacha liczona bez odwrócenia pozycji odwróconych.
- Wnioski przyczynowe z badania korelacyjnego.
- Seria testów t zamiast ANOVA z testem post hoc. Przy wielu porównaniach rośnie ryzyko przypadkowego wyniku istotnego.
- Pominięcie testu Levene’a i klasyczny test t przy wyraźnie nierównych wariancjach, zamiast testu Welcha.
- Zrzuty ekranu z programu statystycznego zamiast tabel. Tabela w pracy ma zawierać tylko potrzebne liczby, z podpisem i odwołaniem w tekście — zobacz spis tabel i rysunków.
FAQ
Jaki test statystyczny wybrać do pracy dyplomowej?
Wybór zależy od trzech rzeczy: typu zmiennej zależnej, liczby porównywanych grup i tego, czy grupy są niezależne. Dla dwóch niezależnych grup i rozkładu normalnego stosuje się test t-Studenta, przy braku normalności — test U Manna-Whitneya. Dla trzech i więcej grup odpowiednio ANOVA lub test Kruskala-Wallisa, a dla dwóch zmiennych jakościowych test chi-kwadrat.
Czy do pracy licencjackiej wystarczy statystyka opisowa?
Zwykle tak, jeśli praca ma charakter diagnostyczny i nie stawia hipotez o różnicach lub związkach. Jeśli jednak formułujesz hipotezy, sama statystyka opisowa ich nie zweryfikuje — potrzebne są testy. Wymagania określa promotor i standard przyjęty na kierunku.
Ile osób musi wziąć udział w badaniu?
Wielkość próby wyznacza się analizą mocy, a nie regułą kciuka. Zależy ona od planowanego testu, przyjętej mocy (zwykle 0,80), poziomu istotności i spodziewanej siły efektu. Dla porównania dwóch grup testem t przy tych założeniach wykrycie efektu umiarkowanego (d = 0,50) wymaga około 64 osób w każdej grupie, a efektu słabego (d = 0,20) — blisko 400. Krążąca po uczelniach liczba „30 osób w grupie” nie wynika z rachunku mocy, tylko z reguły kciuka o centralnym twierdzeniu granicznym, i wystarcza jedynie do wykrycia efektów dużych. Liczebność wyznacza się analizą mocy w bezpłatnym oprogramowaniu do tego przeznaczonym.
Co zrobić, gdy rozkład nie jest normalny?
Masz trzy możliwości: zastosować odpowiednik nieparametryczny testu, przekształcić zmienną albo — przy dużej próbie i umiarkowanej skośności — pozostać przy teście parametrycznym z komentarzem uzasadniającym tę decyzję. Wybraną drogę trzeba opisać w części metodologicznej.
Jaka wartość alfy Cronbacha jest wystarczająca?
Progi pochodzą od Nunnally’ego (1978): 0,70 dla narzędzia dopiero konstruowanego, około 0,80 dla gotowej skali w badaniach naukowych, 0,90 i więcej tam, gdzie na podstawie wyniku podejmuje się decyzje wobec konkretnej osoby. Niższe wartości nie dyskwalifikują pracy, ale wymagają komentarza — szczególnie przy krótkich podskalach, gdzie niska alfa wynika często z małej liczby pozycji, a nie z wadliwego narzędzia.
Czy w pracy trzeba podawać wielkość efektu?
Tak. Standardy APA (wyd. 7) i większość czasopism naukowych wymagają podania wielkości efektu wraz z 95% przedziałem ufności — dla różnicy średnich, dla d Cohena albo dla współczynnika korelacji. Wielkość efektu odpowiada na pytanie, którego nie rozstrzyga sama istotność: jak duża jest różnica. Przedział ufności pokazuje, jak precyzyjnie ją oszacowano.
Czy mogę użyć testu t-Studenta do skali Likerta?
Do pojedynczej pozycji skali — raczej nie, bo jest to zmienna porządkowa. Do wyniku sumarycznego złożonego z kilkunastu pozycji — tak, i jest to praktyka powszechnie stosowana w badaniach, choć część metodologów ją kwestionuje. Warto wtedy dodać w metodologii jedno zdanie uzasadniające przyjęte podejście.
Kiedy stosować test chi-kwadrat, a kiedy dokładny test Fishera?
Kryterium dotyczy liczebności oczekiwanych, nie obserwowanych. Zgodnie z regułą Cochrana chi-kwadrat jest wiarygodny, gdy żadna liczebność oczekiwana nie spada poniżej 1, a co najmniej 80% komórek ma wartość oczekiwaną 5 lub więcej; w tabelach 2×2 przyjmuje się, że wszystkie cztery komórki powinny mieć co najmniej 5. Gdy warunek nie jest spełniony, właściwym wyborem jest dokładny test Fishera. Liczebności oczekiwane programy statystyczne pokazują w opcjach tabeli krzyżowej — trzeba je włączyć.
Nie chcesz robić analizy samodzielnie? Zobacz analizę statystyczną, analizę statystyczną do pracy i analizę do publikacji naukowej. Kolejne przewodniki: metodologia badań, skale psychometryczne i jak pisać pracę dyplomową.
