Skale psychometryczne — katalog i jak opisać je w pracy
Skala psychometryczna to wystandaryzowane narzędzie pomiaru cechy, której nie da się zaobserwować bezpośrednio — stresu, optymizmu, jakości życia. Jej wartość bierze się nie z pytań, lecz z tego, że ktoś sprawdził, czy mierzy stabilnie (rzetelność) i czy mierzy to, co deklaruje (trafność). Ta strona zbiera opisy narzędzi używanych w pracach dyplomowych i pokazuje, jak wybrać skalę oraz opisać ją w rozdziale metodologicznym.
Każdy z linkowanych tekstów zawiera to samo: budowę narzędzia, sposób punktowania, zakres wyników, dane o rzetelności i gotowy akapit do metodologii. Nie publikujemy treści pozycji testowych. W przypadku testów wydawniczych ich reprodukcja narusza prawa autorskie wydawcy, a niezależnie od statusu prawnego upowszechnianie pozycji obniża bezpieczeństwo narzędzia: badani, którzy znają treść pytań, odpowiadają inaczej, przez co normy przestają obowiązywać, a trafność kolejnych pomiarów spada. Część narzędzi (np. PHQ-9, PCL-5) jest udostępniana bez ograniczeń — ale i wtedy nie umieszcza się pełnej treści w ogólnodostępnej pracy.
Jak wybrać skalę do własnego badania
Cztery pytania, w tej kolejności.
- Czy skala mierzy dokładnie ten konstrukt, o który pytasz w hipotezach? Stres odczuwany, stres w pracy i wypalenie zawodowe to trzy różne rzeczy z trzema różnymi narzędziami.
- Czy istnieje polska adaptacja? Samodzielne przetłumaczenie kwestionariusza to nie adaptacja. Zgodnie z wytycznymi International Test Commission adaptacja wymaga niezależnych tłumaczeń na język docelowy uzgodnionych przez panel ekspertów (ITC odradza opieranie się wyłącznie na tłumaczeniu zwrotnym), badania pilotażowego oraz wykazania w próbie polskiej równoważności konstruktu i pozycji wraz z ponownym oszacowaniem rzetelności i trafności. Bez istniejącej polskiej wersji najbezpieczniej wybrać inne narzędzie — z dwoma wyjątkami: adaptacja może być samodzielnym tematem pracy magisterskiej lub doktorskiej, a w pracy eksploracyjnej wolno użyć własnego tłumaczenia, o ile praca wprost stwierdza, że nie jest to narzędzie zaadaptowane, i wymienia to w ograniczeniach.
- Na jakich warunkach można jej użyć? Część skal jest dostępna swobodnie do celów naukowych, część wymaga pisemnej zgody autora adaptacji, a testy wydawnicze mają kategorie dostępu — wyłącznie dla psychologów zastrzeżona jest kategoria C. Sprawdź to przed zebraniem danych.
- Ile pozycji wytrzyma Twój respondent? Im dłuższa ankieta, tym mniej osób ją zaczyna i kończy, i tym gorszej jakości są odpowiedzi w końcowej części (Galesic i Bošnjak, 2009). W badaniach preferencji respondenci podają jako długość idealną około 10–15 minut, a jako maksymalną akceptowalną około 20 minut (Revilla i Ochoa, 2017).
Katalog skal według obszaru
Dobrostan i jakość życia
| Skala | Co mierzy |
|---|---|
| SWLS | ogólne zadowolenie z życia |
| WHOQOL-BREF | jakość życia w czterech dziedzinach + dwie pozycje ogólne, bez wyniku łącznego |
| SUPIN | nasilenie uczuć pozytywnych i negatywnych |
Zasoby osobiste
| Skala | Co mierzy |
|---|---|
| LOT-R | optymizm dyspozycyjny |
| GSES | uogólnione poczucie własnej skuteczności |
| KNS | nadzieja na sukces |
| SOC-29 | poczucie koherencji |
| SES Rosenberga | samoocena |
| INTE | inteligencja emocjonalna w ujęciu samoopisowym |
Stres i radzenie sobie
| Skala | Co mierzy |
|---|---|
| PSS-10 | stres odczuwany w ostatnim miesiącu |
| KPS | poczucie stresu w trzech wymiarach |
| Mini-COPE | strategie radzenia sobie |
| CISS | style radzenia sobie ze stresem |
| MBI | trzy wymiary wypalenia zawodowego, bez wyniku łącznego; kilka wersji (HSS, ES, GS) |
Zdrowie i objawy kliniczne
| Skala | Co mierzy |
|---|---|
| AIS | akceptacja choroby |
| DASS-21 | depresja, lęk i stres |
| HADS | lęk i depresja u pacjentów somatycznych |
| PHQ-9 | nasilenie objawów depresyjnych |
| BDI | nasilenie objawów depresyjnych |
| STAI | lęk jako stan i jako cecha |
| PCL-5 | objawy PTSD |
Osobowość i relacje
| Skala | Co mierzy |
|---|---|
| NEO-FFI | pięć cech osobowości |
| style przywiązania | wzorzec relacji bliskich |
| skale wsparcia społecznego | otrzymywane i spostrzegane wsparcie |
Przegląd całej kategorii: testy psychologiczne.
Rzetelność i trafność — co musi znaleźć się w pracy
Rzetelność mówi, na ile wynik jest wolny od błędu pomiaru. Ma kilka rodzajów: zgodność wewnętrzną (czy pozycje mierzą to samo), stabilność w czasie (test–retest) i zgodność między wersjami. W pracy dyplomowej podaje się zwykle alfę Cronbacha, czyli wskaźnik zgodności wewnętrznej — najpierw wartość z badań adaptacyjnych (z podaniem źródła i próby), a potem wartość obliczoną we własnej próbie. Progi pochodzą od Nunnally’ego (1978): 0,70 dla narzędzia dopiero konstruowanego, około 0,80 dla gotowej skali w badaniach naukowych, 0,90 i więcej przy decyzjach wobec konkretnej osoby. Alfa zakłada, że wszystkie pozycje mierzą konstrukt z jednakową mocą; gdy tak nie jest, zaniża rzetelność — dlatego coraz częściej raportuje się obok niej omegę McDonalda. Rzetelność charakteryzuje przy tym wyniki uzyskane w konkretnej próbie, a nie sam kwestionariusz. Zobacz: alfa Cronbacha.
Trafność mówi, na ile zebrane dowody uzasadniają interpretowanie wyniku jako wskaźnika danego konstruktu — w danej populacji i do danego celu. To samo narzędzie może być trafne dla dorosłych i nietrafne dla nastolatków. Trafność nie jest jedną liczbą: składają się na nią dowody dotyczące treści pozycji, struktury czynnikowej i związków z innymi zmiennymi. W pracy licencjackiej nie prowadzi się własnych badań walidacyjnych — powołujesz się na dowody autorów polskiej adaptacji, podając, na jakiej próbie je uzyskano. Jeśli sprawdzasz strukturę czynnikową we własnych danych, sięgasz po analizę czynnikową.
Dwie rzeczy, które psują wynik na etapie liczenia:
- Pozycje odwrócone i buforowe. Wiele skal zawiera pozycje sformułowane przeciwnie do reszty (np. 4 z 10 pozycji PSS-10, część pozycji skali Rosenberga). Bez odwrócenia ich punktacji błędny będzie wynik ogólny, a alfa Cronbacha zostanie zaniżona — przy kilku takich pozycjach potrafi wyjść nawet ujemna. Osobna pułapka to pozycje buforowe, które w ogóle nie wchodzą do wyniku: w LOT-R punktuje się tylko 6 z 10 pozycji. Które odwrócić, a które pominąć, sprawdza się wyłącznie w podręczniku narzędzia.
- Braki danych. Część skal podaje własną regułę — WHOQOL-BREF pozwala policzyć wynik dziedziny przy najwyżej dwóch brakach i odrzuca kwestionariusz przy ponad 20% braków. Jeśli podręcznik taką regułę zawiera, obowiązuje bezwzględnie. Jeśli nie, wolno przyjąć konwencję ogólną (najczęściej: uzupełnienie braku średnią pozostałych pozycji tej samej podskali, gdy respondent wypełnił co najmniej 80% z nich) — ale trzeba ją opisać w metodologii i podać, ilu przypadków dotyczyła. Niedopuszczalne jest dobieranie sposobu obchodzenia się z brakami po zobaczeniu wyników.
Jak opisać narzędzie w rozdziale metodologicznym
Opis skali to jeden akapit o stałej budowie. Wystarczy podstawić własne dane:
Do pomiaru [konstrukt] zastosowano [pełna nazwa polska] ([skrót], [nazwa angielska]) autorstwa [autorzy oryginału, rok], w polskiej adaptacji [autorzy adaptacji, rok]. Narzędzie składa się z [liczba] pozycji ocenianych na [liczba]-stopniowej skali od „[kotwica dolna]” do „[kotwica górna]”. Pozycje [numery] są punktowane odwrotnie [pozycje [numery] są buforowe i nie wchodzą do wyniku]. Narzędzie ma strukturę [jednoczynnikową / [liczba]-czynnikową] i pozwala obliczyć [wynik ogólny / wyniki podskal: …]. Wynik [każdej podskali] stanowi [sumę / średnią] i mieści się w przedziale od [min] do [max], przy czym wyższy wynik oznacza [kierunek]. W badaniach adaptacyjnych zgodność wewnętrzna mierzona alfą Cronbacha wyniosła [wartość] w próbie [opis]. W badaniu własnym alfa Cronbacha wyniosła [wartość]. Narzędzie wykorzystano na podstawie [licencji / zgody autora adaptacji z dnia …].
Elementy, o których studenci zapominają: rok i autorzy polskiej adaptacji (nie tylko oryginału), kierunek interpretacji wyniku, zakres skali, rzetelność liczona osobno dla każdej podskali oraz podstawa prawna użycia narzędzia. Uwaga: jeśli narzędzie nie przewiduje wyniku ogólnego (WHOQOL-BREF, Mini-COPE, CISS, MBI), nie wolno go tworzyć samodzielnie przez zsumowanie wszystkich pozycji.
Zwróć też uwagę na kolejność narzędzi w ankiecie — metryczkę umieszcza się po kwestionariuszach. Jeśli narzędzi jest kilka, ich stała kolejność wprowadza efekt kolejności: narzędzia na końcu wypełniane są mniej uważnie, co obciąża zawsze te same zmienne. Najlepiej rotować kolejność między respondentami (dwie lub trzy wersje formularza); jeśli to niemożliwe, odnotuj stałą kolejność w ograniczeniach badania. Zobacz: metryczka w ankiecie, kwestionariusz ankiety — przykład i ankieta w Google Forms.
Punktacja, normy i interpretacja wyniku
Trzy pojęcia, które w pracach bywają mylone.
Wynik surowy to liczba, która wychodzi z kwestionariusza po zsumowaniu (lub uśrednieniu) pozycji. Sam w sobie nic nie znaczy — 24 punkty to dużo czy mało, zależy od skali.
Norma pozwala odnieść wynik surowy do grupy odniesienia. Najczęściej spotkasz przeliczanie na steny — skalę od 1 do 10 o średniej 5,5 i odchyleniu standardowym 2. Najczęściej przyjmowany w polskich manualach podział to 1–4 wynik niski, 5–6 przeciętny, 7–10 wysoki, ale granice zawsze sprawdza się w podręczniku konkretnego narzędzia, bo bywają różne. Drugą skalą są centyle: centyl mówi, jaki procent grupy normalizacyjnej uzyskał wynik nie wyższy niż badany. Centyle są łatwe w komunikacji, ale tworzą skalę porządkową — odległości między nimi nie są równe, więc nie oblicza się z nich średnich ani nie stosuje do nich testów parametrycznych; do analiz używa się wyników surowych lub stenów. Uwaga: normy są związane z konkretną populacją i wersją narzędzia — norma opracowana dla dorosłych nie stosuje się do młodzieży.
Punkt odcięcia to coś jeszcze innego: umowna granica, powyżej której wynik traktuje się jako sygnał kliniczny. Występuje głównie w narzędziach przesiewowych. I tu zasada, o której nie wolno zapomnieć w pracy dyplomowej: przekroczenie punktu odcięcia nie jest diagnozą, tylko wskazaniem do dalszej oceny przez specjalistę. Wnioski typu „u 34% badanych stwierdzono depresję” na podstawie kwestionariusza przesiewowego są nadinterpretacją; poprawnie brzmi „u 34% badanych wynik przekroczył punkt odcięcia [wartość] przyjęty za [źródło], co wskazuje na podwyższone nasilenie objawów depresyjnych”. W pracy zawsze podaje się, jaką wartość odcięcia przyjęto i za jakim źródłem. Punkt odcięcia wyznacza się z analizy ROC jako kompromis między czułością a swoistością i obowiązuje on w populacji, w której był walidowany. Ponieważ część wyników powyżej progu to wyniki fałszywie dodatnie, odsetek osób przekraczających odcięcie jest z reguły wyższy niż rzeczywiste rozpowszechnienie zaburzenia i nie może być podawany jako jego oszacowanie.
Gdy narzędzie nie ma polskich norm, wyniki opisuje się porównawczo — średnią i odchyleniem standardowym w badanej grupie oraz zestawieniem z wynikami innych badań na podobnych próbach.
Skala gotowa czy kwestionariusz własny
W większości prac występują oba narzędzia naraz i pełnią różne role.
| Gotowa skala | Kwestionariusz autorski | |
|---|---|---|
| Mierzy | konstrukt psychologiczny | fakty, opinie, dane społeczno-demograficzne |
| Rzetelność | znana z badań adaptacyjnych, potwierdzana we własnej próbie | nie dotyczy pytań o fakty i dane demograficzne; jeśli pytania własne mają tworzyć skalę mierzącą jeden konstrukt, jej rzetelność trzeba oszacować i opisać jako ograniczenie |
| Porównywalność | wyniki można zestawić z innymi badaniami | brak porównań |
| Kiedy stosować | gdy istnieje odpowiednie narzędzie | gdy pytasz o coś, czego żadna skala nie mierzy |
Reguła praktyczna: jeśli dla Twojego konstruktu istnieje polska adaptacja, użyj jej. Autorski zestaw pytań o „poziom stresu” nie zastąpi skali, a recenzent zapyta o jego własności psychometryczne. Kwestionariusz własny zostaw na to, do czego jest niezastąpiony — na metryczkę i pytania o sytuację badanego.
Zgoda na wykorzystanie narzędzia
To pytanie wraca przy każdej obronie, więc warto mieć na nie odpowiedź.
- Skale rozpowszechniane swobodnie do celów naukowych — wystarczy poprawne cytowanie źródła adaptacji.
- Skale wymagające zgody autora — wysyła się krótką wiadomość z opisem badania; odpowiedź warto zachować. Jak sformułować taki mail, opisuje tekst mail do wykładowcy.
- Testy wydawnicze o ograniczonym dostępie — Pracownia Testów Psychologicznych PTP dzieli narzędzia na kategorie A, A+, B1, B2 i C. Wyłącznie dla psychologów zastrzeżona jest kategoria C (m.in. NEO-FFI, CISS, STAI, SUPIN, KPS); kategorie B1 i B2 są dostępne także dla osób spoza psychologii po szkoleniu z psychometrii. Pracownia prowadzi odrębny tryb dla studentów i doktorantów. Kategorię konkretnego testu sprawdza się u wydawcy przed zaplanowaniem badania.
Niezależnie od trybu: treść pozycji nie trafia do aneksu pracy, jeśli narzędzie jest chronione. W aneksie umieszcza się metryczkę i pytania własne, a przy skali chronionej — informację o jej zastosowaniu i źródle.
Najczęstsze błędy
- Własne tłumaczenie zagranicznego kwestionariusza przedstawiane jako narzędzie zaadaptowane.
- Powoływanie się na rzetelność oryginału zamiast polskiej adaptacji.
- Pominięcie pozycji odwróconych przy liczeniu wyniku i alfy Cronbacha.
- Skracanie skali przez usunięcie „niepotrzebnych” pozycji — po takiej zmianie narzędzie traci normy i porównywalność.
- Brak informacji o kierunku interpretacji — czytelnik nie wie, czy wysoki wynik jest dobry, czy zły.
- Publikowanie treści pozycji testowych w aneksie narzędzia chronionego prawem autorskim.
- Trzy długie kwestionariusze naraz — rośnie odsetek ankiet porzuconych i wypełnianych bez uwagi (odpowiedzi w jednej kolumnie, bardzo krótkie czasy wypełnienia).
- Liczenie alfy Cronbacha dla pytań metryczkowych, które nie tworzą żadnej skali.
FAQ
Czym jest skala psychometryczna?
To wystandaryzowane narzędzie pomiaru cechy psychologicznej, której nie można zaobserwować bezpośrednio. Składa się z zestawu pozycji o ustalonej treści i punktacji, ma określony sposób liczenia wyniku oraz udokumentowane własności psychometryczne — rzetelność i trafność sprawdzone w badaniach.
Czy mogę sam przetłumaczyć zagraniczny kwestionariusz?
Nie, jeśli wynik ma być traktowany jako pomiar tego samego konstruktu. Zgodnie z wytycznymi International Test Commission adaptacja wymaga niezależnych tłumaczeń uzgodnionych przez panel ekspertów, badania pilotażowego oraz wykazania równoważności konstruktu i pozycji w populacji docelowej wraz z ponownym oszacowaniem rzetelności i trafności. Bez polskiej adaptacji lepiej wybrać inne narzędzie; użycie własnego tłumaczenia jest dopuszczalne tylko wtedy, gdy praca wprost stwierdza, że nie jest to narzędzie zaadaptowane.
Czy potrzebuję zgody autora na użycie skali w pracy dyplomowej?
To zależy od narzędzia. Część skal jest udostępniana swobodnie do celów naukowych i wymaga tylko poprawnego cytowania, część wymaga pisemnej zgody autora polskiej adaptacji, a testy wydawnicze mają kategorie dostępu — najwyższa (C) jest zastrzeżona dla psychologów, niższe są dostępne po szkoleniu z psychometrii. Warunki sprawdza się przed rozpoczęciem zbierania danych.
Jaka rzetelność skali jest wystarczająca?
Progi pochodzą od Nunnally’ego (1978): 0,70 dla narzędzia dopiero konstruowanego, około 0,80 dla gotowej skali w badaniach naukowych, 0,90 i więcej przy decyzjach wobec konkretnej osoby. Niższe wartości nie przekreślają badania, ale wymagają komentarza — w krótkich podskalach niska alfa wynika często z małej liczby pozycji, a nie z wadliwości narzędzia. Alfę liczy się osobno dla każdej podskali.
Co to są pozycje odwrócone i dlaczego mają znaczenie?
To pozycje sformułowane przeciwnie do pozostałych, na przykład „rzadko czuję się zestresowany” w skali stresu. Zanim policzysz wynik, ich punktację trzeba odwrócić. Pominięcie tego kroku zniekształca wynik ogólny i zaniża współczynnik rzetelności — przy kilku takich pozycjach alfa potrafi wyjść ujemna. Osobną kategorią są pozycje buforowe, które w ogóle nie wchodzą do wyniku: tak jest w LOT-R, gdzie punktuje się 6 z 10 pozycji.
Ile kwestionariuszy można umieścić w jednym badaniu?
Nie ma sztywnego progu — odsetek rezygnacji rośnie stopniowo wraz z długością ankiety. Punktem odniesienia mogą być deklaracje respondentów: około 10–15 minut uznawane jest za długość idealną, a około 20 minut za maksymalną akceptowalną. Praktycznie oznacza to dwa, najwyżej trzy krótkie narzędzia plus metryczkę.
Czy treść kwestionariusza umieszcza się w aneksie pracy?
Tylko wtedy, gdy narzędzie nie jest chronione albo autor wyraził na to zgodę. Przy skalach chronionych w aneksie umieszcza się metryczkę i pytania własne, a samo narzędzie opisuje się w metodologii z podaniem źródła.
Czym różni się rzetelność od trafności?
Rzetelność mówi, na ile wynik jest wolny od błędu pomiaru — czy pozycje mierzą to samo (zgodność wewnętrzna) i czy pomiar jest stabilny w czasie. Trafność mówi, na ile wynik można interpretować jako wskaźnik właśnie tego konstruktu, o który chodzi, w danej populacji. Narzędzie może być rzetelne i jednocześnie nietrafne: mierzyć coś bardzo dokładnie, ale nie to, co deklaruje.
Potrzebujesz pomocy z doborem narzędzi lub obliczeniami? Zobacz analizę statystyczną i analizy i badania empiryczne. Kolejne przewodniki: statystyka w pracy dyplomowej, metodologia badań i jak pisać pracę dyplomową.
