Analiza Blanda-Altmana w ocenie zgodności metod pomiarowych

05.10.2026
Analiza Blanda-Altmana w ocenie zgodności metod pomiarowych
Dlaczego sama korelacja nie wystarcza?
Jak czytać wykres?
Przykład porównania dwóch urządzeń
Jak ocenić czy zgodność jest wystarczająca
Założenia i ograniczenia analizy
Granice zgodności a przedziały ufności
Bibliografia

Czy nowy aparat pomiarowy może zastąpić dotychczas używane urządzenie? Takie pytanie pojawia się w badaniach medycznych, laboratoryjnych i technicznych. Analiza Blanda-Altmana pomaga ocenić, o ile różnią się wyniki dwóch metod mierzących tę samą wielkość i czy te różnice są akceptowalne w danym zastosowaniu.

Dlaczego sama korelacja nie wystarcza?

Wyobraźmy sobie dwie wagi. Druga przy każdym ważeniu pokazuje dokładnie o 3 kg więcej niż pierwsza. Dla zróżnicowanych mas korelacja Pearsona między wynikami wynosi 1, mimo że urządzenia nigdy nie podają tego samego wyniku. Korelacja opisuje związek między pomiarami, ale nie informuje bezpośrednio o ich zgodności.

Przy porównywaniu metod potrzebujemy więc odpowiedzi na inne pytanie: jak duże są różnice między wynikami dla tej samej osoby lub próbki? Nawet wysoka korelacja może współistnieć z rozbieżnościami istotnymi w praktyce.

Jak czytać wykres?

Każdy punkt odpowiada parze wyników uzyskanych dla tej samej osoby. Na osi poziomej umieszczamy średnią z obu pomiarów, a na pionowej ich różnicę. W naszym przykładzie odejmujemy wynik metody A od wyniku metody B. Dodatnia różnica oznacza wyższy wynik B. W całej analizie trzeba zachować ten sam kierunek odejmowania.

Średnia na osi poziomej pozwala sprawdzić, czy wielkość różnic zmienia się wraz z poziomem mierzonej cechy. Używanie w jej miejsce wyłącznie wyniku jednej z porównywanych metod może tworzyć pozorny związek, wynikający ze sposobu obliczania różnicy.

Na wykresie zaznaczamy średnią różnicę oraz dolną i górną granicę zgodności. Średnia różnica opisuje przeciętne przesunięcie między metodami. Granice pokazują zakres, w którym przy spełnieniu założeń oczekujemy około 95% różnic w populacji. W klasycznym podejściu obliczamy je następująco:

Szerokość tego zakresu ma znaczenie dla pojedynczego pomiaru: niewielka średnia różnica nie wyklucza dużych rozbieżności u poszczególnych osób.

Przykład porównania dwóch urządzeń

Rozważmy dwa fikcyjne urządzenia mierzące skurczowe ciśnienie tętnicze. Dla 60 osób wygenerowano po jednym wyniku A i B.  W przykładzie średnia różnica B - A wynosi 2,0 mmHg, a odchylenie standardowe różnic 5,0 mmHg. Oszacowane 95% granice zgodności wynoszą więc od -7,8 do +11,8 mmHg. Korelacja Pearsona między pomiarami jest wysoka i wynosi około 0,97.

Metoda B daje zatem przeciętnie wynik wyższy o 2,0 mmHg. Rozbieżność pojedynczej pary pomiarów może być jednak znacznie większa niż ta średnia. Wykres nie pokazuje wyraźnego trendu różnic ani wyraźnego wzrostu ich rozrzutu wraz ze średnią pomiarów.

Załóżmy, że przed badaniem przyjęliśmy akceptowalne różnice od -5 do +5 mmHg. Obie oszacowane granice wykraczają poza ten zakres, więc wynik nie wspiera zamiennego stosowania metod przy takim kryterium.

Jak ocenić czy zgodność jest wystarczająca

Nie istnieje uniwersalny próg dobrej zgodności. Akceptowalną różnicę należy ustalić przed analizą, uwzględniając cel pomiaru i konsekwencje rozbieżności. Ta sama różnica może być dopuszczalna w jednym zastosowaniu, a zbyt duża w innym.

Samo położenie większości punktów między granicami zgodności nie dowodzi, że metody można stosować zamiennie. Granice są wyznaczane z danych; o przydatności metod decyduje przede wszystkim ich położenie względem wcześniej ustalonych wymagań.

Założenia i ograniczenia analizy

Klasyczne granice oparte na mnożniku 1,96 wymagają w przybliżeniu normalnego rozkładu różnic oraz względnie stałej średniej i zmienności różnic w analizowanym zakresie. Założenie normalności dotyczy różnic, a nie osobno wyników A i B.

Trend punktów może wskazywać na różnicę zależną od poziomu mierzonej cechy. Układ przypominający lejek sugeruje wzrost zmienności różnic. W takich sytuacjach warto rozważyć przekształcenie danych, np. logarytmiczne dla dodatnich pomiarów, lub model uwzględniający zmienną średnią i rozrzut. Wyniki po przekształceniu wymagają odpowiedniej interpretacji.

W podstawowym wariancie każda osoba dostarcza jedną parę wyników, a pary są niezależne. Jeśli tę samą osobę badamy wielokrotnie, powstają obserwacje zależne. Nie należy traktować ich jak pomiarów od różnych osób; potrzebny jest wariant analizy uwzględniający strukturę powtórzeń.

Granice zgodności a przedziały ufności

95% granice zgodności opisują rozrzut różnic. 95% przedziały ufności dla tych granic opisują natomiast niepewność ich oszacowania. To dwa różne pojęcia. W badaniu porównującym metody warto podać przedziały ufności dla średniej różnicy i obu granic, zwłaszcza gdy wynik ma uzasadniać zamienne stosowanie metod.

Bibliografia

[1] Bland JM, Altman DG. Statistical methods for assessing agreement between two methods of clinical measurement. Lancet. 1986;1(8476):307–310. doi:10.1016/S0140-6736(86)90837-8.

[2] Bland JM, Altman DG. Comparing methods of measurement: why plotting difference against standard method is misleading. Lancet. 1995;346(8982):1085–1087. doi:10.1016/S0140-6736(95)91748-9.

[3] Bland JM. Interpreting the limits of agreement: do I have good or bad agreement? University of York. https://www-users.york.ac.uk/~mb55/meas/interlim.htm

[4] Bland JM, Altman DG. Measuring agreement in method comparison studies. Stat Methods Med Res. 1999;8(2):135–160. doi:10.1177/096228029900800204.

[5] Bland JM, Altman DG. Agreement between methods of measurement with multiple observations per individual. J Biopharm Stat. 2007;17(4):571–582. doi:10.1080/10543400701329422.

[6] Bland JM. Sample size for a study of agreement between two methods of measurement. University of York. https://www-users.york.ac.uk/~mb55/meas/sizemeth.htm

Polecane serwisy: