요약. 믿을 수 없는 숫자로는, 좋아졌다는 말도 할 수 없다. — Knee Surgery, Sports Traumatology, Arthroscopy (KSSTA · ESSKA 공식지) 2023, 방법론. 원문
B: 우리가 현장에서 쓰는 모든 수치는 “다시 재면 같은 값이 나오는가”라는 질문 앞에서 검증된다.

B: 우리는 매일 숫자를 만든다. 관절가동범위 각도, 등속성 최대토크, 점프 높이, Y-balance 도달거리, GPS 부하량.
이 숫자들 위에서 복귀 판정을 내리고, 프로토콜을 바꾸고, 좌우 비대칭을 논한다.
그런데 정작 이 측정이 다시 재면 같은 값이 나오는가를 통계적으로 확인하고 쓰는 경우는 많지 않다.
재현되지 않는 도구로 잰 10% 비대칭은 판정의 근거가 아니라 노이즈다.
KSSTA 2023년에 실린 이 논문은 새로운 중재를 검증하는 RCT가 아니다. 그 이전 단계를 다룬다.
측정 도구의 신뢰도(reliability)를 어떻게 설계하고, 어떤 통계로 계산하고, 어떻게 해석할 것인가를 정리한 방법론 가이드다.
최근 진단·모니터링 장비가 빠르게 쏟아지는 상황에서, 저자들은 도구가 임상에서 값어치를 가지려면 그 전에 신뢰도가 확립되어야 한다는 점을 다시 못 박는다.
현장 관점에서 이 논문의 가치는 분명하다. 우리는 논문을 읽을 때 효과크기와 p값을 먼저 보지만, 그 수치를 낳은 측정 도구의 ICC가 0.6인지 0.95인지에 따라 신뢰도의 무게가 완전히 달라진다.
남의 신뢰도 연구를 비판적으로 읽는 눈이자, 우리 센터에서 새 장비를 도입할 때 자체 신뢰도를 검증하는 설계도다.
오늘 다룬 논문
Improving the reliability of measurements in orthopaedics and sports medicine
정형외과·스포츠의학에서 측정의 신뢰도 높이기
| 항목 | 내용 |
|---|---|
| 저자 | Królikowska A, Reichert P, Karlsson J, Mouton C, Becker R, Prill R |
| 저널 | Knee Surgery, Sports Traumatology, Arthroscopy (KSSTA · ESSKA 공식지) |
| 연도 | 2023 (31권 12호, 5277-5285) |
| Impact Factor | 3.3 (SCIE · Q1급 스포츠정형 전문지) |
| RCR (iCite) | 10.79 (분야 평균의 약 11배) |
| 인용 | 41회 (iCite, 2026-09 기준) |
| 연구 디자인 | 방법론·교육형 리뷰 (methodological / educational review) |
| 표본 크기 | 해당 없음 — 원저 데이터 없는 방법론 논문 |
| 근거 등급 | 해당 없음 — 중재 연구가 아님 |
| 핵심 지표 | 급내상관계수(ICC) · Bland-Altman · 변동계수 · 코헨 카파 |
| DOI | 10.1007/s00167-023-07635-1 |
| 원문 | PubMed 37902842 → |
원문: doi.org/10.1007/s00167-023-07635-1
“어떤 측정치가 임상에서 가치 있고 적용 가능하려면, 그 신뢰도가 먼저 확립되어야 한다.”
Królikowska 등, 2023, Knee Surg Sports Traumatol Arthrosc
B: RCR 10.79는 눈여겨볼 값이다. Impact Factor 3.3의 저널 논문이 분야 평균 대비 약 11배 인용된다는 것은, 측정 신뢰도라는 주제가 세부 임상 분야를 가로질러 참조되는 방법론 인프라로 기능하고 있다는 뜻이다.
연구 설계와 방법

B: 이 논문은 데이터를 수집한 원저가 아니라, 신뢰도 연구의 설계와 수행과 해석 전 과정을 안내하는 방법론 문헌이다.
그래서 대상자와 중재가 아니라 신뢰도 연구를 어떻게 짜야 하는가의 의사결정 지점들을 다룬다.
핵심은 신뢰도(reliability)를 재현 가능성, 즉 같은 대상을 반복 측정했을 때 값이 얼마나 일치하는가로 정의하고, 이를 세 갈래로 나누는 것이다.
| 신뢰도 유형 | 무엇을 반복하는가 | 현장 예시 |
|---|---|---|
| 급간 (inter-rater) | 측정자를 바꾼다 | 트레이너 A와 B가 같은 선수의 고관절 ROM을 각각 측정 |
| 급내 (intra-rater) | 같은 측정자가 반복한다 | 한 치료사가 같은 무릎을 시간차로 두 번 측정 |
| 검사-재검사 (test-retest) | 시점을 바꿔 반복한다 | 같은 등속성 장비로 다른 날 재측정. 측정자의 영향이 무시할 만할 때 |
B: 저자들은 신뢰도 연구가 필요한 상황을 세 가지로 못 박는다. 새로 개발한 측정 도구를 쓸 때, 널리 쓰이는 도구를 새로운 절차로 적용할 때, 그리고 잘 알려진 방법론으로 쓰이는 도구인데 신뢰도 자료를 문헌에서 찾을 수 없을 때다.
설계 단계에서 짚는 실무 결정 요소는 다음과 같다.
측정자 수
급간 신뢰도를 보려면 최소 2명 이상이 필요하고, 이 설계가 뒤에서 어떤 ICC 모형을 쓸지를 결정한다.
측정자는 반드시 눈가림 상태여야 한다. 다른 측정자가 얻은 값을 알고 있으면 그 자체가 일치도를 만든다.
표본 크기
신뢰도 연구도 목표 ICC와 검정력을 근거로 사전에 표본을 산출해야 한다. 논문은 Bujang과 Baharum이 제시한 최소 표본 표를 쓰라고 안내하고, 결측과 탈락을 감안해 20에서 30퍼센트를 더 모집하라고 권고한다.
Koo와 Li는 이질적인 대상 30명 이상, 측정자 3명 이상을 권한다.
논문이 든 예시는 이렇다. 측정자 3명, 참가자당 3회 측정, 검정력 90퍼센트, 알파 0.05, 최소 ICC 0.50을 목표로 두면 필요한 표본은 15명이고, 탈락을 감안해 20명을 모으면 충분하다.
반복 측정 사이의 휴식
시행 간 간격이 너무 짧으면 학습과 피로와 기억 효과가, 너무 길면 대상자의 실제 상태 변화가 개입한다.
문헌에서 쓰이는 간격은 같은 날부터 최대 1주까지 폭이 넓고, 하루 안(intra-day)과 날짜 간(inter-day)을 따로 보고하는 설계도 있다.
모든 시행은 같은 조건에서 해야 한다. 같은 장소, 같은 시간대, 그리고 시행 사이에 격한 운동을 하지 않는 상태다.
대상 집단의 변산
동질적인 집단은 원자료의 일치도가 높게 나오고, 이질적인 집단은 변산이 커서 신뢰도 계수가 높게 나온다.
즉 ICC는 그 집단이 얼마나 흩어져 있는지에 의존한다. 같은 도구라도 대상이 바뀌면 값이 달라진다는 뜻이다.
데이터 유형에 맞는 통계
범주형 자료의 일치도는 코헨 카파를 쓴다. 1.0이면 완전 일치, 0.0이면 우연 이상의 일치가 없음, 음수는 우연보다도 못한 일치를 뜻한다.
연속형 자료에서는 피어슨 상관과 대응표본 검정과 Bland-Altman 도표를 쓸 수 있지만, 상관과 일치도를 동시에 반영하는 것은 급내상관계수(ICC)뿐이다.
논문이 ICC에 특히 무게를 두는 이유가 여기 있다. 두 측정값의 상관이 높아도 한쪽이 일관되게 크게 나오는 체계적 편향은 상관계수로 잡히지 않는다.
ICC는 현대적으로 분산분석(ANOVA) 모형 위에서 계산되므로 연속형이고 정규분포를 따르는 자료여야 한다. 신뢰도 연구의 표본은 대개 2000명 미만이라 정규성 검정은 샤피로-윌크 검정을 쓴다.
핵심 결과

B: 방법론 논문이므로 효과크기가 아니라 신뢰도 연구를 읽고 설계할 때의 판독 기준이 결과물이다. 핵심을 실무 체크포인트로 옮기면 다음과 같다.
① 신뢰도는 도구의 고정 속성이 아니라 맥락의 산물이다. 논문은 신뢰도가 측정 도구가 아니라 그 도구를 쓰는 검사 설계와 방법론에 부여되는 것이라고 명시한다.
그래서 남이 보고한 ICC를 그대로 우리 현장에 이식할 수 없다. 신뢰도 연구는 측정자와 대상자와 검사 조건이 실제 임상 현장을 반영할 때만 값어치가 있다.
② 세 종류의 신뢰도는 서로 다른 질문에 답한다. 급간 신뢰도가 높아도 급내 신뢰도가 낮을 수 있고, 그 반대도 가능하다.
논문은 대부분의 경우 급내와 급간을 함께, 최소한 급간은 확립하라고 한다. 매일의 임상에서 모든 대상자를 한 사람이 재는 경우는 드물기 때문이다.
③ ICC는 하나의 계수가 아니다. McGraw와 Wong은 열 가지 형태를 정의했고, Shrout와 Fleiss는 여섯 가지를 괄호 안 두 숫자로 표기했다. 앞 숫자가 모형, 뒤 숫자가 단일 측정인지 평균인지를 가리킨다.
| 모형 | 언제 쓰는가 | Shrout & Fleiss 표기 | 정의 |
|---|---|---|---|
| 일원변량 (one-way random) | 참가자마다 다른 측정자 집단이 무작위로 배정될 때. 다기관 연구 정도이고 실제로는 드물다 | ICC(1,1) · ICC(1,k) | 해당 없음 |
| 이원변량 (two-way random) | 측정자 표본이 더 큰 모집단에서 무작위로 뽑히고 전원이 모든 참가자를 잰다. 정형외과·스포츠의학의 급간 신뢰도에서 가장 흔하다 | ICC(2,1) · ICC(2,k) | 절대일치를 기본으로 |
| 이원혼합 (two-way mixed) | 선택된 측정자만이 관심 대상일 때. 급내·검사-재검사는 언제나 이 모형 | ICC(3,1) · ICC(3,k) | 절대일치만 쓴다 |
B: 정형외과와 스포츠의학의 급간 신뢰도에서 가장 흔한 것은 이원변량 모형이고, 급내와 검사-재검사에서는 언제나 이원혼합 모형을 쓴다.
한 사람이 반복한 값을 다른 측정자 집단으로 일반화할 이유가 없기 때문이다. 그리고 이 둘에서는 정의를 언제나 절대일치로 잡는다.
④ ICC는 반드시 신뢰구간과 함께 읽는다. 점추정치 ICC 0.85 하나만으로는 부족하다. 표본이 작으면 95퍼센트 신뢰구간이 넓게 벌어져 실제 신뢰도가 보통일 가능성을 배제하지 못한다.
⑤ 해석 구간에 표준은 없다. 논문은 두 가지 관례를 나란히 소개한다.
다수 저자가 따르는 Cicchetti와 Sparrow의 기준은 0.40 미만이 낮음, 0.40에서 0.59가 보통, 0.60에서 0.74가 좋음, 0.75 이상이 우수다.
다른 저자들이 쓰는 기준은 0.50 미만이 낮음, 0.50에서 0.75가 보통, 0.75에서 0.90이 좋음, 0.90 초과가 우수다. 다만 이 구간은 이질적인 대상 30명 이상과 측정자 3명 이상이라는 조건에서만 적용된다.
그리고 논문은 곧바로 못 박는다. 표준으로 인정되는 신뢰도 수준의 ICC 값은 존재하지 않는다.
⑥ ICC는 절대 차이를 말해 주지 못한다. 실제 차이의 크기가 관심이면 Bland-Altman의 일치 한계를 봐야 하고, 상대적 요약이 필요하면 변동계수를 쓴다.
이상치를 포함한 분포를 상자그림으로 보여 주는 것이 ICC 하나를 제시하는 것보다 독자에게 도움이 된다고 논문은 덧붙인다.
참고로 저자들이 SEM이나 MDC를 다루지는 않는다. 절대 오차 지표로 이 논문이 지목한 것은 Bland-Altman과 변동계수다.
정리하면 이 논문의 결과는 한 문장으로 압축된다. 신뢰도 없이 보고된 측정치는 임상 결정의 근거가 될 수 없으며, 신뢰도는 유형과 모형과 신뢰구간과 절대오차를 함께 갖춘 설계에서만 제대로 확립된다.
기존 근거·교과서와 무엇이 다른가
측정 신뢰도 자체는 새 개념이 아니다. Koo와 Li의 ICC 선택 가이드, COSMIN 체크리스트, 각종 통계 교과서가 이미 다룬 영역이다.
이 논문의 차별점은 정형외과와 스포츠의학이라는 임상 현장 맥락에 특화해, 흩어진 방법론 지식을 연구 설계 순서대로 재배열했다는 데 있다.
교과서는 ICC를 하나의 신뢰도 지수처럼 소개하는 경향이 있다. 실제로는 설계에 따라 여러 모형이 존재하고, 잘못 고르면 계수가 부풀거나 축소된다.
현장은 표본 크기 계산을 건너뛴다. 중재 연구에는 검정력 분석을 하면서, 신뢰도 연구는 편한 만큼 대상을 모으는 관행이 흔하다.
반복 측정 간격은 방법에서 누락되기 쉽다. 많은 신뢰도 논문이 며칠 간격인지 명시하지 않는데, 이 간격이 학습과 피로와 회복 효과를 통해 결과를 좌우한다.
피어슨 상관을 신뢰도 지표로 오용하는 관행도 교정 대상이다. 신뢰도에는 상관계수가 아니라 일치도 기반 지표가 맞다.
그리고 이 논문에서 가장 현장을 찌르는 문장은 마지막 절에 있다. 높은 신뢰도는 대개 높은 타당도와 반비례한다는 것이다.
특정 현상을 재는 검사를 표준화할수록 그 검사는 실제 사건에서 멀어진다. 그래서 실험실 검사는 대개 더 신뢰할 만하고, 현장 검사는 대개 더 타당하다.
즉 이 논문은 새로운 발견을 제시하기보다, 우리가 안다고 착각하지만 현장에서 반복적으로 어기는 방법론 원칙을 임상 언어로 재정렬한 문헌이다.
현장에서 확인할 5가지
| # | 확인 항목 | 왜 중요한가 |
|---|---|---|
| 1 | 어떤 신뢰도인가 | 급간·급내·검사-재검사 중 무엇을 보려는지 먼저 정한다 |
| 2 | 측정자 수와 눈가림 | 혼자 재는지 여러 명이 재는지에 따라 ICC 모형이 갈린다. 측정자는 서로의 값을 몰라야 한다 |
| 3 | 표본 크기 | 사전 산출이 필요하다. 이질적 대상 30명·측정자 3명이 하나의 기준선이고 탈락을 감안해 20~30%를 더 모은다 |
| 4 | 시행 간 휴식 | 같은 날부터 1주까지 폭이 넓다. 짧으면 학습·피로, 길면 실제 상태 변화가 낀다 |
| 5 | 데이터에 맞는 통계 | 연속형은 ICC, 범주형은 카파. 절대 차이가 관심이면 Bland-Altman |

B: 마지막 5번이 실무에서 가장 자주 어긋난다. 자료 유형과 설계에 맞지 않는 통계를 쓰면 계수 자체가 다른 값이 된다.
그럼 현장에서는 어떻게 해야 하는가
측정을 하는 사람으로서
매번 같은 방식으로 재야 한다. 자세와 랜드마크와 측정 시점을 고정한다. 이것이 급내 신뢰도의 출발점이다.
의미 있는 변화의 최소 폭을 알아 두어야 한다. 측정 오차보다 큰 변화라야 좋아졌다고 말할 수 있다.
여럿이 재는 센터라면 기준을 통일해야 한다. 급간 신뢰도가 흔들리면 트레이너가 바뀔 때마다 데이터가 끊긴다.
측정 결과를 읽는 사람으로서
새 측정 장비나 앱을 도입할 때 신뢰도 근거부터 확인해야 한다. ICC 값이 보고돼 있는지, 어떤 조건에서 검증됐는지 본다.
논문과 광고의 숫자를 볼 때 몇 명을, 몇 번, 어떻게 쟀는가를 따져야 한다. 표본과 설계가 부실하면 그 신뢰도 수치도 믿을 수 없다.
저자들은 논문 전반에서 분명히 한다.
“설계부터 해석까지, 신뢰도 연구는 그 전 과정이 제대로 통제되어야 한다.”

리햅포먼스의 논문 비평
이 논문을 읽고 가장 먼저 확인한 것은 남의 측정이 아니라 우리 측정이었다.
리햅포먼스에서 측정은 내가 전담한다. 그러니 우리에게 먼저 걸리는 것은 급간 신뢰도가 아니라 급내 신뢰도와 검사-재검사 신뢰도다. 같은 사람이 다시 재도 같은 값이 나오는가. 논문의 언어로 옮기면 우리가 확립해야 할 것은 이원혼합 모형 쪽이다.
여기서부터가 뼈아프다. 논문은 신뢰도가 장비에 붙는 속성이 아니라 그 장비를 쓰는 설계와 방법에 붙는 속성이라고 못 박는다. 남이 보고한 ICC를 우리 현장에 그대로 이식할 수 없다는 뜻이다.
그런데 우리가 실제로 쓰는 항목의 자체 ICC를 산출해 본 적이 없다. 논문 데이터에서 뽑을 수 있는 것은 기준선으로 쓰고, 없는 것은 센터 내 최소검출가능변화로 구축을 준비하고 있지만 실제로 쓸 수 있는 것은 내년은 되어야 한다.
논문 자체의 한계도 분명하다. 원저 데이터가 없는 교육형 리뷰이고, 사전등록과 검색 전략과 비뚤림 평가를 갖춘 문헌이 아니다. 그래서 이 방법이 저 방법보다 낫다는 비교 검증이 아니라 표준 절차의 정리로 읽어야 한다.
다만 이 한계가 문제가 되는 쪽은 따로 있다. 웨어러블과 GPS와 관성센서처럼 고빈도 시계열을 뽑는 현장에는 이 프레임을 그대로 얹기 어렵고, 측정자가 여러 명 돌아가며 재는 센터에는 논문이 요구하는 표준화 부담이 훨씬 크게 걸린다.
그렇다면 현장의 우리는 어떻게 해야 할까?
표본 계산과 검정력 분석을 항목마다 돌릴 수는 없다. 대신 논문이 설계 요소로 세운 것들 중 지금 통제할 수 있는 것부터 잡는다.
리햅포먼스는 시행이 애매하면 그 시행을 무효로 하고 다시 잰다. 신장은 3회 편차가 0.5cm를 넘으면 3회를 전부 다시 잰다. 측정 중에는 격려도 안내도 하지 않고 대본을 그대로 읽으며, 시행 사이에도 다시 읽는다. 처음 오는 선수는 본 측정 3일에서 10일 전에 친숙화 세션을 거친다.
이것들은 전부 급내 신뢰도를 지키려고 만든 절차다. 논문을 읽고 새로 만든 것이 아니라, 내가 쟀는데도 그때그때 다르게 측정돼 분석할 수 없었던 경험에서 만들어진 것이다.
정직하게 덧붙일 것이 하나 있다. 우리가 가장 중요하게 보는 홀딩은 본인이 중심을 잡았다고 느낄 때까지 시키는 것이고, 14가지 측정 항목 중에 이것을 잡는 항목은 없다. 신뢰도를 논하기 전에 측정 자체가 없는 영역이 우리에게도 남아 있다.
그래서 이 논문은 우리에게 통계 논문이 아니라 절차 논문이다. 측정을 바꾸고 싶으면 장비를 바꾸는 것이 아니라 절차를 고정하는 것부터 해야 한다.
재활에서 퍼포먼스까지 리햅포먼스