요약. 가벼워서 빨라진 게 아니다. 몸을 깎아서 잠깐 빨라 보였을 뿐이다. — British Journal of Sports Medicine (BJSM) 2023, 합의문 / 리뷰 — 도구 개발. 원문
단일 진단검사가 없는 증후군을 어떻게 점수화할 것인가. 3단계와 4색 신호등, 그 임상적 함의를 읽는다.

상대적 에너지 결핍을 현장에서 다뤄본 사람은 안다. 이게 진단하기 까다로운 이유는 병이 모호해서가 아니라, 단일 확진검사가 존재하지 않기 때문이다.
무월경 하나만 봐도, 골밀도 하나만 봐도, 안정시 대사율 하나만 봐도 REDs를 단정할 수 없다.
위험 요인이 분산되어 있고, 증상이 다기관에 걸쳐 있으며, 무엇보다 환경이 강하게 개입한다. 코칭, 종목 문화, 체중 압박이 전부 여기 얽혀 있다.
그래서 임상가는 늘 같은 딜레마에 빠졌다. 이 선수, REDs가 맞긴 한데 얼마나 심한가? 지금 훈련을 시켜도 되나, 빼야 하나?
2018년 1세대 도구는 이 질문에 위험군 분류 신호등으로 답했지만, red와 yellow와 green 세 단계는 현장의 회색지대를 담기엔 거칠었다.
2023년 BJSM에 실린 이 논문은 IOC 합의 산하 소그룹이 CAT2를 어떻게 설계하고, 지표를 어떻게 가중하고, 어떤 절차로 검증했는지를 정리한 방법론 문헌이다.
우리가 이 논문을 읽는 이유는 진단 기준이 아니라 판단의 알고리즘을 제공하기 때문이다.
오늘 다룬 논문
Review of the scientific rationale, development and validation of the IOC Relative Energy Deficiency in Sport Clinical Assessment Tool: V.2 (IOC REDs CAT2)
IOC 상대적 에너지 결핍 임상 평가 도구 V.2의 과학적 근거·개발·검증 고찰
| 항목 | 내용 |
|---|---|
| 저자 | Stellingwerff T, Mountjoy M, McCluskey WT, Ackerman KE, Verhagen E, Heikura IA |
| 저널 | British Journal of Sports Medicine (BJSM) |
| 연도 | 2023 |
| Impact Factor | 9.3 (SCIE · Q1, Sports Medicine) |
| RCR | 17.01 (분야 평균의 약 17배) |
| 연구 디자인 | 합의문 / 리뷰 — 도구 개발·검증 (델파이형 전문가 합의 + 선수 테스트 피드백) |
| 근거 등급 | 공식 GRADE/PEDro 미적용 (합의문 성격) |
| 인용 | 66회 |
| DOI | 10.1136/bjsports-2023-106914 |
| 원문 | PubMed 37752002 → |
원문: doi.org/10.1136/bjsports-2023-106914
“스포츠 상대적 에너지 결핍(REDs)은 위험 요인이 다양하고 징후와 증상이 많으며 환경의 영향을 크게 받는다. 따라서 단일한 검증된 진단 검사는 없다.”
Stellingwerff 등, 2023, Br J Sports Med
연구 설계와 방법

이 논문은 RCT가 아니라 임상 도구의 개발과 검증 과정을 보고하는 합의문이다.
따라서 읽는 방식이 다르다. 효과크기가 아니라 도구의 구성 타당도와 사용성을 평가하는 눈으로 봐야 한다.
CAT2는 진단을 3단계 프로세스로 구조화한다.
1차 스크리닝 위험 신호를 가진 선수를 거른다.
중증도와 위험도 층화 확인된 REDs 징후와 증상을 1차 지표와 2차 지표로 나누고, 각 지표의 유무에 따라 객관적으로 점수화한다.
의사 주도 최종 진단 선수와 코치, 헬스·퍼포먼스 팀 전체와 함께 확정한다.
핵심 설계 결정은 두 가지다.
첫째, 지표 가중. 모든 징후를 동등하게 세지 않는다. 각 지표는 과학적 근거의 강도, 임상적 중증도와 위험도, 방법론적 타당성과 현장 사용성, 이 세 축으로 가중되었다.
측정하기 쉬운 지표와 임상적으로 치명적인 지표를 구분해서 점수에 반영한다는 뜻이다.
둘째, 4단계 신호등. 기존 3색에 orange를 추가해 4단계로 세분했다.
각 색에는 종목 참여 가이드라인이 연결된다. 현장에서 가장 직접적으로 쓰이는 부분이 이것이다.
검증 절차도 단일 통계검정이 아니라 다단계였다. 초기 초안에서 선수 대상 테스트와 피드백과 수정을 거치고, REDs 전문가 검증을 받고, 임상의와 실무자의 타당성·사용성 평가로 이어졌다.
델파이에 가까운 합의 기반 검증이다.
핵심 결과

이 논문의 결과는 효과크기 표가 아니라 완성된 도구 그 자체와 그 구성 논리다.
| 구성 요소 | CAT (2018, V.1) | CAT2 (2023, V.2) |
|---|---|---|
| 신호등 단계 | 3단계 (green / yellow / red) | 4단계 (green / yellow / orange / red) |
| 지표 구조 | 위험요인 목록 중심 | 1차 지표 / 2차 지표 분리 + 가중 점수화 |
| 진단 흐름 | 위험군 분류 | 3단계: 스크리닝 → 층화 → 의사 최종진단 |
| 출전 판단 | 색상별 권고 | 각 색상과 종목 참여 가이드라인 연결 |
| 점수화 | 정성적 | 지표 유무 기반 객관적 스코어링 |
왜 4색인가
3색 체계의 문제는 노란불과 빨간불 사이가 너무 멀다는 것이었다.
훈련은 하되 강하게 모니터링하고 일부 제한이 필요한 선수가 노란불로 과소평가되거나 빨간불로 과잉제한되었다.
orange는 바로 그 구간을 위한 칸이다. 위험은 분명하나 전면 중단은 과한 선수.
1차와 2차 지표를 나눈 의미
1차 지표는 과학적 근거와 임상 위험도가 높아 단독으로도 무게가 큰 항목이다. 2차 지표는 보조하는 정황 증거다.
이 분리 덕분에 여러 개의 약한 2차 신호가 모이는 경우와 하나의 강한 1차 신호가 있는 경우를 점수상에서 구분할 수 있게 되었다.
수치적 효과크기와 신뢰구간이 없는 것은 논문 종류상 당연하다.
기존 근거와 무엇이 다른가

REDs 개념 자체는 2014년 IOC 합의문에서 RED-S로 등장했고, 그 뿌리는 1990년대 여성 선수 3주징후다.
확장은 이미 알려진 것 에너지 가용성 부족을 축으로 남성과 다기관으로 넓힌 패러다임은 기존 합의문이 정립했다. CAT2는 개념이 아니라 그 개념을 현장에서 운용하는 도구를 갱신한 것이다.
진단 기준에서 위험 층화로 전통적 임상은 무월경, 골밀도 T-score, RMR ratio 같은 컷오프 기반 진단에 기댔다.
CAT2는 단일 컷오프의 한계를 인정하고, 다지표 가중 합산에서 층화로 옮겼다. 검사값 하나로 확진이라는 교과서적 직관과 가장 크게 갈리는 지점이다.
출전 판단을 도구 안으로 기존엔 진단과 그래서 뛰어도 되나가 분리되어 임상가 재량에 맡겨졌다. CAT2는 색상과 참여 가이드라인을 명시적으로 연결해, 복귀 의사결정을 도구 내부 산출물로 만들었다.
논쟁 지점 REDs 진단 도구의 타당성과 임상 유용성을 둘러싼 학계 비판은 진행 중이다. 지표 가중의 근거 강도가 항목마다 불균등하고, orange와 yellow 경계의 임상적 재현성, 종목 간 일반화 문제 등이 제기된다.

리햅포먼스의 논문 비평
과거의 나는 강하게 밀어붙이고 내가 짠 프로그램대로 따라오기만 하면 낫는다고 생각했다. 회원마다, 그날의 심리 상태마다 다르게 접근해야 한다는 것은 한참 뒤에야 깨달았다.
이번에 살펴본 논문은 그 '다르게'를 무엇으로 판단할지 묻는다. 같은 훈련량이 어떤 선수에게는 자극이고 어떤 선수에게는 적자다. 지금 훈련을 시켜도 되나, 빼야 하나. 현장에서 가장 답이 막히던 질문이다.
이 도구가 한 일은 분명하다. 단일 확진검사가 없다는 사실을 인정한 채로, 지표에 가중치를 주고 점수를 층화하고, 그 색에 출전 가이드라인을 붙여두었다. 노란불과 빨간불 사이에 orange 한 칸을 더 낸 것도 현장 감각에 가깝다. 빼지도 풀지도 못하는 구간이 실재한다는 것은 이 논문이 먼저 말한다.
그렇다고 이 점수를 검사 결과처럼 읽을 수는 없다. CAT2는 민감도와 특이도로 정확도를 검증한 도구가 아니다. 검증의 상당 부분이 전문가 투표 동의와 사용성 평가에 기대어 있다. 구성 타당도와 합의는 강하지만 준거 타당도는 아직 없다. 비교할 gold standard 자체가 존재하지 않기 때문이다. 저자들도 그 문장을 숨기지 않고 적어두었다. 지표에 붙은 가중치 역시 항목마다 근거의 강도가 고르지 않다.
더 걸리는 것은 경계다. orange와 yellow가 어디서 갈리는지, 평가자가 바뀌어도 같은 색이 나오는지에 대한 정량 데이터는 제한적이다. 이 대목이 남의 이야기로 들리지 않는다. 우리 센터의 측정 프로토콜을 엄격하게 만든 계기가 정확히 이것이었다. 내가 쟀는데도 그때그때 다르게 측정되어 분석을 할 수가 없었다. 사람이 긋는 기준은 그렇게 흔들린다.
이 도구는 또한 의사 주도 최종 진단을 전제로 설계되어 있다. 선수와 코치, 헬스와 퍼포먼스 팀이 한자리에 모인다는 가정이다. 원주에서 그 자리를 만드는 일은 쉽지 않다. 서울에서 당연하게 하던 것이 여기서는 새로운 것이라 하나부터 열까지 내가 설명해야 한다.
더 어려운 것은 그다음이다. 어떤 의료진이 보더라도 쉬어야 하는 상태인데, 대한민국 유소년 엘리트 시스템에서는 쉬지 않고 뛰어야 할 때가 있다. 의료진은 쉬라 하고 코치는 뛰라 한다. 그 중간에서 조율하는 일이 가장 어렵다.
그렇다면 현장의 우리는 어떻게 해야 할까?
리햅포먼스는 대부분 선수에게 이득이 되는 쪽으로 간다. 입시나 취업 때문에 기록이 반드시 필요한 때라면 의학적 권고보다 최대한 안전하게 경기에 뛰는 쪽을 설계한다. 당장 뛰지 않아도 되는 상황이라면, 미래를 봤을 때 만성 부상을 피하는 편이 낫지 않겠냐고 설득한다.
색을 정확히 매기는 일보다 색이 바뀌는 순간을 놓치지 않는 일이 먼저다. 체중과 월경력, 피로와 반복되는 부상은 따로 검사실을 잡지 않아도 수업 안에서 물어볼 수 있다. 경계가 흔들린다는 이유로 도구를 덮을 것이 아니라, 노란불에서 한 번 멈춰 세우는 사람이 있어야 한다. 빨간불은 그렇게 막힌다.
"가벼워서 빨라진 게 아니다. 몸을 깎아서 잠깐 빨라 보였을 뿐이다."