요약. ‘논문에 나왔다’는 증명의 끝이 아니라, 검증의 시작이다. — Sports Medicine (Springer Nature) 2025, 다기관 재현 프로젝트. 원문
근거기반 실무의 출발점은 논문에 효과가 있다고 나왔다는 사실이다. 노르딕 햄스트링 운동의 부상 감소, 혈류제한 훈련의 근비대, 특정 재활 프로토콜의 복귀 단축. 이런 근거의 바탕에는 결국 개별 연구가 보고한 효과크기가 있다.
그 효과크기가 독립된 연구팀의 재현에서 살아남는지는, 지금까지 스포츠·운동과학에서 체계적으로 확인된 적이 없다.

이 논문은 스포츠·운동과학 재현성의 첫 추정치다. 101명의 연구자가 참여한 다기관 프로젝트이고, 결과는 28%다.
논문을 근거로 프로그램을 짜는 사람이라면, 이 숫자는 특정 기법 하나보다 훨씬 넓은 범위의 의사결정에 걸린다.
오늘 다룬 논문
Estimating the Replicability of Sports and Exercise Science Research
스포츠·운동과학 연구의 재현 가능성 추정
| 항목 | 내용 |
|---|---|
| 저자 | Murphy J, Caldwell AR, Mesquida C … Warne JP (총 101명 다기관 공동 저자) |
| 소속 | Technological University Dublin (아일랜드) 외 |
| 저널 | Sports Medicine (Springer Nature) |
| 연도 | 2025 (55권 10호, 2659-2679) |
| Impact Factor | 9.3 (원고값) JCR 최신값은 확인되지 않음 |
| RCR (iCite) | 9.86 (같은 분야 NIH 지원 논문 = 1.0 · 잠정값) |
| 인용 | 28회 (iCite, 2026-09 기준) |
| 연구 디자인 | 다기관 재현 프로젝트 선정 프로토콜 사전 공개 · 재현마다 사전등록 |
| 대상 | Q1 저널(2016~2021) 응용 연구의 유의한 결과 25편 |
| 판정 | 유의성 · 같은 방향 · 효과크기 호환 세 기준 동시 충족 |
| 근거 등급 | 해당 없음 (메타연구) |
| DOI | 10.1007/s40279-025-02201-w |
| PubMed | PMID 40522610 · PMC12513899 전문 공개 |
원문: doi.org/10.1007/s40279-025-02201-w · PubMed 40522610
연구 설계와 방법

재현 프로젝트의 신뢰도는 무엇을 어떻게 골라 재현했는가에서 결정된다. 이 프로젝트는 선정 프로토콜을 본 연구 이전에 별도 논문으로 먼저 공개했다(Murphy 등, 2023, Sports Medicine). 사후에 입맛대로 골랐다는 비판을 줄이려는 설계다. 다만 연구실의 장비로 할 수 있는 연구가 배정됐고, 협력자는 실행 가능성을 이유로 배정을 거절할 수 있었다.
대상은 SCImago 2019년 스포츠과학 분야 Q1 저널에 2016~2021년 실린 응용 연구 가운데, 유의한 주효과를 보고한 실험 연구다. 9,385편을 선별해 587편의 후보군을 만들었다.
자발적으로 참여한 연구실을 모집한 뒤, 각 연구실의 장비와 전문성을 기준으로 후보군에서 무작위로 배정했다. 재현 실패가 그 연구실이 그 측정을 못 해서로 돌아가지 않게 하는 장치다.
참여 의사를 밝힌 189명 가운데 33명이 재현을 시작했고 29건이 자료 수집을 마쳤다. 표본이 원연구보다 작았던 4건을 빼고 25건을 분석했다. 재현 연구는 건마다 사전등록했다.
판정은 한 지표로 하지 않았다. 원연구와 같은 검정에서 유의할 것, 효과의 방향이 같을 것, 그리고 Z 검정에서 효과크기가 원연구와 유의하게 다르지 않을 것. 세 기준을 모두 요구했다.
앞의 두 기준만 쓰면 유의하긴 한데 원연구의 절반 크기인 결과도 성공으로 집계된다. 세 번째 기준을 더한 것이 이 프로젝트의 방법론적 강점이다.
핵심 결과

PMC 전문 기준
| 항목 | 결과 | 의미 |
|---|---|---|
| 세 기준 모두 충족 | 7/25 (28%) | 견고한 재현 |
| 유의성 · 같은 방향 | 14/25 (56%) | 원연구처럼 유의 |
| 효과크기 호환 (Z 검정) | 9/25 (36%) | 크기까지 맞은 비율 |
| 효과크기가 작아진 연구 | 22/25 (88%) | 25편 전체 감소 폭 중앙값 75% |
| 판정 분류 | 성공 7 · 정보적 실패 9 실질적 실패 7 · 판정 불가 2 |
Brandt 등의 분류 |
| 평균 표본 | 원연구 17명 · 재현 33명 | 원연구는 소표본 |
| 원연구의 신뢰구간 보고 | 16% | 효과크기 보고는 68% |
| 원자료 공유 | 연락한 원저자 156명 중 14% | 재현 이전의 장벽 |
① 25편 중 7편
세 기준을 모두 충족한 연구는 25편 중 7편, 28%였다. 유의성과 방향만 보면 14편(56%)이 재현됐지만, 효과크기가 원연구와 호환된 것은 9편(36%)에 그쳤다.
② 효과크기는 줄었다
실무적으로는 이 발견이 더 무겁다. 25편 중 22편(88%)에서 효과크기가 원연구보다 작아졌다. 25편 전체에서 효과크기 감소 폭의 중앙값은 75%였다. 심리학 재현 프로젝트에서는 효과크기가 대략 절반으로 줄었는데, 이번에는 그보다 훨씬 크게 줄었다.
원연구의 평균 표본은 17명, 재현 연구는 33명이었다. 원연구의 효과크기는 대부분 큰 쪽이었다. 소표본에서 유의성 문턱을 넘어 출판되는 효과크기는 참값보다 부풀려져 있을 확률이 구조적으로 높다.
“스포츠·운동과학 연구자들은 단독 결과에 기대기보다 근거의 누적을 고려해야 한다.”
Murphy 등, 2025, Sports Med
③ 재현 이전의 장벽
세 번째 발견은 결과라기보다 고발에 가깝다. 연락한 원저자 156명 중 원자료를 준 것은 14%였다. 검정 통계량을 따로 요청했을 때는 답이 없었다.
원연구 가운데 검정 통계량을 보고한 것은 48%, 효과크기를 보고한 것은 68%, 신뢰구간을 보고한 것은 16%였다. 재현 이전에, 재현을 시도할 수 있는 형태로 기록되지 않은 연구가 문헌에 상당히 있다는 뜻이다.
기존 근거와 무엇이 다른가
판정 기준이 프로젝트마다 달라 직접 비교는 안 된다 · 외부 문헌은 원고가 가져온 것
| 분야 | 재현 결과 | 출처 |
|---|---|---|
| 심리학 | 36% (유의성 기준) | Open Science Collaboration, Science 2015 |
| 실험경제학 | 61% (11/18) | Camerer 등, Science 2016 |
| 사회과학 (Nature·Science 게재) | 62% (13/21) | Camerer 등, Nat Hum Behav 2018 |
| 전임상 암생물학 | 효과크기 중앙값 85% 축소 | Errington 등, eLife 2021 |
| 스포츠·운동과학 | 28% (세 기준 동시 충족) 56% (유의성 기준) |
이번 논문 |
판정 기준이 프로젝트마다 달라 직접 비교에는 주의가 필요하다. 이번 28%는 효과크기 호환까지 요구한 엄격한 기준이고, 심리학의 36%는 유의성 기준이다. 유의성 기준만 보면 이번 프로젝트는 56%였다. 순위를 매기기보다, 유의성은 절반 남짓 재현되는데 효과의 크기는 대부분 줄었다는 점을 읽어야 한다.
흔들리는 통념이 두 가지다. 하나는 Q1 저널이면 믿을 만하다는 생각이다. 이번 재현 대상은 전부 Q1 저널 논문이었다. 저널 등급은 재현성을 담보하지 않는다.
다른 하나는 유의했으니 효과가 있고, 보고된 효과크기가 기대 효과의 크기라는 생각이다. 이번 데이터는 두 명제를 떼어 놓으라고 말한다. 효과의 존재가 재현되더라도 크기는 줄어드는 경향이 뚜렷했다. 교과서와 리뷰에 인용된 효과크기의 상당수가 상한 추정치일 수 있다.
오독 방지선도 분명히 하자. 재현 실패가 원효과의 부재를 증명하지는 않는다. 28%는 72%가 거짓이라는 뜻이 아니라, 한 번의 재현에서 엄격한 기준을 통과한 비율이 28%라는 뜻이다. 저자들도 재현 연구 하나가 원연구를 뒤집을 수는 없고, 초점은 근거의 누적에 있어야 한다고 적었다.
현장에서는 무엇을 바꾸나

단일 논문의 효과크기로 기대 효과를 잡지 않는다. 신뢰구간의 하한을 기본값으로 쓰거나 점추정치를 보수적으로 깎아 읽는다. 재현 데이터가 없는 새 기법일수록 더 그렇다.
수렴하는 근거를 우선한다. 독립된 연구팀의 반복 확인, 메타분석, 그럴듯한 기전이 겹치는 방법을 프로그램의 뼈대로 삼고, 화제가 된 단일 무작위 대조 연구는 실험적 선택지로 둔다.
사전등록과 원자료 공개가 된 논문에 가중치를 준다. 이번 프로젝트에서 재현을 가로막은 것이 바로 자료와 보고의 불투명성이었다.
자체 측정이 곧 자체 재현이다. 점프 높이, 근력, 통증 지표처럼 개인 안의 변화를 추적하는 측정은 문헌의 효과가 내 현장에서 재현되는지 확인하는 작은 재현 시험이 된다.
논문 한 편으로 프로토콜을 갈아엎지 않는다. 28%라는 기저율 앞에서 최신 연구에 따르면은 프로토콜 전면 교체의 근거로 부족하다.
현실적 제약도 적어 둔다
저자들 스스로 이 추정치가 대표성이 없다고 적었다. 수천 편의 연구 가운데 25편으로는 분야 전체의 재현율을 정확히 말할 수 없다. 협력 연구실의 장비로 할 수 있는 연구가 골라졌으므로, 고비용·특수 장비 연구의 재현성은 이 숫자가 대표하지 못한다.
재현은 연구마다 한 번이었다. 목표는 검정력 95%였지만 원연구 표본을 두 배로 늘리는 방식으로 잡은 재현이 많았고, 저자들은 이 경우 검정력이 목표에 한참 못 미쳤을 수 있다고 인정했다. 그만큼 유의한 재현이 덜 나왔을 수 있다.
반대 방향의 문제도 있다. 효과크기가 호환된다는 판정은 Z 검정이 유의하지 않다는 뜻이지, 두 효과가 같다는 증거는 아니다. 원연구가 보고하지 않은 효과크기는 저자들이 가장 작은 쪽으로 추정해 넣었다.
그래서 28%는 위로도 아래로도 움직일 수 있는 첫 추정치다. 다만 어느 쪽으로 읽어도 단일 논문 하나에 실리는 근거의 무게는 지금보다 가벼워져야 한다.
오늘의 한 줄
‘논문에 나왔다’는 증명의 끝이 아니라, 검증의 시작이다.

리햅포먼스의 논문 비평
이 연재는 매주 분야별로 논문을 한 편씩 골라 읽는다. 그런데 이번 논문은 바로 그 방식, 논문 한 편을 근거로 삼는 방식을 겨냥한다. 이번에는 우리 쪽을 먼저 돌아봐야 공평하다. 좋은 논문을 고르면 된다고 생각하기 쉽지만, 이번 재현 대상은 전부 상위 저널에서 골라 온 논문이었다.
저자들은 한계를 먼저 적었다. 25편은 분야를 대표하지 못하고, 재현은 한 편에 한 번씩이었다. 원연구 표본을 두 배로 늘려 잡은 재현은 목표한 검정력에 못 미쳤을 수 있다. 28%는 위로도 아래로도 움직일 수 있는 첫 추정치다.
그런데 그 한계를 다 걷어 내도 남는 숫자가 있다. 25편 중 22편에서 효과크기가 줄었고, 전체 감소 폭의 중앙값은 75%였다. 원연구의 평균 표본은 17명이었다.
재현 이전의 숫자도 불편하다. 원자료를 내준 원저자는 14%였고, 신뢰구간을 보고한 원연구는 16%였다. 우리가 매주 표에 옮겨 적는 숫자 가운데 상당수는, 다시 확인할 길이 처음부터 막혀 있다는 뜻이다.
이 숫자가 가장 무겁게 걸리는 곳은 일반 회원에게 논문의 효과를 약속하는 현장이다. 17명 남짓에게서 나온 효과크기를, 주 2~3회 오는 일반 회원의 기대치로 그대로 옮기는 순간 그 약속은 대부분 지킬 수 없는 약속이 된다.
나는 실험을 통한 증명이 언제나 현장보다 늦을 수밖에 없다고 믿어 왔다. 이번 논문은 그 늦게 온 증명조차 한 번 더 재면 대부분 작아진다는 것을 보여 준다.
그렇다면 현장의 우리는 어떻게 해야 할까?
리햅포먼스는 논문에서 가져온 방법을 들인 뒤, 재측정으로 우리 회원에게서 효과가 나오는지 확인한다. 재측정은 6주 간격이 원칙이다. 이 논문의 언어로 말하면 그것이 우리의 재현 연구다.
다만 기대치는 고쳐 잡아야 한다. 재측정에서 효과가 논문이 보고한 것보다 한참 작게 나와도, 그것만으로 실패라고 단정하지 않는 것이 맞다. 재현 연구에서도 효과는 대부분 작아졌다. 반대로 한 번의 재측정에서 논문만큼 좋아졌다면, 그것도 한 번 더 확인하기 전에는 믿지 않는 편이 맞다.
논문 한 편은 답이 아니라 출발점이다. 흔들리지 않는 판단은 트레이너의 지식, 현장의 풍부한 경험, 근거 중심의 프로토콜이라는 삼박자에서 나온다. 여기서 근거 중심이란 논문 한 편이 아니라, 쌓인 근거와 우리 손으로 다시 잰 숫자다.