← 목록으로

우리는 우리 속도를 못 잰다 (METR이 자사의 19% 둔화 결과를 물린 이유)

요약
  • METR은 AI 사용 시 개발 속도가 19% 느려졌다는 초기 실험 결과를 발표하려 했으나, 표본 편향과 방법론적 한계로 인해 이를 철회하고 실험 설계를 변경하기로 했습니다.
  • 이번 사례는 개발 성과 측정에서 자기 보고의 한계와 선택 편향 등 임상시험 방식의 엄격한 프로토콜 도입 필요성을 보여줍니다.
  • 2025년 7월 METR의 무작위 대조 실험은 경험 많은 오픈소스 기여자 16명에게 스타 22,000개 이상·코드 100만 줄 이상 저장소의 실제 이슈 246건을 맡기고 과제마다 AI 사용 여부를 무작위 배정한 결과, AI를 쓴 과제가 19% 더 오래 걸렸다고 보고함(신뢰구간 +2%~+39%)
  • 같은 참가자들은 실험 전 24% 빨라질 것으로 예상했고, 과제를 다 끝낸 뒤에도 20% 빨라졌다고 답함 — 인식과 측정이 39%p 벌어짐
  • METR은 2025년 8월부터 규모를 키워 재측정(개발자 57명·저장소 143개·과제 800건 이상). 기존 참가자 10명은 18% 느려짐(신뢰구간 −38%~+9%), 신규 참가자 47명은 4% 느려짐(−15%~+9%)으로 두 구간 모두 0을 포함함
  • 2026년 2월 24일 METR은 이 결과를 발표하는 대신 실험 설계를 바꾸겠다고 공개함. 스스로 꼽은 이유가 세 가지 — AI 없이 일하는 조건 자체를 받아들이지 않는 개발자가 늘어 모집이 편향됨, 참가자의 30~50%가 AI가 가장 도움될 것 같은 과제를 아예 제출하지 않음, 시급이 150달러에서 50달러로 내려가며 표본이 한 번 더 걸러짐
  • 결국 AI를 가장 잘 쓰는 사람과 AI가 가장 잘 먹히는 일이 표본에서 체계적으로 빠짐. METR은 실제로는 생산성 향상이 있었을 가능성이 높다고 보면서도, 자기 데이터로는 그걸 잴 수 없다고 적음
  • 원 논문에도 이 결과가 AI가 대다수 개발자를 느리게 한다는 증거는 아니라고 이미 쓰여 있었음. 19%를 단정으로 옮긴 건 연구가 아니라 인용이었다는 지적
  • 임상시험 쪽에서는 METR이 겪은 문제에 이미 이름이 다 붙어 있음 — 선택 편향, 비순응과 ITT 분석, 눈가림, 사전 등록. 결과를 보고 해석을 고르지 않도록 성공 기준을 시작 전에 프로토콜에 박아두는 관행
  • 팀이 자기 속도를 잴 때: 자기 보고를 1차 지표로 쓰지 않기, 무엇이 빨라졌는지(첫 커밋·리뷰 통과·배포)를 쪼개기, 비교 대상 만들기, 재기 전에 성공 기준 적어두기, 작게 자주 같은 방식으로 재기

직접 쓴 글입니다.

그냥 목록으로
원문 보기 ↗