토론토대 연구진이 모델 11개에 Defects4J v3.0의 실제 결함 233건을 주고 단위 테스트를 생성시켰더니, 고친 코드 대신 버그 있는 코드를 입력했을 때 버그를 잡는 테스트가 8.51%에서 2.98%로 줄고 버그를 정답으로 단언하는 테스트가 0.46%에서 3.84%로 늘었습니다(arXiv:2607.22883, 2026.7). 이걸 오라클 문제로 짚고, ISO 13485의 verification/validation 구분(2026년 2월 FDA QMSR이 그대로 인용), 스냅샷 테스트와 CDISC 부분 날짜 같은 프런트엔드 실무로 연결합니다. 널리 인용되는 METR의 "AI로 19% 느려짐" 결과에 METR이 2026년 2월 선택 효과를 이유로 스스로 단서를 단 내용도 함께 다룹니다.
← 목록으로
새 소식
에이전트가 쓴 테스트는 무엇을 증명하나
요약
- 토론토대 연구진이 AI 모델에 실제 결함에 대한 단위 테스트를 생성시킨 결과, 버그를 잡는 능력이 떨어지고 오히려 버그를 정답으로 단언하는 테스트가 늘어나는 현상을 확인했습니다.
- 연구진은 이를 오라클 문제로 분석하며 실무적 검증의 한계를 지적했습니다.
키워드
토론토대단위 테스트AI 에이전트