AUROC가 같은 두 의료AI가 실제 진료에서는 전혀 다른 결과를 만들 수 있다. 하나는 더 많은 환자를 찾아내지만 경보도 많이 만들고, 다른 하나는 불필요한 경보를 줄이는 대신 놓치는 환자가 늘어날 수 있다. 어느 모델이 더 좋은지는 점수만으로 정할 수 없다. 누가 결과를 보고 어떤 행동을 바꾸는지, 오탐과 미탐의 비용이 무엇인지, 후속 검사와 인력이 그 경보를 감당할 수 있는지부터 정해야 한다.
이 책은 의료AI 성능평가를 “높은 점수 찾기”가 아니라 임상 의사결정 설계로 바꾼다. 임상 질문에서 평가 대상과 비교선을 정하고, 참조표준이 무엇을 의미하는지 확인한 뒤 혼동행렬을 통해 민감도·특이도와 오탐·미탐의 균형을 읽는다. 문턱값이 진료 경로를 어떻게 바꾸는지 살피고, AUROC만으로는 보이지 않는 판별 성능과 확률 예측의 보정을 함께 평가한다.
검증 설계에서는 데이터 분할과 독립성, 누수를 점검하고 외부검증으로 적용 가능성을 묻는다. 평균값 뒤에 숨는 하위집단 위험을 따로 보고, 실제 업무 흐름과 환자 결과까지 이어지는 임상적 유용성의 높이를 구분한다. 배포 뒤에는 성능 저하와 데이터 변화, 경보 부담을 계속 감시해야 한다. 논문 성능표를 읽는 연구자부터 의료AI 도입을 검토하는 임상의·병원 실무자까지, 숫자를 임상 질문과 연결해 과장도 과소평가도 피하는 평가 구조를 익히게 한다.