건강의학

의료AI 성능평가를 설계하는 법

클리니컬에비던스랩
넥스트북(NextBook)
0 (0명)
2명이 읽었어요
유료 작품은 원스토리 앱에서 이용 할 수 있어요.
패스 오퍼링
소장
13,000 ⓒ
의료AI 성능평가를 설계하는 법
듣기기능TTS지원파일정보EPUB
총 용량3.7 MB이용기기
ISBN9791144303645
책 소개
AUROC가 같은 두 의료AI가 실제 진료에서는 전혀 다른 결과를 만들 수 있다. 하나는 더 많은 환자를 찾아내지만 경보도 많이 만들고, 다른 하나는 불필요한 경보를 줄이는 대신 놓치는 환자가 늘어날 수 있다. 어느 모델이 더 좋은지는 점수만으로 정할 수 없다. 누가 결과를 보고 어떤 행동을 바꾸는지, 오탐과 미탐의 비용이 무엇인지, 후속 검사와 인력이 그 경보를 감당할 수 있는지부터 정해야 한다.

이 책은 의료AI 성능평가를 “높은 점수 찾기”가 아니라 임상 의사결정 설계로 바꾼다. 임상 질문에서 평가 대상과 비교선을 정하고, 참조표준이 무엇을 의미하는지 확인한 뒤 혼동행렬을 통해 민감도·특이도와 오탐·미탐의 균형을 읽는다. 문턱값이 진료 경로를 어떻게 바꾸는지 살피고, AUROC만으로는 보이지 않는 판별 성능과 확률 예측의 보정을 함께 평가한다.

검증 설계에서는 데이터 분할과 독립성, 누수를 점검하고 외부검증으로 적용 가능성을 묻는다. 평균값 뒤에 숨는 하위집단 위험을 따로 보고, 실제 업무 흐름과 환자 결과까지 이어지는 임상적 유용성의 높이를 구분한다. 배포 뒤에는 성능 저하와 데이터 변화, 경보 부담을 계속 감시해야 한다. 논문 성능표를 읽는 연구자부터 의료AI 도입을 검토하는 임상의·병원 실무자까지, 숫자를 임상 질문과 연결해 과장도 과소평가도 피하는 평가 구조를 익히게 한다.

목차
프롤로그. 점수보다 먼저 정해야 할 것

1장. 지표를 결정하는 임상 질문
  1절. 진단·선별·예후·모니터링의 다른 질문
  2절. 대상·사용자·시점을 고정한 사용목적
  3절. 모델 출력과 임상 행동 사이의 경로
  4절. 연구 질문을 잠그는 한 문장 설계

2장. 점수의 기준이 되는 비교선과 참조표준
  1절. 현재 진료와 단순 규칙이라는 기준선
  2절. 유병률과 표본 구성이 만드는 성능 차이
  3절. 참조표준과 라벨 오류의 숨은 영향
  4절. 우월·비열등·추가 가치의 비교 구조

3장. 오탐과 미탐을 드러내는 혼동행렬
  1절. 네 칸으로 읽는 실제 환자 흐름
  2절. 민감도와 특이도의 서로 다른 책임
  3절. 유병률에 흔들리는 양성·음성 예측도
  4절. 오탐·미탐 비용을 붙인 임상 비용표

4장. 진료 경로를 바꾸는 문턱값
  1절. 문턱값과 운영 목적의 결합
  2절. 선별·확진·우선순위 분류의 다른 균형
  3절. 다중 문턱값과 보류 구간의 설계

5장. AUROC 너머의 판별 성능
  1절. 순위 판별력으로 읽는 AUROC
  2절. 불균형 자료에서의 정밀도-재현율 곡선
  3절. 관심 구간을 좁히는 부분 AUROC
  4절. 정확도·F1·단일 점수 선정의 함정

6장. 확률 예측의 신뢰를 가르는 보정
  1절. 판별과 다른 확률 보정
  2절. 보정도·절편·기울기의 해석
  3절. 브라이어 점수와 재보정의 조건

7장. 점수의 신뢰도를 만드는 검증 설계
  1절. 학습·튜닝·검증·시험 자료의 역할
  2절. 환자·기관·시간 단위 분할의 원칙
  3절. 교차검증과 부트스트랩의 올바른 쓰임
  4절. 표본 크기·신뢰구간·사전 분석계획

8장. 성능을 부풀리는 데이터 누수
  1절. 전처리와 특징 선택에서 생기는 누수
  2절. 환자 중복과 시계열 중복의 착시
  3절. 결과 이후 정보를 쓰는 시간 누수
  4절. 파이프라인 잠금과 누수 감사

9장. 적용 가능성을 묻는 외부검증
  1절. 지리·시간·장비·진료환경의 차이
  2절. 사용목적에 맞춘 외부검증 코호트
  3절. 성능 저하의 원인 분해와 모델 업데이트
  4절. 한 번의 외부검증이 보장하지 못하는 것

10장. 평균값 뒤의 하위집단 위험
  1절. 성별·연령·중증도·기관별 성능 차이
  2절. 작은 하위집단의 불확실성과 신뢰구간
  3절. 사전 가설과 사후 탐색의 경계
  4절. 공정성 지표와 임상적 격차의 해석

11장. 진료 결과로 이어지는 임상적 유용성
  1절. 기술 성능과 환자·의료진·조직 결과
  2절. 결정곡선과 순편익의 임상 번역
  3절. 조용한 검증에서 전향적 비교시험까지
  4절. 자동화 편향·경고 피로·업무량 변화

12장. 배포 뒤 성능을 지키는 감시 체계
  1절. 입력·출력·임상 결과의 모니터링
  2절. 데이터 변화와 개념 변화의 경보선
  3절. 재보정·재학습·중단의 의사결정
  4절. 연구계획서와 도입평가서의 최종 구조

에필로그. 점수를 임상 결정으로 번역하는 습관

작가 소개
  • 작가클리니컬에비던스랩
클리니컬에비던스랩은 의료·임상·보건·간호·의료기기 분야의 전문지식을 근거와 의사결정의 구조로 정리하는 의료 콘텐츠 연구 그룹이다. 임상시험, 진단과 치료, 환자안전, 의료데이터, 의료기기 평가와 시판 후 관리까지 현장에서 요구되는 절차와 판단 기준을 체계적으로 해설한다. 복잡한 지표와 규제 문서를 의료인, 연구자, 실무자가 바로 활용할 수 있는 검토표와 업무 흐름으로 전환하는 데 집중한다.
출판사
넥스트북(NextBook)