한 도시의 평균 통행 속도는 좋아졌는데 외곽 버스를 타는 사람의 출근은 더 늦어질 수 있다. 도로 위 차량만 측정하고 정류장의 기다림을 제외했다면 두 문장은 동시에 참이다. 데이터가 거짓말을 하지 않았는데도 현실이 다르게 보이는 이유는 숫자를 만들기 전에 이미 무엇을 재고 무엇을 빼놓을지 선택했기 때문이다.
『데이터는 어떻게 현실을 왜곡하는가』는 숫자를 믿을지 말지를 묻는 책이 아니다. 측정 대상의 정의, 기록되지 않은 사람, 평균과 분모, 표본의 구성, 분류의 경계, 상관과 인과, 그래프의 축과 정렬처럼 데이터가 현실을 압축하는 과정부터 차근차근 살핀다. 정확한 계산보다 먼저 어떤 현실이 데이터로 들어왔고 무엇이 화면 밖으로 밀려났는지를 확인하게 한다.
책의 중반부는 지표가 목표가 되는 순간과 알고리즘이 과거의 기록을 미래의 판단으로 옮기는 과정을 다룬다. 처리 건수, 점수, 별점, 정확도처럼 편리한 숫자가 사람의 행동을 바꾸고, 조직의 보고선을 지나며 더 매끈한 이야기로 변하는 장면을 보여 준다. 생성형 AI의 확신, 자동화된 판단의 책임, 모델이 시간이 지나며 낡는 문제도 같은 틀에서 읽는다.
후반부에서는 현실을 덜 왜곡하는 데이터 사용법을 제시한다. 질문을 먼저 쓰고, 데이터 생성 과정을 그리며, 정의·분모·시간·누락을 함께 확인하고, 한 숫자에 대안 해석을 붙이는 식이다. 고객 이탈 예측, 지역 안전 대시보드, 학교 학습지원, 병원 재입원 예측 사례를 통해 검증 질문을 실제 결정에 옮기는 방법도 보여 준다.
데이터를 자주 보는 직장인과 기획자, 보고서를 읽는 시민, AI와 알고리즘의 결과를 업무에 활용하는 사람에게 필요한 것은 더 많은 숫자가 아니라 숫자의 사용설명서를 읽는 힘이다. 이 책은 데이터 냉소와 데이터 맹신 사이에서, 어떤 수치를 어디까지 믿고 어떤 질문을 더 해야 하는지 판단하는 가장 기본적인 문해력을 제공한다.
숫자를 읽을 때마다 정의와 분모, 시간과 누락을 따로 적어 보는 습관만으로도 많은 오해를 줄일 수 있다. 데이터가 정교해질수록 질문도 정교해져야 한다. 이 책은 정확도를 높이는 기술과 함께 정확해 보이는 결과를 실제 사람과 현장에 적용할 때 필요한 책임의 기준까지 한 화면에 놓는다.