AI 인프라 시장은 오랫동안 더 큰 모델, 더 많은 GPU, 더 많은 HBM이라는 등식으로 움직였다. 그런데 터보퀀트가 던진 질문은 그 등식을 흔든다. 같은 메모리로 더 긴 문맥과 더 많은 동시 사용자를 처리할 수 있다면 HBM 수요는 줄어드는가, 아니면 더 넓은 추론 시장으로 옮겨 붙는가.
이 책은 구글 터보퀀트 이후의 AI 인프라를 메모리, GPU, 데이터센터, 클라우드 가격, 반도체 밸류체인 관점에서 차례로 해석한다. 핵심은 단순한 HBM 종말론이 아니다. KV 캐시 압축이 추론 서버의 병목을 어떻게 바꾸는지, 효율화가 GPU 활용률과 토큰당 원가, 데이터센터 설계, 전력과 냉각 산업까지 어떻게 연결되는지 읽어 낸다.
반도체 투자자, AI 인프라를 보는 실무자, 클라우드와 데이터센터 산업의 다음 판을 이해하려는 독자에게 이 책은 뉴스 하나에 흔들리지 않는 구조적 판단 기준을 제공한다. 효율은 수요를 없애는 것이 아니라 돈이 머무는 위치를 바꾼다. 이 책은 바로 그 이동 경로를 추적한다.