생성형 AI 시대, 데이터를 가치로 만드는 방법
가진 자료를, AI가 답할 수 있는 자료로.
생성형 AI는 잘 정비된 데이터를 만났을 때 비로소 제 몫을 합니다. 아무리 똑똑한 모델도 자료가 흩어져 있고 형식이 제각각이면 엉뚱한 답을 내놓거나, 있는 자료조차 찾지 못합니다. 그래서 지금 정말 필요한 일은 거창한 AI 개발이 아니라, 우리가 이미 가진 자료를 ‘AI가 활용할 수 있는 형태’로 바꾸는 것입니다. 이 책은 바로 그 과정을 처음부터 끝까지 손으로 따라가게 합니다.
책을 읽는 동안 독자는 자기 컴퓨터에서 RAG검색 증강 생성 챗봇 한 개를 직접 만듭니다. 메타데이터를 설계하고, 자료를 수집해 정제하고, 작은 토막청크으로 나눠 임베딩하고, 벡터 데이터베이스에 담아 의미로 검색하고, 끝으로 생성형 AI가 출처까지 밝히며 답하게 합니다. 한 장의 산출물이 다음 장의 입력이 되도록 짜여 있어, 열 개의 장을 따라가다 보면 마지막에 실제로 작동하는 챗봇이 손에 남습니다.
이 책은 도서관과 기록관의 사례로 개념을 풀어 가지만, 방법 자체는 자료의 종류를 가리지 않습니다. 학위논문이든, 연구 데이터든, 직접 모은 문서든, ‘자기 자료’를 가진 사람이라면 같은 길을 그대로 밟을 수 있습니다.
모든 실습은 본인 PC에서 돌아갑니다. 외부 클라우드를 쓰지 않고, Python·VS Code·Git·Jupyter를 1장에서 함께 설치한 뒤 진행합니다. 새 라이브러리를 쓸 때마다 ‘왜 이걸 쓰는지’를 먼저 설명하고, Windows를 기본으로 하되 Mac 안내도 함께 둡니다. 프로그래밍이 처음이어도, 임베딩·벡터 같은 말이 낯설어도 괜찮습니다. 본문에서 비유로 풀어 다시 설명합니다.
이런 분께 권합니다
도서관·기록관·연구기관에서 자료를 관리하고 서비스하는 분
문헌정보학·기록관리학을 공부하거나 그 길을 준비하는 학생
학위논문·연구 데이터·개인 문서로 나만의 AI 챗봇을 만들어 보고 싶은 누구나
이 책의 특징
개념 → 코드 → 실행 결과 → 점검까지, 멈추지 않고 읽히도록 설계했습니다.
Gemini API, ChromaDB, Kiwi 같은 실제 도구로 끝까지 동작하는 코드를 다룹니다.
저작권·개인정보·운영 비용·거버넌스까지 짚어, 학습을 넘어 현장 적용을 준비하게 합니다.
흔히 부딪히는 함정인코딩, API 한도, 한국어 처리 등을 미리 막아 둡니다.
완주하면
누군가의 도움 없이도 자기 자료로 RAG 챗봇 한 개를 처음부터 끝까지 만들고, 운영 점검까지 할 수 있게 됩니다. 그리고 그 경험은 다음에 어떤 자료를 만나든 같은 방법을 적용할 수 있는 자신감으로 남습니다.