이미 소장하고 있다면 판매해 보세요.
|
1장 LLM과 sLLM
1.1 LLM 알아보기 __1.1.1 LLM 개념과 동작 원리 __1.1.2 LLM의 주요 기술 __1.1.3 LLM의 대표 모델 1.2 sLLM 알아보기 __1.2.1 sLLM의 개념 __1.2.2 sLLM의 배경과 필요성 __1.2.3 sLLM이 해결할 수 있는 문제 1.3 sLLM의 대표 모델 2장 sLLM을 활용한 산업별 사례 분석 2.1 산업별 동향 2.2 도메인별 동향 __2.2.1 의료 산업 __2.2.2 공공/행정 __2.2.3 금융 __2.2.4 교육 __2.2.5 법률 __2.2.6 유통/이커머스 __2.2.7 제조/산업 2.3 스타트업, 기업, 연구 기관에서의 활용 사례 __2.3.1 스타트업 __2.3.2 대기업 __2.3.3 연구 기관 2.4 LLM 모델 vs sLLM 장단점 __2.4.1 LLM 모델 __2.4.2 sLLM 모델 3장 sLLM 모델 트렌드와 최신 동향 3.1 국내외 시장 동향 __3.1.1 세계 시장 동향 __3.1.2 국내 시장 현황 3.2 최신 sLLM 모델 __3.2.1 LLaMA(메타) __3.2.2 Gemma(구글) __3.2.3 Phi(마이크로소프트) __3.2.4 Mistral AI __3.2.5 최근 출시 모델 3.3 오픈 소스 기반 LLM과 클라우드 기반 LLM __3.3.1 오픈 소스 기반 LLM __3.3.2 클라우드 기반 LLM __3.3.3 오픈 소스 기반 LLM vs 클라우드 기반 LLM 4장 sLLM 모델 학습 환경 구축 4.1 모델 기반 기술 __4.1.1 허깅페이스 __4.1.2 Ollama __4.1.3 랭체인, 라마인덱스, 랭그래프 __4.1.4 벡터 데이터베이스 __4.1.5 RAG __4.1.6 파인튜닝 4.2 필수 라이브러리와 도구 __4.2.1 파이썬: 파이토치, 텐서플로, 허깅페이스 트랜스포머 __4.2.2 데이터 전처리 __4.2.3 분산/클라우드 환경 5장 파인튜닝과 sLLM 파인튜닝 5.1 파인튜닝 __5.1.1 파인튜닝 정의 __5.1.2 파인튜닝의 주요 기술과 하이퍼파라미터 설정 __5.1.3 sLLM 파인튜닝의 필요성 __5.1.4 sLLM 파인튜닝 특징과 장단점 5.2 상용 서비스인 OpenAI의 파인튜닝 활용 __5.2.1 OpenAI 파인튜닝 절차 5.3 sLLM 파인튜닝 __5.3.1 모델 선택의 기준 __5.3.2 주요 모델 비교 및 실습 최적 세팅 __5.3.3 여러 sLLM 파인튜닝 및 성능 비교하기 6장 sLLM의 효율적인 파인튜닝 6.1 효율적인 파인튜닝의 필요성 __6.1.1 전통적인 풀 파인튜닝의 한계 __6.1.2 경량 파인튜닝 6.2 LoRA __6.2.1 기본 개념 __6.2.2 LoRA 코드 이해하기 __6.2.3 LoRA의 장단점 6.3 QLoRA __6.3.1 기본 개념 __6.3.2 작동 원리 __6.3.3 QLoRA 코드 이해하기 __6.3.4 QLoRA 설정하기 __6.3.5 QLoRA의 장단점 6.4 파인튜닝 기법 비교 __6.4.1 LoRA vs QLoRA __6.4.2 풀 파인튜닝 vs LoRA vs QLoRA 6.5 한국어 모델 파인튜닝 실습 7장 효율적인 sLLM 최적화 기법 7.1 모델 최적화 개요 __7.1.1 왜 최적화가 필요한가? __7.1.2 어떻게 최적화할 것인가? 7.2 모델 압축 기법 __7.2.1 가지치기 __7.2.2 양자화 __7.2.3 가지치기 vs 양자화 __7.2.4 지식 증류 7.3 추론 최적화 기법 __7.3.1 배치 처리 __7.3.2 키-값 캐시 __7.3.3 플래시 어텐션 7.4 GPU 비용 절감 전략 __7.4.1 메모리 최적화 기법 __7.4.2 분산 학습 기초 __7.4.3 클라우드 GPU 비용 관리 __7.4.4 실용적 대안 7.5 정리 및 실전 가이드 __7.5.1 최적화 기법 선택하기 __7.5.2 단계별 최적화 로드맵 __7.5.3 상황별 체크리스트 8장 sLLM 모델의 서비스 적용 8.1 API 배포 __8.1.1 FastAPI 서비스 구축하기 __8.1.2 FastAPI 서비스 실습 __8.1.3 허깅페이스 Inference API 활용하기 __8.1.4 허깅페이스 Inference API 실습 8.2 Gradio로 웹 인터페이스 만들기 8.3 클라우드 환경에 배포하기 __8.3.1 허깅페이스 Spaces 생성하기 __8.3.2 배포용 파일 저장 __8.3.3 허깅페이스 Spaces 업로드하기 __8.3.4 코드로 허깅페이스 Spaces 배포하기 9장 sLLM 기반 서비스 구축 9.1 챗봇, 문서 요약, AI 어시스턴트 만들기 __9.1.1 개발 환경 준비하기 __9.1.2 간단한 챗봇 만들기 __9.1.3 문서 요약 서비스 만들기 __9.1.4 RAG 기반 AI 어시스턴트 만들기 __9.1.5 문서 관리 인터페이스 9.2 프로젝트에 오픈 소스 활용하기 __9.2.1 랭체인 __9.2.2 랭체인 실습 __9.2.3 라마인덱스 __9.2.4 라마인덱스 실습: 문서 인덱싱과 쿼리 엔진 10장 실무에서 발생하는 문제 해결 10.1 데이터 부족 문제 해결법 __10.1.1 데이터 부족 문제의 이해 __10.1.2 데이터 증강 기법 __10.1.3 효율적인 학습 전략 __10.1.4 외부 데이터 소스 활용 10.2 모델 출력 품질 향상 기법 __10.2.1 출력 품질 평가 체계 __10.2.2 하이퍼파라미터 튜닝 __10.2.3 출력 품질 개선 기법 __10.2.4 일반적인 품질 문제 해결 10.3 윤리적 이슈와 보안 고려 사항 __10.3.1 데이터 윤리와 프라이버시 __10.3.2 모델 보안 및 악용 방지 __10.3.3 책임 있는 AI 배포 |
|
책의 흐름
책은 sLLM에 따라 기본 개념에서 시작해, 실제로 모델을 가져와 쓰고, 다듬고, 서비스로 띄우는 과정까지 천천히 따라갑니다. 전반부에서는 LLM과 sLLM이 어떻게 다른지, 어떤 모델들이 있는지를 살펴봅니다. LLaMA, Gemma, 클로드처럼 요즘 자주 들리는 이름을 정리하고, 국내 sLLM 생태계가 지금 어떤 모습으로 굴러가는지도 함께 살펴봅니다. 중반부에서는 본격적으로 모델을 다뤄 봅니다. 허깅페이스에서 모델을 불러오고, 양자화로 가볍게 만들고, LoRA, QLoRA 같은 경량 파인튜닝으로 내 데이터에 맞게 조정하는 과정을 코드와 함께 익힙니다. 코랩의 제한된 자원 안에서 돌아가는 방법에 특히 신경을 썼습니다. 후반부에서는 파인튜닝한 모델을 실제 서비스로 만드는 방법을 기술하고 있습니다. FastAPI로 인 터페이스를 만들고, Gradio로 웹 화면을 붙이며, 허깅페이스 스페이스나 ngrok으로 외부에 공개하는 흐름을 단계별로 따라갈 수 있도록 정리했습니다. 각 장의 코드는 모두 구글 코랩에서 그대로 돌아가도록 다듬었고, 한국어에 잘 맞는 모델들을 우선 사용했습니다. 누구를 위한 책인가 이 책은 AI를 처음 시작하는 분을 가장 먼저 떠올리며 썼습니다. 파이썬을 조금 다뤄 봤고, sLLM이라는 단어를 어디선가 들어 봤지만 어디서부터 시작해야 할지 막막한 분들입니다. 그래서 모든 개념은 처음 듣는 사람의 입장에서 풀어 썼고, 어려운 수식 대신 코드와 그림으로 설명했습니다. AI를 전공하는 대학생에게도 좋은 실습서가 되리라 생각합니다. 강의에서 배운 이론을 실제로 돌려 보고 싶을 때 또는 졸업 프로젝트 주제를 찾고 있을 때 펼쳐보면 좋겠습니다. 현업 개발자에게도 도움이 되기를 바랍니다. API 비용 부담 없이 자기 서비스에 LLM을 붙여 보고 싶거나, 사내 환경 때문에 외부 API를 쓰기 어려운 상황이라면 sLLM은 좋은 선택지가 됩니다. 다만 GPT 같은 거대 모델을 처음부터 학습시키는 방법은 이 책에서 다루지 않습니다. 이 책은 이미 공개된 좋은 모델을 기반으로 내 손으로 다듬어 쓰는 길을 안내합니다. 이 책을 읽을 때 처음부터 차례로 읽어도 좋고, 필요한 장부터 펼쳐도 됩니다. 허깅페이스 사용법을 다루는 장은 이후 모든 실습의 바탕이 되니, 코드를 직접 돌려 보실 생각이라면 먼저 읽어 보기를 권합니다. 가능하면 책을 읽는 동안 코랩 창을 하나 함께 열어 두면 좋겠습니다. 눈으로 읽는 것과 손으로 직접 돌려 보는 것은 정말 다른 경험입니다. 잘 안 돌아가는 코드가 있어도 너무 마음 쓰지 말고, 본문에 적어 둔 단서들을 따라가 보면서 스스로 해결해 보는 감각도 함께 가져갔으면 합니다. ---「들어가며」중에서 |
|
가볍고 안전하게 시작하는 최고의 맞춤형 AI!
작아서 더 똑똑한 sLLM! sLLM은 LLM이 가진 높은 연산 비용과 실시간 응답성 문제를 해결하고, 특정 도메인에 최적화된 결과를 제공하는 효율적인 솔루션입니다. 범용 지식에 초점이 맞춰진 LLM과 달리, sLLM은 기업 내부 시스템에 적용하여 데이터 보안을 강화하면서도 조직에 꼭 필요한 정보를 중심으로 학습할 수 있습니다. 이 책은 sLLM을 내 손으로 직접 만들고 최적화하는 과정을 안내하는 sLLM 실습서입니다. 이미 공개된 LLaMA, Gemma, Phi 등의 오픈소스 모델을 기반으로 나만의 데이터를 주입하는 경량 파인튜닝(LoRA, QLoRA) 기술부터 메모리 부담을 덜어주는 경량화 최적화 기법까지 폭넓게 다룹니다. 특히 구글 코랩 환경에서 실행되는 실전 예제와 한국어 도메인에 최적화된 모델들을 중심으로 구성해 활용도를 극대화했습니다. 나아가 완성된 모델에 실용적인 웹 화면을 결합하고, 이를 즉시 배포하여 실제 작동하는 완성도 높은 엔드투엔드(End-to-End) 서비스를 직접 구축해 볼 수 있습니다. 복잡한 수식 대신 직관적인 도해와 실전 코드로, AI 입문자부터 현업 개발자까지 나만의 AI를 구축하고 배포하는 전 과정을 실습하며 실무 역량을 키울 수 있습니다. |
|
AI 기술이 빠르게 발전하는 시대에 우리가 진정으로 주목해야 할 것은 모델의 크기가 아니라, ‘얼마나 내 삶과 업무에 유용한가’입니다. 거대하고 무거운 인공지능이 주를 이루는 트렌드 가운데, 이 책은 우리 삶과 일터에 쏙 들어오는 ‘작고 똑똑한 맞춤형 AI’, 즉 sLLM(소형 언어 모델)의 세계로 독자들을 초대합니다. 이 책은 sLLM의 핵심 개념부터 실무 적용법까지 체계적으로 엮어낸 완성도 높은 지침서입니다. 저자의 깊은 통찰이 담긴 명확한 설명과 다채로운 실제 활용 사례는 독자들에게 “아, AI를 이렇게 내 데이터에 맞춰 직접 활용하면 되는구나!” 하는 해답을 제시합니다. 이론에만 그치지 않고 현업에서 바로 쓸 수 있는 실용적인 관점까지 촘촘하게 담아낸 점이 매우 인상적입니다. 빠르게 변화하는 AI 흐름 속에서 나만의 단단한 경쟁력을 갖추고 싶은 학생, 교육의 미래를 고민하는 교사, 연구자, 그리고 새로운 기술을 비즈니스에 접목하려는 모든 이들에게 이 책을 기쁜 마음으로 추천합니다. 이 책이 독자들이 sLLM을 더욱 가깝고 친숙하게 만나는 소중한 출발점이 되기를 기대합니다. - 고유정 (목원대학교 SW교양학부 교수)
|
|
기술서에는 두 종류가 있습니다. 무엇을 할 수 있는지를 보여주는 책과 무엇을 책임져야 하는지를 가르치는 책. 이 책은 후자에 속합니다. sLLM은 단순히 작은 모델이 아닙니다. 우리 도메인의 데이터로 만들었기에 결과를 우리가 책임져야 하고, 우리 인프라 위에서 운영하므로 관리 부담과 비용을 우리가 떠안아야 하며, 외부 대형 모델이 보장해주던 안전망까지 우리 손으로 직접 짜야 합니다. 저자는 그 무게를 피하지 않습니다. 책임의 무게가 가장 큰 의료 도메인에서 출발해, 모델을 직접 손에 올리는 실습, 도메인에 맞추는 파인튜닝, 메모리를 원본의 1/10까지 압축하는 경량화, 그리고 마지막 출력 한 줄까지 다단계 필터로 닫는 안전장치까지, sLLM의 한 사이클을 이루는 모든 단계를 한 권에 정직하게 정리했습니다. LLM의 시대가 ‘거대한 모델을 잘 호출하는 시대’였다면, sLLM의 시대는 ‘내 모델을 끝까지 책임지는 시대’입니다. 그 길 위에 선 모든 엔지니어와 의사결정자에게 이 책을 권합니다. - 박문희 (카카오엔터 기술재무기획 리더)
|
|
생성형 AI의 폭발적인 성장 이후, 시장의 관심은 거대 모델의 경량화와 효율화를 뜻하는 sLLM으로 빠르게 이동하고 있습니다. 이제 기업의 생존과 차별화는 sLLM을 어떻게 비즈니스에 최적화하느냐에 달려 있습니다. 하지만 급변하는 기술 트렌드 속에서 이론과 실무를 동시에 잡아주는 가이드북을 찾기란 결코 쉽지 않았습니다. 이 책은 대형 모델과 sLLM의 개념 차이부터 최신 시장 동향까지 기술의 거대한 흐름을 한눈에 파악할 수 있도록 돕습니다. 특히 단순히 ‘아는 것’에 그치지 않고 ‘할 수 있게’ 만든다는 점이 이 책의 가장 큰 미덕입니다. 인프라 구축과 파인튜닝, 최적화 기법은 물론이고, 엔지니어들이 가장 갈증을 느끼는 실제 프로덕션 환경으로의 모델 배포와 RAG 시스템 같은 핵심 AI 애플리케이션 구현까지 막힘없이 연결됩니다. 저자의 치열한 고민이 담긴 상세한 설명과 풍부한 실무 코드 예시들은 독자들이 현업에서 겪을 시행착오를 극적으로 줄여 줄 강력한 무기가 될 것입니다. sLLM의 최신 트렌드를 파악하고 싶은 기획자부터, 내 손으로 직접 모델을 배포하고 엔드투엔드(End-to-End) 서비스를 완성해야 하는 개발자까지, sLLM이라는 거대한 파도 위에서 완벽한 방향을 잡고 싶은 모든 이들에게 이 책을 기쁜 마음으로 추천합니다. - 배재현 (코웨이)
|
|
현업에서 데이터 사이언티스트이자 FDE(Forward Deployed Engineer)로 다양한 AI 프로젝트를 수행하다 보면, AI 모델을 활용해 서비스를 개발하는 것과 실제 사용자가 만족하는 서비스로 완성하는 것 사이에는 생각보다 큰 간극이 있음을 실감하곤 합니다. 특히 RAG 기반 지식 시스템 구축이나 도메인 맞춤형 LLM 서비스 개발 과정에서는 수많은 선택과 판단이 필요합니다. 어떤 데이터로 파인튜닝할 것인지, 제한된 자원 환경에서 어떤 경량화 기법을 선택할 것인지, 추론 성능과 응답 품질 사이의 균형을 어떻게 맞출 것인지와 같은 결정들이 결국 서비스의 완성도를 좌우하기 때문입니다. 이 책은 AI 서비스를 개발하며 마주하게 되는 이러한 고민들에 체계적인 해답을 제시합니다. 트랜스포머 아키텍처의 핵심 원리를 이해하는 것에서 출발해 허깅페이스 기반 모델 활용, 랭체인과 라마인덱스를 이용한 RAG 시스템 구축, OpenAI API와 LoRA·QLoRA를 활용한 효율적인 파인튜닝, 그리고 가지치기와 양자화를 통한 모델 최적화까지 서비스 개발의 전 과정을 단계적으로 안내합니다. 특히 기술을 단순히 소개하는 데 그치지 않고, FastAPI 기반 배포, Gradio 인터페이스 구축, ChromaDB와 Sentence-Transformers를 활용한 RAG 기반 AI 어시스턴트 개발까지 하나의 완성된 서비스 파이프라인을 직접 구현하며 각 기술이 실제 서비스에서 어떻게 연결되는지 이해할 수 있도록 구성되어 있습니다. 이 책의 목적은 단순히 ‘이 코드를 어떻게 사용하는가’를 알려주는 데 있지 않습니다. 각각의 기술이 왜 필요한지, 어떤 상황에서 선택해야 하는지, 실제 서비스에서 어떻게 연결되는지를 유기적으로 이해하도록 돕습니다. 덕분에 독자는 예제 코드를 단순히 따라 하는 수준을 넘어, sLLM 시스템의 구조와 동작 원리를 파악하고 스스로 판단할 수 있는 엔지니어로 성장할 수 있습니다. AI 서비스를 직접 구축하고 운영해야 하는 개발자와 프로젝트를 주도하는 실무자들은 물론, ‘어떻게든 돌아가는 코드’를 만드는 수준을 넘어 ‘왜 이렇게 동작하는지 이해하고 설명할 수 있는 엔지니어’로 성장하고 싶은 모든 분께 강력히 추천합니다. - 천지은 ((주)대림 IT운영전략팀 파트리더)
|