이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
머리말QA의 변화와 새로운 성장 기회QA 커리어는 어디로 향하는가베타 리뷰어의 한마디: 첫 독자가 전하는 말이 책이 전하려는 것독자에게 드리는 부탁Chapter 1. AI 시대, 소프트웨어의 품질 기준은 왜 달라져야 하는가_1.1 AI 이전의 프로젝트에서 QA는?_1.2 AI 프로젝트 초기, QA가 마주한 혼란의 기록__우리가 품질에서 놓친 것들: AI 프로젝트 초반, 불안정했던 QA 현실_1.3 더 이상 늦게 들어가선 안 된다: Shift-Left Testing__Shift-Left Testing__Shift-Left Testing의 실전 적용: “우리가 바꾼 프로세스”_1.4 새로운 기술에는 새로운 품질 기준이 필요하다.__Responsible AI Frameworks__ISO/IEC 42001: AI 관리 체계 전반의 품질 통제 기준__TTA의 인공지능 신뢰성 인증__Responsible AI를 위한 새로운 AI 테스트 기준, RaiT_1.5 마무리하며: AI 시대 요즘 QA에 대하여Chapter 2. AI 에이전트를 이해하면 테스트가 쉬워집니다_2.1 AI 모델의 개념과 생성 방식 이해__AI 모델의 기본 개념__AI 모델의 분류 방식_2.2 AI 모델 최적화 기술__프롬프트 튜닝(Prompt-Tuning)__파인 튜닝(Fine-tuning) 모델__RAG(Retrieval-Augmented Generation)__모델 증류 (Model Distillation)_2.3 AI 에이전트 테스트 포인트__무한 응답의 혼돈: 예측 불가성과 환각(hallucination)__데이터 중독과 편향(Bias) - 사회적 편견이 응답으로 나타나는 경우__문맥의 미로 - 컨텍스트 누락, 왜곡, 충돌__기술 종속의 덫 - 모델과 프롬프트 의존성(lock-in)_2.4 AI 에이전트 유형별 구조__AI 에이전트 주요 구성 요소__정확한 명령을 처리하는 Function Agent__문맥을 기억하는 Agentic Agent__말을 걸지 않아도 먼저 도와주는 Promptless Agent_2.5 마무리하며: AI Agent 이해가 시작입니다.Chapter 3. AI Agent 품질을 측정하는 프레임워크_3.1 Responsible AI Agent Test (RaiT)__RaiT 테스트 방법론__RaiT 테스트 프로세스__RaiT 테스트 도구_3.2 RaiT 품질지표__문맥연결성 (Contextual Relevance, 관련성)__의도해석성 (Intent Interpretation, 이해도)__신뢰안전성 (Trust & Safety, 안전성)__표현적절성 (Linguistic Appropriateness, 표현성)__정보정확성 (Factual Correctness, 정확성)__목표충족성 (Task Effectiveness, 적합성)__반응안정성 (Response Stability, 일관성)__지속적응성 (Continuity & Adaptivity, 지속성)3.3 RaiT 평가 기준점__품질 기준점 영향 요소__품질 기준점 정책_3.4 마무리하며: RaiT는 AI Agent 품질의 새로운 기준Chapter 4. AI Agent 테스트 설계 실전_4.1 RaiT 테스트 플랜 프로세스__품질 지표 평가 및 선택__품질 Criteria 정의__답변 기준 설정_4.2 RaiT 테스트 케이스 도출__테스트 케이스 종류와 품질 지표__질문 생성 프롬프팅__컨텐츠 추가_4.3 RaiT 테스트 실행 프로세스__매뉴얼 검증: AI 모델 품질 향상을 위한 필수적인 사람 중심 평가__자동 테스트__이슈 등록 및 관리__결과 보고_4.4 마무리하며: 같은듯 다른 테스트 프로세스Chapter 5. 모델의 평가는 이제 모델에게 : 프롬프트와 모델로 평가 자동화하기_5.1. '정답'이 없는 시대의 테스터를 위한 자동화 안내서__초기 계획 수립의 어려움__LLM 평가방식 자동화에 대한 고민__자동화 구현 방식의 고민__자동화 프롬프트의 중요성_5.2 Rubric 기반 Judge Prompt 설계__무엇이 좋은 Judge 프롬프트를 만드는가?__Judge 프롬프트의 5가지 핵심 구성요소__단계별 루브릭 상세화: 점수에 의미 부여하기__실전! Judge 프롬프트 템플릿 작성하기__살아있는 프롬프트로 발전시키기_5.3 Few-shot 기반 Judge Prompt 설계__제로샷(Zero-shot)의 한계를 넘어: 왜 Few-shot이 필요한가?__효과적인 Few-shot 예시(Exemplar)의 조건__실전! Few-shot Judge 프롬프트 템플릿 작성하기__퓨샷 프롬프팅의 장점과 주의사항_5.4 AI의 오답노트와 모범답안: 감점/긍정 피드백 활용법__기본 평가의 한계와 2단계 평가의 필요성__실전! 2단계 평가 프롬프트 작성 예시__평가에서 학습으로: 피드백 루프의 완성__감점 피드백: 실패에서 배우는 수정된 모범 답안 생성__긍정 피드백: 성공에서 배우는 행동 원칙 추출__결론: 평가와 학습의 선순환_5.5 평가 모델 기반 판정 (BERTScore, Classifier)__BERTScore: 정답과 의미가 얼마나 비슷한가? 의미 유사도 측정__Classifier(분류기): 이 답변은 합격인가, 불합격인가? - 품질 기준 평가_5.6 A/B Test와 신뢰도 확보 방법__A/B 테스트의 핵심 원리__오프라인 A/B 테스트: BERTScore를 활용한 자동화된 성능 비교__온라인 A/B 테스트: 실제 사용자를 통한 최종 검증_5.7 마무리하며: AI 평가 시스템, 살아있는 유기체로 만들기Chapter 6. 품질은 반복에서 만들어집니다 - 자동화와 적용 사례_6.1 실무 QA 환경에서의 자동화 전략과 성공 포인트__실무 성공을 위한 5가지 자동화 전략_6.2 평가 자동화 구조 설계: 입력 〉 실행 〉 판정 〉 리포트__1단계: 입력 (Input) - 자동화의 재료를 준비하는 단계__2단계: 실행 (Execution) - 평가를 수행하는 엔진__3단계: 판정 (Judgment) - 품질을 측정하고 점수를 매기는 단계__4단계: 리포트 (Report) - 결과를 분석하고 공유하는 단계__평가 테스트 자동화 구조 다이어그램_6.3 LLM 평가 자동화 구현__LLM 평가 자동화 실습 환경 준비하기__Postman으로 빠르게 사전 검증하기__LLM 평가 자동화 구현하기__최종 실행 결과_6.4 지속 가능한 자동화 운영: 프롬프트, 데이터, 보안, 비용 관리__체계적인 프롬프트 관리 전략: 프롬프트를 '코드'처럼 다루기__살아있는 테스트 케이스 관리 전략: '골든셋'의 진화__가장 중요한 자산: API 키 보안과 관리__비용 최적화: 토큰(Token) 사용량 완벽하게 이해하고 관리하기_6.5 LLM 평가 자동화 현업 실무 적용 사례 (RaiT Tool)__사례1 모두를 위한 LLM 테스팅 도구 - RaiT Client)__사례2 API 기반 평가 플랫폼 - RaiT Web__사례3 Jenkins를 활용한 온디맨드(On-Demand) 평가 - RaiT CI_6.6 평가 결과 분석 및 활용 전략__평가 결과 분석 및 후속 조치 프로세스__리소스 효율화: '선택과 집중' 전략_6.7 마무리하며: 자동화 도입 시 고려할 점과 유지 테스트__1. 자동화 도입 전, 반드시 답해야 할 3가지 질문__2. 시스템 도입 후: 지속적인 유지보수 전략Chapter 7. 여전히 중요한 성능_7.1 성능의 트레이드오프: 품질, 속도, 그리고 비용_7.2 Time to First Token (TTFT): 사용자가 느끼는 '반응 속도'의 모든 것_7.3 Time to Last Token (TTLT): 사용자가 느끼는 '완성 속도'의 모든 것_7.4 성능 모니터링 리포트 결과와 유관부서 협업_7.5 마무리하며: 속도와 품질, 두 마리 토끼를 잡는 법Appendix A. Test Plan Checklist_1. 목표 및 범위 정의_2. 품질 지표 및 기준 설정_3. 테스트 케이스 설계_4. 테스트 수행 전략_5. 이슈 관리 및 결과 보고_6. 자원 및 일정 계획Appendix B. 테스트 결과 보고서 템플릿_1. 개요_2. 테스트 목표 및 범위_3. 테스트 방법론_4. 품질 지표별 품질 기준점_5. 테스트 결과 요약_6. 품질 지표별 상세 분석__6.1. 안전성__6.2. 정확성__6.3. 일관성__6.4. 지속성_7. 결론 및 권고 사항_8. 첨부 자료
|
|
정답 없는 AI 시대, 품질을 감이 아닌 ‘검증 가능한 과정’으로 증명하는 실무 가이드AI 에이전트가 제품의 핵심 기능이 되면서, 테스트는 더 이상 “기능이 동작하나?”만 확인하는 일이 아니게 됐습니다. 같은 질문에도 답이 달라지고, 맥락에 따라 결과가 흔들리며, 무엇보다 재현이 어려운 오류가 늘어납니다. 그리고 어느날 팀은 말합니다.“어제는 PASS였는데 오늘은 FAIL”입니다.원인을 설명하지 못한 채 땜질과 핫픽스를 반복하는 상황 앞에서, 이 책은 바로 그 혼란을 출발점으로 삼아 시작합니다.정답이 없는 AI 시대에 품질을 감이 아니라 원칙과 절차로 다루는 방법을 실무 흐름으로 정리합니다.특히 이 책의 강점은 “평가”를 말로만 다루지 않는다는 점입니다. 개발이 끝난 뒤에 검증을 덧붙이는 방식에서 벗어나, Shift-Left Testing 관점으로 기획·설계 단계부터 품질 목표와 검증 흐름을 함께 설계하도록 안내합니다. 이어서 **Responsible AI Testing 프레임워크(RaiT)**로 ‘좋은 답변’을 항목화해 팀이 합의할 수 있는 형태로 바꾸고, 누구나 납득할 수 있는 판단 체계로 연결합니다. “정확도만 보면 된다”는 단순한 접근을 넘어, 의도 이해, 안전성, 표현의 적절성, 일관성처럼 실제 서비스에서 문제를 만드는 지점을 품질 요소로 정리해, 평가가 사람마다 달라지는 위험을 줄입니다.또한 이 책은 평가를 ‘한 번’ 해보는 수준에서 멈추지 않고, 반복 가능한 운영 방식으로 완성합니다. Judge 프롬프트를 통해 평가를 자동화하고, 릴리스마다 기준이 흔들리지 않도록 리그레션 운영 루프로 연결합니다. 테스트 준비부터 실행, 결과 정리와 공유까지를 하나의 흐름으로 표준화해, 팀이 커지거나 담당자가 바뀌어도 품질 판단이 무너지지 않게 설계한 점이 인상적입니다.마지막으로 “품질이 좋아도 느리면 실패한다”는 현실을 놓치지 않습니다. 사용자 체감 속도를 보여주는 TTFT/TTLT 관점을 함께 제시해, 답변의 내용뿐 아니라 반응 속도와 완성 속도까지 품질 관리 범위로 끌어옵니다. 그리고 이 모든 내용을 현업에서 바로 적용할 수 있도록 체크리스트와 보고서 템플릿까지 제공해, 독자가 “읽고 끝”이 아니라 “내일 바로 적용”할 수 있게 구성했습니다. QA와 개발자가 같은 언어로 품질을 합의하고, 흔들리는 결과를 운영 가능한 품질 체계로 바꾸고 싶다면 이 책은 현실적인 출발점이 될 것입니다.이런 분께 추천합니다!QA/QE“어제 PASS, 오늘 FAIL”처럼 흔들리는 AI 서비스 품질을 기준과 운영 루프로 정리하고 싶은 분수동 확인에 지치지 않고, 반복 가능한 평가·리그레션 체계를 만들고 싶은 분개발자/테크리드QA팀이 없거나 리소스가 부족해도, 팀이 함께 돌릴 수 있는 품질 검증 방식이 필요한 분릴리스마다 품질 이슈를 땜질하는 대신, 자동 평가(Judge 프롬프트) 기반 운영으로 전환하고 싶은 분PM/기획자“좋은 답변”을 말로만 합의하지 않고, 팀이 납득할 품질 기준과 판단 방식을 세우고 싶은 분릴리스마다 품질 목표와 사용자 경험(정확도·안전·일관성·속도)을 한 흐름으로 관리하고 싶은 분AI/데이터·서비스 운영 담당자모델·프롬프트 변경이 잦은 환경에서, 변경 전후 품질을 일관되게 비교·추적하고 싶은 분결과 리포트와 지표를 기반으로 품질을 ‘운영’하는 체계가 필요한 분-이 책의 구성-이 책은 독자의 이해를 돕기 위해 가상의 검색 서비스 기업 ‘펜 서치(PEN Search Inc.)’를 설정했습니다. 실제 기업은 아니지만, AI 검색 서비스를 개발·운영하는 과정에서 발생할 수 있는 문제를 보다 구체적으로 설명하기 위한 사례로 활용됩니다. 펜 서치는 처음에는 키워드 기반 검색 서비스를 운영하다가, 차세대 플랫폼 ‘넥스트 서치(Next Search)’로 전환하는 과정을 겪습니다. 이 과정에서 단순한 검색 기능을 넘어, 사용자의 의도와 맥락을 이해하고 답변을 제공하는 AI 에이전트를 도입합니다.이러한 설정을 통해 독자는 검색 서비스가 어떻게 발전하는지, 그리고 그 과정에서 품질 기준과 테스트 방법론이 어떤 방식으로 적용되는지를 보다 현실적으로 이해할 수 있습니다. 더 나아가 AI 모델·에이전트 시대에 품질의 기준이 어떻게 달라져야 하는지, 그리고 QA가 어떤 방식으로 역량과 커리어를 확장할 수 있는지를 함께 보여주고자 합니다.책은 총 7장으로 구성되어 있습니다.1장은 가상의 AI 프로젝트를 함께 수행하면서 QA가 겪었던 혼란을 돌아보고, Shift-Left전환을 통해 품질을 수행하는 과정을 이야기합니다.2장은 AI 에이전트를 이해하는 것이 왜 테스트의 출발점인지를 설명합니다. 모델 생성 방식과 최적화 기술, 그리고 에이전트 유형별 구조를 소개합니다.3장은 AI 에이전트 테스팅을 위한 Responsible AI Testing, 즉 RaiT 프레임워크를 다룹니다. 8가지 품질 지표로 AI 에이전트를 어떻게 평가할 수 있는지 제시합니다.4장은 실제 프로젝트에 RaiT를 적용하는 방법을 다룹니다. 테스트 플랜 수립부터 케이스 도출, 자동화 적용까지 단계별로 정리했습니다.5장은 “AI 품질 판정은 어떻게 내릴 것인가?”라는 질문을 다룹니다. 단순히 사람이 점수를 매기는 것을 넘어, 프롬프트와 모델을 활용한 평가 자동화 기법을 소개합니다. 자동화 프롬프트 설계와 구현 고민까지 실제 경험을 담았습니다.6장은 “품질은 반복에서 만들어진다”는 관점에서 자동화 사례를 다룹니다. 반복 테스트를 어떻게 효율적으로 구축하고, 어떤 방식으로 적용했는지 보여줍니다.7장은 여전히 중요한 성능 품질을 다룹니다. 기능이나 AI 에이전트 답변 품질만큼이나, 성능이 사용자 경험을 좌우한다는 점을 다시 짚고, 자동화된 성능 테스트 방식을 정리했습니다.-추천사-이 책은 AI 품질 관리 분야의 새로운 접근법인 RaiT(Responsible AI Agent Test) 프레임워크를 제시하며, 급변하는 AI 환경 속에서 현업 개발자와 QA가 직면하는 문제를 명확히 짚어줍니다.특히, 단순히 이론을 나열하고 개념을 소개하는 데 그치지 않고, 구체적인 품질 항목을 기반으로 실무에 바로 적용 가능한 테스트 기준을 제시하고 정량 평가가 가능하도록 설계한 부분이 인상적입니다.또한, OECD, ISO 등 글로벌 기준의 철학을 바탕으로 하면서도, 국내 현장의 특성을 반영한 소프트웨어 품질 모델까지 폭넓게 참고하여 프레임워크의 논리적 근거를 탄탄하게 구축했습니다. 이는 단순히 '해야 한다'고 주장하는 것을 넘어, '왜 이렇게 해야 하는지'에 대한 설득력을 높여줍니다.안효석 | N Tech Service QA 실장이 책은 단순한 테스트 매뉴얼이 아니라, AI 시대를 살아가는 QA의 새로운 역할을 제시하는 책입니다.기존의 QA 프로세스가 AI 프로젝트에서는 통하지 않는 이유를 현실적인 사례로 보여주며, 그 해답으로 RaiT 프레임워크라는 새로운 품질 기준을 제안합니다. 이 책은 QA를 단순한 검증자가 아닌, 기획과 설계 단계부터 품질을 주도하는 Quality Engineer로 그립니다. 또한 Responsible AI와 AI Safety, 윤리·규제 기반 테스트 등 미래 커리어 확장 가능성까지 제시하며, QA에게 “어디로 나아가야 할지”에 대한 명확한 방향을 제시하는 나침반 같은 책입니다.이정현 | LINE PlusAI 시대, ‘잘 만드는 법’만이 아니라 ‘믿고 쓸 수 있게 운영하는 법’까지 알려주는 실전 안내서입니다.현장에서 바로 사용할 수 있는 테스트 설계, 자동화 흐름 등을 알기 쉽게 풀어주고, 실제 사례와 체크리스트로 시행착오를 줄이며, 팀이 같은 기준으로 품질을 논하게 만들어 줍니다. QA뿐 아니라 개발자·기획자 모두가 함께 볼 수 있는, AI 서비스 품질의 친절한 길잡이입니다.박진구 | NAVER Cloud정답 없는 AI의 답변 앞에서 길을 잃은 모든 QA와 개발자를 위한 필독서.저자의 생생한 실무 경험을 바탕으로 프롬프트 설계부터 자동화 파이프라인 구축, 운영 노하우까지의 모든 것을 담았습니다. 또한 QA의 역할을 단순한 '테스터'에서 데이터 기반의 '품질 설계자'로 재정의합니다.무엇보다 실체 없는 이론이 아니라, 실제 동작하는 코드와 템플릿을 통해 독자에게 즉시 적용 가능한 '실행력'을 선물합니다. 책을 덮는 순간, AI 품질 시스템의 전략가가 될 수 있다는 확신을 얻게 될 것 입니다.권윤정 | 잡플래닛
|