← 갤러리로 돌아가기

📐 AI 결과를 검증하는 법(평가·관측)이란?

그럴듯해 보이는 답이 항상 정확한 답은 아니에요 — 그래서 "평가 셋"으로 미리 점검해요
💡 "평가 셋 실행하기"를 눌러보세요. 같은 업무를 서로 다른 프롬프트 2개로 시켰을 때, 정답률이 얼마나 달라지는지 비교해드려요.
업무: 고객 문의 이메일을 "환불 / 배송 / 기타" 3가지로 자동 분류하기 — 테스트 질문 3개로 미리 점검
개선 전 프롬프트
"이 이메일을 환불/배송/기타 중 하나로 분류해줘"
-
개선 후 프롬프트
"이 이메일을 환불/배송/기타 중 하나로 분류해줘. '환불'은 결제 취소·반품 요청, '배송'은 배송 지연·오배송만 해당하고, 둘 다 아니면 '기타'로 분류해. 분류 이유도 한 줄로 적어줘."
-

💬 한 줄 정리

평가(evaluation)는 "이 프롬프트(또는 내가 만든 GPTs·스킬)가 실제로 잘 작동하는가"를, 감으로 판단하지 않고 정답을 미리 알고 있는 테스트 질문 여러 개(평가 셋)로 직접 확인하는 방법이에요. 한두 번 써보고 "결과가 그럴듯하니 잘 되네"라고 넘어가면, 애매한 케이스에서 조용히 틀리고 있는 걸 놓치기 쉬워요. 프롬프트를 수정할 때마다 같은 평가 셋을 다시 돌려보면, "이번 수정이 정말 나아졌는지"를 숫자로 확인할 수 있어요 — 특히 애매하거나 예외적인 케이스일수록 이 점검이 중요해요.

🧾 이 페이지, 이런 프롬프트로 만들었어요

아래 프롬프트를 복사해서 Claude·ChatGPT(GPT)·Gemini 어디에든 붙여넣고 직접 시도해보세요. 참고로 이건 예시 없이 지시만 담은 제로샷(zero-shot) 프롬프트예요 — 원하는 결과물의 예시를 1개 넣으면 원샷(one-shot), 여러 개 넣으면 퓨샷(few-shot) 프롬프팅이 되는데, 예시를 더할수록 결과가 원하는 스타일에 더 가까워지는 경우가 많아요.

"AI 결과를 검증하는 법(평가 셋)" 개념을 체험시켜주는 단일 HTML 페이지를 만들어줘.

- "이메일을 환불/배송/기타로 분류하기" 업무 하나를 예시로 정하고
- "개선 전 프롬프트"와 "개선 후 프롬프트"(분류 기준을 구체적으로 명시한 버전) 2개를 나란히 배치
- "평가 셋 실행하기" 버튼을 누르면, 미리 정한 테스트 질문 3개에 대해
  각 프롬프트가 맞았는지(✓) 틀렸는지(✕)를 순서대로 하나씩 나타나게 하고
  마지막에 정답률(예: 1/3 vs 3/3)을 크게 표시해줘
- 마지막에 "평가 셋"이 무엇인지, 왜 감으로 판단하면 안 되는지 한 문단으로 설명해줘
- CSS·JS 전부 인라인으로 넣은 단일 HTML 파일로, 한국어로 출력해줘
이 페이지는 AI(Claude)가 만든 예시 자료입니다 — 강의 데모용 · 모든 점수는 예시를 위한 가상의 값입니다