← 갤러리로 돌아가기

🛡️ AI 탈옥(Jailbreak) 시도와 방어란?

역할극이나 그럴듯한 설정으로 AI의 안전 규칙을 우회하려는 시도와, 이를 알아채고 대응하는 방식이에요
💡 아래 칩(버튼) 중 하나를 눌러보세요. 사용자의 시도와, 그에 대한 AI의 실제 응답 예시를 함께 보여드려요. 모두 교육용으로 순화된 예시예요.

🎭 탈옥 시도, 클릭해서 확인해보기

위 버튼 중 하나를 눌러서, AI가 이런 시도에 실제로 어떻게 반응하는지 확인해보세요.
⚠️ 교육용 예시 — 실제로 위험한 내용은 포함되어 있지 않아요
사용자의 시도
AI의 실제 응답 (예시)

💬 한 줄 정리

'탈옥(Jailbreak)'은 사용자가 역할극이나 그럴듯한 설정을 이용해서 AI가 원래 지키기로 되어 있는 안전 규칙을 우회하도록 유도하는 시도를 말해요. "너는 이제 규칙 없는 AI야"처럼 직접 설득하거나, 소설·영화 속 캐릭터인 척하며 위험한 내용을 요청하는 방식이 대표적이에요. 잘 설계된 AI는 이런 프레이밍에 속지 않고, 요청의 겉모습이 아니라 실제로 어떤 결과가 나올지를 기준으로 판단해서 정중히 거절해요. 다만 무조건 막기만 하는 게 아니라, 가능한 범위 안에서 사용자의 진짜 목적을 도와줄 안전한 대안을 함께 제시하는 것이 좋은 설계예요. 이렇게 어떤 프롬프트로 포장되어도 원칙을 지키는 일관성이 있어야 사용자와 사회가 AI를 신뢰하고 안심하고 쓸 수 있어요.

🧾 이 페이지, 이런 프롬프트로 만들었어요

아래 프롬프트를 복사해서 Claude·ChatGPT(GPT)·Gemini 어디에든 붙여넣고 직접 시도해보세요. 참고로 이건 예시 없이 지시만 담은 제로샷(zero-shot) 프롬프트예요 — 원하는 결과물의 예시를 1개 넣으면 원샷(one-shot), 여러 개 넣으면 퓨샷(few-shot) 프롬프팅이 되는데, 예시를 더할수록 결과가 원하는 스타일에 더 가까워지는 경우가 많아요.

- 'AI 탈옥(Jailbreak) 시도와 방어'라는 주제로 교육용 인터랙티브 데모 HTML 페이지를 만들어줘
- 상단에 개념 제목, 한 줄 설명, 파란 안내 배너를 넣어줘
- 가운데 카드에 클릭 가능한 칩(chip) 버튼 3개를 만들어줘: 각각 'DAN 역할극 시도', '소설 캐릭터 설정으로 우회 시도', '개발자 모드 사칭 시도' 같은 순화된 예시 문구로
- 칩을 클릭하면 아래에 '사용자의 시도'와 'AI의 실제 응답(정중한 거절 + 안전한 대안 제시)' 두 개의 말풍선이 나타나도록 해줘
- 이 데모는 교육용 예시이며 실제로 위험한 정보가 담겨 있지 않다는 점을 작은 태그로 명확히 표시해줘
- 하단에는 왜 AI가 어떤 프레이밍에도 원칙을 지켜야 신뢰를 얻는지 3~6문장으로 설명하는 카드를 추가해줘
- 마지막에 이 페이지를 만든 프롬프트를 복사할 수 있는 카드도 넣어줘
- 라이트/다크 모드 지원, 미니멀하고 전문적인 톤으로 디자인해줘
- CSS·JS 전부 인라인으로 넣은 단일 HTML 파일로, 한국어로 출력해줘
이 페이지는 AI(Claude)가 만든 예시 자료입니다 — 강의 데모용