개발/용어 사전

Guardrail이란? AI 답변을 제한하고 보호하는 장치

cedis 2026. 6. 12. 02:11
AI 응용 기술 용어 정리

Guardrail은 AI가 아무 말이나 하지 않도록 입력과 출력을 검사하고 제한하는 안전장치입니다.

핵심 요약

RAG를 붙였다고 답변이 항상 안전해지는 것은 아닙니다. 검색 결과를 무시하거나, 근거 없는 내용을 덧붙이거나, 민감한 정보를 노출할 수 있기 때문에 guardrail이 필요합니다.

  • Guardrail
  • Grounding
  • Hallucination
  • 근거 없는 생성 방지
  • 유사 문서 없음 처리

1. 한 줄로 정의하면

Guardrail은 AI 애플리케이션에서 허용하지 않을 입력, 출력, 주제, 민감정보, 근거 없는 답변 등을 제한하기 위한 정책과 검사 장치입니다.

Grounding
답변을 제공된 근거에 묶어두는 설계입니다.
Hallucination
모델이 근거 없이 그럴듯한 내용을 만들어내는 현상입니다.
Denied Topic
서비스 정책상 다루지 않기로 한 주제입니다.
Contextual Grounding
답변이 검색된 자료와 맞는지 확인하는 관점입니다.

2. 왜 이 개념이 필요했나

지식베이스형 서비스에서 AI 작성 기능을 만들면, 모델은 사용자의 요청에 맞춰 그럴듯한 콘텐츠를 만들어냅니다. 문제는 그 문서가 실제 저장된 근거와 맞지 않을 수 있다는 점입니다.

Guardrail은 이런 위험을 줄이는 장치입니다. AWS Bedrock Guardrails 문서에서도 harmful content, sensitive information, contextual grounding 같은 필터를 제공합니다.

직접 구현 단계에서도 완전한 managed guardrail은 아니더라도 references 표시, 유사도 threshold, 유사 문서 없음 처리, 원문 과다 의존 경고 같은 정책을 넣을 수 있습니다.

3. 동작 흐름

1
입력 검사
사용자 요청이 허용 범위 안인지 확인합니다.
2
검색 근거 확인
RAG 검색 결과가 충분히 있는지, threshold를 넘는지 봅니다.
3
생성 제한
근거 없는 내용은 만들지 말라고 프롬프트와 후처리로 제한합니다.
4
출력 표시
references, warnings, 유사 문서 없음 메시지를 함께 보여줍니다.

4. 구조를 그림처럼 보면

순서 흐름
1
사용자 요청 입력
2
입력 정책 검사
금지 주제, 민감정보, 권한 범위 확인
3
RAG 검색 결과 검사
threshold와 references 확인
4
출력 정책 검사
근거 없는 단정, 원문 과다 의존, 민감정보 노출 차단
5
답변과 warnings를 함께 반환

5. 서비스 예시로 이해하면

AI 작성 기능에서는 참고 콘텐츠가 없는데도 근거 기반 작성처럼 출력하면 위험합니다. 이때는 '관련 문서를 찾지 못했으므로 일반 작성안만 생성한다'고 표시하거나, 아예 생성 기능을 제한할 수 있습니다.

또한 기존 문서를 너무 그대로 복사하는 것도 문제입니다. references를 보여주되, 답변은 요약과 재구성 중심으로 만들고 warnings를 함께 제공하는 설계가 필요합니다.

if max_similarity < threshold:
    warnings.add("충분히 유사한 콘텐츠를 찾지 못했습니다.")
    references = []
else:
    references = top_k_posts

prompt: references에 없는 사실은 단정하지 말 것

6. 헷갈리기 쉬운 비교

개념목적서비스 적용
Grounding 답변을 근거에 묶음 참고 콘텐츠 기반 작성안
Guardrail 위험한 입력/출력을 제한 민감정보, 욕설, 근거 없는 생성 차단
Source Citation 근거를 사용자에게 표시 references로 기존 문서 링크 제공

7. 실무에서 조심할 점

  • 프롬프트에 '거짓말하지 마'라고 쓰는 것만으로 guardrail이 완성되지는 않습니다.
  • threshold가 너무 낮으면 관련 없는 문서를 근거로 삼을 수 있습니다.
  • 원문 과다 의존 방지와 근거 표시 사이의 균형이 필요합니다.

8. 구현할 때 먼저 볼 코드 책임

Guardrail은 모델에게 주의하라고 말하는 프롬프트 하나로 끝나지 않습니다. 서버 코드에서 입력 검사, 검색 결과 검사, 출력 검사 책임을 분리해야 합니다.

특히 RAG에서는 references가 없을 때와 references가 낮은 유사도일 때의 응답 정책을 먼저 정해야 합니다.

GuardrailPolicy
  - minSimilarity
  - maxReferenceLength
  - forbiddenTopics
  - sensitiveInfoPatterns

RagAnswerGuard
  - references 비어 있음 검사
  - max_similarity threshold 검사
  - 원문 과다 의존 경고
  - warnings 배열 반환

이번 글에서 기억할 것

  • Guardrail은 AI 답변의 안전 범위를 정하는 장치입니다.
  • Grounding은 답변을 근거 자료에 묶어두는 설계입니다.
  • RAG에서도 유사 문서 없음 처리와 references 표시가 중요합니다.

스스로 점검

  • Guardrail과 Grounding의 차이를 설명할 수 있는가?
  • 유사도 threshold가 너무 낮으면 어떤 문제가 생기는가?
  • AI 작성 기능에서 warnings가 필요한 이유를 말할 수 있는가?

참고한 공식 문서