Cloud 환경의 AI 방화벽을 활용한 LLM에 대한 프롬프트 인젝션 방어 설계
Designing Prompt Injection Defense for Large Language Models through AI Firewalls in Cloud Environments
- 주제(키워드) Cloud , AI , LLM , 보안 , 설계
- 주제(DDC) 005.8
- 발행기관 아주대학교 정보통신대학원
- 지도교수 예홍진
- 발행년도 2026
- 학위수여년월 2026. 8
- 학위명 석사
- 학과 및 전공 정보통신대학원 사이버보안
- 실제URI http://www.dcollection.net/handler/ajou/000000036618
- 본문언어 한국어
- 저작권 아주대학교 논문은 저작권에 의해 보호받습니다.
초록/요약
대규모 언어모델(Large Language Model, LLM)은 자연어 기반의 질의응답, 문서 요약, 검색 보조, 코드 생성, 업무 자동화 등 다양한 영역에서 빠르게 확산되고 있다. 그러나 LLM은 자연어 입력 자체가 모델의 동작을 변화시킬 수 있다는 구조적 특성으로 인해, 기존 웹 애플리케이션 보안이나 네트워크 보안 체계만으로는 충분히 대응하기 어려운 새로운 공격면을 형성한다. 특히 프롬프트 인젝션(prompt injection)은 사용자의 직접 입력이나 외부 문서, 검색 결과, 첨부파일 등 비신뢰 문맥을 통해 모델의 원래 지시를 우회하거나 변질시키는 대표적인 위협으로 평가된다. OWASP는 이를 생성형 AI 환경의 핵심 위험 항목으로 제시하며, 프롬프트 인젝션이 민감정보 노출, 시스템 프롬프트 유출, 비인가 기능 호출, 중요 의사결정 왜곡으로 이어질 수 있다고 설명한다. 본 논문은 Cloud 환경에서 AI 방화벽을 활용하여 LLM 기반 서비스에 대한 프롬프트 인젝션 공격을 방어하기 위한 관리적·기술적 설계안을 제안하는 것을 목적으로 한다. 이를 위해 우선 LLM과 생성형 AI의 기술적 특성, 프롬프트 인젝션의 공격 유형과 위협 모델, 클라우드 네이티브 보안 원리, AI 방화벽 개념을 이론적으로 정리하였다. 이어서 기존 연구 동향과 산업계의 LLM 보안 프레임워크를 분석하여, 모델 수준 안전성 강화만으로는 실제 엔터프라이즈 환경의 위험을 충분히 통제하기 어렵다는 한계를 도출하였다. 이를 바탕으로 본 논문은 입력 계층, 검색 보호 계층, 정책 제어 계층, 출력 계층, 샌드박스 및 행위 제어 계층, 관제 계층으로 구성된 AI 방화벽 기반 참조 아키텍처를 제안하였다. 입력 계층에서는 정규화와 위험 탐지를 수행하고, 검색 보호 계층에서는 RAG 기반 외부 문맥의 명령성 요소를 분리·검증하며, 정책 제어 계층에서는 IAM 및 최소권한 원칙과 연계된 정책 집행을 수행한다. 출력 계층은 민감정보 유출 방지와 정책 위반 응답 차단을 담당하고, 샌드박스 및 행위 제어 계층은 고위험 도구 호출에 대한 승인 및 격리 실행을 제공한다. 마지막으로 관제 계층은 구조화 로그와 감사 추적성을 바탕으로 사고 대응과 정책 개선을 지원한다. 또한 본 논문은 직접 프롬프트 인젝션, 간접 프롬프트 인젝션, 도구 호출 오남용, 출력 유출, 멀티턴 우회 공격을 포함한 대표 시나리오를 구성하여 제안 아키텍처의 방어 흐름을 정성적으로 평가하였다. 평가 결과, 제안 구조는 공격을 단일 지점에서 완전히 차단하는 방식보다 입력, 문맥, 정책, 출력, 관제의 다중 계층에서 피해를 예방·완화·추적하는 데 유효함을 보였다. 특히 실제 실무 환경에서 중요한 IAM, DLP, SIEM, observability, human approval과의 연계 가능성을 제시함으로써, AI 방화벽을 엔터프라이즈 LLM 서비스의 실질적 보안 통제면으로 활용할 수 있음을 확인하였다. 본 연구는 프롬프트 인젝션을 단순한 입력 필터링 문제가 아니라, Cloud 환경에서의 데이터 흐름, 권한 통제, 외부 문맥 검증, 도구 호출 승인, 감사 가능성을 포함하는 서비스 수준 보안 문제로 재정의하였다는 점에서 의의를 가진다. 또한 AI 방화벽을 중심으로 기존 클라우드 보안 통제와 생성형 AI 보안을 통합하는 참조 아키텍처를 제시함으로써, 실제 조직이 LLM 서비스를 보다 안전하게 도입·운영하기 위한 실무적 기반을 제공한다.
more목차
제1장 서론. 1
1.1 연구 배경 및 필요성. 2
1.2 연구 목적. 3
1.3 연구 범위 및 한계. 4
1.4 연구 방법 및 논문 구성 5
1.5 기대효과 및 연구 의의. 6
제2장 이론적 배경 7
2.1 LLM과 생성형 AI 개요 7
2.1.1 생성형 AI의 개념과 발전 7
2.1.2 LLM의 구조와 동작 원리 8
2.1.3 LLM 서비스의 유형과 활용 방식. 8
2.1.4 LLM의 기술적 한계와 보안적 함의 9
2.2 프롬프트 인젝션과 GenAI 위협 모델. 10
2.2.1 프롬프트 인젝션의 개념 10
2.2.2 프롬프트 인젝션의 유형 10
2.2.3 프롬프트 인젝션의 공격 경로와 영향. 12
2.2.4 GenAI 위협 모델의 특성 12
2.2.5 프롬프트 인젝션 방어 원칙. 13
2.3 클라우드 네이티브 아키텍처와 보안 13
2.3.1 클라우드 네이티브 아키텍처의 개념 13
2.3.2 클라우드 환경에서의 LLM 서비스 구조. 14
2.3.3 Zero Trust와 IAM의 중요성 14
2.3.4 데이터 보호와 관측 가능성. 15
2.3.5 클라우드 네이티브 보안과 LLM 보안의 접점 15
2.4 AI 방화벽 개념 및 기존 솔루션 동향 15
2.4.1 AI 방화벽의 개념. 16
2.4.2 AI 방화벽의 주요 기능 16
2.4.3 기존 솔루션 및 산업 동향 17
2.4.4 AI 방화벽의 한계와 보완 필요성 18
2.5 소결 18
제3장 관련 연구 동향. 19
3.1 LLM 공격·방어 연구 동향. 19
3.1.1 LLM 보안 연구의 확산 배경 19
3.1.2 공격 연구 중심의 문헌 경향 20
3.1.3 방어 연구 중심의 문헌 경향 20
3.2 프롬프트 인젝션 공격 유형 및 벤치마크 연구 21
3.2.1 공격 유형 분류 연구 21
3.2.2 벤치마크와 평가 데이터셋 연구 22
3.2.3 실증 연구와 취약성 평가 결과 22
3.3 LLM 보안 프레임워크 및 표준 동향. 22
3.3.1 OWASP GenAI/LLM 보안 프레임워크. 22
3.3.2 CSA와 클라우드 보안 관점의 연구. 23
3.3.3 NIST 및 일반적 위험관리 프레임워크와의 연계. 23
3.4 LLM 방화벽·AI 게이트웨이 솔루션 동향 24
3.4.1 AI 방화벽 개념의 부상 24
3.4.2 산업계가 제시하는 기능적 구조 24
3.4.3 솔루션 동향의 한계 25
3.5 기존 연구의 한계와 본 논문의 차별성 25
3.6 소결 26
제4장 Cloud 환경의 AI 방화벽 기반 LLM 프롬프트 인젝션 방어 아키텍처 27
4.1 설계 원칙 및 요구사항 정의 27
4.1.1 설계 목표 27
4.1.2 설계 요구사항 28
4.1.3 설계 원칙 28
4.2 위협 모델링 및 보호 대상 정의. 29
4.2.1 보호 대상 자산. 29
4.2.2 공격자 및 위협 시나리오. 29
4.2.3 신뢰 경계와 공격 표면. 30
4.3 제안 아키텍처 개요 30
4.3.1 전체 구조 30
4.3.2 처리 흐름 31
4.3.3 아키텍처 배치 형태 32
4.4 입력 계층(Input Layer) 설계 32
4.4.1 입력 계층의 역할. 32
4.4.2 정규화 및 전처리. 32
4.4.3 위험 탐지 로직. 33
4.5 검색 보호 및 외부 문맥 계층 설계 33
4.5.1 Retrieval Firewall의 필요성. 33
4.5.2 검색 문맥 검증 절차 33
4.6 정책 제어 계층(Policy Control Layer) 설계 34
4.6.1 정책 제어 계층의 목적. 34
4.6.2 IAM 및 최소권한 연계 34
4.6.3 정책 규칙 예시. 34
4.7 출력 계층(Output Layer) 설계 35
4.7.1 출력 계층의 필요성 35
4.7.2 응답 검증 및 후처리 36
4.7.3 고위험 응답에 대한 인간 승인 36
4.8 샌드박스 및 행위 제어 계층 설계. 36
4.8.1 샌드박스 계층의 목적 36
4.8.2 행위 제어 구조. 37
4.9 관제 및 로깅 계층 설계 37
4.9.1 보안 가시성 확보. 37
4.9.2 SIEM 및 위협 인텔리전스 연계. 37
4.10 아키텍처 적용 시 고려사항. 37
4.10.1 정확도와 지연의 균형. 38
4.10.2 멀티모델 및 멀티클라우드 환경. 38
4.11 소결 38
제5장 AI 방화벽 기반 프롬프트 인젝션 방어 설계안. 38
5.1 다계층 방어 전략 설계. 39
5.1.1 방어 철학과 기본 방향. 39
5.1.2 다계층 방어의 구성 39
5.1.3 위험 등급 기반 제어 모델 40
5.2 프롬프트 무결성 검증 메커니즘 41
5.2.1 프롬프트 무결성의 개념 41
5.2.2 구조화 프롬프트 설계 41
5.2.3 무결성 검증 절차. 41
5.3 입력 정규화 및 위험 탐지 설계. 42
5.3.1 정규화의 필요성 42
5.3.2 탐지 로직의 계층화 42
5.3.3 탐지 결과의 운영 활용. 42
5.4 검색 문맥 보호 및 RAG 방어 설계 43
5.4.1 간접 프롬프트 인젝션 대응 원칙 43
5.4.2 검색 결과 필터링과 재구성. 43
5.5 출력 검증 및 데이터 유출 방지 설계 43
5.5.1 출력 방어의 중요성 43
5.5.2 민감정보 탐지 및 마스킹. 44
5.5.3 형식 검증과 안전 출력 정책 44
5.6 도구 호출 통제와 인간 승인 설계. 44
5.6.1 도구 호출 통제의 필요성. 45
5.6.2 승인 절차 설계. 45
5.6.3 실행 후 검증. 45
5.7 샌드박스 실행 및 적대적 테스트 설계 45
5.7.1 샌드박스의 역할 45
5.7.2 적대적 테스트 절차 46
5.8 관제, 정책 자동화 및 지속적 개선 46
5.8.1 중앙 관제 체계 설계 46
5.8.2 정책 자동화와 지속적 업데이트 46
5.9 관리적·운영적 보안 체계 설계 47
5.9.1 거버넌스 조직 구성 47
5.9.2 운영 절차와 문서화 47
5.9.3 규제 및 컴플라이언스 대응. 47
5.10 소결 48
제6장 프로토타입 설계 및 시나리오 기반 평가 48
6.1 평가 목적 및 접근 방법 48
6.1.1 평가 목적 49
6.1.2 평가 접근 방법. 49
6.1.3 평가 항목 49
6.2 프로토타입 환경 설계 49
6.2.1 평가 대상 서비스 가정. 50
6.2.2 프로토타입 구성 요소 50
6.2.3 평가용 정책 기준. 50
6.3 평가 시나리오 설계 51
6.3.1 시나리오 선정 기준 51
6.3.2 시나리오 1: 직접 프롬프트 인젝션 51
6.3.3 시나리오 2: 간접 프롬프트 인젝션 51
6.3.4 시나리오 3: 도구 호출 오남용 52
6.3.5 시나리오 4: 출력 유출 시도. 52
6.3.6 시나리오 5: 멀티턴 우회 공격 52
6.4 시나리오별 방어 흐름 분석. 53
6.4.1 입력·문맥·정책·출력 연계 효과 53
6.4.2 관제 및 감사 측면의 평가 54
6.5 정성적 평가 54
6.5.1 안전성 평가 54
6.5.2 운영성 평가 55
6.5.3 확장성 평가 55
6.6 한계 및 시사점. 56
6.6.1 평가의 한계 56
6.6.2 연구적 시사점 56
6.6.3 실무적 시사점 56
6.7 소결 57
제7장 결론 및 향후 연구 57
7.1 연구 결과 요약. 58
7.1.1 문제 정의와 연구 필요성. 58
7.1.2 제안 아키텍처의 핵심 내용. 59
7.1.3 시나리오 기반 평가 결과. 59
7.2 실무 적용성 관점의 의의. 59
7.2.1 엔터프라이즈 보안 통제면으로서의 AI 방화벽 59
7.2.2 기존 보안 체계와의 연계 가능성 60
7.2.3 운영 및 거버넌스 관점의 실용성 60
7.2.4 생산성과 통제의 균형 61
7.3 연구의 한계 61
7.4 향후 연구 방향. 61
7.4.1 실제 클라우드 플랫폼 기반 구현 연구 62
7.4.2 정량 평가 및 벤치마크 연구 62
7.4.3 에이전트 및 멀티모달 확장 연구 62
7.4.4 정책 자동화와 자가 적응형 방어 연구 62
7.5 결론 63
참고문헌. 63
부록. 67

