요약
- 프롬프트 인젝션 공격은 악의적인 자연어 지시를 사용해 LLM이 의도되지 않았거나 승인되지 않은 작업을 수행하도록 조작합니다.
- 공격자는 이러한 지시를 프롬프트에 직접 삽입하거나 업로드된 파일, 웹사이트, 외부 데이터 소스 및 모델이 처리하는 기타 콘텐츠를 통해 간접적으로 삽입할 수 있습니다.
- 성공적인 프롬프트 인젝션은 LLM이 민감한 정보를 유출하거나, 연결된 도구를 오용하거나, 의도된 통제를 우회하거나, 예상된 동작을 변경하게 만들 수 있습니다.
프롬프트 인젝션이란?
프롬프트 인젝션은 악의적인 행위자가 사용자 프롬프트 또는 시스템 입력에 유해한 지시를 삽입하여 AI 언어 모델을 조작하는 사이버 공격입니다. 목표는 AI가 예기치 않게 동작하거나 민감한 정보를 드러내도록 만드는 것입니다.
이러한 공격은 LLM이 지시와 사용자 입력을 처리하고 혼합하는 방식을 악용합니다. 공격자는 AI가 원래의 프로그래밍 대신 승인되지 않은 명령을 따르도록 속이는 악성 텍스트를 제작합니다.
이 공격이 성공하는 이유는 모델이 정상적인 지시와 악의적인 조작을 신뢰성 있게 구분할 수 없기 때문입니다.
프롬프트 인젝션 공격에는 세 가지 주요 유형이 있습니다:
- 직접 프롬프트 인젝션은 공격자가 채팅 인터페이스에 악성 텍스트를 직접 입력할 때 발생합니다. 예로는 "이전의 모든 지시를 무시하라"와 같은 접두 지시, "침투 테스터처럼 행동하라"와 같은 설득형 페르소나 채택, 그리고 안전 거부를 억제하는 언어가 있습니다.
- 간접 프롬프트 인젝션은 공격자가 LLMs가 소비하는 외부 콘텐츠(예: RAG 파이프라인, 파일 업로드 또는 웹 페이지)를 표적으로 삼아, 나중에 처리되는 보이지 않는 지시를 숨길 수 있을 때 발생합니다. Prompt Security의 보안 연구원들은 조작된 문서 텍스트를 통해 Bing Chat이 기밀 규칙을 드러내도록 속이며 이를 입증했습니다.
- 저장형(지속형) 인젝션은 공격자가 데이터베이스, 지식 베이스 또는 채팅 기록에 프롬프트를 심어 두고, 모델이 이를 다시 참조할 때까지 잠복 상태로 유지될 때 발생합니다. 엔터프라이즈 환경에서는 오염된 레코드 하나가 향후 모든 대화에 조용히 영향을 미칠 수 있습니다.
최신 멀티모달 모델은 추가적인 위험에 직면합니다. 공격자는 기존 키워드 필터를 우회하면서 동일한 악의적 의도를 담은 악성 텍스트를 이미지나 PDF에 숨길 수 있습니다. 대규모로 LLM을 배포하는 조직에게 프롬프트 인젝션은 기존의 인프라 중심 공격에서 핵심 AI 기능을 악용하는 위협으로의 근본적인 전환을 의미합니다.
.png)
AI 시스템에 대한 프롬프트 인젝션의 영향 및 위험
오염된 프롬프트 하나만으로도 전체 AI 배포가 손상될 수 있습니다. 공격자가 삽입된 지시를 통해 LLM 동작을 조작하면 조직은 측정 가능한 비즈니스 결과에 직면합니다.
위험은 세 가지 범주로 나뉩니다:
- 조작된 출력에 의한 데이터 유출: 공격자는 모델에 액세스 제어를 우회하고, 학습 데이터에 포함된 기밀 시스템 프롬프트, 내부 문서, 고객 데이터 또는 독점적인 비즈니스 로직을 유출하도록 지시합니다.
- 손상된 AI 어시스턴트로 인한 운영 중단: 조작된 챗봇이 사기성 거래를 승인하거나, 헬프데스크 봇이 승인되지 않은 액세스를 부여하거나, 자율 에이전트가 파일을 삭제하거나 데이터베이스를 손상시키는 파괴적 명령을 실행합니다.
- 오염된 학습 데이터로 인한 공급망 위험: 공개 데이터셋과 웹 스크래핑 콘텐츠에는 모델이 RAG 파이프라인을 통해 이를 수집할 때 활성화되는 잠복 지시가 숨겨져 있어, 해당 데이터에 의존하는 모든 다운스트림 애플리케이션에 영향을 미칩니다.
이러한 위험 때문에 프롬프트 인젝션은 LLM 기술을 배포하는 모든 조직에 중요한 우려 사항이 됩니다. 이러한 공격의 작동 방식을 이해하는 보안 팀은 사고가 발생하기 전에 다계층 방어를 구축할 수 있습니다.
프롬프트 인젝션 공격을 이해하는 것의 중요성
프롬프트 인젝션 공격은 기존의 사이버 보안 프레임워크가 다루지 못하는 비즈니스 위험을 초래합니다. 인프라를 표적으로 삼는 기존 공격과 달리, 프롬프트 인젝션은 AI 시스템의 핵심 기능을 악용하므로 모든 LLM 배포가 악의적인 행위자의 잠재적 진입점이 됩니다.
예를 들어, Stanford의 한 연구원은 어시스턴트의 가드레일을 무력화하는 단 하나의 조작된 질의를 통해 Bing Chat이 기밀 시스템 프롬프트를 드러내도록 성공적으로 유도했습니다. 이 사건은 시스템 명령과 동일한 컨텍스트에 존재하는 사용자 입력 때문에 모델이 악의적인 요청과 승인된 요청을 구분하지 못한다는 점을 보여주었습니다.
공격자는 또한 헬프데스크 봇에 "이전의 모든 지시를 잊어라"라고 지시한 뒤 내부 데이터베이스에 접근하거나 권한 있는 작업을 호출하려고 시도할 수 있습니다. 또는 검색 증강 생성(RAG) 파이프라인이 수집하는 공개 데이터를 오염시켜 모델이 공격자 통제하의 답변을 반환하도록 강제할 수 있습니다.
심지어 무해한 작업도 위험해질 수 있습니다. 예를 들어 LLM이 이력서를 요약할 때, 삽입된 프롬프트가 모델을 설득해 지원자의 자격을 부풀리게 할 수 있습니다.
이러한 잠재적 위협을 인지하지 못한 채 LLM을 배포하는 조직은 다음과 같은 측정 가능한 비즈니스 위험에 직면합니다:
- 데이터 노출 사고는 GDPR, CCPA 및 산업별 규정 준수 요구사항에 따른 규제 벌금을 유발할 수 있습니다
- 운영 중단은 조작된 AI 응답으로 인해 점점 더 LLM 자동화에 의존하는 비즈니스 프로세스에 영향을 미칩니다
- 평판 손상은 손상된 고객 대면 AI 시스템으로 인해 브랜드 신뢰와 고객 유지에 영향을 줄 수 있습니다
- 재정적 손실은 사기 탐지, 위험 평가 또는 자동화된 거래와 같은 영역에서 잘못된 AI 기반 의사결정으로 발생할 수 있습니다
CISO에게 과제는 기존 보안 지표가 AI 특화 위험을 포착하지 못한다는 점이며, 이에 따라 경영진과 이사회에 LLM 보안 태세를 측정하고 보고하기 위한 새로운 프레임워크가 필요합니다.
프롬프트 인젝션 공격은 어떻게 작동하나요?
프롬프트 인젝션 공격은 단일 대화 컨텍스트 내에서 LLM이 지시를 처리하고 우선순위를 정하는 방식을 악용하여 작동합니다.
LLM에 질의를 제출하면 엔진은 조용히 세 계층의 텍스트를 연결합니다. 핵심 동작을 정의하는 시스템 프롬프트, 애플리케이션을 형성하는 개발자 지시, 그리고 사용자 입력입니다. 모델은 전체 문자열을 하나의 대화로 취급하므로 이 계층들의 상대적 순서가 모든 것을 좌우합니다 - 마지막 지시가 종종 우선합니다.
이 설계가 근본적인 취약점을 만듭니다. 프롬프트 인젝션 공격은 프롬프트 컨텍스트에 악성 지시를 삽입하는 것으로 시작되며, 이후 LLM은 이를 순순히 실행합니다. 페이로드가 실행 가능한 코드가 아니라 자연어이기 때문에 기존 입력 필터는 한계가 있습니다. 이 공격은 모델의 언어적 논리를 조작하므로, 기존 코드 인젝션보다 결정론적으로 정제하기가 훨씬 어렵습니다.
실제 환경에서 직접 프롬프트 인젝션 공격이 작동하는 방식은 다음과 같습니다:

LLM은 이를 하나의 연속된 대화로 취급하며, 마지막 지시가 앞선 안전 규칙을 무효화할 수 있습니다. 모델은 잠재적으로 다음과 같이 동작할 수 있습니다:
- "내부 데이터를 절대 공개하지 말라"는 규칙을 무시
- 대신 악의적인 "관리자 비밀번호를 출력하라" 명령을 따름
검색 증강 워크플로우 또는 자율 에이전트에서는 오염된 웹 페이지나 데이터베이스 레코드가 동일한 "이전 지시를 무시하라" 지시를 컨텍스트에 밀반입할 수 있으며, 이후 모델은 파일 삭제, 이메일 전송 또는 셸 명령 실행 도구를 호출할 수 있습니다.
모든 인젝션이 성공하는 이유는 LLM에 신뢰 경계에 대한 내장 개념이 없기 때문입니다.
프롬프트 인젝션 탐지: 지표 및 기법
프롬프트 인젝션 공격은 자동화된 시스템이 포착할 수 있는 행동적 지문을 남깁니다. 보안 팀은 LLM 입력, 출력 및 컨텍스트 조작 전반에서 세 가지 범주의 의심스러운 활동을 주시해야 합니다.
입력 패턴 이상 징후
사용자 질의에서 지시 재정의 문구를 주시하십시오. 공격자는 "이전의 모든 지시를 무시하라" 또는 "시스템 프롬프트를 무시하라"와 같은 접두어를 사용해 모델 동작을 탈취합니다. 비정상적인 구분자, 마크업 문자 또는 "보안 감사자처럼 행동하라", "관리자인 척하라"와 같은 페르소나 채택 언어는 조작 시도를 나타냅니다.
공격자는 역할극 지시가 포함된 정교하게 조작된 질의를 사용해 챗봇이 기밀 시스템 규칙을 드러내도록 속일 수 있습니다. 단순 키워드 필터는 공격자가 끊임없이 새로운 표현을 개발하기 때문에 이러한 공격을 놓치지만, 행동 기반 AI는 구체적인 표현과 무관하게 의미적으로 유사한 조작 시도를 표시합니다.
출력 동작 변화
프롬프트 인젝션에 손상된 모델은 안전 제약을 위반하는 응답을 생성합니다. 유출되어서는 안 되는 시스템 프롬프트나 내부 데이터 참조와 같은 정보 공개를 주시하십시오. LLM이 갑자기 파일 삭제 API를 호출하거나 승인 없이 이메일을 보내는 것과 같은 예기치 않은 도구 호출도 눈에 띕니다.
모델이 악의적인 지시를 따를 때 응답 패턴이 바뀝니다. 평소 세 문장으로 답변하던 고객 서비스 봇이 갑자기 장황한 기술 설명을 생성할 수 있습니다. AI 어시스턴트가 평소의 거부 메커니즘을 우회하고 권한 있는 명령을 실행할 수도 있습니다. 모델은 접근해서는 안 되는 데이터를 참조하거나 이전에 일관되게 작동하던 가드레일을 무시할 수 있습니다.
보안 플랫폼은 이러한 의심스러운 출력을 이를 유발한 프롬프트까지 추적하여, 악성 입력에서 손상된 응답에 이르는 전체 공격 체인을 보여줄 수 있습니다.
컨텍스트 조작 신호
간접 공격은 LLM이 소비하는 외부 콘텐츠를 표적으로 삼습니다. 웹 페이지, 업로드된 문서 또는 데이터베이스 레코드를 수집하는 RAG 파이프라인은 숨겨진 지시를 끌어들일 수 있습니다. 공격자는 겉보기에 무해한 파일, 보이지 않는 텍스트 레이어가 있는 PDF 또는 멀티모달 모델이 해석하고 실행하는 지시가 포함된 이미지에 악성 프롬프트를 삽입합니다.
LLM 애플리케이션에 데이터를 공급하는 소스를 모니터링하십시오. 지식 베이스의 오염된 레코드 하나가 향후 모든 대화에 영향을 줄 수 있습니다. SentinelOne의 Prompt Security 인수는 이러한 공급망 공격에 특화된 탐지 기능을 확장하여, 모델이 처리하기 전에 외부 콘텐츠의 지시 인젝션 시도를 식별합니다.
이러한 지표를 포착하려면 정상적인 LLM 동작과 조작된 LLM 동작을 이해하는 행동 기반 AI와 지속적인 모니터링이 필요합니다.
프롬프트 인젝션 공격을 막는 방법
방어에는 탐지 및 모니터링에서 시작해 강력한 예방 및 완화 전략으로 뒷받침되는 다계층 접근 방식이 필요합니다.
1. 포괄적인 로깅 및 이상 징후 탐지 구현
포괄적인 로깅은 모든 방어 전략의 기반을 형성합니다. 개인정보 보호 규칙을 위반하지 않으면서 대화 컨텍스트를 유지할 수 있도록 대용량 로그 파이프라인을 사용해 전체 프롬프트, 모델 응답, 타임스탬프 및 세션 식별자를 캡처하십시오.
이상 징후 탐지를 위협 레이더로 배치하십시오. "이전 지시를 무시하라"와 같은 명백한 문자열을 감시하는 단순 규칙 엔진과, 의미가 정상 트래픽에서 벗어나는 프롬프트를 표시하는 더 고급 언어 모델을 함께 사용하십시오. 기존의 키워드 기반 필터는 공격자가 끊임없이 새로운 문구와 접근 방식을 개발하기 때문에 진화하는 프롬프트 인젝션 기법에 대응하지 못합니다. 행동 기반 AI 시스템은 프롬프트의 의미적 의도와 구조적 패턴을 분석하여, 특정 공격 문구가 새로운 경우에도 악의적인 행위를 식별합니다.
2. 입력 정제 및 출력 필터링
모델에 들어가는 텍스트부터 시작하십시오. 입력 정제는 지시형 동사와 탈옥 문구를 제거하거나 이스케이프 처리하고, 출력 필터링은 모델이 엄격한 스키마 또는 제한된 허용 목록 함수에 따르도록 강제합니다. 이를 통해 유출된 시스템 프롬프트나 비정상적인 도구 호출을 막을 마지막 기회를 확보할 수 있습니다.
최신 자율 보안 플랫폼은 수천 건의 LLM 상호작용을 동시에 처리하면서, 보안 팀에 과부하를 주지 않고 대규모 행동 분석을 적용할 수 있습니다. 이 기능은 조직이 여러 비즈니스 기능과 고객 접점에 걸쳐 LLM을 배포할수록 중요해집니다.
3. 시스템 지시를 사용자 입력과 분리
원시 문자열을 연결하는 대신 내부 지시를 사용자 입력과 분리해 유지하십시오. The Wrap 시스템 프롬프트를 명확한 구분자로 감싸고 별도의 필드에 유지합니다. 최소 예시는 다음과 같습니다:

이러한 아키텍처 분리는 모델이 승인된 지시와 사용자 제공 콘텐츠를 구분하도록 도와 지시 혼동의 위험을 줄입니다.
4. 최소 권한 원칙 적용
모델을 읽기 전용 데이터로 제한하고 플러그인 및 외부 도구에 대한 액세스를 제한하십시오. 민감한 워크플로우의 경우 위험한 완료 결과를 실시간으로 검토할 수 있도록 human in the loop를 유지하십시오. 프롬프트가 권한 있는 작업으로 이어질 때는 요청을 human-in-the-loop 승인 대기열로 라우팅하십시오.
자율 AI 보안 플랫폼을 구현하는 조직은 사람의 개입 없이 실시간으로 프롬프트 인젝션 시도에 대응할 수 있습니다. 이러한 시스템은 의심스러운 LLM 상호작용을 자동으로 격리하고, 영향을 받은 프로세스를 분리하며, 포렌식 분석을 위한 상세한 감사 추적을 유지하면서 대응 조치를 구현할 수 있습니다.
5. 애플리케이션 레드팀 수행
애플리케이션에 적대적 프롬프트를 입력하고 그 실패 사례로 파인튜닝하여 모델이 이에 저항하도록 학습시킴으로써 방어를 선제적으로 테스트하십시오. 정기적인 레드팀 훈련은 새로운 공격 벡터를 식별하고 방어 조치의 효과를 검증하는 데 도움이 됩니다.
수동 모니터링이 비현실적인 대규모 LLM 배포에서는 자율 대응이 특히 가치 있습니다. 시스템은 공격 패턴에 따라 대응 전략을 조정하고, 수동 규칙 업데이트나 보안 팀 개입 없이 탐지 기능을 지속적으로 업데이트할 수 있습니다.
SentinelOne 및 프롬프트 인젝션 방어를 위한 자율 AI
SentinelOne은 prompt security의 경량 에이전트와 브라우저 확장 프로그램을 통해 실시간 AI 가시성을 제공합니다. 관리되지 않는 AI 사용을 자신 있게 처리하고 ChatGPT, Gemini, Claude, Cursor 및 기타 맞춤형 LLM에 대한 보안을 강화할 수 있습니다.
SentinelOne's platform은 수천 개의 AI 도구와 어시스턴트 전반에 걸친 사용 현황의 실시간 인벤토리를 유지합니다. 모든 프롬프트와 응답은 전체 컨텍스트와 함께 캡처되어, 보안 팀에 감사 및 규정 준수를 위한 검색 가능한 로그를 제공합니다.
고위험 프롬프트를 차단하고 인라인 코칭을 사용해 사용자가 안전한 AI 관행을 학습하도록 도울 수 있습니다. 프롬프트 인젝션 및 탈옥 시도, 악성 출력 조작, 프롬프트 유출을 차단할 수 있습니다. SentinelOne은 보호 장치를 적용할 수 있으며 OpenAI, Anthropic, Google을 포함한 모든 주요 LLM 제공업체에 대해 모델 불문형 커버리지를 제공합니다. 동적 위험 점수를 할당하고 허용, 차단, 필터링 및 마스킹 조치를 자동으로 시행합니다. SentinelOne의 prompt security는 AI cyber security의 더 넓은 일부입니다. AI security portfolio를 확인하고 agentic AI security analysts 및 machine-speed endpoint defenses로 방어를 확장하십시오.
프롬프트 인젝션 공격 FAQ
프롬프트 인젝션 공격은 사용자 입력이나 외부 콘텐츠에 악성 지침을 삽입하여 AI 언어 모델을 조작합니다. 공격자는 AI가 원래 프로그래밍 대신 승인되지 않은 명령을 따르도록 속이는 텍스트를 만들어 모델이 예기치 않게 동작하거나 민감한 정보를 노출하게 만듭니다.
아니요. 파인튜닝은 모델이 특정 프롬프트를 거부하도록 학습하는 데 도움이 될 수 있지만, 이를 면역 상태로 만들지는 않습니다. 공격자는 여전히 새로운 지침을 만들어 학습을 우회할 수 있으므로, 다계층 방어가 필수적입니다.
방지를 위해서는 여러 방어 계층이 필요합니다. 포괄적인 로깅과 입력 정제를 구현하고, 시스템 지침을 사용자 입력과 분리하며, 최소 권한 원칙을 적용하고, 공격자가 악용하기 전에 새로운 공격 벡터를 식별하기 위한 정기적인 레드팀 테스트를 수행하세요.
SQL injection은 데이터베이스 쿼리에 실행 가능한 코드를 몰래 삽입하여 구조화 질의 언어를 악용합니다. 프롬프트 인젝션은 모델의 논리와 동작을 조작하는 악성 지침을 몰래 삽입하여 자연어 인터페이스를 악용합니다.
아니요. 비밀 유지는 공격자를 더 어렵게 만들 수 있지만, 프롬프트는 영리한 질의를 통해 숨겨진 지침을 드러내도록 유도되는 경우가 많습니다. 비밀 유지는 강력한 보안 통제가 아니라 난독화의 한 형태입니다.
아니요. 멀티모달 모델도 취약합니다. 악성 지침은 이미지, 오디오 파일 또는 기타 형식에 숨겨질 수 있으며, 이후 모델이 이를 해석하고 실행하여 텍스트 전용 필터를 우회할 수 있습니다.
Jailbreaking은 금지된 콘텐츠를 생성하기 위해 안전 가드레일을 무력화하려고 시도하는 반면, 프롬프트 인젝션은 모델을 조작하여 의도하지 않은 작업을 수행하거나 민감한 데이터를 노출하게 만듭니다. 둘 다 지침 혼동을 악용하지만 서로 다른 취약점을 표적으로 합니다.
조직은 규제 처벌을 유발할 수 있는 데이터 노출, 조작된 AI 응답으로 인한 운영 중단, 손상된 고객 대면 시스템으로 인한 평판 훼손, 그리고 사기 탐지나 위험 평가와 같은 영역에서 잘못된 AI 기반 의사결정으로 인한 재정적 손실에 직면합니다.

