https://aclanthology.org/2024.acl-long.809.pdf
* 해당 포스팅은 위의 논문을 참고하여 작성하였습니다.

ArtPrompt는 ASCII Art를 이용해 LLM의 안전장치를 우회하는 Jailbreak 공격 기법이다.
일반적으로 LLM에는 유해하거나 위험한 요청에 응답하지 않도록 Safety Alignment가 적용되어 있다. 이를 위해 지도 학습이나 인간 피드백 기반 강화학습, Red Teaming 등 다양한 방법이 사용된다. 하지만 연구진은 기존의 LLM 안전 정렬 과정이 대부분 텍스트의 의미를 중심으로 이루어진다는 점에 주목했다. 우리가 일반적으로 사용하는 문장은 각각의 문자가 단어를 구성하고, 단어가 문장을 구성하면서 의미를 전달한다. 하지만 모든 텍스트가 이런 방식으로 의미를 전달하는 것은 아니다.
대표적인 예가 ASCII Art이다. ASCII Art는 문자와 공백을 특정한 위치에 배치하여 글자나 그림을 표현하는 방식이다. 이 경우 각각의 문자를 개별적으로 읽는 것만으로는 전체 의미를 알 수 없다. 문자들이 공간적으로 어떻게 배치되어 있는지를 함께 살펴봐야 한다. 사람은 ASCII Art를 보면 문자 하나하나의 의미보다 전체적인 모양을 보고 어떤 글자인지 알아낼 수 있다.
연구진은 여기서 한 가지 의문을 제기했다. LLM의 안전장치가 일반적인 텍스트의 의미를 중심으로 학습되었다면 ASCII Art처럼 시각적인 배치를 통해 의미를 전달하는 입력도 제대로 처리할 수 있을까. 이를 확인하기 위해 연구진은 Vision in Text Challenge라는 벤치마크를 만들었다. VITC는 문자와 숫자를 ASCII Art로 표현한 뒤 LLM이 그것을 제대로 인식할 수 있는지 확인하는 테스트이다. 실험에는 GPT 3.5, GPT 4, Gemini, Claude, Llama2가 사용되었다.
결과적으로 모든 모델이 ASCII Art를 인식하는 데 어려움을 보였다. ASCII Art 하나로 표현된 문자나 숫자도 제대로 인식하지 못하는 경우가 많았으며 여러 문자를 연속해서 표현하면 인식 성능은 더욱 크게 떨어졌다. Few Shot Prompting이나 Chain of Thought와 같은 방법을 사용해 모델에게 추가적인 추론을 유도해도 성능 향상은 크지 않았다.

즉 당시의 주요 LLM들은 일반적인 텍스트를 이해하는 능력에 비해 문자들의 공간적인 배치를 통해 만들어진 정보를 이해하는 능력이 상당히 부족했다. 연구진은 바로 이 특징을 Jailbreak에 이용했다. 이 공격을 ArtPrompt라고 한다. ArtPrompt의 핵심은 매우 단순하다.
1. 먼저 공격자가 입력하려는 Prompt에서 LLM의 안전장치를 작동시킬 가능성이 높은 민감한 단어를 찾는다.
2. 그리고 해당 단어를 일반적인 텍스트에서 제거한다.
3. 그다음 제거한 단어를 ASCII Art 형태로 변환한다.
4. 마지막으로 원래 문장과 ASCII Art를 결합하여 하나의 Prompt를 만든 뒤 LLM에 전달한다.
흥미로운 점은 여기서 발생한다. LLM은 ASCII Art 자체를 정확하게 인식하는 데 어려움을 겪으면서도 주변 문장의 문맥을 이용하여 해당 ASCII Art가 무엇을 의미하는지 어느 정도 추론할 수 있었다. 즉 안전장치가 입력 단계에서 민감한 단어를 명확하게 인식하지 못했음에도 실제 답변을 생성하는 과정에서는 주변 문맥을 바탕으로 숨겨진 의미를 추론하는 현상이 나타났다.
연구진은 이 차이를 ArtPrompt의 핵심적인 공격 지점으로 이용했다. 쉽게 말하면 위험한 단어를 그대로 보여주면 안전장치가 이를 발견하지만, 그 단어를 ASCII Art라는 다른 형태로 숨기면 안전장치가 제대로 감지하지 못할 수 있다는 것이다. 그러면서도 LLM은 전체 문맥을 이용해 공격자가 무엇을 요구하고 있는지 추론할 수 있다.
ArtPrompt의 또 다른 특징은 공격 과정이 비교적 단순하다는 점이다. 일부 Jailbreak 공격은 모델 내부 정보에 접근하거나 수많은 Prompt를 반복적으로 생성하고 수정하는 최적화 과정이 필요하다. 반면 ArtPrompt는 공격 대상 LLM의 내부 구조나 파라미터를 알 필요가 없다. 일반 사용자가 모델에 Prompt를 입력하고 결과를 확인할 수 있는 정도의 Black Box 접근만으로도 공격을 시도할 수 있다. 또한 민감한 단어를 ASCII Art로 변환한 뒤 기존 Prompt와 결합하는 방식이기 때문에 공격 Prompt 생성 과정 자체를 자동화할 수도 있다.
연구진은 ArtPrompt의 효과를 확인하기 위해 GPT 3.5, GPT 4, Claude, Gemini, Llama2를 대상으로 실험했다. 또한 단순히 ArtPrompt만 테스트한 것이 아니라 기존 Jailbreak 기법들과 비교했다. 비교 대상에는 Direct Instruction, GCG, AutoDAN, PAIR, DeepInception 등이 포함되었다.
실험 결과 ArtPrompt는 테스트한 모든 LLM에서 Jailbreak 가능성을 보여주었다. 모델에 위험한 요청을 일반적인 문장으로 직접 입력했을 때는 대부분 안전장치가 작동했지만 동일한 요청의 일부를 ASCII Art 형태로 변환하면 모델에서 안전하지 않은 응답이 생성되는 경우가 증가했다. 전체적인 실험 결과에서도 ArtPrompt는 비교 대상으로 사용된 여러 Jailbreak 공격보다 높은 평균 공격 성공률을 기록했다. 특히 공격 Prompt를 만들기 위해 복잡한 반복 최적화 과정이 필요하지 않다는 점도 중요한 특징으로 나타났다.
연구진은 기존 Jailbreak 방어 방법으로 ArtPrompt를 막을 수 있는지도 확인했다. 실험에는 Perplexity 기반 탐지와 Paraphrase 그리고 Retokenization 방식이 사용되었다.
Perplexity 방식 : 일반적인 문장과 크게 다른 비정상적인 입력을 찾아내는 방식.
Retokenization 방식 : 입력을 다시 Token 단위로 처리하여 공격자가 의도한 Token 구조를 깨뜨리는 방식.
Paraphrase 방식 : 입력 문장의 의미는 유지하면서 문장 자체를 다시 작성하는 방식이다.
실험 결과 ArtPrompt는 Perplexity 기반 탐지와 Retokenization을 적용한 환경에서도 공격 효과가 유지되었다. 세 가지 방법 가운데에서는 Paraphrase가 ArtPrompt의 효과를 가장 많이 감소시켰다. ASCII Art는 문자와 공백의 배치 자체가 중요하기 때문에 문장을 다시 구성하는 과정에서 이러한 구조가 손상될 수 있기 때문이다. 하지만 Paraphrase 역시 ArtPrompt를 완전히 차단하지는 못했다.
연구진은 추가로 ASCII Art를 인식할 수 있도록 모델을 Fine Tuning하는 실험도 진행했다. ASCII Art가 포함된 데이터를 학습시킨 모델은 기존 모델보다 ASCII Art를 훨씬 잘 인식했으며 ArtPrompt의 공격 효과도 감소하는 모습을 보였다. 이는 중요한 의미를 가진다. ArtPrompt의 문제는 단순히 ASCII Art라는 특이한 입력 형식 하나에서 끝나는 것이 아니라 LLM의 Safety Alignment가 어떤 형태의 데이터를 기준으로 이루어졌는지와 관련되어 있기 때문이다.
기존 Safety Alignment가 자연어의 의미를 중심으로 위험한 입력을 학습했다면 같은 의미를 완전히 다른 형태로 표현했을 때 안전장치가 이를 놓칠 가능성이 존재한다. ASCII Art는 이러한 문제를 보여주는 하나의 사례이다. 사람의 입장에서는 같은 의미를 가진 정보라도 LLM의 입장에서는 표현 방식에 따라 전혀 다른 입력으로 처리될 수 있다. 따라서 LLM의 안전성을 확보하기 위해서는 단순히 특정 단어나 문장의 의미를 탐지하는 것만으로는 부족할 수 있다. 동일한 의미가 문자 배치나 인코딩 또는 다른 표현 방식으로 전달될 가능성까지 고려해야 한다.
ArtPrompt 연구가 보여주는 핵심도 여기에 있다. LLM이 어떤 내용을 이해할 수 있는 능력과 그 내용을 안전장치가 탐지할 수 있는 능력은 항상 동일하지 않다. 공격자는 바로 이 차이를 이용할 수 있다. ArtPrompt는 ASCII Art라는 단순한 방법을 이용했지만 이를 통해 LLM Safety Alignment가 자연어의 의미에 지나치게 의존할 경우 예상하지 못한 입력 표현이 새로운 Jailbreak 공격 표면이 될 수 있음을 보여주었다.
'AI + Security' 카테고리의 다른 글
| 글자를 뒤집어서 Jailbreak (0) | 2025.04.19 |
|---|---|
| DeepSeek도 탈옥할 수 있을까? DeepSeek Jailbreak 공격 분석 (0) | 2025.04.13 |
| PortSwigger - Web LLM attacks (5) (0) | 2025.03.24 |
| PortSwigger - Web LLM attacks (4) (0) | 2025.03.23 |
| PortSwigger - Web LLM attacks (3) (0) | 2025.03.05 |