1. LLM 학습 데이터 추출
ChatGPT에게 특정 단어를 반복하도록 요청하는 방식으로 학습 데이터가 출력되는 현상을 다룬다. 실제로 전화번호, 이메일, 주소와 같은 PII가 노출될 수 있음을 보여줌
-> LLM의 학습 데이터 자체가 공격 대상이 될 수 있음
2. Adversarial Machine Learning
머신러닝 모델도 기존 소프트웨어처럼 취약점을 가질 수 있다는 관점에서 AI 취약점의 관리와 대응을 다룬다. 기존 보안 프로세스로 AI 취약점을 처리할 수 있는지, 취약점 정보 공유의 어려움, 공격에 대한 법적 문제, 정부 차원의 대응 등을 논의한다.
→ AI 보안도 기존 사이버보안 체계와 연결해서 관리해야 함.
3. Llama Guard
Meta가 공개한 LLM용 안전성 검사 모델이다. 사용자의 입력과 LLM의 출력이 안전한지 판단하고, 조직이 원하는 안전성 기준에 맞게 조정할 수 있다.
→ LLM의 입력과 출력을 별도의 모델로 검사해 유해한 요청·응답을 차단.
4. 머신러닝 연구 코드의 전통적인 취약점
AI 자체의 취약점뿐 아니라 AI를 개발하는 코드에도 기존 소프트웨어 취약점이 존재할 수 있다는 내용이다. NVIDIA AI Red Team이 350만 개의 Python 파일과 Jupyter Notebook을 분석해 Insecure Deserialization, XML Injection, 민감정보 처리 문제 등을 발견했다.
→ AI 보안 = 모델 보안뿐 아니라 AI 개발 환경과 코드 보안까지 포함.

5. LLM Jailbreak
LLM이 악성·위험한 요청을 거부하도록 학습되어 있어도 특정 공격용 프롬프트를 만들어 안전장치를 우회할 수 있다는 내용이다. 특히 연구에서는 jailbreak suffix를 알고리즘으로 생성하고, 여러 LLM에 적용 가능한 Universal & Transferable 공격을 소개한다.
→ Jailbreak를 사람이 직접 만드는 것뿐 아니라 자동으로 생성할 수도 있음.
6. OWASP Top 10 for LLM Applications
LLM 애플리케이션에서 발생할 수 있는 주요 보안 위험을 정리한 OWASP 자료를 소개한다. 대표적으로prompt injection, Insecure Output Handling, Training Data Poisoning 등이 있으며, 각 취약점에 대한 공격 시나리오와 대응 방법을 제공한다.
→ LLM 애플리케이션의 보안 위험을 체계적으로 분류하고 대응하기 위한 기준.
7. ChatGPT Plugin Exploit
Prompt Injection을 이용해 ChatGPT의 인증된 Plugin이 사용자를 대신해 권한 있는 작업을 수행하도록 만드는 공격을 다룬다. 악성 웹페이지 등에 삽입된 프롬프트가 Plugin을 호출해 사용자의 private data에 접근하는 식이다.
→ Prompt Injection은 단순히 이상한 답변을 유도하는 문제가 아니라, 연결된 Plugin/API의 권한까지 악용할 수 있음.
8. AI Executive Order와 보안
2023년 미국의 AI 행정명령이 개인정보보호와 보안팀에 어떤 영향을 주는지를 다룬다. AI를 안전하고 신뢰할 수 있게 개발·사용하기 위한 정책적 요구사항과 보안팀이 고려해야 할 사항을 설명한다.
→ AI 보안은 기술 문제뿐 아니라 정책·규제 문제와도 연결됨.
9. Fuzzomatic — AI를 이용한 취약점 탐색
LLM을 취약점 발견 과정에 활용한 사례다. ChatGPT API를 이용해 Rust 프로젝트의 fuzz target을 생성하고, GitHub의 인기 Rust 프로젝트 37개에서 14개의 버그를 발견했으며 그중 4개는 integer overflow였다.
→ AI가 공격을 받는 대상일 뿐 아니라 보안 취약점 탐색 도구로도 활용될 수 있음.
https://github.com/kudelskisecurity/fuzzomatic
GitHub - kudelskisecurity/fuzzomatic: Automatically fuzz Rust projects from scratch
Automatically fuzz Rust projects from scratch. Contribute to kudelskisecurity/fuzzomatic development by creating an account on GitHub.
github.com
10. WormGPT
WormGPT와 FraudGPT처럼 악의적인 목적으로 사용되는 생성형 AI를 다룬다. 공격자가 이를 이용해 악성코드, 피싱 이메일 등을 생성하거나 취약점을 찾을 수 있다는 내용이다.
→ 생성형 AI가 공격자의 능력을 높이는 도구로도 사용될 수 있음.
'AI + Security' 카테고리의 다른 글
| AI Jailbreak의 공격 원리와 방어 전략 (0) | 2025.02.07 |
|---|---|
| LLM을 공격하는 17가지 방법, Prompt Injection 공격 유형 총정리 (0) | 2025.02.04 |
| 딥시크 (0) | 2025.02.01 |
| 실제 해커들은 AI를 어떻게 사용할까? Google이 분석한 Gemini 악용 사례 (0) | 2025.01.30 |
| 보안과 인공지능을 결합하는 시대 (0) | 2025.01.17 |