AI + Security

Top 10 AI security

oose 2025. 1. 26. 22:47

1. LLM 학습 데이터 추출 

ChatGPT에게 특정 단어를 반복하도록 요청하는 방식으로 학습 데이터가 출력되는 현상을 다룬다. 실제로 전화번호, 이메일, 주소와 같은 PII가 노출될 수 있음을 보여줌

-> LLM의 학습 데이터 자체가 공격 대상이 될 수 있음

 

2. Adversarial Machine Learning

머신러닝 모델도 기존 소프트웨어처럼 취약점을 가질 수 있다는 관점에서 AI 취약점의 관리와 대응을 다룬다. 기존 보안 프로세스로 AI 취약점을 처리할 수 있는지, 취약점 정보 공유의 어려움, 공격에 대한 법적 문제, 정부 차원의 대응 등을 논의한다.
AI 보안도 기존 사이버보안 체계와 연결해서 관리해야 함.

 

3. Llama Guard

Meta가 공개한 LLM용 안전성 검사 모델이다. 사용자의 입력과 LLM의 출력이 안전한지 판단하고, 조직이 원하는 안전성 기준에 맞게 조정할 수 있다.
LLM의 입력과 출력을 별도의 모델로 검사해 유해한 요청·응답을 차단.

 

4. 머신러닝 연구 코드의 전통적인 취약점

AI 자체의 취약점뿐 아니라 AI를 개발하는 코드에도 기존 소프트웨어 취약점이 존재할 수 있다는 내용이다. NVIDIA AI Red Team이 350만 개의 Python 파일과 Jupyter Notebook을 분석해 Insecure Deserialization, XML Injection, 민감정보 처리 문제 등을 발견했다.
AI 보안 = 모델 보안뿐 아니라 AI 개발 환경과 코드 보안까지 포함. 

 

5. LLM Jailbreak

LLM이 악성·위험한 요청을 거부하도록 학습되어 있어도 특정 공격용 프롬프트를 만들어 안전장치를 우회할 수 있다는 내용이다. 특히 연구에서는 jailbreak suffix를 알고리즘으로 생성하고, 여러 LLM에 적용 가능한 Universal & Transferable 공격을 소개한다.
Jailbreak를 사람이 직접 만드는 것뿐 아니라 자동으로 생성할 수도 있음. 

 

6. OWASP Top 10 for LLM Applications

LLM 애플리케이션에서 발생할 수 있는 주요 보안 위험을 정리한 OWASP 자료를 소개한다. 대표적으로prompt injection, Insecure Output Handling, Training Data Poisoning 등이 있으며, 각 취약점에 대한 공격 시나리오와 대응 방법을 제공한다.
LLM 애플리케이션의 보안 위험을 체계적으로 분류하고 대응하기 위한 기준. 

 

7. ChatGPT Plugin Exploit

Prompt Injection을 이용해 ChatGPT의 인증된 Plugin이 사용자를 대신해 권한 있는 작업을 수행하도록 만드는 공격을 다룬다. 악성 웹페이지 등에 삽입된 프롬프트가 Plugin을 호출해 사용자의 private data에 접근하는 식이다.
Prompt Injection은 단순히 이상한 답변을 유도하는 문제가 아니라, 연결된 Plugin/API의 권한까지 악용할 수 있음.

 

 

8. AI Executive Order와 보안

2023년 미국의 AI 행정명령이 개인정보보호와 보안팀에 어떤 영향을 주는지를 다룬다. AI를 안전하고 신뢰할 수 있게 개발·사용하기 위한 정책적 요구사항과 보안팀이 고려해야 할 사항을 설명한다.
AI 보안은 기술 문제뿐 아니라 정책·규제 문제와도 연결됨.

 

9. Fuzzomatic — AI를 이용한 취약점 탐색

LLM을 취약점 발견 과정에 활용한 사례다. ChatGPT API를 이용해 Rust 프로젝트의 fuzz target을 생성하고, GitHub의 인기 Rust 프로젝트 37개에서 14개의 버그를 발견했으며 그중 4개는 integer overflow였다.
AI가 공격을 받는 대상일 뿐 아니라 보안 취약점 탐색 도구로도 활용될 수 있음.

 

https://github.com/kudelskisecurity/fuzzomatic

 

GitHub - kudelskisecurity/fuzzomatic: Automatically fuzz Rust projects from scratch

Automatically fuzz Rust projects from scratch. Contribute to kudelskisecurity/fuzzomatic development by creating an account on GitHub.

github.com

 

10. WormGPT

WormGPT와 FraudGPT처럼 악의적인 목적으로 사용되는 생성형 AI를 다룬다. 공격자가 이를 이용해 악성코드, 피싱 이메일 등을 생성하거나 취약점을 찾을 수 있다는 내용이다.
생성형 AI가 공격자의 능력을 높이는 도구로도 사용될 수 있음.