전체 글 154

Sirens Whisper : 사람에게 들리지 않는 소리로 LLM 탈옥

원문 : https://www.usenix.org/system/files/usenixsecurity26-ling.pdf 1. 음성 기반 LLM의 새로운 공격 표면요즘 LLM은 Text뿐만 아니라 스마트폰, 스마트홈, 차량 등에서 음성으로도 사용되고 있다. 이때 사용자의 말은 주변 환경을 지나 마이크에 들어가고, 음성 인식과 LLM을 거쳐 처리된다. 문제는 이 과정에서 공격자가 외부의 소리를 통해 몰래 명령을 넣을 수도 있다는 것이다.특히 음성은 Text와 달리 실행 전에 사용자가 내용을 눈으로 확인하기 어렵다. 만약 사람에게는 들리지 않으면서 마이크에는 전달되는 소리를 만들 수 있다면, 사용자가 모르는 사이에 LLM에 Prompt를 입력하는 것이 가능해진다. 이 연구는 바로 이 부분을 공격 표면으로 본..

AI + Security 2026.09.09

AI Tokens - 토큰이 화폐 가치를 갖게 될까?

요즘 ai 에 돈을 너무 많이 쓰게 된다. 뭐 하나를 돌리다가도 토큰 때문에 막히고, 급한 상황에서는 충전을 하면서까지 ai를 쓰게 되는데... 이런 상황을 겪다보니 나중에는 이 토큰이 하나의 화폐 가치가 되는 건 아닐까 하는 생각이 들었다. 그에 대한 기사를 정리해보았다. 원문 : https://papers.ssrn.com/sol3/papers.cfm?abstract_id=6811678 여기서 먼저 주의할 점 : 논문에서 말하는 토큰이란, AI 기업이 별도의 디지털 화폐를 발행하는 상황을 가정하고 이를 AI Token이라고 부른다는 것 1) AI 기업의 화폐는 무엇을 기반으로 가치를 가질까?여기서 바로 문제가 하나 생긴다. 돈이 가치를 가지려면 사람들이 그것을 믿을 만한 이유가 있어야 한다. 원..

AI + Security 2026.08.18

Jailbreak를 막으면 정상 질문까지 거부하는 문제

원문 : https://aclanthology.org/2026.acl-long.260.pdf 한번 보안 문제가 발생하면 그 뒤로 별 거 아닌 요청에도 출력을 막아버리는 경우가 많다. 이유를 찾아보았음 [1] 탈옥을 막으면 왜 과잉 거부가 늘어날까?LLM의 안전성을 생각할 때 서로 반대되는 두 가지 문제가 존재한다. 첫 번째는 탈옥이다. 위험하거나 유해한 요청인데도 모델이 이를 거부하지 않고 답변하는 경우다. 두 번째는 과잉 거부다. 위험하지 않은 정상적인 질문인데도 모델이 지나치게 조심하면서 답변을 거부하는 경우다. 예를 들어 보안 공격 방법을 묻는 질문이라고 하더라도 교육이나 연구 목적의 정상적인 질문이 있을 수 있다. 하지만 모델이 단순히 공격이나 해킹과 관련된 표현만 보고 위험하다고 판단한다면 정..

AI + Security 2026.08.05

LLM의 내부에서는 실제로 어떤 일이 일어나는가

1. 여러 언어를 처리하는 방법 앤트로픽 연구진은 같은 의미의 질문을 영어, 프랑스어, 중국어로 바꿔가며 Claude 내부를 살펴봤다. 언어는 달라도 내부에서는 ‘작다’, ‘반대’, ‘크다’와 같은 공통된 개념이 활성화되는 것을 확인했다. 언어마다 완전히 별개의 방식으로 처리하기보다는 공통된 개념을 거친 뒤 각 언어에 맞는 답을 만들어내는 것으로 보인다고 한다.=> 근데 왜 언어에 따라서 탈옥이 가능해지기도 하는 걸까?? 2. 문장을 미리 계획한다Claude에게 운율이 맞는 시를 작성하게 했더니 단순히 한 단어씩 이어서 생성하는 것이 아니라, 마지막에 사용할 단어를 어느 정도 미리 정해놓고 그 단어에 맞게 문장을 만들어가는 모습이 발견됐다. 연구진이 내부의 특정 개념을 바꾸자 최종 단어뿐만 아니라 그 ..

AI + Security 2026.06.24

ai 심리 파악해서 탈옥하기

원문 : https://arxiv.org/pdf/2512.18244 >> 이 논문에서 다루는 방법이 기존 Jailbreak와 다른 점기존 Jailbreak는 주로 입력 자체를 변형하는 방식에 집중. 하지만 이 연구에서는 LLM이 상황에 따라 비교적 일정한 행동 성향을 보인다는 점에 주목했음. 예를 들어 상대방의 요구에 얼마나 잘 동조하는지, 규칙을 얼마나 중요하게 생각하는지, 사회적인 압박에 어떻게 반응하는지 등을 분석할 수 있다는 것. 연구진은 이런 특성이 사람의 실제 심리 상태라는 의미는 아니며, 인간이 만든 대규모 언어 데이터를 학습하면서 나타나는 행동 패턴으로 다뤘다. 또한 LLM은 사람에게 도움이 되고 자연스럽게 대화하도록 학습된다. 근데 사람의 대화 방식을 잘 모방할수록 권위에 따르거나, 상..

AI + Security 2026.02.11

AgentDojo

메인 목표 : 외부 Tool이 반환한 신뢰할 수 없는 데이터가 Agent를 Hijack하여 공격자가 원하는 작업을 수행하게 만드는 Prompt Injection을 핵심 Threat Model로 설정 예를 들어 정상적인 User Task가“Bob이 보낸 이메일을 찾아서 내용을 요약해줘” 라고 한다면 Agent는 이메일 검색 Tool을 실행한다. 그런데 검색 결과 안에 공격자가 삽입한 Prompt Injection이 존재한다. 그러면 AgentDojo는 동시에 두 가지를 게 됨.1) User Task Utility원래 사용자가 요청한 일을 제대로 했는가.2) Security공격자가 삽입한 지시까지 실행해버렸는가. 일반적인 JailbreakAgentDojo의 Prompt Injection공격자가 모델에 직접 ..

AI + Security 2026.02.08

n8n 프로젝트 (2인 진행)

전체 워크 플로우 이에 대한 각 기능을 소개합니다. 1. 기상 브리핑 2. 수업 종료 알림 + 복습 일정 생성 2. 학습 시작 전 알림 3. 버튼 클릭 시 워크플로우 3-1. 각 버튼 별 기능a. 완료/미완료b. 미루는 이유 선택 -> 역량 부족/노력 부족c. 5분 행동 입력 유도d. 삭제 버튼(실수 방지 기능 포함)e. 완료 버튼f. 일정 재배치 및 삭제/5분 행동 버튼4. 5분 행동 생성 및 출력 5. 일정 생성 및 캘린더 등록, 노션과 슬랙에 기록 회고 어려웠던 점 1. webhook 연결(slack api에서 request url 연결에 자꾸 실패했었음.)2. json 파싱(ai의 json 출력이 일정하지가 않아서 javascript 코드로 보완해야 했음.)3. 버튼 클릭 시 일정..

web study 2026.01.30