공격 토큰을 어디에 끼우느냐가 성패를 가른다
SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
- 논문
- SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
- 저자
- Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee** 교신저자 · Dongguk University-Seoul
- 학회
- The 14th International Conference on Learning Representations (ICLR 2026)
- 트랙
- Poster
- 링크
- OpenReviewGitHub
배경
LLM 이 널리 배포되면서 jailbreak 공격으로 취약점을 찾아내는 일이 중요해졌습니다. 그중 Greedy Coordinate Gradient(GCG) 같은 최적화 기반 공격은 의미 없어 보이는 적대적 토큰 몇 개를 만들어 붙여 모델의 거부를 뚫습니다.
이 계열은 토큰을 붙일 자리를 프롬프트 맨 뒤로 고정해 왔습니다. 관행이 굳어진 탓에 다른 자리에 끼웠을 때 어떤 일이 벌어지는지는 살펴본 적이 없었습니다. 본 논문은 프롬프트 안에서 토큰을 넣을 수 있는 후보 위치를 slot 이라 부르고, 이 자리 선택이 공격 성패에 어떤 영향을 주는지 실증적으로 조사했습니다.
제안 방법
먼저 자리를 하나씩 바꿔 가며 시험해 보니, jailbreak 취약성이 어느 slot 을 고르느냐와 강하게 연관되어 있었습니다. 같은 공격이라도 어디에 끼우느냐에 따라 결과가 달라진다는 뜻입니다.
이 관찰을 바탕으로 자리별 취약도를 수치로 재는 Vulnerable Slot Score(VSS)를 정의했습니다. SlotGCG 는 모든 slot 을 VSS 로 평가한 뒤 가장 취약한 자리들을 골라 그 지점에 최적화를 집중합니다.
이 위치 탐색은 공격 방식과 무관하게 동작하기 때문에, 기존의 어떤 최적화 기반 공격에도 그대로 얹을 수 있습니다. 추가로 드는 전처리 시간은 200ms 입니다.
실험 설정
- 데이터
- AdvBench 의 유해 행동 50건. 허위정보, 불법 행위, 유해 콘텐츠 생성 등 여러 범주를 포함
- 대상 모델
- Llama-2-7B, Llama-2-13B, Llama-3.1-8B-Instruct, Mistral-7B, Vicuna-7B, Qwen-2.5
- 기반 공격
- GCG, AttnGCG, I-GCG, GCG-Hij, GBDA 각각에 SlotGCG 를 얹어 비교
- 방어
- Perplexity Filter, Erase-and-Check(suffix·infusion), SmoothLLM(swap·insert·patch), RPO, SafeDecoding, Llama-Guard-3
- 판정
- 템플릿 기반 필터링, GPT-4 판정, 사람 확인의 3단계로 공격 성공률(ASR) 산정
결과
- GCG 계열 공격에 SlotGCG 를 얹으면 대부분의 모델에서 ASR 이 올랐고, 평균 14%p 상승했습니다. 공격에 강한 것으로 알려진 Llama 계열에서 특히 크게 올랐습니다. Llama-2-13B 에서 I-GCG 에 적용했을 때 ASR 94%를 기록했고, AttnGCG 에 적용했을 때는 62%p 가 올랐습니다.
- 방어를 걸었을 때 차이가 가장 극적이었습니다. Erase-and-Check(suffix)는 기존 공격 네 가지를 모두 ASR 0.0%로 완전히 막아냈지만, SlotGCG 를 얹자 GCG 52.0%, AttnGCG 56.0%, I-GCG 66.0%, GCG-Hij 62.0%로 되살아났습니다. Erase-and-Check(infusion) 에서도 GCG 가 24.0%에서 70.0%로 올랐습니다.
- 전체 방어를 평균하면 기존 방식보다 42%p 높은 ASR 을 유지했습니다. 방어가 프롬프트 끝의 토큰 덩어리를 겨냥하도록 설계돼 있는데, 여러 자리에 흩어 끼우면 그 전제가 무너지기 때문으로 보입니다.
- 수렴도 더 빨랐습니다. 같은 공격 효과를 더 적은 최적화 단계로 얻었습니다.
의의
지금까지의 방어는 적대적 토큰이 프롬프트 끝에 몰려 있다는 가정 위에 서 있었습니다. 삽입 위치를 바꾸는 것만으로 그 방어들이 뚫린다는 것은, 위치를 고려하지 않은 평가가 모델의 실제 안전성을 과대평가해 왔다는 뜻입니다. VSS 와 SlotGCG 는 어떤 최적화 기반 공격에도 붙일 수 있어 red teaming 의 평가 범위를 넓힙니다.