ICLR 2026 Poster 2026.01.26

공격 토큰을 어디에 끼우느냐가 성패를 가른다

SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks

논문
SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
저자
Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee** 교신저자 · Dongguk University-Seoul
학회
The 14th International Conference on Learning Representations (ICLR 2026)
트랙
Poster
링크

배경

LLM 이 널리 배포되면서 jailbreak 공격으로 취약점을 찾아내는 일이 중요해졌습니다. 그중 Greedy Coordinate Gradient(GCG) 같은 최적화 기반 공격은 의미 없어 보이는 적대적 토큰 몇 개를 만들어 붙여 모델의 거부를 뚫습니다.

이 계열은 토큰을 붙일 자리를 프롬프트 맨 뒤로 고정해 왔습니다. 관행이 굳어진 탓에 다른 자리에 끼웠을 때 어떤 일이 벌어지는지는 살펴본 적이 없었습니다. 본 논문은 프롬프트 안에서 토큰을 넣을 수 있는 후보 위치를 slot 이라 부르고, 이 자리 선택이 공격 성패에 어떤 영향을 주는지 실증적으로 조사했습니다.

프롬프트 끝에만 토큰을 붙이는 GCG 계열과 취약한 자리에 나눠 끼우는 SlotGCG 비교
Figure 1. GCG 계열 공격(왼쪽)과 SlotGCG(오른쪽)의 비교입니다. 기존 방식은 적대적 토큰을 프롬프트 뒤에 몰아 붙이지만, SlotGCG 는 프롬프트 안에서 취약한 자리를 골라 나눠 끼웁니다.

제안 방법

먼저 자리를 하나씩 바꿔 가며 시험해 보니, jailbreak 취약성이 어느 slot 을 고르느냐와 강하게 연관되어 있었습니다. 같은 공격이라도 어디에 끼우느냐에 따라 결과가 달라진다는 뜻입니다.

이 관찰을 바탕으로 자리별 취약도를 수치로 재는 Vulnerable Slot Score(VSS)를 정의했습니다. SlotGCG 는 모든 slot 을 VSS 로 평가한 뒤 가장 취약한 자리들을 골라 그 지점에 최적화를 집중합니다.

이 위치 탐색은 공격 방식과 무관하게 동작하기 때문에, 기존의 어떤 최적화 기반 공격에도 그대로 얹을 수 있습니다. 추가로 드는 전처리 시간은 200ms 입니다.

실험 설정

데이터
AdvBench 의 유해 행동 50건. 허위정보, 불법 행위, 유해 콘텐츠 생성 등 여러 범주를 포함
대상 모델
Llama-2-7B, Llama-2-13B, Llama-3.1-8B-Instruct, Mistral-7B, Vicuna-7B, Qwen-2.5
기반 공격
GCG, AttnGCG, I-GCG, GCG-Hij, GBDA 각각에 SlotGCG 를 얹어 비교
방어
Perplexity Filter, Erase-and-Check(suffix·infusion), SmoothLLM(swap·insert·patch), RPO, SafeDecoding, Llama-Guard-3
판정
템플릿 기반 필터링, GPT-4 판정, 사람 확인의 3단계로 공격 성공률(ASR) 산정

결과

  1. GCG 계열 공격에 SlotGCG 를 얹으면 대부분의 모델에서 ASR 이 올랐고, 평균 14%p 상승했습니다. 공격에 강한 것으로 알려진 Llama 계열에서 특히 크게 올랐습니다. Llama-2-13B 에서 I-GCG 에 적용했을 때 ASR 94%를 기록했고, AttnGCG 에 적용했을 때는 62%p 가 올랐습니다.
  2. 방어를 걸었을 때 차이가 가장 극적이었습니다. Erase-and-Check(suffix)는 기존 공격 네 가지를 모두 ASR 0.0%로 완전히 막아냈지만, SlotGCG 를 얹자 GCG 52.0%, AttnGCG 56.0%, I-GCG 66.0%, GCG-Hij 62.0%로 되살아났습니다. Erase-and-Check(infusion) 에서도 GCG 가 24.0%에서 70.0%로 올랐습니다.
  3. 전체 방어를 평균하면 기존 방식보다 42%p 높은 ASR 을 유지했습니다. 방어가 프롬프트 끝의 토큰 덩어리를 겨냥하도록 설계돼 있는데, 여러 자리에 흩어 끼우면 그 전제가 무너지기 때문으로 보입니다.
  4. 수렴도 더 빨랐습니다. 같은 공격 효과를 더 적은 최적화 단계로 얻었습니다.

의의

지금까지의 방어는 적대적 토큰이 프롬프트 끝에 몰려 있다는 가정 위에 서 있었습니다. 삽입 위치를 바꾸는 것만으로 그 방어들이 뚫린다는 것은, 위치를 고려하지 않은 평가가 모델의 실제 안전성을 과대평가해 왔다는 뜻입니다. VSS 와 SlotGCG 는 어떤 최적화 기반 공격에도 붙일 수 있어 red teaming 의 평가 범위를 넓힙니다.

목록