누드를 지웠더니 사람도 같이 사라졌다
Co-occurring Associated REtained concepts in Diffusion Unlearning
- 논문
- Co-occurring Associated REtained concepts in Diffusion Unlearning
- 저자
- Miso Kim, Georu Lee, Yunji Kim, Hoki Kim*, Jinseong Park*, Woojin Lee** 공동 교신저자 · Dongguk University-Seoul, Chung-Ang University, Korea Institute for Advanced Study
- 학회
- The 14th International Conference on Learning Representations (ICLR 2026)
- 트랙
- Poster
- 링크
- OpenReviewGitHub
배경
확산 모델은 대규모 데이터로 학습하는 과정에서 유해하거나 NSFW 인 이미지를 만들 수 있는 능력까지 함께 얻습니다. 이를 사후에 걷어 내는 방법이 machine unlearning 이고, 최근에는 목표 토큰의 노이즈 예측을 빈 프롬프트 쪽으로 밀어내도록 모델을 미세조정하는 post-hoc erasure 가 주로 쓰입니다.
문제는 이 방식이 목표 개념만 지우지 않는다는 점입니다. 목표와 함께 등장하던 무해한 개념까지 같이 억눌립니다. nudity 를 지우면 person 이라는 개념이 함께 무너져, "A person" 이라는 평범한 프롬프트에도 사람 대신 건물이나 뭉개진 이미지가 나옵니다.
본 논문은 이렇게 억울하게 억눌리지만 반드시 지켜야 할 공기 개념을 CARE (Co-occurring Associated REtained concepts)로 정의합니다. 그리고 언러닝 이후 이들이 얼마나 보존됐는지를 직접 재는 CARE score 를 제안합니다. 언러닝된 모델로 해당 개념을 생성했을 때, 그 이미지가 무관한 COCO 물체 토큰들보다 원래 개념과 더 가깝게 나오는 비율을 CLIP 유사도로 측정하는 방식입니다. 사람이 직접 라벨링한 기준과 대조해 신뢰도를 확인했습니다.
제안 방법
ReCARE(Robust erasure for CARE)는 지켜야 할 어휘 목록인 CARE-set 을 자동으로 만드는 데서 출발합니다. 별도 데이터를 모으지 않고, 어차피 학습에 쓰는 대상 이미지에서 공기 후보 토큰을 뽑습니다. 실제 이미지에 함께 나타난 단어들이므로 억지로 고른 목록이 아닙니다.
뽑은 후보에는 목표와 사실상 같은 말인 유해한 공기어와, CARE 로 볼 수 없는 무관한 토큰이 섞여 있어 두 단계로 걸러 냅니다. 먼저 전역 군집화로 지울 대상과 지나치게 가깝거나 지나치게 먼 토큰을 떨어내고, 다음으로 군집 안에서 다시 세밀하게 추립니다.
완성된 CARE-set 은 학습에서 두 가지 역할을 동시에 합니다. Retain Loss 에서는 지켜야 할 대상을 알려 주는 보존 신호가 되고, Erase Loss 에서는 어디까지 지워야 하는지 방향을 잡아 주는 기준이 됩니다.
실험 설정
- 대상 개념
- Nudity, 화풍(Van Gogh), 사물(Tench) 세 가지
- 비교 대상
- STEREO, ESD, UCE, AdvUnlearn, AGE, MACE, RECE, SPM, FMN, SalUn, EraseDiff 등 최신 언러닝 기법 11종
- 공격
- 적대적 프롬프트에 대한 견고성을 보기 위해 UnlearnDiff(UD), Ring-A-Bell(RAB), CCE 세 가지
- 지표
- 견고성은 공격 성공률 ASR, 유용성은 COCO-30K 의 FID 와 CLIP Score, 보존은 CARE score. 셋을 레이더 차트 넓이로 합친 RATIO 를 대표 지표로 사용
결과
- Nudity 언러닝에서 RATIO 0.76 으로 1위였습니다. 원본 SD v1.4 가 0.56, 가장 근접한 AGE 가 0.56, STEREO 는 0.21, AdvUnlearn 은 0.18 이었습니다. 견고성과 유용성과 보존을 함께 놓고 보면 격차가 분명합니다.
- 지우는 성능 자체도 최고 수준이었습니다. 공격 없는 조건과 UnlearnDiff 공격에서 ASR 0.00%였고, 가장 까다로운 CCE 공격에서도 11.14%에 그쳤습니다. 같은 CCE 에서 AGE 는 27.27%, MACE 는 61.82%, AdvUnlearn 은 65.45%로 대부분의 기존 방법이 목표 개념을 다시 만들어 냈습니다.
- 차이를 가른 것은 보존입니다. STEREO 는 ASR 0.00%로 완벽하게 지웠지만 CARE score 가 0.11 까지 떨어져 person 개념이 사실상 파괴됐고, AdvUnlearn 도 0.36 이었습니다. ReCARE 는 같은 수준으로 지우면서 CARE score 0.94 를 지켰습니다. 언러닝하지 않은 원본이 0.97 입니다.
- 유용성 손실도 작았습니다. COCO-30K 기준 CLIP Score 0.3053, FID 13.85 로 원본 SD v1.4 의 0.3136, 14.12 에 가깝습니다. 같은 조건에서 STEREO 는 FID 가 17.83 까지 나빠졌습니다. Van Gogh 화풍과 Tench 사물에서도 같은 경향이 나타났습니다.
의의
유해 개념을 얼마나 잘 지웠는지만 보면 언러닝은 쉬워 보입니다. 전부 지워 버리면 되기 때문입니다. 실제로 지우기 성능이 가장 좋은 방법이 사람이라는 개념까지 함께 파괴하고 있었습니다. CARE score 는 이 손실을 처음으로 수치로 드러냈고, ReCARE 는 지켜야 할 어휘를 학습 안으로 끌어들여 지우기와 보존을 동시에 만족시켰습니다.