AREA 01
Trustworthy AI
LLM & Agent SafetyUnlearning & PrivacyAdversarial RobustnessOptimization StabilityFairness
모델이 언제, 왜 실패하는지를 먼저 규명하고, 그 결과를 방어 기법 설계로 연결합니다. 2020년 Optimization Stability와 Fairness에서 시작해, 최근 LLM jailbreak와 diffusion unlearning으로 확장됐습니다.
연도별 논문16편
2026년 3편 · NRF 우수신진 과제 진행 중
LLM & Agent Safety
챗봇과 AI 에이전트를 먼저 공격해보고 막는 연구
- 대화형 AI가 유해한 답을 내놓게 만드는 공격 기법 설계
- 뚫리는 지점을 찾아 방어에 반영, 한국어 포함 여러 언어에서 검증
- FAGEN@ICML2026What Did You Do Behind My Back?! Covert Indirect Prompt Injection on Tool-Using LLM Agents
- ICLR2026SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
- Information Sciences2025Towards undetectable adversarial attack on time series classification
- Applied Soft Computing2025Black-box adversarial examples via frequency distortion
Unlearning & Privacy
AI가 배운 것 중 지워야 할 정보만 골라 지우는 기술
- 지울 정보만 선택적으로 삭제하고 나머지 성능은 그대로 유지
- 데이터를 암호화된 채로 두고 학습하는 방법 연구
Adversarial Robustness
적대적 노이즈에 흔들리지 않는 AI 모델 개발
- 눈에 보이지 않는 노이즈가 AI 판단을 뒤바꾸는 현상 규명
- 그런 노이즈에서도 안전한 범위를 수치로 증명하는 모델 설계
- NeurIPS2021Towards Better Understanding of Training Certifiably Robust Models against Adversarial Examples
- Neural Networks2023Bridged adversarial training
- J. Ambient Intelligence2024Sliced Wasserstein adversarial training
- Engineering Applications of AI2024Evaluating practical adversarial robustness of fault diagnosis systems via spectrogram-aware ensemble method
- Information Sciences2025Towards undetectable adversarial attack on time series classification
- Applied Soft Computing2025Black-box adversarial examples via frequency distortion
Optimization Stability
학습 도중 모델이 무너지지 않게 만드는 기술
- 학습 중 갑자기 성능이 무너지는 순간의 원인 규명
- 끝까지 안정적으로 학습되는 방법 설계
- AAAI2020Understanding catastrophic overfitting in single-step adversarial training
- IEEE Access2026Exploring the Effect of Multi-Step Ascent in Sharpness-Aware Minimization
- Applied Soft Computing2023Fast sharpness-aware training for periodic time series classification
Fairness
특정 집단에게 불리하게 판단하지 않는 AI 개발
- 성별·연령 같은 정보 때문에 생기는 차별 완화
- 채용 면접 평가처럼 사람에게 직접 영향을 주는 판단에 적용
- Information Sciences2021Fair clustering with fair correspondence distribution
- IEEE Access2023Fairness-Aware Multimodal Learning in Automatic Video Interview Assessment
- IEEE Access2020Joint transfer of model knowledge and fairness over domains
- 대한산업공학회2023멀티모달을 사용하는 AI 면접에서의 공정성 개선
ICLR 2026 2건 · NeurIPS · AAAI · Neural Networks · Information Sciences
자세히