AREA 01
Trustworthy AI
모델이 언제, 왜 실패하는지를 먼저 규명하고, 그 결과를 방어 기법 설계로 연결합니다.
연구 과제
2025.03 ~ 2027.02진행 중
윤리적인 다국어 LLM 활용을 위한 문맥 기반 탈옥 가드레일 구축
한국연구재단 우수신진연구
2022.06 ~ 2025.02
인공지능 시스템의 실용화를 위한 딥러닝 안정성 알고리즘 개발
한국연구재단 기본연구
2022.07 ~ 2022.12
공정한 인공지능 면접 모델 알고리즘 개발
Genesis Lab
논문
LLM & Agent Safety
- FAGEN@ICML 2026What Did You Do Behind My Back?! Covert Indirect Prompt Injection on Tool-Using LLM Agents
- ICLR 2026SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
- Information Sciences 2025Towards undetectable adversarial attack on time series classification
- Applied Soft Computing 2025Black-box adversarial examples via frequency distortion
Unlearning & Privacy
Adversarial Robustness
- NeurIPS 2021Towards Better Understanding of Training Certifiably Robust Models against Adversarial Examples
- Neural Networks 2023Bridged adversarial training
- J. Ambient Intelligence 2024Sliced Wasserstein adversarial training
- Engineering Applications of AI 2024Evaluating practical adversarial robustness of fault diagnosis systems via spectrogram-aware ensemble method
Optimization Stability
- AAAI 2020Understanding catastrophic overfitting in single-step adversarial training
- IEEE Access 2026Exploring the Effect of Multi-Step Ascent in Sharpness-Aware Minimization
- Applied Soft Computing 2023Fast sharpness-aware training for periodic time series classification
Fairness
- Information Sciences 2021Fair clustering with fair correspondence distribution
- IEEE Access 2023Fairness-Aware Multimodal Learning in Automatic Video Interview Assessment
- IEEE Access 2020Joint transfer of model knowledge and fairness over domains
- 대한산업공학회 2023멀티모달을 사용하는 AI 면접에서의 공정성 개선
2026
- ICLR 2026Co-occurring Associated REtained concepts in Diffusion Unlearning
- IEEE Access 2026Exploring the Effect of Multi-Step Ascent in Sharpness-Aware Minimization
- ICLR 2026SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
- FAGEN@ICML 2026What Did You Do Behind My Back?! Covert Indirect Prompt Injection on Tool-Using LLM Agents
2025
- Applied Soft Computing 2025Black-box adversarial examples via frequency distortion
- Information Sciences 2025Towards undetectable adversarial attack on time series classification
2024
- Engineering Applications of AI 2024Evaluating practical adversarial robustness of fault diagnosis systems via spectrogram-aware ensemble method
- J. Ambient Intelligence 2024Sliced Wasserstein adversarial training
2023
- Neural Networks 2023Bridged adversarial training
- IEEE Access 2023Fairness-Aware Multimodal Learning in Automatic Video Interview Assessment
- Applied Soft Computing 2023Fast sharpness-aware training for periodic time series classification
- 대한산업공학회 2023멀티모달을 사용하는 AI 면접에서의 공정성 개선
2021
- Information Sciences 2021Fair clustering with fair correspondence distribution
- NeurIPS 2021Parameter-free HE-friendly Logistic Regression
- NeurIPS 2021Towards Better Understanding of Training Certifiably Robust Models against Adversarial Examples