SelfCAD: Protecting Your Efficient Reasoning Capabilities via Self-Cautious Insertion
Taiye Chen, Mingjie Li, Yichuan Mo, Shuo Feng, and Yisen Wang. (2026). "SelfCAD: Protecting Your Efficient Reasoning Capabilities via Self-Cautious Insertion."
Taiye Chen, Mingjie Li, Yichuan Mo, Shuo Feng, and Yisen Wang. (2026). "SelfCAD: Protecting Your Efficient Reasoning Capabilities via Self-Cautious Insertion."
Yichuan Mo, Yukun Jiang, Yanbo Shi, Mingjie Li, Michael Backes, Yang Zhang, and Yisen Wang. (2026). "TrustLDM: Benchmarking Trustworthiness in Language Diffusion Model." ICLR 2026 Trustworthy Workshop.
Yichuan Mo, Quan Chen, Mingjie Li, Zeming Wei, and Yisen Wang. (2026). "Decoding Large Language Diffusion Models with Foreseeing Movement." ICLR 2026 DeLTa Workshop.
Zeming Wei, Yifei Wang, Li Ang, Yichuan Mo, and Yisen Wang. (2026). "Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations." TPAMI 2026.
Yisen Wang, Yichuan Mo, Dongxian Wu, Mingjie Li, Xingjun Ma, and Zhouchen Lin. (2026). "On the Adversarial Transferability of Generalized "Skip Connections"." TPAMI 2026.
Yisen Wang, Yichuan Mo, Hongjun Wang, Junyi Li, and Zhouchen Lin. (2025). "Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training." arXiv preprint arXiv:2510.13361.
Ang Li, Yichuan Mo, Mingjie Li, Yifei Wang, and Yisen Wang. (2025). "Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning." arXiv preprint arXiv:2502.09673.
Yichuan Mo, Yuji Wang, Zeming Wei, and Yisen Wang. (2024). "Fight Back Against Jailbreaking via Prompt Adversarial Tuning." NeurIPS 2024.
Yichuan Mo, Hui Huang, Mingjie Li, Ang Li, and Yisen Wang. (2024). "TERD: A Unified Framework for Safeguarding Diffusion Models Against Backdoors." ICML 2024.
Ang Li, Yichuan Mo, Mingjie Li, and Yisen Wang. (2024). "PID: Prompt-Independent Data Protection Against Latent Diffusion Models." ICML 2024.
Yichuan Mo, Dongxian Wu, Yifei Wang, Yiwen Guo, and Yisen Wang. (2022). "When Adversarial Training Meets Vision Transformers: Recipes from Training to Architecture." NeurIPS 2022.
Yang Li, Yichuan Mo, Liangliang Shi, Junchi Yan, Xiaolu Zhang, and Jun Zhou. (2022). "Improving Generative Adversarial Networks via Adversarial Learning in Latent Space." NeurIPS 2022.
Qibing Ren, Yiting Chen, Yichuan Mo, Qitian Wu, and Junchi Yan. (2022). "DICE: Domain-attack Invariant Causal Learning for Improved Data Privacy Protection and Adversarial Robustness." SIGKDD 2022.
Yichuan Mo, and Shilin Wang. (2022). "Multi-Task Learning Improves Synthetic Speech Detection." ICASSP 2022.
Conference proceedings talk at Testing Institute of America 2014 Annual Conference, Los Angeles, CA, USA
Talk at London School of Testing, London, UK
Tutorial at UC-Berkeley Institute for Testing Science, Berkeley, CA, USA
Talk at UC San Francisco, Department of Testing, San Francisco, CA, USA