InfoResearchPreprint
Weeding Out Bad Seeds: Initial-Noise-Robust Unlearning for Text-to-Image Diffusion Models
- Published
- Record updated
Summary
Researchers show that current state-of-the-art unlearning methods for Text-to-Image diffusion models are brittle: suppressed concepts re-emerge under specific random initial noise, a failure they call "probabilistic forgetting." They attribute this to uniform Gaussian sampling during unlearning, which yields sparse, uninformative gradient updates, and propose a concept-conditioned Adaptive Noise Sampling strategy. Across six unlearning methods and four backbones, it cuts conditional nudity re-emergence by 67.2% on average over four baselines and lowers attack success rates.
Related items
- InfoDoes Target Alignment Mean Target Recovery? An Evidence-Ladder Study of Adversarial Claims on Contrastive EncodersSimilar attack · Arxiv (cs.RO + cs.CV security)
- InfoBRANCH: Bypassing Multi-Scanner AI GuardrailsSimilar attack · Arxiv (cs.CR + cs.CL + cs.LG)
- InfoDetecting Adversarial Images through Response Profiles of Vision-Language ModelsSimilar attack · Arxiv (cs.RO + cs.CV security)
- InfoGraphRectify: Graph-Based Transfer of Adversarial Example Detectors Across Neural NetworksSimilar attack · Arxiv (cs.RO + cs.CV security)
- InfoVCR-Bench: A Modular Open-Source Benchmark for Video Classification RobustnessSimilar attack · Arxiv (cs.RO + cs.CV security)