南京航空航天大学&江西财经大学|一种面向文生图扩散模型微调中数据集过度使用检测的数据集水印方法(IEEE TDSC 2026)

近年来,Stable Diffusion 等文生图扩散模型快速发展,高质量开源数据集为模型训练和微调提供了重要支撑。然而,随着 LoRA 等轻量化微调技术的普及,开源数据集被未经授权或过度使用的风险也日益突出。如何在保证数据正常使用的同时实现数据集溯源,成为一个亟待解决的问题。
现有数据集保护方法主要包括指纹、对抗扰动、后门水印和二进制字符串水印等方案,但它们普遍存在计算开销大、影响数据质量、容易被检测移除或信息容量有限等问题。更重要的是,当多个数据集采用相同的水印方式时,很难准确判断可疑模型究竟使用了哪个数据集进行微调。针对这一问题,本文提出了一种面向文生图扩散模型 LoRA 微调的数据集水印方法 DSW(Dataset-Specific Watermarking)。
图1多个数据集采用相同水印时难以准确定位数据来源
DSW 的核心思想是:为每个数据集嵌入一张专属水印图像,并能够从可疑模型生成的图像中恢复该水印。作者设计了编码器和解码器,分别负责水印嵌入和水印提取,并通过联合优化,使水印能够在模型微调后仍被稳定恢复。整个过程无需修改文本提示,仅需对数据集图像进行不可见水印嵌入,在保证数据可用性的同时降低了提示词水印带来的分布偏移风险。
与传统仅检测“是否存在水印”的方法不同,DSW 能够建立受保护数据集与嫌疑模型之间的一一对应关系。验证阶段提供两种验证方式:一种基于 PSNR 和 SSIM 的相似度计算,另一种基于二分类器。当恢复出的水印与目标水印一致时,即可判定模型使用了对应的数据集进行微调;若只能恢复空白图像,则说明模型未学习到该数据集水印。

图2 方法整体流程:水印嵌入和水印提取
实验分别在 Pokémon BLIP Captions、Simpsons BLIP Captions 和 FaceCaption 三个数据集上开展。结果表明,DSW 在可用性、有效性、隐蔽性和鲁棒性方面均表现优异:生成图像质量基本不受影响;两种验证方式均能够准确完成版权验证,其中基于分类器的方法达到 100% 检测准确率;水印具有良好的视觉隐蔽性;面对中心裁剪、高斯噪声、高斯模糊、JPEG 压缩、DiffPure 净化攻击以及提示词改写等操作,仍能保持可靠的验证效果。此外,DSW 在 LoHa、LoKr 等不同 LoRA 变体下依然具有良好的迁移能力,即使仅对部分数据进行水印嵌入,也能够保持较高的验证成功率。

图3 原始图像、水印图像及水印恢复效果
总体来看,本文提出的数据集水印方法 DSW,实现了受保护数据集与可疑模型之间的一一对应验证,在保证数据可用性和水印隐蔽性的同时,提高了文生图扩散模型微调场景下的数据集版权保护能力。未来,作者将进一步探索更复杂微调方式、更强攻击以及多数据集训练场景下的数据集版权保护问题。
论文信息
该研究工作发表在 IEEE Transactions on Dependable and Secure Computing(IEEE TDSC),2026年第23卷第3期。作者依次为南京航空航天大学黄智慧,江西财经大学肖祥立(通讯作者)、张玉书和方玉明。
Huang Z, Xiao X, Zhang Y, et al. I've Got Proof! Dataset-Specific Watermarking for Detecting Excessive Dataset Usage in Text-to-Image Diffusion Model Fine-Tuning[J]. IEEE Transactions on Dependable and Secure Computing, 2026, 23(3): 6828-6842.DOI: 10.1109/TDSC.2026.3668814
供稿:肖祥立
义务编辑与校对:薛禹良博士