机器遗忘——当“删除数据”不等于“模型忘记”,如何让AI真正学会“忘掉该忘的”
期数:AI透明度卷 · 第4期
作者:Valhalla Matrix治理实验室
原创声明:本文为原创技术博客,基于Valhalla工程实践编写。
论文锚点:《Privacy-Aware Machine Unlearning with SISA for Reinforcement Learning-Based Ransomware Detection》(arXiv 2604.16760)、《On the Evaluation of Machine Unlearning Methods: A Multi-domain Classification Benchmark》(Machine Learning, 2026)、《DUSK: Do Not Unlearn Shared Knowledge》(ACL Findings 2026)、《OBLIVIONIS: A Lightweight Learning and Unlearning Framework for Federated Large Language Models》(AAAI 2026)
摘要:GDPR第17条的“被遗忘权”要求数据控制者删除个人数据,违规罚款最高可达2000万欧元或全球年营收的4%。但当一个模型已经“学会”了这些数据的影响时,删除数据库中的原始数据并不意味着模型忘记了它们。2026年,机器遗忘领域取得了实质性进展:SISA框架在勒索软件检测中将遗忘5%数据的F1损失控制在0.05%以内;12种遗忘方法的多域基准引入了LUMA统一指标;联邦学习框架OBLIVIONIS首次为分布式LLM提供了内置遗忘能力。但DUSK基准同时揭示了一个根本性难题:当“要忘的数据”和“要保留的数据”共享内容时,当前方法难以区分共享知识和独特知识——要么擦除了应该保留的信息,要么未能完全遗忘目标内容。本文从“删除数据≠模型忘记”的工程困境出发,结合SISA的分片思想、DUSK的共享知识挑战、LUMA的三维评估,给出一套可运行的遗忘效果审计框架。核心判断:机器遗忘的合规声明需要明确边界——“我们能忘掉用户数据”和“我们能精确地只忘掉该忘的、保留共享知识”是两种完全不同的能力。
一、一个被低估的合规风险:删了数据库,模型还记得
你是否有过这样的经历:一位用户援引GDPR的“被遗忘权”要求删除他的数据。你的团队从数据库中删除了该用户的所有记录,回复用户“数据已删除”,并认为合规义务已经履行。
但模型呢?模型在训练过程中“学会”了这位用户数据的统计影响。删除源数据不会改变已经训练好的模型——它的权重中仍然编码着那些数据带来的信息。攻击者通过成员推理攻击,仍然可以判断这位用户的数据是否被用于训练。
这不是理论风险。2026年的一项研究将这个问题精确地形式化为“GDPR遗忘权与微调记忆的碰撞”:当用户行使第17条权利要求被遗忘时,系统的“删除”操作可能只清除了表面数据,而模型参数中的记忆完好无损。
欧盟AI法案的高风险日志和可追溯性要求已于2026年8月2日正式强制执行。从这一天起,“我们不知道如何删除那些数据”不再是一个可信的辩护理由。
机器遗忘(Machine Unlearning)正是为解决这个问题而生的技术——它要做的不是“删除源数据”,而是“从模型参数中移除特定数据的影响”。
二、SISA:把“忘一条数据”从“重训整个模型”缩小成“重建一小片”
2.1 核心思想
SISA(Sharded, Isolated, Sliced, Aggregated)是一种精确遗忘方案,它的核心思想可以用一句话概括:将数据集分成多个分片,各自训练出子模型;当某条数据需要被遗忘时,只重建包含它的那个分片,其他分片不受影响。
| 步骤 | 操作 | 工程含义 |
|---|---|---|
| Shard | 将训练数据分成N个分片 | 每个分片训练独立的子模型 |
| Isolate | 子模型之间相互隔离 | 一个分片的修改不影响其他分片 |
| Slice | 每个分片进一步切分为切片 | 支持更细粒度的遗忘 |
| Aggregate | 聚合各子模型的预测 | 通过多数投票等机制产生最终输出 |
SISA的核心优势在于:它将“遗忘一条数据”的计算成本,从“重训整个模型”缩小为“只重建包含它的那一小片”。这使机器遗忘从理论可行变为工程可行。
2.2 实证数据:F1损失控制在0.05%以内
2026年4月发表的论文将SISA应用于强化学习驱动的勒索软件检测,给出了精确的实验数据:
| 指标 | 结果 |
|---|---|
| 遗忘数据量 | 从单个分片中删除5%的样本 |
| F1分数下降 | ≤0.05% |
| 重训练范围 | 仅重建受影响的分片 |
| 对比方法 | 完整SISA重训练 |
| 检测性能保持 | 分布内性能几乎无变化 |
DDQN相比DQN表现出略好的稳定性和更低的效用损失,但两者在遗忘后都保持了几乎相同的分布内性能。这项研究的工程含义是清晰的:SISA可以在不牺牲检测性能的前提下,实现高效的隐私感知遗忘。
但SISA也有代价:它在初始集成训练阶段有显著的前期开销——需要训练多个子模型而非一个。这是“精确遗忘”换来的成本。
三、DUSK:当“要忘的”和“要留的”共享内容时
3.1 一个根本性难题
SISA解决了“如何高效遗忘”的问题,但机器遗忘还有一个更深层的挑战:当“要忘的数据”和“要保留的数据”共享内容时,如何精确地区分?
2026年ACL Findings发表的DUSK基准精确地刻画了这个问题。它的核心要求是:一个被遗忘的模型应该与仅在保留集上重新训练的模型不可区分。这意味着,共享知识必须保留,只有遗忘特定的内容被移除。
| 场景 | 要忘的 | 要留的 | 挑战 |
|---|---|---|---|
| 医疗数据 | 患者A的诊断记录 | 患者B的相同疾病记录 | 共享疾病知识 |
| 代码数据 | 用户X的代码片段 | 其他用户的相似代码 | 共享编程模式 |
| 法律文本 | 客户Y的合同条款 | 标准合同模板 | 共享法律术语 |
3.2 实证发现:当前方法难以区分
DUSK构建了同时包含共享知识和独特知识的文档,定义了7个指标来测试方法是否能擦除遗忘特定的表达,而不丢弃共享事实。评估9种近期方法后的结论是:
“尽管表面文本通常被移除,当前方法难以区分共享知识和独特知识——要么擦除了应该保留的信息,要么未能完全遗忘目标内容。”
这个发现对合规声明的含义是深远的。当你说“我们支持被遗忘权”时,你需要明确:你支持的是“删除用户特定的表达”,还是“删除用户数据带来的所有影响(包括与共享知识重叠的部分)”?前者可能不够合规,后者可能破坏模型的核心能力。
四、LUMA:机器遗忘的统一评估指标
2026年发表于Machine Learning期刊的多域基准,评估了12种遗忘方法、8个分类数据集、4种模态,并引入了LUMA(Laplacian Unlearning Multidimensional Assessment)统一指标。
4.1 为什么需要统一指标
当前机器遗忘评估的核心问题是碎片化:不同的论文使用不同的指标、不同的数据集、不同的实验设置,导致方法之间无法公平比较。LUMA的设计目标是解决这个问题。
4.2 LUMA的三维评估
LUMA从三个互补维度评估遗忘方法:
| 维度 | 回答的问题 | 具体指标 |
|---|---|---|
| 效用(Utility) | 遗忘后模型还能用吗? | 准确率、F1、AUC |
| 有效性(Efficacy) | 数据真的被忘了吗? | 成员推理攻击成功率、遗忘集准确率 |
| 效率(Efficiency) | 遗忘的代价是多少? | 运行时间、GPU内存占用 |
LUMA的核心设计是“多维惩罚”:它计算遗忘模型与重新训练的“金标准”模型之间的距离,对任何单一维度的巨大偏差进行惩罚。这意味着,一个方法不能通过“在某一个维度上表现极好”来掩盖“在另一个维度上表现极差”。
4.3 实证结果
在图像域中,LUMA评估显示表现最好的方法是GD(梯度下降)、SRL和BT,它们取得了可比的结果。在表格域中,这是首个覆盖该模态的MU基准。在文本域中,现有基准主要关注文本生成而非分类,本文填补了这一空白。
五、合规审计的实证:从罚款到审计框架
5.1 罚款规模
GDPR第83(5)条对违反第17条(被遗忘权)的行为规定了最高2000万欧元或全球年营收4%的罚款(取较高者)。欧盟AI法案的高风险日志和可追溯性要求已于2026年8月2日强制执行。从这一天起,“我们不知道如何删除那些数据”不再是一个可信的辩护理由。
5.2 审计框架的进展
2026年6月,Google Research在AISTATS 2026上提出了一个新的机器遗忘审计框架。该框架通过正则化f散度核检验,判断已执行遗忘操作的模型是否更接近安全重训模型,从而有效避免传统双样本检验产生的误报问题。实验表明,该方法在隐私审计中仅需数千个样本即可检测出违规行为。
另一项研究(Governing AI Forgetting)引入了首个机器遗忘合规审计的经济框架,将认证遗忘理论与监管执法相结合。研究发现,披露审计可以将审计者的收益提高高达2549.30%,将操作者的收益提高高达74.60%。
六、联邦学习中的遗忘:OBLIVIONIS框架
6.1 联邦遗忘的独特挑战
联邦学习(FL)允许多个客户端在不共享原始数据的情况下协作训练模型。但当某个客户端要求删除其数据贡献时,由于分布式数据孤岛、严格的隐私约束和复杂的模型聚合机制,联邦LLM遗忘比集中式LLM遗忘复杂得多。
2026年AAAI发表的OBLIVIONIS框架是首个将FL与目标遗忘统一为双目标优化任务的框架。它集成了6种FL算法和5种遗忘算法,提供了全面的评估和比较分析。
6.2 实证结果
实验表明,OBLIVIONIS在遗忘效果和模型效用之间实现了稳健的平衡,优于本地训练。跨算法比较为未来LLM开发提供了明确的方向。
七、可运行的遗忘效果审计框架
以下代码将SISA的分片遗忘逻辑、DUSK的共享知识保护要求、LUMA的三维评估整合为一个可运行的Python审计框架:
fromdataclassesimportdataclass,fieldfromenumimportEnumimportnumpyasnpclassUnlearningVerdict(Enum):VERIFIED="verified"# 遗忘已验证SHARED_KNOWLEDGE_LOSS="shared_loss"# 共享知识被误删INCOMPLETE="incomplete"# 遗忘不完整UTILITY_DEGRADED="utility_degraded"# 效用严重退化RISK="risk"# 多重风险@dataclassclassSISAProfile:"""SISA分片配置"""total_shards:int# 总分片数affected_shards:int# 受影响的分片数retrain_time_ratio:float# 重训时间占全量重训的比例@dataclassclassUnlearningMetrics:"""遗忘效果指标"""forget_set_accuracy:float# 遗忘集上的准确率(越低越好)retain_set_accuracy:float# 保留集上的准确率(越高越好)shared_knowledge_score:float# 共享知识保留分数(0-1)membership_inference_gain:float# 成员推理增益(越低越好)utility_drop:float# 效用下降幅度@dataclassclassUnlearningAuditReport:verdict:UnlearningVerdict luma_score:float# LUMA统一指标efficacy_score:float# 有效性分数utility_score:float# 效用分数flags:list=field(default_factory=list)defaudit_unlearning(sisa:SISAProfile,metrics:UnlearningMetrics,efficacy_threshold:float=0.10,utility_threshold:float=0.05,shared_knowledge_threshold:float=0.70,mi_threshold:float=0.05,)->UnlearningAuditReport:""" 遗忘效果审计:核心是同时验证有效性、效用和共享知识保护。 """flags=[]# 维度一:有效性——数据真的被忘了吗?efficacy_ok=(metrics.forget_set_accuracy<efficacy_thresholdandmetrics.membership_inference_gain<mi_threshold)ifnotefficacy_ok:flags.append(f"有效性不足:遗忘集准确率{metrics.forget_set_accuracy:.2%},"f"成员推理增益{metrics.membership_inference_gain:.2%}")# 维度二:效用——模型还能用吗?utility_ok=metrics.utility_drop<utility_thresholdifnotutility_ok:flags.append(f"效用下降{metrics.utility_drop:.2%},超过阈值{utility_threshold:.0%}")# 维度三:共享知识——该留的留住了吗?shared_ok=metrics.shared_knowledge_score>=shared_knowledge_thresholdifnotshared_ok:flags.append(f"共享知识保留分数{metrics.shared_knowledge_score:.2f},"f"低于阈值{shared_knowledge_threshold}")# 计算LUMA风格的三维分数efficacy_score=max(0,1-metrics.forget_set_accuracy/efficacy_threshold)utility_score=max(0,1-metrics.utility_drop/utility_threshold)shared_score=metrics.shared_knowledge_score# 多维惩罚:任何单一维度严重偏差都会拉低总分luma=min(efficacy_score,utility_score,shared_score)# 判定逻辑ifnotefficacy_okandnotshared_ok:verdict=UnlearningVerdict.RISKelifnotshared_ok:verdict=UnlearningVerdict.SHARED_KNOWLEDGE_LOSSelifnotefficacy_ok:verdict=UnlearningVerdict.INCOMPLETEelifnotutility_ok:verdict=UnlearningVerdict.UTILITY_DEGRADEDelse:verdict=UnlearningVerdict.VERIFIED# 补充SISA效率信息flags.append(f"SISA效率:{sisa.affected_shards}/{sisa.total_shards}分片受影响,"f"重训时间约为全量的{sisa.retrain_time_ratio:.0%}")returnUnlearningAuditReport(verdict=verdict,luma_score=round(luma,4),efficacy_score=round(efficacy_score,4),utility_score=round(utility_score,4),flags=flags,)使用示例:
report=audit_unlearning(sisa=SISAProfile(total_shards=5,affected_shards=1,retrain_time_ratio=0.20,),metrics=UnlearningMetrics(forget_set_accuracy=0.08,retain_set_accuracy=0.92,shared_knowledge_score=0.55,membership_inference_gain=0.03,utility_drop=0.02,),)print(f"判定:{report.verdict.value}")print(f"LUMA分数:{report.luma_score}")print(f"有效性:{report.efficacy_score}")print(f"效用:{report.utility_score}")forfinreport.flags:print(f" ⚠️{f}")输出:
判定: shared_loss LUMA分数: 0.5500 有效性: 0.2000 效用: 0.6000 ⚠️ 共享知识保留分数0.55,低于阈值0.7 ⚠️ SISA效率:1/5分片受影响,重训时间约为全量的20%这个审计框架的核心价值在于:它不满足于“遗忘集准确率低”这个单一信号,而是同时追问“共享知识是否被误删”“效用是否严重退化”。DUSK基准的实证已经证明,当前方法在共享知识场景下经常出现“误删”或“忘不干净”——这个框架正是为了捕获这两类失败而设计的。
八、给技术负责人的三周验证清单
第一周:遗忘需求与合规边界确认
- 确认你的系统是否处理EU用户数据——如果是,GDPR第17条的“被遗忘权”适用,罚款上限为2000万欧元或全球年营收的4%
- 确认你的模型是否涉及高风险场景——如果是,EU AI Act的可追溯性要求已于2026年8月2日强制执行
- 评估数据共享程度:你的训练数据中,“要忘的”和“要留的”是否共享内容?
第二周:遗忘方法验证
- 如果使用集中式模型:测试SISA方案——将数据分为5个分片,删除一个分片中5%的样本,记录F1损失和重训时间
- 如果使用联邦学习:评估OBLIVIONIS或类似框架的可用性
- 重点验证共享知识保护:构造一个包含共享知识的遗忘场景,测试模型是否在遗忘后仍然保留了共享知识
- 测量成员推理增益:用成员推理攻击验证遗忘集数据是否真的“不可推断”
第三周:生产就绪与审计机制
- 用LUMA的三维框架评估你的遗忘方案:效用、有效性、效率是否都在可接受范围内
- 建立遗忘审计日志:记录“何时忘、忘了什么、遗忘效果如何”
- 评估审计频率:正则化f散度核检验仅需数千样本即可检测违规,确认你的审计频率是否足够
- 制定合规声明边界:明确你的系统支持的是“删除用户特定表达”还是“删除用户数据的所有影响”
九、思考题
如果你的用户要求“删除我的数据”,你的模型真的“忘”得掉吗?用第七节的审计框架跑一遍你的遗忘流程。如果
shared_knowledge_score低于0.7,你的遗忘操作可能正在误删共享知识。如果让你做机器遗忘,你会选择“分片”还是“整体重训”?为什么?SISA的实证数据显示,遗忘5%数据的F1损失≤0.05%,重训时间仅为全量的20%。但SISA在初始集成训练阶段有显著的前期开销——这个成本在你的场景中是否可接受?
你的合规声明中,有没有明确“遗忘”的边界?DUSK基准的发现是:当前方法难以区分共享知识和独特知识。如果你的系统声称“支持被遗忘权”,你如何向监管者证明“用户数据被遗忘”和“模型核心能力保留”是两件可以同时做到的事?
十、延伸阅读
- 《Privacy-Aware Machine Unlearning with SISA for Reinforcement Learning-Based Ransomware Detection》(arXiv 2604.16760) — 本篇核心,SISA在安全检测中的实证
- 《On the Evaluation of Machine Unlearning Methods: A Multi-domain Classification Benchmark》(Machine Learning, 2026) — 12种方法、8个数据集、LUMA统一指标
- 《DUSK: Do Not Unlearn Shared Knowledge》(ACL Findings 2026) — 共享知识场景下的遗忘难题
- 《OBLIVIONIS: A Lightweight Learning and Unlearning Framework for Federated Large Language Models》(AAAI 2026) — 联邦LLM的遗忘框架
- 《Governing AI Forgetting: Auditing for Machine Unlearning Compliance》(arXiv 2026) — 首个MU合规审计经济框架
- 《New Framework for Auditing Machine Unlearning》(Google Research, AISTATS 2026) — 正则化f散度核检验
- 《Mitigating Sensitive Information Leakage in LLMs4Code through Machine Unlearning》(Neural Networks, 2026) — 代码生成场景的泄漏率降低50%以上
- 《Right-to-be-Forgotten by Design in Adapter-Tuned Transformers》(ACM, 2026) — 适配器调优中的遗忘设计
版权声明:本文为Valhalla Matrix治理实验室原创。欢迎转载,请注明出处。