反事实 Logit 配对模型修复

反事实 Logit 配对 (CLP) 是 TensorFlow 模型修复库中的一种技术,旨在确保当示例中引用的敏感属性被删除或替换时,模型的预测结果不会发生改变。例如,在毒性分类器中,像“我是男人”和“我是女同性恋”这样的示例不应产生不同的毒性预测。

有关此主题的深入探讨,请参阅关于反事实公平性对抗性 logit 配对反事实 logit 配对的研究。

什么时候应该使用反事实 Logit 配对?

CLP 解决了特征中引用的敏感属性发生变化导致预测结果改变(而预测结果本不应改变)的情况。通过这种方式,它试图回答以下问题:该模型是否仅因身份属性的存在而容易改变其预测结果?有关反事实公平性的详细信息,请参阅该研究论文

这一问题出现在 Perspective API 中,这是一个供开发人员和发布商用来分析评论内容是否存在潜在冒犯性或毒性文本的机器学习工具。Perspective API 以评论文本作为输入,并返回一个 0 到 1 之间的分数,用以表示评论具有毒性的概率。例如,“你是个白痴”这样的评论可能获得 0.8 的毒性概率分数,这表示读者将该评论视为毒性的可能性。

在 Perspective API 最初发布后,外部用户发现包含种族或性取向信息的身份术语与预测的毒性分数之间存在正相关性。例如,“我是女同性恋”这一短语获得了 0.51 的分数,而“我是男人”则获得了较低的 0.2 分。在这种情况下,身份术语并非被贬义使用,因此分数不应存在如此大的差异。有关 Perspective API 的更多信息,请参阅关于无意偏见与身份术语的博文。

我该如何衡量反事实 Logit 配对的效果?

如果您已评估过机器学习模型,并确定由特定敏感属性变化引起的预测结果改变会造成负面影响,那么您应该衡量此类问题的普遍程度。在二分类或多分类器的情况下,翻转 (flip) 定义为:当示例中引用的敏感属性发生变化时,分类器给出了不同的决策(例如将预测从“有毒”变为“无毒”)。在评估翻转的普遍程度时,您可以查看翻转计数翻转率。通过考量翻转可能对用户造成的伤害及其发生的频率,您可以确定这是否是一个应该通过应用 CLP 来解决的问题。有关这些指标的更多信息,请参考公平性指标指南

我可以在哪些模型类型上应用反事实 Logit 配对?

该技术可用于处理不同数据类型(如文本、图像和视频)的二分类器和多分类器。

什么时候反事实 Logit 配对不适合我?

CLP 并非适用于所有情况。例如,如果身份术语的存在或缺失确实会合法地改变分类器的预测,那么它就不适用。如果分类器的目的是确定特征是否引用了特定的身份群体,可能就是这种情况。如果分类器结果与身份群体之间的非预期相关性不会对用户产生负面影响,该方法的作用也较小。

CLP 适用于测试语言模型或毒性分类器是否仅仅因为文本中出现了“黑人”、“同性恋”、“穆斯林”等术语,就以不公平的方式改变其输出(例如将某段文本归类为有毒)。CLP 并不旨在对个人进行预测(例如通过操纵个人的身份)。有关更详细的讨论,请参阅这篇论文

请务必记住,CLP 是负责任的 AI 工具包中的一种技术,专门用于解决因特征中引用的敏感属性而导致预测改变的情况。根据您的模型和用例,考虑历史上边缘化群体是否存在性能差距也很重要,尤其是因为 CLP 可能会影响群体性能。这可以通过公平性指标进行评估,并由同样位于 TensorFlow 模型修复库中的 MinDiff 加以解决。

您还应该考虑您的产品是否确实适合使用机器学习。如果适合,您的机器学习工作流程应根据已知的推荐实践进行设计,例如具备定义明确的模型任务和清晰的产品需求。

反事实 Logit 配对是如何工作的?

CLP 通过对数据集中的原始示例和反事实示例进行 Logit 配对,为原始模型增加了一个损失函数。通过计算这两个值之间的差异,您可以惩罚导致分类器预测发生变化的敏感术语差异。这项工作基于关于对抗性 logit 配对反事实 logit 配对的研究。