等化几率(equalized odds)
/ EE-kwuh-lyzd ODZ /
等化几率是一种公平定义,与人口统计均等不同,它会去关注「这个决定是否正确」。它问的是:在那些「本应得到肯定答复」的人当中,模型给出肯定的可能性,是否不论群体都一样?而在那些「本应得到否定答复」的人当中,它错误地给出肯定的可能性,是否同样不论群体都一样?说白了就是:模型犯错——无论哪一类错——的比率,在各群体之间应当相等。
假设一项医学检查会把患者标记为「需要复诊」。等化几率要求:在真正患病的人里,每个群体被查出来的比例应当相同(真阳性率相等);在其实健康的人里,每个群体被误报的比例也应当相同(假阳性率相等)。它有意允许各群体「被标记的总比率」不同——如果他们的实际需求本就不同;它所禁止的,是那种比如在一个群体里能查出90%的病人、在另一个群体里却只查出60%的系统。
它为何重要:等化几率瞄准的是比人口统计均等更尖锐的伤害。它直接对抗「工具对一个群体好用、对另一个群体糟糕」的局面——即一个工具因你是谁,而更容易冤枉你,或更容易漏掉真实的病例。这恰恰是现实系统屡屡跌进的故障模式:从对深肤色面孔误判率更高的人脸识别,到对某个社区过度标记的风险评分。它的取舍要诚实交代:强推它可能逼模型整体准确率下降,而且你通常无法让它与「校准一致」同时成立。
一个欺诈检测系统,拦截了来自某国4%的合法交易,却拦截了来自另一国同样合法的交易中的12%。两个群体的假阳性率不同,因此违反了等化几率——第二个国家里清白的顾客,承担了系统更多的错误。
等化几率要拉平的是「错误率」,而不只是「整体通过率」——它追问的是:谁在为这些错误买单。
一个常见的混淆:等化几率不等于人口统计均等。「均等」拉平的是「给出肯定的频率」;而「等化几率」拉平的是「对那些应得者给出肯定的频率」(以及错误地给不应得者的频率)。当各群体在真实结果上确有差异时,二者会激烈地分道扬镳。