摘要

  • 测试应比较相近用户、情境和后果,而不是孤立句式。
  • 实质差距需要负责人、发布标准、申诉渠道和修复有效的证据。

对话系统中的性别偏见可能来自训练材料、标签、产品规则和理解用户的方式。措辞礼貌的答案仍可能推荐不同角色、给予不同可信度,或对某类人更频繁地失败。团队应定义具有实际后果的任务,在不同语言和身份间测试成对情境,并检查后续决策,而非只看有害语言分数。下一项有效证据,是模型变更前后可重复的审计,并允许受影响者质疑结果。公平是一套运营纪律,不是界面宣称的性格。

来源