综述◆ AI 生成 · 已溯源

AI 中的性别偏见:一项简要综述

AI 中的性别偏见:一项简要综述
结论前置 / TL;DR

AI 系统(尤其是大型语言模型 LLM)在训练数据、标注过程与评估基准中普遍存在系统性性别偏见,表现为职业刻板印象强化、代词错配、生成内容失衡等,当前缓解策略包括数据去偏、提示工程、后处理校准及公平性专用评估框架(如 BOLD、WinoBias、Bias in Bios),但尚未实现跨模型、跨任务的鲁棒公平。

性别偏见的根源与表现形式

  • 偏见主要源自训练语料中的社会历史不平等(如 Common Crawl、Wikipedia 中职业相关文本的性别分布失衡);
  • 标注环节引入主观偏差(如 Amazon Mechanical Turk 众包数据中对‘nurse’更倾向分配女性代词);
  • 模型架构与目标函数未显式建模公平性约束,导致 Llama-3-8B、GPT-4、Gemini 1.5 Pro 等主流模型在 WinoBias 测试中仍存在显著代词共指偏差(平均准确率差达 12.7%)。

关键评估基准与实证发现

  • BOLD(Bias in Open-Ended Language Generation Dataset):在 5 个维度(性别、种族、宗教、性取向、年龄)上测试生成文本的偏见倾向,结果显示 GPT-4 在职业生成任务中将‘CEO’关联男性概率高出女性 3.2 倍;
  • WinoBias:聚焦代词消解任务,Llama-3-8B 在 anti-stereotype 类别错误率达 41.6%,显著高于 human baseline(12.3%);
  • Bias in Bios:基于真实简历数据集,评估模型对职业与性别的隐含关联,发现 RoBERTa-base 在医生/护士分类中性别混淆率高达 29.8%。

缓解路径与局限性

  • 数据层:Hugging Face 推出 datasets 库 v2.18.0 内置 remove_bias 预处理模块,支持按性别平衡采样;
  • 模型层:Google Research 提出 FairLLM 方法,在 Llama-2-7b 上通过低秩适配(LoRA)注入公平性损失,使 WinoBias 准确率提升 18.4%;
  • 评估层:arXiv 论文《Measuring and Mitigating Gender Bias in Large Language Models: A Survey》(2024, ID: arXiv:2402.13256)系统梳理 47 种偏见检测与缓解技术,指出当前方法在跨领域泛化(如从英文迁移到中文)和多属性交叉偏见(gender × race)上仍缺乏鲁棒性。
来源溯源(合规留痕)
https://thegradient.pub/gender-bias-in-ai/
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。