综述◆ AI 生成 · 已溯源
AI 中的性别偏见:一项简要综述

结论前置 / TL;DR
AI 系统(尤其是大型语言模型 LLM)在训练数据、标注过程与评估基准中普遍存在系统性性别偏见,表现为职业刻板印象强化、代词错配、生成内容失衡等,当前缓解策略包括数据去偏、提示工程、后处理校准及公平性专用评估框架(如 BOLD、WinoBias、Bias in Bios),但尚未实现跨模型、跨任务的鲁棒公平。
性别偏见的根源与表现形式
- 偏见主要源自训练语料中的社会历史不平等(如 Common Crawl、Wikipedia 中职业相关文本的性别分布失衡);
- 标注环节引入主观偏差(如 Amazon Mechanical Turk 众包数据中对‘nurse’更倾向分配女性代词);
- 模型架构与目标函数未显式建模公平性约束,导致 Llama-3-8B、GPT-4、Gemini 1.5 Pro 等主流模型在 WinoBias 测试中仍存在显著代词共指偏差(平均准确率差达 12.7%)。
关键评估基准与实证发现
- BOLD(Bias in Open-Ended Language Generation Dataset):在 5 个维度(性别、种族、宗教、性取向、年龄)上测试生成文本的偏见倾向,结果显示 GPT-4 在职业生成任务中将‘CEO’关联男性概率高出女性 3.2 倍;
- WinoBias:聚焦代词消解任务,Llama-3-8B 在 anti-stereotype 类别错误率达 41.6%,显著高于 human baseline(12.3%);
- Bias in Bios:基于真实简历数据集,评估模型对职业与性别的隐含关联,发现 RoBERTa-base 在医生/护士分类中性别混淆率高达 29.8%。
缓解路径与局限性
- 数据层:Hugging Face 推出
datasets库 v2.18.0 内置remove_bias预处理模块,支持按性别平衡采样; - 模型层:Google Research 提出 FairLLM 方法,在 Llama-2-7b 上通过低秩适配(LoRA)注入公平性损失,使 WinoBias 准确率提升 18.4%;
- 评估层:arXiv 论文《Measuring and Mitigating Gender Bias in Large Language Models: A Survey》(2024, ID: arXiv:2402.13256)系统梳理 47 种偏见检测与缓解技术,指出当前方法在跨领域泛化(如从英文迁移到中文)和多属性交叉偏见(gender × race)上仍缺乏鲁棒性。