论文:LLM 自动作文评分的“母语偏见”——跨题稳健,却对不同母语考生打分有别

一项研究用 LoRA 微调的开源模型 Gemma-3-27B 在 TOEFL11 全量语料(1.21 万篇、11 种母语、8 个题目)上评估 AES:整体档位一致率 77.79%、QWK 0.702、跨题稳健,但暴露出第一语言(L1)相关的评分差异。
用 1.21 万篇 TOEFL 作文做“压力测试”
这篇论文(arXiv:2607.14605)研究 LLM 自动作文评分(AES)的跨题泛化与第一语言(L1)评分效应。它沿用 “AiAWE” 系统同样的模型与推理配置——一个用 480 篇(两个题目)议论文微调过的 LoRA-adapted Gemma-3-27B-it 开源模型,然后在 TOEFL11 全量语料上评估:1.21 万篇作文、来自 11 种母语背景的考生、跨 8 个题目,且这些题目训练时都没见过。
结果:跨题很稳
模型原始分(0.5–5.0)被映射到 ETS 使用的三档(低/中/高)以便直接对比。整体档位一致率 77.79%,二次加权 kappa(QWK)0.702,相邻档一致率高达 99.98%。关键是:8 个未见题目上准确率都很稳,与训练主题相关的题目并无优势——说明跨题泛化稳健。
隐忧:第一语言(L1)偏见
但研究同时发现了与考生第一语言相关的评分差异——即“母语偏见”。这意味着:即便一个 AES 模型跨题泛化很好,它在不同母语群体上的评分公平性仍需单独审视。对把 LLM 用于高利害评估(考试、招聘、教育)的场景,这是一个必须正视的信号:整体准确率高 ≠ 对每个群体都公平。开源可复现的评测(同模型、同配置、公开语料)也让这类公平性审计更容易被独立验证。