大模型◆ AI 生成 · 已溯源

单词普查:44 个语言模型在答案选择上的趋同性分析

单词普查:44 个语言模型在答案选择上的趋同性分析
结论前置 / TL;DR

在无系统提示、单轮问答条件下,44 个语言模型对 31 类开放性单字/词问题(如“说出一种树”)的回答高度趋同——例如“任选一个词”时,41% 的模型输出 “serendipity”;该研究提出标准化轻量评估协议 One-Word Census,并发现趋同强度极端(7/31 类别中单一答案占比超 80%),但模型间 conformity 差异达 4 倍以上,且与模型类型强相关:persona- 和 community-tuned 模型最偏离群体共识。

研究方法:One-Word Census 协议

  • 使用 31 个极简单轮提示(single-turn prompts),每类提示指定一个具有大量合法单字/词答案的语义类别(如 "Name a tree."、"Name a color.");
  • 每个模型对每个提示重复回答 4 次,全程禁用 system prompt;
  • 答案比对采用 exact-match on normalized tokens(标准化后 token 级精确匹配),不依赖 embedding 或人工评判;
  • 成本约每模型 1 美元,全部实验基于 arXiv:2607.12796v1 实现。

核心发现

  • 趋同性(convergence)普遍存在且强度惊人:在 31 个类别中,7 类出现单一答案覆盖全模型回答超 80%(如 "Pick a word -- any word." → "serendipity" 占 41%);
  • 模型间 conformity 差异显著:最高与最低模型的 answer-choice surprisal(留一法计算:某模型答案在其余模型联合分布下的平均 −log₂ 概率)相差超 4 倍;
  • 差异具有结构性:persona-tuned(如 Claude-instant-1.2)与 community-tuned(如 OpenAssistant、zephyr-7b-beta)模型显著偏离群体分布,而 base 模型(如 Llama-2-7b-chat、Gemma-2b)和 instruction-tuned 模型(如 Mistral-7b-instruct)更趋一致。

方法论贡献

  • 提出 One-Word Census —— 一种低成本、高复现性、无需微调或标注的模型行为探针;
  • 揭示语言模型输出分布并非均匀采样,而是受训练数据隐式先验与对齐策略共同塑造的结构化偏置;
  • 为模型可解释性、安全对齐评估及社区偏好建模提供新维度:answer-choice surprisal 可作为衡量个体模型‘共识偏离度’的量化指标。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12796
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。