大模型◆ AI 生成 · 已溯源

WebGPT:通过文本浏览器增强语言模型事实准确性

WebGPT:通过文本浏览器增强语言模型事实准确性
结论前置 / TL;DR

OpenAI 通过在文本浏览器交互数据上对 GPT-3 进行监督微调与强化学习(RLHF),显著提升其对开放性问题的回答事实准确性,且无需修改模型架构。

核心方法

WebGPT 基于 GPT-3(具体为 davinci 模型)构建,不引入新参数或结构,而是通过模拟人类使用文本浏览器(如链接点击、页面滚动、摘要提取)的行为轨迹进行训练。训练流程包含两阶段:

  • 监督微调(SFT):使用人工编写的浏览器交互演示数据(含搜索、浏览、引用步骤)对 GPT-3 进行初步对齐;
  • 基于人类反馈的强化学习(RLHF):利用人类标注的偏好数据(比较不同回答+证据链的质量)优化奖励模型,并通过 PPO 算法更新策略。

关键结果

  • 在 RealNews dataset 和 ELI5 测试集上,WebGPT 的答案事实准确率显著优于 baseline GPT-3(davinci)及 InstructGPT(text-davinci-001);
  • 生成答案时自动附带可验证的网页引用(URL + 文本片段),支持溯源;
  • 模型未接入实时网络——所有浏览行为均在离线构建的 Common Crawl + Wikipedia 子集上模拟执行,确保可控性与可复现性。

技术定位

该工作属于 LLM 领域中「外部知识整合」的经典范式探索,早于 RAG(Retrieval-Augmented Generation)成为主流方案,为后续如 OpenAI 的 WebPilot、Google 的 Search-Google-Gemini 联动等提供了重要方法论基础。论文发布于 arXiv:2112.09861。

来源溯源(合规留痕)
https://openai.com/index/webgpt
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。