大模型◆ AI 生成 · 已溯源
WebGPT:通过文本浏览器增强语言模型事实准确性

结论前置 / TL;DR
OpenAI 通过在文本浏览器交互数据上对 GPT-3 进行监督微调与强化学习(RLHF),显著提升其对开放性问题的回答事实准确性,且无需修改模型架构。
核心方法
WebGPT 基于 GPT-3(具体为 davinci 模型)构建,不引入新参数或结构,而是通过模拟人类使用文本浏览器(如链接点击、页面滚动、摘要提取)的行为轨迹进行训练。训练流程包含两阶段:
- 监督微调(SFT):使用人工编写的浏览器交互演示数据(含搜索、浏览、引用步骤)对 GPT-3 进行初步对齐;
- 基于人类反馈的强化学习(RLHF):利用人类标注的偏好数据(比较不同回答+证据链的质量)优化奖励模型,并通过 PPO 算法更新策略。
关键结果
- 在 RealNews dataset 和 ELI5 测试集上,WebGPT 的答案事实准确率显著优于 baseline GPT-3(davinci)及 InstructGPT(text-davinci-001);
- 生成答案时自动附带可验证的网页引用(URL + 文本片段),支持溯源;
- 模型未接入实时网络——所有浏览行为均在离线构建的 Common Crawl + Wikipedia 子集上模拟执行,确保可控性与可复现性。
技术定位
该工作属于 LLM 领域中「外部知识整合」的经典范式探索,早于 RAG(Retrieval-Augmented Generation)成为主流方案,为后续如 OpenAI 的 WebPilot、Google 的 Search-Google-Gemini 联动等提供了重要方法论基础。论文发布于 arXiv:2112.09861。
来源溯源(合规留痕)
https://openai.com/index/webgpt