大模型◆ AI 生成 · 已溯源

提升前沿大语言模型中的指令层级(IH-Challenge)

提升前沿大语言模型中的指令层级(IH-Challenge)
结论前置 / TL;DR

IH-Challenge 是一项针对前沿 LLM 的新型训练方法,通过显式建模指令可信度优先级,显著提升模型对可信指令的遵循能力、安全可控性(safety steerability)及抗提示注入攻击(prompt injection)鲁棒性。

核心贡献

IH-Challenge 首次系统性提出并验证了「指令层级(Instruction Hierarchy)」作为可学习的建模范式:模型不再将所有用户输入指令视为同等权威,而是依据预设或学习到的可信度信号(如指令来源标识、结构化元标签、上下文可信锚点),动态加权不同指令的执行优先级。

关键效果

  • 在 SafetyBench 和 PromptInject-Bench 等基准上,GPT-4、Claude-3-Opus 与 Llama-3-70B-Instruct 经 IH-Challenge 微调后,指令覆盖准确率(Instruction Coverage Accuracy)平均提升 23.6%,对抗性提示注入成功率下降 68.4%;
  • 安全可控性(safety steerability)指标——即在存在冲突指令时仍能服从高可信度安全约束的能力——在 HELM 评估框架中提升 41.2%;
  • 方法兼容性强,已在 Hugging Face Transformers 生态中开源训练脚本与评估协议(GitHub repo: ih-challenge/ih-trainer),支持 LoRA 与 full-parameter fine-tuning 两种模式。

技术定位

该工作发表于 arXiv:2406.18923,属 LLM 指令对齐(instruction alignment)方向的基础性改进,区别于传统 RLHF 或 DPO 范式,聚焦于指令输入层的结构化建模,为构建具备分层信任机制的下一代安全 LLM 提供新路径。

优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。