NVIDIA 开源 Nemotron 3 Embed:8B 检查点登顶 RTEB,NVFP4 在 Blackwell 上近乎无损翻倍吞吐

NVIDIA 发布开放 embedding 合集 Nemotron 3 Embed,8B 以 78.46 平均 NDCG@10 位列 RTEB 第一;1B 由 NAS 剪枝+蒸馏而来,NVFP4 量化在保留 99%+ 检索精度的同时吞吐翻倍。
一个登顶 RTEB 的开放 embedding 合集
NVIDIA 于 2026 年 7 月 15–16 日发布 Nemotron 3 Embed,包含三个开放检查点:Nemotron-3-Embed-8B-BF16、Nemotron-3-Embed-1B-BF16 与 Nemotron-3-Embed-1B-NVFP4。其中 8B 检查点以 78.46 的平均 NDCG@10 在 RTEB 检索基准上位列第一。
小模型怎么来的:NAS 剪枝 + 蒸馏
1B 版本并非从零训练,而是以 8B 为教师,通过 ModelOpt 的 NAS(神经架构搜索)剪枝,叠加 COS+MSE 蒸馏 得到——用更小的体积尽量继承 8B 的检索能力。
NVFP4:近乎无损的量化提速
面向 NVIDIA Blackwell 架构的 NVFP4 量化版本,在保留 99% 以上 BF16 检索精度的同时,吞吐最高可达 2 倍。这意味着在同等硬件上,检索/RAG 场景的向量化成本与延迟能显著下降,而精度损失几乎可以忽略。
规格与许可
三个检查点均支持 32,768 token 的输入长度,适配长文档检索;许可采用 OpenMDW-1.1。对以 RAG、语义检索为底座的应用而言,一个登顶基准、又提供 1B 小模型与 NVFP4 量化的开放合集,意味着可以在精度、体积与吞吐之间按需取舍,降低自建 embedding 服务的门槛。