Advertisement

HelpSteer2: Open-source dataset for training top-performing reward models

阅读量:

本篇文章属于LLM系列内容,主要涉及对《HelpSteer2: Open-source dataset for training top-performing reward models》这一文献的译介工作。

HelpSteer2:用于训练表现最佳的奖励模型的开源数据集

  • 摘要
    • 1 引言
    • 2 数据集
    • 3 奖励模型
    • 4 对齐模型
    • 5 结论

摘要

构建具备高质量偏好的数据集对于训练奖励模型具有关键作用,此类模型能够有效引导大型语言模型(LLM)生成符合人类偏好的优质输出。随着LLM能力的持续增强与协同性能的提升,现有授权的偏好数据集如Open Assistant、HHRLHF和HelpSteer亟需更新,以维持其在奖励建模过程中的适用性。从GPT-4等封闭式LLM中获取偏好数据的方式在商业应用方面存在诸多限制。为提升生成内容及属性标注的质量水平,我们推出了HelpSteer2,这是一个采用CC-BY-4.0协议授权的偏好数据集。借助基于HelpSteer2训练出的强大内部基础模型,截至2024年6月12日,我们在Reward Bench核心数据集上实现了SOTA成绩(92.0%),超越了当前公开及专有模型的表现。特别值得关注的是,HelpSteer2仅包含一万组响应对,相较于现有偏好数据集(如HH-RLHF)减少了整整一

全部评论 (0)

还没有任何评论哟~