Comparing Bad Apples to Good Oranges
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要涉及对《Comparing Bad Apples to Good Oranges: Aligning Large Language Models __ via Joint Preference Optimization》这一文献的译介工作。
将坏苹果与好橙子进行比较:通过联合偏好优化对齐大型语言模型
- 摘要
- 1 引言
- 2 背景介绍
- 3 基于DOVE框架的联合偏好优化方法
- 4 反馈协议间的交互影响
- 5 大型语言模型的对齐策略
- 6 相关研究综述
- 7 结论部分
摘要
获取大型语言模型(LLM)对齐的一种普遍采用的技术手段,是借助于在固定上下文条件下生成多个文本并进行比较,以识别人类偏好。然而,这种技术仅在相同上下文环境下利用成对比较的方式进行操作。实际上,这种基于条件的排名方式往往难以全面反映人类偏好的多维特性。在本研究中,我们对传统偏好获取的范式进行了重新审视,并引入了一个新的维度,该维度建立在指令与响应对共同激发偏好的基础上。尽管以往的偏好优化方法主要针对条件排名机制(如DPO)进行设计,但本文提出的偏好获取方案则引入了DOVE这一新型优化目标,旨在使所选指令-响应对的联合概率高于被拒绝的对应组合。值得注意的是,在摘要任务和开放式对话数据集上的实验结果表明,基于DOVE训
全部评论 (0)
还没有任何评论哟~
