Advertisement

Comparing Bad Apples to Good Oranges

阅读量:

本篇文章属于LLM系列内容,主要涉及对《Comparing Bad Apples to Good Oranges: Aligning Large Language Models __ via Joint Preference Optimization》这一文献的译介工作。

将坏苹果与好橙子进行比较:通过联合偏好优化对齐大型语言模型

  • 摘要
    • 1 引言
    • 2 背景介绍
    • 3 基于DOVE框架的联合偏好优化方法
    • 4 反馈协议间的交互影响
    • 5 大型语言模型的对齐策略
    • 6 相关研究综述
    • 7 结论部分

摘要

获取大型语言模型(LLM)对齐的一种普遍采用的技术手段,是借助于在固定上下文条件下生成多个文本并进行比较,以识别人类偏好。然而,这种技术仅在相同上下文环境下利用成对比较的方式进行操作。实际上,这种基于条件的排名方式往往难以全面反映人类偏好的多维特性。在本研究中,我们对传统偏好获取的范式进行了重新审视,并引入了一个新的维度,该维度建立在指令与响应对共同激发偏好的基础上。尽管以往的偏好优化方法主要针对条件排名机制(如DPO)进行设计,但本文提出的偏好获取方案则引入了DOVE这一新型优化目标,旨在使所选指令-响应对的联合概率高于被拒绝的对应组合。值得注意的是,在摘要任务和开放式对话数据集上的实验结果表明,基于DOVE训

全部评论 (0)

还没有任何评论哟~