Advertisement

Learning to Summarize from Human Feedback

阅读量:

从人工反馈中学写摘要

  • 引言
    • 序列到序列模型

      • 序列-序列结构

      • 存在的问题与应对策略

        • 暴露偏差
        • 评估指标
        • 应对措施
      • 图灵测试与生成对抗网络

    • OpenAI的策略

      • 全能解码器 GPT3
      • 总体设计框架
      • 最优策略梯度算法
        • 存在的问题及问题的核心问题
        • PPO
    • 实验部分

    • 展望未来

前言

近期,OpenAI再次引发广泛关注,他们通过引入人工反馈机制,成功生成出质量远超人工撰写的摘要论文。那么具体表现如何呢?以下图片将提供直观的佐证:

在这里插入图片描述

OpenAI邀请了一批人员担任标注者,每次向他们提供两篇摘要,并要求其判断哪一篇更优。可以想象,如果每次提供的两篇摘要均为人工撰写,那么大约有50%的情况下第一篇会优于第二篇。这正是上图中黑色虚线所表示的位置。图中纵坐标"Fraction preferred to ref"

全部评论 (0)

还没有任何评论哟~