Learning to Summarize from Human Feedback
发布时间
阅读量:
阅读量
从人工反馈中学写摘要
- 引言
-
序列到序列模型
-
-
序列-序列结构
-
存在的问题与应对策略
-
- 暴露偏差
- 评估指标
- 应对措施
-
图灵测试与生成对抗网络
-
-
OpenAI的策略
-
- 全能解码器 GPT3
- 总体设计框架
- 最优策略梯度算法
-
- 存在的问题及问题的核心问题
- PPO
-
实验部分
-
展望未来
-
前言
近期,OpenAI再次引发广泛关注,他们通过引入人工反馈机制,成功生成出质量远超人工撰写的摘要论文。那么具体表现如何呢?以下图片将提供直观的佐证:

OpenAI邀请了一批人员担任标注者,每次向他们提供两篇摘要,并要求其判断哪一篇更优。可以想象,如果每次提供的两篇摘要均为人工撰写,那么大约有50%的情况下第一篇会优于第二篇。这正是上图中黑色虚线所表示的位置。图中纵坐标"Fraction preferred to ref"
全部评论 (0)
还没有任何评论哟~
