RULER: What’s the Real Context Size of Your Long-Context Language Models?
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要对《RULER: What’s the Real Context Size of Your Long-Context Language Models __?》这一文献进行语言转换处理。
RULER:你的长上下文语言模型的实际上下文大小是多少?
- 摘要
- 1 引言
- 2 相关研究
- 3 RULER基准测试
- 4 实验与结果分析
- 5 任务错误剖析
- 6 模型特性探讨
- 7 总结与展望
摘要
大海捞针(NIAH)测试用于衡量从大量干扰文本中提取特定信息的能力,该测试已被广泛应用于评估具备长上下文处理能力的语言模型(LM)。然而,这种基于检索的简单测试仅能体现模型对长上下文理解的表层能力。为了实现对长上下文语言模型更为全面的评估,我们设计了一种新型合成基准RULER,该基准支持针对不同序列长度和任务复杂度进行灵活配置。RULER在原有NIAH测试基础上进行了扩展,涵盖了多种类型的针头以及不同数量的针头信息。同时,RULER还引入了多跳跟踪与聚合等新任务类别,以检验模型在超出单纯上下文搜索能力之外的表现。我们在RULER上对10个长上下文语言模型及13项代表性任务进行了评估。尽管这些模型在传统NIAH测试中表现接近完美,但随着上下文长度的增长,其性能显著下降。虽然所有模型均声称支持32K或更
全部评论 (0)
还没有任何评论哟~
