Advertisement

RULER: What’s the Real Context Size of Your Long-Context Language Models?

阅读量:

本篇文章属于LLM系列内容,主要对《RULER: What’s the Real Context Size of Your Long-Context Language Models __?》这一文献进行语言转换处理。

RULER:你的长上下文语言模型的实际上下文大小是多少?

  • 摘要
    • 1 引言
    • 2 相关研究
    • 3 RULER基准测试
    • 4 实验与结果分析
    • 5 任务错误剖析
    • 6 模型特性探讨
    • 7 总结与展望

摘要

大海捞针(NIAH)测试用于衡量从大量干扰文本中提取特定信息的能力,该测试已被广泛应用于评估具备长上下文处理能力的语言模型(LM)。然而,这种基于检索的简单测试仅能体现模型对长上下文理解的表层能力。为了实现对长上下文语言模型更为全面的评估,我们设计了一种新型合成基准RULER,该基准支持针对不同序列长度和任务复杂度进行灵活配置。RULER在原有NIAH测试基础上进行了扩展,涵盖了多种类型的针头以及不同数量的针头信息。同时,RULER还引入了多跳跟踪与聚合等新任务类别,以检验模型在超出单纯上下文搜索能力之外的表现。我们在RULER上对10个长上下文语言模型及13项代表性任务进行了评估。尽管这些模型在传统NIAH测试中表现接近完美,但随着上下文长度的增长,其性能显著下降。虽然所有模型均声称支持32K或更

全部评论 (0)

还没有任何评论哟~