大型语言模型在文本摘要领域适应性评估研究
发布时间
阅读量:
阅读量
近年来,大型语言模型(Large Language Models, LLMs)在包括抽象文本摘要在内的多种自然语言处理任务中取得了重大突破。抽象文本摘要旨在生成文档中最核心信息的精炼表达。然而,当前针对大型语言模型在不同领域文本摘要任务中的适应能力研究仍较为有限。目前的相关研究多集中于单一领域,如新闻报道或临床资料,缺乏对跨领域表现的系统性分析。
为更深入地理解这些模型在各类目标领域的适应性,我们对11种模型在文本摘要任务中的领域适应能力进行了全面测评。所涉及的模型涵盖传统的编码器-解码器架构以及多种参数规模的大型语言模型。实验分别在微调(fine-tuning)和上下文学习(in-context learning, ICL)两种设定下进行,以评估其在政府、医疗及科学等多个领域的表现。
本次评估采用的指标包括自动评估标准ROUGE和BERTScore,以及专为衡量领域适应能力而设计的一系列指标。其中包含领域词汇重叠度(Domain Vocabulary Overlap, DVO)、G-eval评分及词元分布偏移(Token Distribution Shift)等。
实验结果显示,在上下文学习设置中,大型语言模型展现出较强的领域适应能力。尤其值得注意的是,仅拥有70亿参数的小型模型,在仅需两个学习示例的情况下即可实现与大规模模型相近的表现水平。然而,G-eval评分明确揭示了
全部评论 (0)
还没有任何评论哟~
