Advertisement

NER-模型评估:词级评估与实体级评估的Precision、Recall和F1分数

阅读量:

一、概述

评估命名实体识别的标准包括两个关键因素:一是识别出的实体边界的准确性;二是所识别实体类别标签的准确性。常见错误类型主要包括未检测到重要 entities 或者将非 actual entities 当作真实存在的 entities;还有将不同类别中的 objects 错误归为同一类别;以及在 tagging过程中出现模糊不清的情况。

  • 文本信息准确,数据类型标注可能存在误差;
    • 相反地,边缘定位不准确,但实体名称及其类别标记很可能准确无误。

在二分类模型中,其预测结果与真实结果可能取值为0或1。为了便于标识区分,在后续分析中采用N代表0、P代表1,并以T标记正确预测、F标记错误判断。将这些配对组合起来,则会形成如图所示的混淆矩阵(特别指出:所有配对组合的结果均基于预测输出进行分析)。

因为1与0被视为数字而具有阅读性不佳的特点, 所以我们选择将P用于表示1而N用于表示0这两种情况.经过转换后得到的结果包括PP、PN、NP以及NN四种组合.其可读性同样较差,目前尚难以直观判断这些预测是否准确.为了更加清晰地区分这些预测结果是否准确,我们决定将其中一个符号修改为T与F,从而更容易识别各个情况.

![在这里插入图片描述](https://ad.itadn.com/c/weblog/blog-img/images/2025-05-31/W4VNIPkjzU

全部评论 (0)

还没有任何评论哟~