命名实体识别(NER)-转录(一):doccano标注后的序列标注任务数据转录成BIO格式
发布时间
阅读量:
阅读量
Doccano是一款开放源代码的语料标注软件,主要用于实体识别任务的训练数据标注。然而,完成标注后的数据无法直接用于模型训练,仍需进行格式转换处理。以下将以BIO格式为例,说明具体的转换过程。
一、doccano标注之后的数据格式(json)
{"id": 4, "text": "?⽣益科技主要从事覆铜板制造与销售业务,销售收⼊占到公司总收⼊的81.52%。", "meta": {}, "annotation_approver": null, "labels": [[1, 5, "ORG"], [32, 38, "NUM"]]}
{"id": 6, "text": "⽬前,益科技,已是覆铜板的龙头企业。早在公司2018 年年报,⽣益科技硬质覆铜板销售总额全球排名第⼆。", "meta": {}, "annotation_appro ver": null, "labels": [[31, 35, "ORG"], [22, 27, "NUM"], [3, 6, "ORG"], [20, 22, "ORG"]]}
{"id": 9, "text": "专注⾼频覆铜板的南通项⽬⼀期产能为100w平⽶/年,现逐步投产。", "meta": {}, "annotation_approver": null, "labels": [
全部评论 (0)
还没有任何评论哟~
