王昊奋《知识图谱学习笔记》第三讲:知识抽取与挖掘(上)
发布时间
阅读量:
阅读量
本笔记是依据王昊奋老师所讲授的知识图谱入门教程第三讲内容整理而成。整体而言,该课程讲解了知识图谱的三种数据来源,并针对每种来源阐述了对应的知识抽取方式,同时展示了佛学知识图谱的构建实例,并布置了两道运用正则表达式进行知识抽取的练习题。
由于视频内容较为丰富,我主要聚焦于第一部分内容,即对非结构化数据的知识抽取方法,具体涉及文本处理的相关技术。至于结构化数据与半结构化数据的相关内容,仅作初步了解,笔记中对此部分的总结相对简略。最后的案例具有较高的参考价值,不仅提供了在线展示链接,还附有相关论文,对学习和实践均具启发意义。
前言 知识图谱数据来源和知识抽取方式
知识图谱的数据来源可划分为三类:结构化、半结构化以及非结构化。
-
结构化数据主要包括链接数据与数据库。
- 在数据库中进行知识抽取时,常用的方法为D2R,其主要挑战在于如何处理诸如嵌套表等复杂表格数据。对于链接数据的知识抽取,则主要采用图映射的方式,其核心难点在于实现数据对齐。若希望从开放知识图谱构建一个特定领域的知识图谱,一种较为便捷的手段是应用图映射技术。在此过程中,需要依据自身领域知识图谱所定义的schema,完成开放知识图谱与目标领域知识图谱之间的数据对齐。
-
半结构化数据涵盖网页中的表格、列表以及百科资料中的信息。
- 针对这类数据的知识
全部评论 (0)
还没有任何评论哟~
