构建知识图谱 , 需要掌握一些工具 , 比如爬虫、二次等 。如果掌握了工具 , 构建知识图谱并不难 , 难的是大数据源 。一个是开放领域的知识图谱 , 一个是垂直领域的知识图谱 。数据是构建地图的最大绊脚石 。只要有数据 , 简单使用neo4j或者其他工具就可以构建地图 。
如何构建知识图谱?
【为什么构建知识图谱,如何构建知识图谱】目前的知识图谱分为两类 。一类是开放域的知识图谱 , 另一类是垂直领域的知识图谱 , 首先就是要先处理数据互联网上的数据基本上都是结构化的 , 非结构化的和半结构化的 。结构数据一般就是公司的业务数据 , 这些数据都存储到数据库里 , 从库里面抽取出来做一些简单的预处理就可以拿来使用 。半结构化数据和非结构化数据 , 比如对商品的描述 , 或是标题 , 可能是一段文本或是一张图片 , 这就是一些非结构化数据了 ,
但它里面是存储了一些信息的 , 反映到的是知识图谱里的一些属性 。所以需要对它里面进行一个抽取 , 这是构建知识图谱中比较费时费力的一个工作 , 从数据里需要抽取的其实就是之前所提到的实体、属性、关系这些信息 。对于实体的提取就是NLP里面的命名实体识别 , 这里相关的技术都比较成熟了 , 从之前传统的人工词典规则的方法 , 到现在机器学习的方法 , 还有深度学习的一些使用另外还需要做的是实体对齐和实体消歧 。
关于实体对齐 , 举例来说 , 比尔盖茨这四个字是中文名称 , BillGates是他的英文名称 , 但其实这两个指的是同一个人 。由于文本的不一样 , 开始的时候导致这是两个实体 , 这就需要我们对它进行实体对齐 , 把它统一化 。另外是实体消歧 , 举例来说 , 苹果是一种水果 , 但是在某些上下文里面 , 它可能指的是苹果公司 。这就是一个实体歧义 , 我们需要根据上下文对它进行实体消歧 ,
其次 , 在完成了以上步骤之后 , 接下来就是本体抽取 。比如说公司是一个机构 , 它是有这种上下流的关系的 , 对于平级的也需要计算一个他们的相识度 , 比如比尔盖茨和乔布斯在实体层面 , 他们是比较相似的 。他们都属于人这个实体 , 他们跟公司的差别还是挺大的 , 所以需要一个相似度的计算 。在以上步骤完成之后需要对知识库进行质量评估 ,
如何构建健康知识图谱?
可将医学知识图谱构建技术归纳为五部分 , 即医疗知识的表示、抽取、融合、推理以及质量评估 。通过从大量的结构化或非结构化的医学数据中提取出实体、关系、属性等知识图谱的组成元素 , 选择合理高效的方式存入知识库 , 1)医学知识表示 。知识表示是为描述世界所做的一组约定 , 是知识符号化、形式化、模式化的过程 , 主要研究计算机存储知识的方法 , 其表示方式影响系统的知识获取、存储及运用的效率 ,
在医疗领域 , 实体维度包括疾病、症状、检查、检验、体征、药品等等医学名词 , 甚至医生、科室、医院也可以纳入范畴 。关系是指实体间的关系 , 比如 , 针对疾病和症状 , 关系可有“包含关系” , “不包含关系” , 甚至“金标准关系”(比如 , 所有炎症都会带来发热 , 这就是金标准) , 疾病和医生可以定义“医生擅长治疗疾病” , 医生和医院可以定义“归属于关系”等等 。
- 为什么淘宝买不到纪念币,为什么交易的地方很少见
- 有些人为什么蚊子不咬,而有的人蚊子不爱咬
- 为什么联通宽带比较稳,还是移动的宽带好
- 为什么联通电视和电信,家里看电视和wifi
- 为什么支付宝转账要钱,手机银行转账不收手续费
- 马云为什么选择上汽,为什么马云偏偏选中张勇
- 为什么中国手机还用gps,中国有了北斗系统
- 手机移动网络为什么卡,为什么移动4G网络越来越卡
- 不用的手机为什么老是有软件更新,不更新的话影响大吗
- 余罪网剧为什么被下架,《余罪》被封让网友很气愤
