摘要
本发明公开了一种基于DOM的企业知识网络构建方法及系统,该方法包括:S1:解析PDF文档,生成包含各文档元素及其层级结构的文档对象模型;S2:基于所述DOM进行知识实体提取,为每一个知识实体生成包含实体内容及其在所述DOM中节点路径的文档引用;S3:基于所述知识实体及其文档引用,构建实体间的知识关系;S4:将所述知识实体和知识关系进行集成,形成统一的知识网络。通过直接利用PDF的原生结构信息,而非依赖于易失真的OCR文本,极大地提高了关系抽取的准确性,并最终生成一个支持深度查询和推理的、高可信度的知识网络数据结构。