科技成果

一种文本提取方法及装置

作者:成果转化与社会服务中心浏览:时间:2023-06-09

本发明涉及一种文本提取方法,所述方法包括:步骤一、预处理给定的网页的超文本传输协议html源码,以获取所述源码中的文本的字符串序列,所述字符串序列包含N个文本行;步骤二、提取所述字符串序列中每个文本行的特征元素,所述特征元素包含M个属性;步骤三、依据第一关联规则,确定所述字符串序列中的潜在正文行组成的潜在正文块,所示第一关联规则由所述特征元素中的所述M个属性确定。通过本发明实施例能够提高网页中文本块提取的准确度,提高搜索引擎的搜索效率和准确度。

类型 发明专利 发明人 卜湛
所属单位 南京财经大学 授权时间 2017/5/10

请升级浏览器版本

你正在使用旧版本浏览器。请升级浏览器以获得更好的体验。