科技成果 首页 - 科技资源 - 科技成果 - 正文 一种文本提取方法及装置 作者:成果转化与社会服务中心浏览:时间:2023-06-09 本发明涉及一种文本提取方法,所述方法包括:步骤一、预处理给定的网页的超文本传输协议html源码,以获取所述源码中的文本的字符串序列,所述字符串序列包含N个文本行;步骤二、提取所述字符串序列中每个文本行的特征元素,所述特征元素包含M个属性;步骤三、依据第一关联规则,确定所述字符串序列中的潜在正文行组成的潜在正文块,所示第一关联规则由所述特征元素中的所述M个属性确定。通过本发明实施例能够提高网页中文本块提取的准确度,提高搜索引擎的搜索效率和准确度。 类型 发明专利 发明人 卜湛 所属单位 南京财经大学 授权时间 2017/5/10