一种文档字符串编码模糊匹配方法

    公开(公告)号:CN115964457A

    公开(公告)日:2023-04-14

    申请号:CN202111192730.2

    申请日:2021-10-13

    Abstract: 本发明涉及数据处理技术领域,具体公开了一种文档字符串编码模糊匹配方法。该方法包括:构建带有标签的字符串编码信息库;获取文档字符串编码信息,对其进行预处理和特征选择,形成特征集合;对所述特征集合中的特征项进行特征提取,构建编码向量;构建支持向量机分类器,通过所述编码向量对支持向量机进行训练并获得文档编码的分类结果标签;对文档字符串进行模糊匹配时,对所查询的字符串进行划分并添加索引;在字符串编码查询时,进行字符串编码长度过滤及匹配过滤,将所述字符串添加到结果合集中。该方法能够提高文本分类效率和分类准确精度,且能够反映不同长度段落对匹配结果不影响的差异,同时编辑距离验证操作次数较少。

Patent Agency Ranking