一种基于异构数据库的耦合词性标注方法

    公开(公告)号:CN104965820A

    公开(公告)日:2015-10-07

    申请号:CN201510422718.4

    申请日:2015-07-17

    Abstract: 本发明公开了一种基于异构数据库的耦合词性标注方法。该方法根据预设映射规则对异构数据库的词性标注集进行映射处理,建立耦合词性标注集。进而,利用该耦合词性标注集对训练数据进行转换,并采用耦合词性标注集标注的训练数据对CRF词性标注模型进行训练,以使训练后的CRF词性标注模型能够自动挖掘识别异构数据中不同的词性标记间的映射关系。与现有技术相比,本发明通过一次建模过程即可完成异构数据库之间词性标注的识别和转换过程,提高了词性标注的鲁棒性和准确率。

    一种数据标注方法及装置

    公开(公告)号:CN104965821A

    公开(公告)日:2015-10-07

    申请号:CN201510422815.3

    申请日:2015-07-17

    Abstract: 本发明提供一种数据标注方法及装置,通过已有的标注数据训练第一句法分析器,其中已有的标注数据包括预先在句子中标注的核心词和所述核心词的依存关系;基于所述第一句法分析器自动分析当前待分析句子中未标注的词,从未标注的词中选取出最有歧义的词,对所选取出的最有歧义的词的依存关系进行人工标注,得到部分标注的待分析句子。即本发明实施提供的上述技术方案是一种基于部分标注的数据标注方法,其相对于现有完全标注方法来说降低工作量,并且发明人通过实验证明,对同等数量的待分析句子进行标注,本发明实施例提供的上述技术方案相对于现有完全标注方法来说降低80%的工作量,却取得与完全标注方法近似的准确度。

Patent Agency Ranking