一种基于混合采样策略的中文电子病历命名实体识别方法

    公开(公告)号:CN115497590A

    公开(公告)日:2022-12-20

    申请号:CN202211295864.1

    申请日:2022-10-21

    Abstract: 本发明属于文本处理领域,提供了一种基于混合采样策略的中文电子病历命名实体识别方法,所述方法包括获取有标记实体的源领域数据集和少量标记实体或无标记实体的目标领域数据集;利用源领域数据集训练命名实体识别模型。运用迁移学习将模型应用到目标源领数据集中,得到实体识别结果;运用混合采样策略的主动学习从实体识别结果中选出最有价值的样本,人工标注后加入到训练集中,重复上述过程,直到目标领域实体识别结果达到要求。本发明通过迁移从源领域中学习的知识到目标领域中,缓解了零标记样本冷启动问题,通过选取最有价值的样本减少了人工标注数据量并减少了单位样本的标注成本,同时提高了中文电子病历对于句子级的命名实体识别准确率。

Patent Agency Ranking