-
公开(公告)号:CN116226557A
公开(公告)日:2023-06-06
申请号:CN202211726541.3
申请日:2022-12-29
Applicant: 中国科学院信息工程研究所
IPC: G06F16/9538 , G06F16/957 , G06F16/955 , G06F16/35 , G06F40/295 , G06V10/764
Abstract: 本发明公开一种待标注数据的拾取方法、装置、电子设备和存储介质,涉及数据标注领域。所述方法包括:获取用户所参与的标注任务;基于所述标注任务,为所述用户提供用于固定数据的输入格式;在所述用户正在浏览的页面上,突显所述标注任务下的已采集数据,以得到数据捕获区域;通过用户行为确定所述用户在所述数据捕获区域中捕获的网页区域和内容;基于所述输入格式,将所述网页区域和内容传输给数据标注系统。本发明可以精准完成数据获取和格式校验并同步提交到标注系统,大幅提升标注效率。
-
公开(公告)号:CN108228710B
公开(公告)日:2021-09-28
申请号:CN201711237280.8
申请日:2017-11-30
Applicant: 中国科学院信息工程研究所
IPC: G06F16/955 , G06F40/284 , G06F40/289
Abstract: 本发明涉及一种针对URL的分词方法及装置。该方法包括:1)对URL地址按照其内在的层次结构进行分割,得到若干层次部分;2)对所述若干层次部分依次进行符号分割与正则表达式过滤;3)对步骤2)处理后得到字符串进行分割,得到URL分词序列。其中步骤1)将URL地址分割为五个层次部分:协议类型、自由域名、二级域名、顶级域名和路径;步骤3)利用双向最大匹配算法和概率模型对字符串进行分割。本发明充分利用了URL本身的层次结构,能够高效地对URL进行分割,并最大化地保留了URL地址中的有用信息,得到的URL分词序列可用于网页分类、钓鱼URL检测等任务中的特征分析,能够有效提高任务准确率。
-
公开(公告)号:CN108959242B
公开(公告)日:2021-07-27
申请号:CN201810431801.1
申请日:2018-05-08
Applicant: 中国科学院信息工程研究所
IPC: G06F40/295 , G06K9/62
Abstract: 本发明涉及一种基于中文字符词性特征的目标实体识别方法及装置。该方法包括:1)在训练文本中标记目标实体并进行分词及词性标注;2)将训练文本拆分为字符,得到字符序列,每个字符保留拆分之前的词性;3)将字符的词性与字符在分词中的位置进行拼接作为字符词性,得到字符词性序列;4)将对目标实体的标记映射至目标实体中的各个字符上,得到字符标注序列;5)将字符序列与字符词性序列作为特征,将字符标注序列作为训练目标值,输入机器学习模型中进行训练;6)将待识别文本的字符序列与字符词性序列输入训练好的机器学习模型,得到目标实体识别结果。本发明能够根据需求在中文文本中准确有效地对所需特定目标实体进行识别与提取。
-
公开(公告)号:CN112651243A
公开(公告)日:2021-04-13
申请号:CN202011481330.9
申请日:2020-12-15
Applicant: 中国科学院信息工程研究所
IPC: G06F40/295 , G06F40/216 , G06F40/242 , G06F16/35
Abstract: 本发明公开了一种基于融入结构化实体信息的缩写项目名称识别方法及电子装置,包括:获取知识库锚文本、常用项目名词典及缩写项目名称,结合实体边界识别模块、命名实体抽取模块及缩写项目名称识别模块,对一预训练编码器进行训练,得到缩写项目名称识别模型;将测试文本输入所述缩写项目名称识别模型,识别所述测试文本中的缩写项目名称。本发明提高了文本中缩写项目名称的识别率与召回率。
-
公开(公告)号:CN112651234A
公开(公告)日:2021-04-13
申请号:CN202011502018.3
申请日:2020-12-18
Applicant: 中国科学院信息工程研究所
IPC: G06F40/253 , G06F40/30 , G06F40/117 , G06F40/169 , G06F40/247
Abstract: 本发明公开一种半开放信息抽取的方法及装置,涉及自然语言处理领域,通过将目标实体和无结构文本前后拼接构成组合文本,处理得到目标实体感知的上下文表示;再将目标实体感知的上下文表示作为共享特征,为后续的谓语抽取、宾语抽取和边界对齐这三个子任务生成特定的私有表示,对私有表示进行谓语和宾语的抽取,以及进行边界对齐;最后通过谓语和宾语组合,查找起始和结束位置组合在边界对齐矩阵中是否有相应的标签,如果找到,则保留 元组并作为输出的关系知识。本发明能够克服现有的开放信息抽取方法不能有效抽取特定实体相关的目标知识的不足。
-
公开(公告)号:CN107451433B
公开(公告)日:2020-05-22
申请号:CN201710499053.6
申请日:2017-06-27
Applicant: 中国科学院信息工程研究所
IPC: G06F21/16 , G06F40/211 , G06F40/284 , G06N3/04
Abstract: 本发明提供一种基于文本内容的信息源识别方法,适用于非结构化的文本,即自由文本,包括以下步骤:将输入的文本按句子切分并分词;识别出各句子中包含的类型为信息源的实体;如所述实体为其所在句子的信息源,则将其作为一信息源实体;整合各句子得到的信息源实体,作为文本信息识别结果。可以不依赖于网页结构化信息,不依赖于人工特征提取,通过分析文本内容,自动识别非结构化文本的信息源。同时提供对应实现上述方法的装置。
-
公开(公告)号:CN109086327A
公开(公告)日:2018-12-25
申请号:CN201810716386.4
申请日:2018-07-03
Applicant: 中国科学院信息工程研究所
Abstract: 本发明涉及一种快速生成网页视觉结构图形的方法及装置。该方法包括:提取网页中的文本域的视觉结构图形;提取网页中的图像域的视觉结构图形;将文本域的视觉结构图形与图像域的视觉结构图形去重与合并,得到网页的视觉结构图形。该装置包括文本域视觉结构图形提取模块、图像域视觉结构图形提取模块、去重与合并模块。本发明抛弃了传统分析方法中网页DOM结构的累赘,仅由网页截图应用图形学方法处理图片,大大降低了算法耗时;本发明采用数学形态学变换,能够快速、准确地分别提取网页中文本域与图像域的视觉结构图形。
-
-
公开(公告)号:CN104111983B
公开(公告)日:2017-12-19
申请号:CN201410306336.0
申请日:2014-06-30
Applicant: 中国科学院信息工程研究所
Abstract: 本发明涉及一种开放式的多源数据采集系统及方法,包括用于根据需要创建采集任务,配置采集任务信息,生成相应的数据采集接口规则的任务管理模块;用于加载数据采集接口规则,执行处于激活状态的采集任务,相应的采集任务进行数据源监听并采集数据,将接采集的数据按照统一格式进行封装,并发送给数据存储模块的任务执行模块;用于存储数据输出模块输出的数据的数据存储模块;本发明覆盖了比较全面的数据源采集类型,支持目前通用的数据采集方式,支持数据采集接口的动态扩展和多个数据源的并行采集,当有新的数据源接入时,只需要配置数据采集任务信息,不需要部署采集代理和数据模式转换工具即可轻松实现对新数据源的数据采集。
-
公开(公告)号:CN107451433A
公开(公告)日:2017-12-08
申请号:CN201710499053.6
申请日:2017-06-27
Applicant: 中国科学院信息工程研究所
Abstract: 本发明提供一种基于文本内容的信息源识别方法,适用于非结构化的文本,即自由文本,包括以下步骤:将输入的文本按句子切分并分词;识别出各句子中包含的类型为信息源的实体;如所述实体为其所在句子的信息源,则将其作为一信息源实体;整合各句子得到的信息源实体,作为文本信息识别结果。可以不依赖于网页结构化信息,不依赖于人工特征提取,通过分析文本内容,自动识别非结构化文本的信息源。同时提供对应实现上述方法的装置。
-
-
-
-
-
-
-
-
-