-
公开(公告)号:CN110399478A
公开(公告)日:2019-11-01
申请号:CN201810354364.8
申请日:2018-04-19
Applicant: 清华大学
IPC: G06F16/35
Abstract: 本发明实施例提供事件发现方法和装置。其中,方法包括:根据全部词类,获取当前时间段的每一新闻文档的表示向量;根据聚类算法,对当前时间段的新闻文档的表示向量进行聚类,将属于同一聚类的表示向量所对应的新闻文档构成报道同一事件的新闻文档集合;对于每一事件,若根据该事件与全部已确定的事件之间的第一相似度,获知该事件与任一已确定的事件相同,则将报道该事件的新闻文档集合,与报道该已确定的事件的新闻文档集合进行合并。装置包括:文档表示模块、事件获取模块和事件合并模块。本发明实施例提供的事件发现方法和装置,有效降低了文档表示的维度,并缓解了语义稀疏问题,能提高事件发现的效率和准确性。