一种基于微博文本和个人信息的用户职业分类方法及系统

    公开(公告)号:CN105243094A

    公开(公告)日:2016-01-13

    申请号:CN201510577403.7

    申请日:2015-09-11

    CPC classification number: G06F16/353

    Abstract: 本发明提供一种基于微博文本和个人信息的用户职业分类方法及系统,所述方法包括以下步骤。收集指定数量第一用户的微博文本和个人信息,并根据第一用户的个人信息获得其职业类型,并将所述第一用户的个人信息作为第一训练样本。根据第一用户的职业类型字段,对第一用户的微博文本和个人信息进行标注,并将标注好的微博文本和个人信息进行分词处理后作为第二训练样本。利用所述第一训练样本及第二训练样本分别构建第一最大熵分类器及第二最大熵分类器,并利用所述第一最大熵分类器及第二最大熵分类器对第二用户进行分类并融合,并根据融合结果确定所述第二用户职业类型。如此,有效提高微博用户职业分类的准确率。

Patent Agency Ranking