具有多模态信息的检索对象的检索方法和装置

    公开(公告)号:CN113076433B

    公开(公告)日:2022-05-17

    申请号:CN202110454387.8

    申请日:2021-04-26

    Abstract: 本说明书实施例提供一种具有多模态信息的检索对象的检索方法和装置,方法包括:获取单模态的查询信息,单模态的查询信息为第一文本或第一图片;当查询信息为第一文本时,将第一文本输入生成模型,生成与第一文本包含的主体对应的图像特征;将第一文本对应的文本特征和图像特征输入图文转换器,对文本特征和图像特征进行基于自注意力的融合,输出查询信息的第一查询特征向量;根据第一查询特征向量与各检索特征向量之间的相似度,确定与查询信息相匹配的检索对象;各检索特征向量分别对应于数据库中的各检索对象,任一检索特征向量为将其对应的检索对象的多模态信息输入图文转换器得到的。能够提高检索精度。

    针对目标图像的类别识别方法和装置

    公开(公告)号:CN112926700B

    公开(公告)日:2022-04-12

    申请号:CN202110460794.X

    申请日:2021-04-27

    Abstract: 本说明书实施例提供一种针对目标图像的类别识别方法和装置,所述目标图像中包括文本,所述方法包括:识别所述目标图像中的文本内容,得到第一文本识别结果;将所述目标图像输入图像编码器,通过所述图像编码器输出所述目标图像对应的第一图像语义特征向量;将所述第一文本识别结果输入文本编码器,通过所述文本编码器输出所述第一文本识别结果对应的第一文本语义特征向量;将所述第一图像语义特征向量和所述第一文本语义特征向量输入多模融合编码器,通过所述多模融合编码器输出第一全局特征向量;根据所述第一全局特征向量,确定所述目标图像的目标类别。能够提高针对目标图像的类别识别的准确率。

    具有多模态信息的检索对象的检索方法和装置

    公开(公告)号:CN113076433A

    公开(公告)日:2021-07-06

    申请号:CN202110454387.8

    申请日:2021-04-26

    Abstract: 本说明书实施例提供一种具有多模态信息的检索对象的检索方法和装置,方法包括:获取单模态的查询信息,单模态的查询信息为第一文本或第一图片;当查询信息为第一文本时,将第一文本输入生成模型,生成与第一文本包含的主体对应的图像特征;将第一文本对应的文本特征和图像特征输入图文转换器,对文本特征和图像特征进行基于自注意力的融合,输出查询信息的第一查询特征向量;根据第一查询特征向量与各检索特征向量之间的相似度,确定与查询信息相匹配的检索对象;各检索特征向量分别对应于数据库中的各检索对象,任一检索特征向量为将其对应的检索对象的多模态信息输入图文转换器得到的。能够提高检索精度。

    针对目标图像的类别识别方法和装置

    公开(公告)号:CN112926700A

    公开(公告)日:2021-06-08

    申请号:CN202110460794.X

    申请日:2021-04-27

    Abstract: 本说明书实施例提供一种针对目标图像的类别识别方法和装置,所述目标图像中包括文本,所述方法包括:识别所述目标图像中的文本内容,得到第一文本识别结果;将所述目标图像输入图像编码器,通过所述图像编码器输出所述目标图像对应的第一图像语义特征向量;将所述第一文本识别结果输入文本编码器,通过所述文本编码器输出所述第一文本识别结果对应的第一文本语义特征向量;将所述第一图像语义特征向量和所述第一文本语义特征向量输入多模融合编码器,通过所述多模融合编码器输出第一全局特征向量;根据所述第一全局特征向量,确定所述目标图像的目标类别。能够提高针对目标图像的类别识别的准确率。

Patent Agency Ranking