-
公开(公告)号:CN111340117A
公开(公告)日:2020-06-26
申请号:CN202010124513.9
申请日:2020-02-27
Applicant: 支付宝(杭州)信息技术有限公司
Abstract: 本说明书涉及一种联结主义时间分类(CTC)模型的训练方法和装置,在该方法中,将特征向量分别输入第一全连接层和第二全连接层;确定特征向量和标签序列的联合表示向量后输入第三全连接层;然后,CTC损失层根据各层输出的归一化结果确定标签序列的似然分布和空白字符先验分布,从而确定本次训练的梯度值,完成一次训练。本说明书还提供了基于上述CTC模型的数据处理方法和装置、电子设备以及计算机可读存储介质。
-
公开(公告)号:CN119653202A
公开(公告)日:2025-03-18
申请号:CN202411720941.2
申请日:2024-11-27
Applicant: 支付宝(杭州)信息技术有限公司
IPC: H04N21/854 , G06V40/16 , G06T7/246 , G06V10/764 , G06V10/82 , G06N3/0499 , G06N3/0455 , G06N3/08 , G10L21/10
Abstract: 一种预测目标对象的运动特征的方法、训练扩散模型的方法和设备,所述预测目标对象的运动特征的方法包括:获取第一图像,所述第一图像包括目标对象的头像;基于所述第一图像生成所述目标对象的第一位置特征,所述第一位置特征包括所述目标对象的多个预设点在预设状态下的第一位置和所述多个预设点的第一运动特征,所述第一运动特征包括所述多个预设点的相对于所述第一位置的第一偏移;获取第一语音音频,基于第一语音音频获取音频特征序列;通过扩散模型,基于所述第一位置特征和所述音频特征序列,确定第二运动特征的第一序列,所述第二运动特征包括所述多个预设点的相对于所述第一位置的第二偏移。
-
公开(公告)号:CN118941441A
公开(公告)日:2024-11-12
申请号:CN202411108186.2
申请日:2024-08-12
Applicant: 支付宝(杭州)信息技术有限公司
IPC: G06T3/04 , G06T9/00 , G06F40/289 , G06F40/126
Abstract: 本说明书提供一种图像生成方法、图像生成模型的训练方法及系统。图像生成方法包括:获得目标文本和至少一个目标风格图像,目标文本用于指示目标图像的内容,所述至少一个目标风格图像用于指示目标图像的风格,确定目标文本的目标文本token、所述至少一个目标风格图像的目标风格token,目标文本token用于表征目标文本中的内容,目标风格token用于表征所述至少一个目标风格图像中的风格,根据目标文本token和目标风格token生成目标图像。通过引入指示目标图像的风格的目标风格图像,可以更准确地描述风格并生成该风格的图像。通过token的方式从风格和内容维度生成目标图像,可以避免风格和文本之间的混淆。
-
公开(公告)号:CN114880517B
公开(公告)日:2024-10-22
申请号:CN202210592045.7
申请日:2022-05-27
Applicant: 支付宝(杭州)信息技术有限公司
IPC: G06F16/73 , G06F16/783 , G06F16/75
Abstract: 本说明书实施例提供了用于视频检索的方法及装置。在该方法中,获取待匹配视频中的视频帧图像;从视频帧图像中提取图像特征以及文本特征;根据用于表征聚类中心的中心变量对图像特征和所述文本特征进行特征融合,以得到融合特征,其中,中心变量用于将属于同一视频的不同模态的特征进行关联;以及根据融合特征在视频数据库中进行视频检索,以确定出视频数据库中与待匹配视频相匹配的视频,其中,视频数据库中存储有多个视频以及每个视频对应的视频特征。
-
公开(公告)号:CN116910511A
公开(公告)日:2023-10-20
申请号:CN202310848401.1
申请日:2023-07-11
Applicant: 支付宝(杭州)信息技术有限公司
IPC: G06F18/213 , G06F18/25 , G06F18/214 , G06F18/24
Abstract: 本说明书实施例披露一种情感识别模型的训练方法及装置。该方法包括:首先,获取训练样本集,其中各个训练样本包括情感类别标签、与情感识别任务强相关的强特征和其他的若干弱特征;然后,利用情感识别模型处理各个训练样本,具体包括:在特征对齐层,将强特征和若干弱特征分别映射到相同的特征空间,对应得到强映射表征和若干弱映射表征;在权重计算层,基于强映射表征计算若干弱映射表征对应的若干权重;在特征提取层,利用若干权重处理若干弱映射表征得到若干提取表征;在特征融合层,对强映射表征和若干提取表征进行融合处理,得到融合表征;在情感预测层,基于融合表征确定情感识别结果;基于情感类别标签和情感识别结果,训练情感识别模型。
-
公开(公告)号:CN112926700B
公开(公告)日:2022-04-12
申请号:CN202110460794.X
申请日:2021-04-27
Applicant: 支付宝(杭州)信息技术有限公司
Abstract: 本说明书实施例提供一种针对目标图像的类别识别方法和装置,所述目标图像中包括文本,所述方法包括:识别所述目标图像中的文本内容,得到第一文本识别结果;将所述目标图像输入图像编码器,通过所述图像编码器输出所述目标图像对应的第一图像语义特征向量;将所述第一文本识别结果输入文本编码器,通过所述文本编码器输出所述第一文本识别结果对应的第一文本语义特征向量;将所述第一图像语义特征向量和所述第一文本语义特征向量输入多模融合编码器,通过所述多模融合编码器输出第一全局特征向量;根据所述第一全局特征向量,确定所述目标图像的目标类别。能够提高针对目标图像的类别识别的准确率。
-
公开(公告)号:CN113688650A
公开(公告)日:2021-11-23
申请号:CN202111117739.7
申请日:2021-09-22
Applicant: 支付宝(杭州)信息技术有限公司 , 蚂蚁区块链科技(上海)有限公司
Inventor: 黄莹 , 黄星 , 廖群伟 , 陈景东 , 王剑 , 刘家佳 , 暨凯祥 , 胡锦华 , 刘雷 , 武琳娟 , 王昊 , 章鹏 , 李莎 , 卢睿 , 杜金泉 , 冯成林 , 张谦 , 苏煜 , 林楠 , 鞠春春 , 吕炯炯 , 朱伟
Abstract: 本公开披露了一种识别图片的方法和装置。所述方法包括:接收扫码图片,所述扫码图片包含商品的营销活动对应的活动码;对所述扫码图片进行图像识别,以确定所述扫码图片是否为目标图片,所述目标图片为对所述商品的实体上的所述活动码进行扫描后得到的图片。
-
公开(公告)号:CN113076433A
公开(公告)日:2021-07-06
申请号:CN202110454387.8
申请日:2021-04-26
Applicant: 支付宝(杭州)信息技术有限公司
IPC: G06F16/38 , G06F16/33 , G06F16/583 , G06N3/04 , G06N3/08
Abstract: 本说明书实施例提供一种具有多模态信息的检索对象的检索方法和装置,方法包括:获取单模态的查询信息,单模态的查询信息为第一文本或第一图片;当查询信息为第一文本时,将第一文本输入生成模型,生成与第一文本包含的主体对应的图像特征;将第一文本对应的文本特征和图像特征输入图文转换器,对文本特征和图像特征进行基于自注意力的融合,输出查询信息的第一查询特征向量;根据第一查询特征向量与各检索特征向量之间的相似度,确定与查询信息相匹配的检索对象;各检索特征向量分别对应于数据库中的各检索对象,任一检索特征向量为将其对应的检索对象的多模态信息输入图文转换器得到的。能够提高检索精度。
-
公开(公告)号:CN112926700A
公开(公告)日:2021-06-08
申请号:CN202110460794.X
申请日:2021-04-27
Applicant: 支付宝(杭州)信息技术有限公司
Abstract: 本说明书实施例提供一种针对目标图像的类别识别方法和装置,所述目标图像中包括文本,所述方法包括:识别所述目标图像中的文本内容,得到第一文本识别结果;将所述目标图像输入图像编码器,通过所述图像编码器输出所述目标图像对应的第一图像语义特征向量;将所述第一文本识别结果输入文本编码器,通过所述文本编码器输出所述第一文本识别结果对应的第一文本语义特征向量;将所述第一图像语义特征向量和所述第一文本语义特征向量输入多模融合编码器,通过所述多模融合编码器输出第一全局特征向量;根据所述第一全局特征向量,确定所述目标图像的目标类别。能够提高针对目标图像的类别识别的准确率。
-
公开(公告)号:CN112633185A
公开(公告)日:2021-04-09
申请号:CN202011565601.9
申请日:2020-09-04
Applicant: 支付宝(杭州)信息技术有限公司
Abstract: 本说明书实施例提供一种图像处理的方法和装置,将光谱遥感图像切割为多个待处理图像进行处理,尽可能保留光谱遥感图像的信息。在处理光谱遥感图像时,按照不同的分辨率,对光谱遥感图像在多个尺度(对应分辨率)上进行缩放,从而得到各个尺度分别的语义分割结果,以及相应的注意力图。进一步地,利用注意力图,对各个语义分割结果进行融合。该方法引入注意力图,来描述语义分割的重要度,从而提高目标识别结果的准确度。
-
-
-
-
-
-
-
-
-