-
公开(公告)号:CN118607532A
公开(公告)日:2024-09-06
申请号:CN202410691440.X
申请日:2024-05-30
Applicant: 中国科学院自动化研究所
IPC: G06F40/30 , G06F40/279 , G06F18/214
Abstract: 本申请提供一种基于词表扩充的语种间语义对齐方法、装置及电子设备。该方法包括:从目标语言的语料中提取所述目标语言的token;将目标语言的token作为扩充token对原语言模型进行词表扩充;通过微调词表扩充后的原语言模型将所述扩充token嵌入到预训练语言的语义空间中。本申请提供的基于词表扩充的语种间语义对齐方法、装置及电子设备,将目标语言以新添加的token形式嵌入到预训练语言的语义空间中,增强模型处理多语言任务的能力的同时,提升了模型对目标语言的文本理解和生成能力。