尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

HanjaBridge: Resolving Semantic Ambiguity in Korean LLMs via Hanja-Augmented Pre-Training

HanjaBridge: Resolving Semantic Ambiguity in Korean LLMs via Hanja-Augmented Pre-Training 文章主要内容总结本文针对韩语大语言模型(LLMs)因韩语独特的语言特性(尤其是汉源韩语词的同音异义现象)导致的语义歧义问题,提出了一种名为HanjaBridge的方法。该方法通过在持续预训练(CPT)框架中融入“汉字增强语义注入”技术,为每个同音的韩语词提供所有可能的汉字(Hanja)候选,引导模型通过上下文进行语义消歧;同时结合token级知识蒸馏,防止模型在优化韩语性能时遗忘其他语言能力。实验结果显示,HanjaBridge在韩语理解任务上表现显著,尤其在KoBALT基准测试中实现了21%的相对性能提升;同时,通过韩中共享汉字强化语义对齐,促进了跨语言迁移能力。此外,该方法在推理时无需保留汉字增强信息,不增加额外运行成本,兼顾了实用性与效率。创新点多候选汉字注入:不同于将韩语词映射到单一汉字的传统方式,HanjaBridge提供所有可能的汉字候选,迫使模型主动利用上下文进行语义消歧,增强了模型对歧义的辨别能力。token级知识蒸馏:在持续预训练中结合知识蒸馏,使模型在提升韩语性能的同时,保留原有多语言能力(尤其是英语),避免了“灾难性遗忘”。无推理成本损耗:仅在训练阶段使用汉字增强,推理时无需额外处理,保持了与原有模型一致的运行效率,便于实际部署。跨语言语义对齐:利用韩中共享的汉字(Hanja),强化了两种语言在词级别的语义关联,提升了跨语言迁移性能。
返回列表