尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Adapting Large Language Models to Low-Resource Tibetan: A Two-Stage Continual and Supervised Fine...

Adapting Large Language Models to Low-Resource Tibetan: A Two-Stage Continual and Supervised Fine... 文章核心总结与翻译一、主要内容本文针对藏语这一低资源语言(数据稀缺、形态复杂且代表性不足),提出了一种两阶段训练框架,将Qwen2.5-3B大语言模型适配于藏语场景:持续预训练(CPT)阶段:使用20万条藏语单语语料(涵盖新闻、文学、宗教文本等多体裁),以自回归语言建模为目标,让模型建立藏语词汇、句法和语篇层面的语言基础,最大上下文长度设为8192 tokens。监督微调(SFT)阶段:基于5万条指令数据(80%藏语相关任务+20%中文通用指令),涵盖藏语指令遵循、汉藏翻译、英藏翻译三类任务,巩固模型的任务适配能力并避免灾难性遗忘,最大序列长度设为4096 tokens。实验结果显示,该框架成效显著:模型困惑度从2.98降至1.54;汉藏翻译BLEU值从0.046提升至0.261(提升5.7倍),chrF值从2.2提升至6.6(提升3倍);英藏翻译也通过跨语言迁移实现显著提升。层间权重分析表明,适配主要集中在嵌入层、输出头及中晚期MLP投影层,且SFT阶段是巩固而非覆盖CPT阶段建立的语言表征。二、创新点提出了首个针对藏语大模型的两阶段适配框架,系统分离语言基础构建与任务适配,有效解决低资源场景下的模型适配问题,且框架可复现、开源。首次对藏语大模型适配的内部机制进行定量探索,通过435层的层间权重分析,揭示了模型适配的关键层位与参数演化规律(CPT与SFT权重变化相关性接近1.0)。验证了
返回列表