尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

From Phonemes to Meaning: Evaluating Large Language Models on Tamil

From Phonemes to Meaning: Evaluating Large Language Models on Tamil 文章主要内容与创新点总结一、主要内容研究背景:大型语言模型(LLMs)在高资源语言任务中表现出强大的泛化能力,但在泰米尔语等低资源、形态丰富的语言中的语言能力尚未得到充分探索。现有多语言基准大多是英语数据集的翻译版本,无法捕捉目标语言的语言和文化细微差异。数据集构建:构建了首个泰米尔语专属语言评估基准ILAKKANAM,包含820道来自斯里兰卡1-13年级泰米尔语学科考试的题目,由专业语言学家标注为5个语言类别(语音学、音系学、形态学、句法学、语义学)和1个事实知识类别,涵盖不同难度层级。模型评估:采用标准化评估框架,对闭源模型(如GPT-5、Claude Sonnet 4.5、Gemini 2.5等)和开源模型(如LLaMA 4、DeepSeek-V3、Qwen 2.5等)进行评估,同时开展类别级、年级级分析及语言类别分类任务测试。核心发现:Gemini 2.5总体表现最佳(正确率79.55%),闭源模型整体优于开源模型,凸显语言基础的差距;所有模型在低年级题目上表现较好,随语言复杂度提升(尤其是5年级及13年级)性能显著下降;模型在事实知识类别(如文化、历史、文学常识)表现较弱,语音学类别表现相对最优;模型的整体性能与其语言类别识别能力无强相关性,表明性能可能源于数据暴露而非真正的语言理解。
返回列表