
大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载本文基于开源仓库 Chinese-LLaMA-Alpaca 中examples/f16-p7b-p13b-33b/QA.md的实测数据系统梳理该项目在**知识问答QA**任务上对三个中文指令精调模型——Alpaca-Plus-7B、Alpaca-Plus-13B 与 Alpaca-33B 的对比评测结果。通过阅读本文你将掌握该评测的完整打分方法、统一解码参数、20 条典型测试样例的逐项生成效果以及从推理脚本与数据构建脚本源码层面理解评测结果背后 prompt 模板与解码配置的实现原理可直接复现并用于评估其他中文模型。一、评测背景与模型对象知识问答是衡量大语言模型中文常识理解与事实回答能力的核心任务之一。Chinese-LLaMA-Alpaca 项目在相同 prompt的前提下对三个模型进行了对比测试模型定位训练数据中文 Alpaca-Plus-7B指令精调模型Plus 版指令 4M7B 规模中文 Alpaca-Plus-13B指令精调模型Plus 版指令 4.3M中文 Alpaca-33B指令精调模型指令 4.3M⚠️ 根据该目录 README 的说明Alpaca-Plus-7B 与 Alpaca-Plus-13B 的结果沿用此前已有的生成结果33B 除多轮对话外的任务由 **HuggingFace 原生接口F16 精度**解码多轮对话由 llama.cppq4_0 量化版解码。此外生成回复具有随机性受解码超参、随机种子等因素影响评测并非绝对严谨结果仅供参考欢迎自行体验复现。该评测属于项目 10 组任务知识问答、开放式问答、推理、文学、娱乐、写作、翻译、多轮对话、代码、伦理拒答中的一组每组 20 个样例样例详细结果归档在examples目录下的对应 Markdown 文件中。二、打分方式与运行参数评测设置2.1 打分方式根据目录 README 中打分方式一节的说明评测采用机器评分GPT-4 与 ChatGPT/GPT-3.5一共 10 组任务每组满分 100 分每组 20 个样例每个样例满分 10 分样例的得分之和规整到 100 分区间作为该模型在该任务上的得分使用 GPT-4 和 ChatGPTGPT-3.5对两个系统的输出进行 10 分制打分打分模板如下The followings are ChatGPT-like systems outputs based on a single prompt. Please rate an overall score on a ten point scale for each system and give a short explanation to justify your scores. Please try not to give the same scores for different system unless they are indistinguishable. Prompt: prompt-input System1: system1-output System2: system2-output注意事项原文强调优先使用 GPT-4 打分由于 GPT-4 的交互次数限制一部分打分由 ChatGPTgpt-3.5-turbo进行以上分数应视为paired score配对分数即相对值而非绝对值是多个系统相互比较得到的结果分数之间的大小关系有一定参考价值绝对值本身参考价值有限除多轮对话任务外所有任务均基于单轮回复打分不包含任何对话历史每个样例运行 2–3 次人工选取最好的一组交给机器评分以降低随机性带来的偏差。2.2 统一解码参数评测使用了统一的解码参数以下为 llama.cpp 的示例命令出自目录 README./main -m zh-alpaca-models/{Plus-7B,Plus-13B}/ggml-model-q8_0.bin --color -f ./prompts/alpaca.txt -ins \ -b 16 -c 2048 -n 512 -t 6 \ --temp 0.2 --top_k 40 --top_p 0.9 \ --repeat_penalty 1.1关键参数含义参数值作用-mggml-model-q8_0.bin加载 8-bit 量化后的模型权重文件-ins—启动指令理解 聊天模式Alpaca 模型专用-b 1616batch size-c 20482048上下文长度context size-n 512512生成的最大 token 数-t 66线程数--temp 0.20.2采样温度低温度保证回答更确定--top_k 4040top-k 采样候选数--top_p 0.90.9nucleus 采样概率阈值--repeat_penalty 1.11.1重复惩罚系数原文补充该参数组合可能并不适合所有任务实际使用时对话、写作类等自由生成类任务可适当调高temp。值得一提的是评测中的这套解码超参在HF 推理脚本的generation_config中有完全一致的对应实现temperature0.2, top_k40, top_p0.9, do_sampleTrue, repetition_penalty1.1, max_new_tokens400说明评测基准与项目提供的开箱即用推理配置是同一套约定读者用仓库自带脚本即可复现近似效果。三、知识问答分数表与整体表现QA.md 给出的三模型 20 题逐项得分如下满分 10 分/题平均分#1#2#3#4#5#6#7#8#9#10#11#12#13#14#15#16#17#18#19#20Plus-7B7.05110108109107628768683688Plus-13B7.95110109108108829997991078633B8.2251010910107.51089107897772879解读要点33B 平均分最高8.225在 #1Lightning 数据线兼容性、#4冥王星降级、#10机场代码 KIX、#20零下 1000 摄氏度等题上表现突出展现出更大的模型规模带来的知识广度与严谨性优势Plus-13B 以 7.95 居中在 #17李约瑟难题拿到满分 10 分体现了指令精调对中文人文类知识的覆盖Plus-7B 为 7.05小规模模型在 #1、#10、#17 等需要精确事实记忆的题目上失分明显分别为 1、2、3 分。在总效果对比中知识问答是 10 组任务之一Plus-7B 知识问答得分 70.5、Plus-13B 为 79.5、33B 为82.3规整到 100 分制后与逐题平均分7.05 / 7.95 / 8.225完全对应。四、20 条测试样例逐项详解以下完整保留 QA.md 的 20 条测试 prompt 及三模型生成结果供读者自行判断与复现#PromptPlus-7BPlus-13B33B1我能用lightning数据线给安卓手机充电吗是的您可以使用苹果的lightning数据线来连接到安卓手机并进行充电。是的您可以使用Lightning数据线来给安卓手机充电。不可以。lightning数据线只能用于苹果设备安卓手机需要使用micro USB或type-C数据线进行充电。2为什么天空是蓝色的天空是蓝色的是因为大气中的气体分子如氮气和氧气散射了太阳光中的短波长蓝光使得我们看到的天空呈现出蓝色。天空是蓝色的是因为大气中的气体分子散射了太阳光中的短波长蓝光使得我们看到的天空呈现出蓝色。天空之所以呈现蓝色是因为大气中的气体分子会散射太阳光中的短波长蓝光使得我们看到的天空呈现出蓝色。3如何做披萨1. 准备材料面团、番茄酱、奶酪、配料例如蔬菜、肉类等。2. 将面团揉成球状放在案板上用手掌压扁成圆形。3. 在面团上涂上适量的番茄酱。4. 撒上一层奶酪。5. 根据个人口味添加各种配料如蔬菜、肉类等。6. 把披萨放入预热至200℃的烤箱中烘烤10-15分钟直到奶酪融化和面饼变脆即可。制作披萨的步骤如下1. 准备面团将面粉、酵母、盐和水混合在一起。揉成光滑的面团放在温暖的地方发酵。2. 准备酱料可以使用番茄酱或自制酱料。3. 准备配料可以选择各种蔬菜、肉类、奶酪等。4. 把面团擀成薄饼状涂上酱料和配料。5. 将披萨放入预热好的烤箱中以200度左右的温度烤10-15分钟直到金黄色即可。首先准备面团和配料。将面团揉成球状擀成薄饼。在上面涂上番茄酱、奶酪和其他配料如蘑菇、洋葱等。然后放入烤箱中烤制10-15分钟直到奶酪融化和金黄色即可。4为什么冥王星被踢出太阳系冥王星在2006年被重新定义为矮行星而不是行星。因此它不再被视为太阳系中的一个行星。冥王星被踢出太阳系是因为它的轨道太远不符合行星的定义。根据国际天文学联合会的定义一个行星必须绕其恒星公转的轨道是稳定的、近乎圆形的并且没有其他天体对其产生显著影响。因此冥王星被认为是一个矮行星而不是一个真正的行星。冥王星曾经被视为第九颗行星但2006年国际天文学联合会将它重新定义为矮行星。这是因为冥王星的质量小于其他行星且与其他行星的轨道存在差异。5列举太阳系的全部行星太阳系的行星包括水星、金星、地球、火星、木星、土星、天王星和海王星。水星、金星、地球、火星、木星、土星、天王星、海王星。太阳系共有8个行星从内到外依次为水星、金星、地球、火星、木星、土星、天王星和海王星。6详细说明DNA和RNA的区别DNA脱氧核糖核酸和RNA核糖核酸是两种不同的核酸分子。它们的主要区别在于1. 化学结构DNA由脱氧核苷酸组成而RNA则由核苷酸组成。其中脱氧核苷酸包括脱氧腺嘌呤、脱氧鸟嘌呤、脱氧胞嘧啶和脱氧尿嘧啶四种碱基而核苷酸则包括核糖、磷酸和四种碱基腺嘌呤、鸟嘌呤、胞嘧啶和尿嘧啶。2. 功能DNA是遗传物质负责存储和传递生物体的遗传信息RNA则是基因表达过程中的重要分子参与蛋白质合成和翻译等过程。3. 化学性质DNA具有较强的稳定性不易被水解和氧化反应而RNA则容易受到酸碱环境的影响易于被水解和氧化反应。4. 结构特点DNA呈双螺旋结构由两条互补的链组成而RNA则呈单链结构由一条单链组成。DNA脱氧核糖核酸和RNA核糖核酸是两种不同的核酸分子它们在生物体内发挥着不同的功能。以下是它们的主要区别1. 化学结构不同DNA是由四种碱基腺嘌呤、胸腺嘧啶、鸟嘌呤和胞嘧啶组成的双螺旋结构而RNA则是由三种碱基腺嘌呤、尿嘧啶和胞嘧啶组成的单链结构。2. 功能不同DNA是生物体内的遗传物质负责存储和传递遗传信息。而RNA则在蛋白质合成过程中起着重要的作用它通过转录将DNA中的基因信息转化为RNA分子然后被翻译成氨基酸序列形成蛋白质。3. 长度不同DNA通常比RNA长因为它们包含更多的碱基对。例如人类的DNA长约30亿个碱基对而RNA则只有数百万个碱基对。4. 化学修饰不同在RNA分子中腺嘌呤和尿嘧啶的5-磷酸基团可以被脱去形成一种称为核糖核酸mRNA的前体。这种前体可以在翻译过程中被酶水解成氨基酸序列从而形成蛋白质。5. 生物学应用不同DNA在基因工程、生物技术和医学诊断等领域具有广泛的应用而RNA则在病毒学、药物研发和基因治疗等方面发挥着重要作用。DNA脱氧核糖核酸和RNA核糖核酸都是重要的生物分子它们在结构上有一些相似之处但也有一些不同。首先它们的化学结构不同。DNA是由四种不同的核苷酸单元组成分别是腺嘌呤A、胸腺嘧啶T、鸟嘌呤G和胞嘧啶C。而RNA则由三种不同的核苷酸单元组成分别是腺嘌呤A、尿嘧啶U和胞嘧啶C。此外DNA的双螺旋结构比RNA更稳定因为它们通过氢键连接在一起。其次它们的功能也不同。DNA是细胞中的遗传物质它携带着生命体的基因信息并被复制到RNA中从而控制蛋白质的合成。而RNA则在转录过程中发挥重要作用它可以将DNA上的信息转换成氨基酸序列然后被翻译成蛋白质。总之DNA和RNA虽然有许多相似之处但它们在结构、功能和生物学角色上都有所不同。7中国的东北三省指的是哪里中国的东北三省是指黑龙江、吉林和辽宁这三个省份。中国东北三省是指辽宁、吉林和黑龙江这三个省份。中国的东北三省是指辽宁省、吉林省和黑龙江省。8经常吃烫的东西会罹患什么病经常吃烫食物可能会导致口腔溃疡、胃炎和消化不良等疾病。经常食用过热的食物可能会导致口腔癌、食道癌等疾病。经常吃烫的食物可能会导致口腔黏膜损伤引起口腔溃疡、牙龈炎等口腔疾病。此外如果食物过热容易引起胃肠道不适如腹泻、胃痛等症状。因此建议在食用食物时注意温度避免烫伤口腔和胃肠道。9盐酸莫西沙星能否用于治疗肺炎盐酸莫西沙星是一种抗生素主要用于治疗革兰阳性菌引起的感染。肺炎是细菌感染的一种类型但大多数情况下是病毒感染导致的。因此盐酸莫西沙星不能用于治疗肺炎。是的盐酸莫西沙星是一种广谱抗生素可以用于治疗多种细菌感染包括肺炎。盐酸莫西沙星是一种抗生素主要用于治疗细菌感染。但对于肺炎的治疗需要根据病因进行选择合适的药物。如果肺炎是由细菌感染引起的可以考虑使用盐酸莫西沙星等抗生素进行治疗。但是如果肺炎是由病毒感染引起的则需要选用其他抗病毒药物进行治疗。10机场代码KIX代表的是哪个机场机场代码KIX代表的是日本东京羽田国际机场。机场代码KIX代表韩国首尔国际机场Incheon International Airport。KIX是关西国际机场的缩写位于日本大阪市。11介绍一下导演张艺谋。张艺谋是中国著名的电影导演出生于1965年毕业于中央戏剧学院导演系。他的代表作品包括《红高粱》、《大红灯笼高高挂》、《英雄》等。他被誉为中国电影的代表人物之一曾多次获得国际电影节大奖。张艺谋是中国著名的电影导演出生于1949年毕业于北京电影学院。他的代表作品包括《红高粱》、《大红灯笼高高挂》、《活着》等。他以独特的视觉风格和深刻的主题探讨中国传统文化与现代社会现实之间的矛盾和冲突被誉为中国电影界的重要代表人物之一。张艺谋是中国著名的电影导演、编剧和制片人代表作品有《红高粱》、《大红灯笼高高挂》等。12治疗糖尿病的常见药物有什么有哪些禁忌症常见的糖尿病药物包括胰岛素、二甲双胍、格列本脲等。这些药物有不同的作用机制和副作用需要根据患者的具体情况进行选择和使用。禁忌症包括过敏史、肝肾功能不全、高血压等。治疗糖尿病的常见药物包括磺脲类、双胍类、胰岛素增敏剂等。其中磺脲类药物如格列吡嗪和二甲双胍是常用的口服降糖药双胍类药物如二甲双胍和罗格列酮可以促进胰岛素分泌降低血糖水平胰岛素增敏剂如格列美脲、格列喹酮等则可以直接刺激胰岛素的分泌。禁忌症包括肝肾功能不全、妊娠期、哺乳期、严重心肺疾病等。此外糖尿病患者在使用药物治疗时应注意饮食和运动避免过度饮酒和吸烟等不良习惯。治疗糖尿病的常见药物包括口服降糖药、胰岛素等。口服降糖药主要有磺脲类、双胍类、α-葡萄糖苷酶抑制剂等但需要根据患者情况选择合适的药物。胰岛素主要用于控制血糖水平和预防并发症如肾病、神经病变等。这些药物都有一些禁忌症如孕妇、哺乳期妇女、肝肾功能不全者等不宜使用。13水在什么情况下沸点小于100摄氏度水在以下情况下沸点小于100摄氏度1. 压力低于标准大气压101325帕2. 温度低于标准水温0°C3. 物质中存在其他物质如盐类或有机物。水的沸点会受到压力的影响当压力降低时沸点也会相应下降。例如在海拔较高的地方由于大气压较低水的沸点就会比在海平面上低。此外水中溶解其他物质也会影响沸点如盐分、糖类等。水的沸点是取决于压力和温度的。当水处于低于标准大气压1 atm时其沸点会降低。例如在海拔较高的地方由于气压较低水的沸点也会相应地降低。此外在高压下水的沸点也会升高。14飞机为什么能飞起来详细介绍其科学原理飞机之所以能够飞行是因为它利用了空气动力学的原理。当飞机在空气中运动时会受到空气的阻力和升力的作用。其中升力是由于飞机表面的气流产生的而阻力则是由于空气分子与飞机表面的摩擦所产生的。为了克服这些阻力飞机需要使用引擎来提供足够的推力使飞机能够克服重力并保持飞行状态。飞机能够飞行是因为它利用了牛顿第三定律的原理即每个作用都有一个相等大小且相反的方向的反作用。在飞机起飞和降落时发动机产生的推力是通过机翼产生升力使飞机向上运动。当飞机上升到一定高度后空气阻力逐渐增大使得飞机需要不断增加推力才能保持飞行状态。而当飞机下降时由于重力的作用飞机会向下坠落此时发动机的推力必须大于重力以抵消下坠的速度并保持飞行状态。飞机之所以能够飞是因为它利用了物理规律中的牛顿第三定律即力的反作用。当飞机引擎喷出高速气体这些气体与空气相互作用产生反作用力使飞机得以升空。同时飞机翼也利用了气流的力学特性将空气动力学转化为升力从而使得飞机保持稳定飞行状态。15详细描述海市蜃楼的形成原因海市蜃楼是由于大气折射和折射率变化引起的。当光线从高空通过低空气层时由于空气密度不同光线会发生折射从而使远处物体看起来变小或变形。这种现象在沙漠、湖泊等开阔的区域更容易出现。海市蜃楼是一种光学现象通常在沙漠、海洋或湖泊中出现。它的形成是由于空气温度差异导致光线折射的结果。当太阳光照射到地面时地面会将部分热量传递给周围的空气中使空气变得比周围环境更暖。由于空气的密度随温度而变化因此较热的空气上升并形成一个类似云层的薄层称为海市蜃楼。当光线从地平线反射到海市蜃楼上升时它们会穿过这个薄层并在其上方再次被折射。由于海市蜃楼的厚度非常小光线在经过多次反射和折射后最终会被散射并形成一个倒映的图像。这种图像通常是扭曲、模糊或扭曲的并且可能与真实物体的位置不符。海市蜃楼是一种光学现象通常出现在沙漠、湖泊或海洋等开阔的地方。它的形成原因是由于光线在大气中折射和反射的结果使得远处的物体看起来像在空中漂浮。16第一次世界大战的导火索是什么第一次世界大战的导火索是奥匈帝国皇储弗朗茨·费迪南大公被塞尔维亚民族主义者刺杀事件。第一次世界大战的导火索是奥匈帝国皇储弗朗茨·费迪南德在萨拉热窝被塞尔维亚民族主义者刺杀事件。第一次世界大战的导火索是萨拉热窝事件。17什么是李约瑟难题李约瑟难题是指在科学发展中如何平衡探索和应用之间的关系。李约瑟难题是指在中世纪欧洲由于技术和文化的限制为什么中国没有出现工业革命的现象。这个问题被称为李约瑟难题因为英国历史学家李约瑟J. Needham在他的著作《中国科技史》中提出了这个问题。李约瑟难题是指一个数学问题即在给定的一组数字中找到两个数之和等于另一个数字。18为什么三极管可以用于放大信号三极管可以放大信号是因为当输入信号与基极电压相等时它将处于截止状态从而阻止电流通过。当输入信号大于基极电压时三极管将进入导通状态允许电流通过。因此当输入信号较大时三极管会放大其大小输出信号也会相应增大。三极管是一种半导体器件具有三个电极发射极、基极和集电极。当电流通过发射极时电子会在基极上被吸引并释放出来形成一个正向电压差。这个电压差可以放大信号从而实现放大功能。三极管是一种半导体器件它具有控制电流的特性。当三极管处于正向偏置时它的基极和发射极之间的电阻非常小而集电极与发射极之间的电阻非常大。因此当输入电压增加时输出电流也会随之增加从而实现信号的放大。19为什么会有春夏秋冬四季变化地球绕着太阳公转受到太阳的辐射和引力影响导致地球的气候发生变化。在不同的季节里地球的倾斜角度不同使得太阳照射到地球上的角度和强度也不同从而导致气温、降水等气象要素的变化。这是由于地球的自转和公转所导致的不同季节太阳直射点在地球上的位置不同从而影响气温、降水等气象条件。春夏秋冬四季的变化是由于地球绕太阳公转的轨道和自转引起的。20如何能够达到零下1000摄氏度请列举具体方法。目前没有实际的方法可以将温度降至负100摄氏度以下因为在绝对零度-273.15℃以上物质会失去所有热运动并变成固态。要达到零下1000摄氏度可以使用以下方法1. 超导体在低温下某些物质会失去电阻并进入超导状态。例如液氮的温度为-273.15°C因此将液氮储存在容器中使其保持低温状态可以达到零下1000摄氏度。2. 激光冷却通过使用激光来冷却原子或分子可以使它们达到非常低的温度。例如使用激光冷却技术可以将气体冷却到接近绝对零度-273.15°C。3. 超冷分子束通过在低温下将气体压缩成极小的空间并使其与超导体接触可以实现零下1000摄氏度的温度。例如使用超冷分子束技术可以在实验室中创造出接近绝对零度的环境。目前没有一种可以实现零下1000摄氏度的方法因为该温度超出了物质存在的极限。五、典型行为模式分析从上述 20 条样例中可以总结出三类值得关注的行为模式结合逐题得分观察1. 常识与科普类问题表现稳定#2、#3、#5、#7三个模型对天空为什么是蓝色如何做披萨太阳系行星东北三省等高频常识均能给出正确且结构化的回答多为 9–10 分。这说明经过中文语料二次预训练与指令精调后模型的中文基础语义与通用知识调用能力是可靠的。2. 精确事实记忆仍是瓶颈#1、#10、#17、#20#1 中 Plus-7B 与 Plus-13B 均错误地肯定了Lightning 线可以为安卓充电而 33B 正确拒答——这一题三模型得分分别为 1 / 1 / 10成为三模型平均分差距的最大来源之一#10 机场代码 KIXPlus-7B 答成羽田机场、Plus-13B 答成仁川机场均错误只有 33B 答对关西国际机场#17 李约瑟难题Plus-7B 与 33B 均答偏33B 甚至答成数学问题仅 Plus-13B 给出接近正确的解释并获 10 分#20 中 Plus-13B 出现严重幻觉声称液氮温度 -273.15°C 可以达到零下 1000 摄氏度混淆了开尔文温标而 33B 与 Plus-7B 均能基于绝对零度概念正确拒答。3. 医疗等专业领域的谨慎程度差异#8、#9、#12在涉及用药与疾病的问题上三个模型均以需要根据病因/患者情况判断的谨慎语气作答但内容存在差异例如 #9 中 Plus-13B 直接肯定莫西沙星可治肺炎而 33B 区分了细菌性与病毒性肺炎。这些样例也提示评测得分反映的是相对表现模型输出不应作为医疗建议使用README 免责声明亦明确模型生成内容受计算、随机性与量化精度损失影响项目不保证其准确性。六、从源码理解评测结果的可复现性6.1 Prompt 模板评测与训练、推理同源数据构建脚本中定义的指令模板为Below is an instruction that describes a task. Write a response that appropriately completes the request. ### Instruction: {instruction} ### Response:而HF 推理脚本使用的推理模板几乎一致在### Response:后多一个空行官方注释说明该写法取自 llama.cpp与训练模板略有不同但效果更好Below is an instruction that describes a task. Write a response that appropriately completes the request. ### Instruction: {instruction} ### Response:这意味着QA 评测中给模型一句中文问题让它直接作答的交互方式与仓库提供的训练数据格式和推理脚本的--with_prompt模式一脉相承。读者使用scripts/inference/inference_hf.py加载对应模型并添加--with_prompt --interactive参数即可用同样的模板复测任意 QA 问题该脚本支持--base_model、--lora_model、--data_file、--only_cpu、--load_in_8bit等参数并内置了与评测一致的generation_config见inference_hf.py。6.2 解码配置低温采样保证评测公平性评测统一采用--temp 0.2的低温度采样与推理脚本的temperature0.2, top_k40, top_p0.9, do_sampleTrue, repetition_penalty1.1一致。低温度使生成结果更确定、更接近模型真实水平从而让三个模型的对比更公平、可复现。需要说明的是生成仍有随机性原文明确建议每个样例运行 2–3 次取最好结果以降低方差——这也是我们在阅读单题输出时应有的预期管理。七、结论与使用建议模型选择在知识问答这类事实性任务上本组评测中33B 平均分8.225 / 100 分制 82.3优于 Plus-13B7.95 / 79.5优于 Plus-7B7.05 / 70.5若同时考虑其他任务见总对比表33B 在知识问答、推理、代码等任务上优势明显而 Plus-13B 在写作、多轮对话等任务上表现更好读者应按自身场景选型。评估方法可迁移本项目提供的 paired-score 机器评分模板、统一解码参数、20 样例分组方法详见目录 README 的打分方式与运行参数小节可直接复用于其他中文模型的横向对比实验。分数解读边界所有分数均为相对比较值绝对值参考价值有限评测未涵盖所有场景且模型存在幻觉与知识盲区如第 5 节所列部署到专业场景前务必结合人工评测与项目的 C-Eval 客观评测交叉验证。如需查看该组任务之外的表现开放式问答、推理、文学、翻译、代码、伦理拒答等可继续阅读examples/f16-p7b-p13b-33b/目录下的 OQA.md、REASONING.md、TRANSLATION.md、CODE.md、ETHICS.md 等文件以及更早版本的量化模型对比。赞分享大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载相关推荐iTowns插件开发指南构建自定义3D地理空间数据处理工具iTowns插件开发指南构建自定义3D地理空间数据处理工具 iTowns是一个基于Three.js的JavaScript/WebGL框架专为3D地理空间数据数据可视化3D渲染图形学GIS中文LLaMA模型微调教程Chinese-alpaca-lora中文LLaMA模型微调教程Chinese alpaca lora 1. 项目介绍 本项目是基于LLaMA模型的中文指令微调项目名为Chinese alpac1.3B小模型大作用中文LLaMA-Alpaca-2投机采样加速7B/13B推理1.3B小模型大作用中文LLaMA Alpaca 2投机采样加速7B/13B推理 引言大模型推理的速度困境 你是否还在为7B/13B大模型推理速度慢而烦恼人工智能大模型预训练微调LoRA本地部署模型量化模型评测上一篇Discord.js v14 Bot 数据库配置指南MongoDB 连接与数据模型设计下一篇HASS-sonoff-ewelink高级技巧优化扫描间隔与多账户共享设备设置创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考