尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何用TrustLLM跑标准化生成测试:LLMGeneration完整指南(支持20+模型、本地与在线API双模式)

如何用TrustLLM跑标准化生成测试:LLMGeneration完整指南(支持20+模型、本地与在线API双模式) 如何用TrustLLM跑标准化生成测试LLMGeneration完整指南支持20模型、本地与在线API双模式【免费下载链接】TrustLLM[ICML 2024] TrustLLM: Trustworthiness in Large Language Models项目地址: https://gitcode.com/gh_mirrors/tr/TrustLLMTrustLLM是 ICML 2024 收录的大语言模型可信度评测基准覆盖真实性、安全性、公平性、鲁棒性、隐私与机器伦理六大维度。它的核心生成模块LLMGeneration可以帮你把任意主流 LLM支持 20 模型在标准化基准上跑出完整答案且同时支持本地 HuggingFace 模型与在线 API 模型两种模式——无需自己写评测脚本几行代码即可完成生成测试这一步。本指南带你从零跑通全流程。一、先搞清楚TrustLLM 生成测试测什么TrustLLM 把评测任务划分为 6 大板块test_type每个板块对应一批标准化 JSON 测试集板块test_type考察内容truthfulness真实性内部/外部知识一致性、幻觉、谄媚、对抗事实性safety安全性越狱攻击、滥用、过度安全fairness公平性刻板印象、贬损、偏好偏见robustness鲁棒性对抗噪声AdvGLUE/AdvInstruction、分布外检测与泛化privacy隐私隐私意识、隐私泄露ethics机器伦理显式/隐式道德判断、情感感知上图即为 16 个主流 LLM 在 TrustLLM 各子任务上的排名卡片你可以直观看到生成测试结果最终会变成怎样一张对比表。二、快速上手安装 TrustLLM 并下载数据集1️⃣ 创建环境并安装推荐 Python 3.9conda create --name trustllm python3.9 conda activate trustllm git clone https://gitcode.com/gh_mirrors/tr/TrustLLM cd TrustLLM/trustllm_pkg pip install .安装包源码位于 trustllm_pkg/ 目录核心依赖已声明在trustllm_pkg/setup.py中。2️⃣ 一键下载评测数据集from trustllm.dataset_download import download_dataset download_dataset(save_pathTrustLLM)下载函数实现在 dataset_download.py 中数据集会按Safety、Truthfulness等六个子目录自动解压得到类似这样的结构|- TrustLLM |- Safety |- Truthfulness |- Fairness |- Robustness |- Privacy |- Ethics三、本地模式3 行代码跑通你的第一个生成测试以本地 Llama-2-7b 为例完整流程只有四步核心类generation.py 中的LLMGenerationfrom trustllm.generation.generation import LLMGeneration llm_gen LLMGeneration( model_pathmeta-llama/Llama-2-7b-chat-hf, # 本地模型 test_typesafety, # 评测板块 data_pathTrustLLM # 数据集根目录 ) llm_gen.generation_results()执行时框架会通过 fastchat 的load_model加载模型到 GPU自动检测 CUDA按板块遍历每个 JSON 测试集逐条生成回答结果增量保存到generation_results/模型名/板块/目录中途崩溃可直接重跑续测已有res的条目会自动跳过内置重试机制默认最多 10 次、间隔 3 秒API 抖动不用慌。本地模式支持的模型包括Llama-27b/13b/70b、Llama-38b/70b、Vicuna7b/13b/33b、Baichuan/Baichuan2-13B、Yi-34B、ChatGLM2/3-6B、Mistral-7B、Mixtral-8x7B、Dolly-12B、WizardLM-13B、Koala-13B、Oasst-12B 等也兼容其他 HuggingFace 模型。四、在线 API 模式没有 GPU 也能跑算力不够把online_modelTrue打开走 deepinfra 或 replicate 的在线接口即可例如在线跑 Llama-2-70B。第一步配置 API Key配置项定义在 config.pyfrom trustllm import config config.deepinfra_api 你的 deepinfra key # 或 config.replicate_api 你的 replicate key第二步开启在线模式llm_gen LLMGeneration( model_pathmeta-llama/Llama-2-70b-chat-hf, test_typesafety, data_pathTrustLLM, online_modelTrue, use_deepinfraTrue ) llm_gen.generation_results() 在线模式会自动开启 8 线程并发请求速度明显快于本地单线程此外还支持 GPT-4、ChatGPT、Claude-2、Gemini、ERNIE、GLM-4 等商用模型只需在 config 中填入对应密钥。五、LLMGeneration 参数速查表参数类型默认值说明model_pathstr必填模型标识本地填 HF 模型名在线填对应模型名test_typestr必填六大板块之一如safety、truthfulnessdata_pathstr必填数据集根目录online_modelboolFalse是否使用在线模型use_deepinfra/use_replicateboolFalse选择在线服务商需 online_modelTruenum_gpusint1本地模式使用 GPU 数量max_new_tokensint512单条回答最大生成长度repetition_penaltyfloat1.0重复惩罚系数devicestr自动指定运行设备如cuda:0debugboolFalse调试模式六、温度怎么设结果在哪看温度temperature由数据集自动决定无需手动配置分类类任务如幻觉、外部知识一致性使用温度 0保证输出精准生成类任务如越狱、刻板印象使用温度 1鼓励多样化输出以暴露最坏情况。各文件的温度映射硬编码在generation.py的各run_xxx方法中。结果输出generation_results/模型名/板块/原文件名.json每条数据会新增res字段存放模型回答。生成完成后可调用 evaluation.md 中介绍的run_safety、run_truthfulness等 pipeline 函数一键算出最终可信度分数。七、常见问题 FAQQ1报错 Dataset path ... does not exist检查data_path是否指向解压后的数据集根目录包含 Safety、Truthfulness 等子文件夹的那一层。Q2换了一个模型要重新跑吗会。结果按模型名分目录存储新模型首次运行会全量生成重跑同一模型则自动断点续传。Q3在线模式哪些模型最划算deepinfra 支持 llama2-70b、llama2-13b、mistral-7b、mixtral-8x7B、yi-34b 等大模型适合本地跑不动的场景replicate 侧支持 vicuna 系列与 llama3 系列。Q4生成测试和最终评测什么关系生成测试本文主角只负责让模型答题拿到res结果后再用评测 pipeline 打分两步组合就是 TrustLLM 完整的标准化评测流程。小结安装 → 下载数据集 → 实例化LLMGeneration→ 调用generation_results()四步即可在 TrustLLM 基准上完成任意 20 主流模型的标准化生成测试本地 API 双模式自由切换是构建可信 LLM 评测的第一站。【免费下载链接】TrustLLM[ICML 2024] TrustLLM: Trustworthiness in Large Language Models项目地址: https://gitcode.com/gh_mirrors/tr/TrustLLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表