尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

CompassBench 2.0 评测体系详解:OpenCompass 八大能力域的评测设计与实践

CompassBench 2.0 评测体系详解:OpenCompass 八大能力域的评测设计与实践 模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载导读本文基于 OpenCompass 官方文档 CompassBench 2.0 介绍系统讲解 CompassBench 评测体系的设计思路如何在语言、知识、创作、推理、数学、代码、长文本、智能体八大能力域上组织任务如何通过主观与客观相结合、Few-shot CoT、圆形变换circular提问、格式约束后处理等机制提升评测的稳定性与可复现性。读完本文你将掌握 CompassBench 各任务的考核目标、典型题目形态以及它们在 OpenCompass 仓库中对应的真实评测配置与底层实现路径可直接据此理解或复现年度榜单的评测流程。一、CompassBench 与 OpenCompass 年度榜单CompassBench 是 OpenCompass 为支撑年度榜单Annual Leaderboard而设计的综合评测基准Benchmark。它不局限于单一维度而是横跨大语言模型最受关注的八大能力域力求对一个模型的综合素质给出多角度、可量化的评价。其整体设计要点包括评测方式采样主观与客观相结合具体根据各个任务不同进行具体设计。客观题如选择题、填空题采用可自动判分的指标开放式问题如创作类任务则引入多维度打分。推理、数学、代码、智能体等任务采用 Few-shot CoTChain-of-Thought评测方式通过示例引导模型展示推理过程再抽取最终答案以考察模型的逐步推理能力。填空题通过 Few-shot 和输出格式约束协助抽取答案在 Prompt 中给出示例与输出格式限制降低答案解析的歧义。选择题通过变换提问方式圆形轮换选项减少随机影响同一问题多次以不同选项排列提问抵消模型对选项位置的先验偏好。开放式问题对同一问题进行多次采样并采用多维度打分多次生成后从不同维度综合评价降低单次采样的偶然性。此外文档还明确指出OpenCompass 在客观题评测的后处理上已进行较多优化并在评测时在 Prompt 中对回答格式进行约束对于因指令跟随问题带来的无法完成答案提取的情况将视为回答错误。同时官方计划在下一期加入指令跟随能力的专项评测。从仓库结构看CompassBench 2.0v1.1 数据版本的完整评测配置集中在 opencompass/configs/datasets/compassbench_20_v1_1/ 目录下按agent、code、knowledge、language、math、reason六个子目录组织另有 compassbench_20_v1_1_public 公开版本以及早期版本的 compassbench_v1_3 配置可供对照。二、能力全景八大能力域任务总览CompassBench 2.0 的能力域、任务划分与官方介绍如下表所示能力任务介绍语言信息抽取从文本中提取出特定类型的信息常用于处理结构化数据、知识图谱、问答系统等场景语言意图识别对用户输入的文本或语音进行分析判断其意图或需求应用于智能客服、语音助手、聊天机器人等场景语言情感分析对文本中的情感或情绪进行识别和分析可用于情感倾向分析场景如分析社交媒体用户评论语言内容总结将较长的文本压缩成简短的概括性摘要适用于新闻标题、电子邮件摘要等场景语言内容评价对文本的质量、价值或观点进行判断和评价可用于评论筛选、观点挖掘等场景语言多语言翻译将一种语言的文本转换为另一种语言适用于跨语言沟通、在线翻译等场景语言中华传统文化理解涉及对中国古代文学、艺术、哲学、历史等领域的研究语言中文语意理解理解词汇、短语和句子之间的语义关系近义词、反义词、整体-部分关系、修饰关系等语言多轮对话评价模型在多轮对话中保持上下文一致性和连贯性的能力考察是否理解并记住对话上下文知识生活常识考察普通社会中智力正常的人普遍拥有的、大众化的知识知识自然科学理科研究自然界本质和规律数学、物理、化学、生物、天文等知识自然科学工科应用性自然科学计算机科学、医学、建筑学、材料学、机械学、测量学、气象学、环境学等知识社会科学研究社会现象的具体科学经济学、政治学、军事学、社会学、管理学、教育学等知识人文科学围绕人的心灵世界、精神生命主题展开的思想、观念、知识探索文学、历史学、哲学、艺术、语言等创作内容扩写基于标题或大纲增加细节、描述和解释使内容更丰富饱满散文、小说、学术论文、报告等创作内容续写在现有文本基础上继续编写保持风格、情节和人物设定一致小说、故事等叙事性文本创作内容改写不改变主题和基本结构的前提下对文本进行修改、重组和优化提高表达能力和逻辑性推理逻辑推理综合考察演绎、归纳和溯因等常见逻辑推理模式推理常识推理基于日常生活积累的知识和经验对事物进行合理推断和判断数学初等数学初等教育数学能力小学数学数学中等数学中等教育数学能力初中和高中数学数学高等数学高等教育数学能力大学和研究生数学代码代码理解考察逻辑推理与代码生成能力包括算法数据结构、编程语言语法、跨编程语言转换等代码代码分析给定一段代码进行意图分析、代码规范检查、错误检查等长文本长文本理解与推理考察模型在不同长度上下文2k、4k、8k、16k、32k下的理解和推理能力智能体任务规划根据用户需求目标和工具条件合理拆解任务、安排子任务执行顺序与策略智能体工具调用评估模型能否准确调用合适的 API并在调用时正确传递参数智能体反思能力评估模型在子任务执行失败时是否具有反思和重新规划任务路径的能力智能体任务执行总结评估模型能否根据子任务执行结果总结分析、完成原始任务目标并按要求输出回复智能体多轮交互评估模型在进行多轮复杂工具调用时能否准确理解意图三、语言能力从语义理解到多轮对话的全面考察语言能力域共包含 9 类任务是 CompassBench 中任务形态最丰富的板块。官方给出的典型题目示例如下信息抽取给定一段新闻文本如 NFL 季后赛报道要求回答事实性问题例如野马队在 AFC 锦标赛中打败了谁考察从非结构化文本中定位并抽取特定实体与事实的能力。意图识别输入长篇议论文如关于天人合一思想的分析文章让模型判断根据原文提供的信息下列推断不正确的一项是四个选项A–D分别代表不同推论考察深层理解与意图判断。情感分析给出大众点评上的餐厅评价文本要求判断是正面评价还是负面评价选项为正面评价/负面评价考察情感倾向识别。内容总结给出一段联合国减灾办公室的新闻报道要求压缩为简短概括性摘要考察长文信息浓缩能力。内容评价给出一个问题与两个候选答案要求判断哪个答案更好考察对生成内容质量、忠实度与完整性的评判能力。多语言翻译例如要求将英文句子 He [Wales] basically lied to us from the start... 翻译成法语考察跨语言转换能力。中华传统文化理解如王实甫在《西厢记》中写道淋漓襟袖啼红泪比司马青衫更湿其中司马青衫指的是什么考察古代文学典故的掌握。中文语意理解如繁荣与以下哪个词具有近义关系盛世/荣誉/繁花/昌盛考察词汇语义关系。多轮对话以多轮 user 消息构成连续任务先整理 Markdown 表格再要求增加销量列、改标题语言与对齐方式、再添加收入列并按销量排序考察模型在多轮交互中的上下文记忆与指令跟随连贯性。在仓库实现层面语言任务的配置见 compassbench_v1_language_gen_7aa06d.py。从源码结构看该配置文件通过data_type区分不同题型与对应的评测管线意图识别、情感分析、内容评价、传统文化理解、中文语意理解等选择题型均声明为data_typecircular-mcq与infer_methodgen即使用圆形轮换选项的选择题 生成式推理。该类配置最终由 custom.py 中的make_circular_mcq_gen_config展开为完整的PromptTemplate ZeroRetriever GenInferencer评测管线并搭配CircularOptionSimAccEvaluator等评估器。信息抽取information_retrieval配置文件中被注释处于调试状态使用qa数据格式与EMEvaluator精确匹配评估。多语言翻译使用BleuFloresEvaluatorBLEU 分数评估。内容总结中/英使用RougeEvaluator与JiebaRougeEvaluatorROUGE 与中文分词 ROUGE 评估英文版输出列为summary并配有专门的摘要提示词{article}\nSummary of the article is:\n与{article}\n上述内容摘要如下\n。四、知识能力五大知识维度的客观考察知识能力域覆盖生活常识、自然科学理科/工科、社会科学、人文科学五类以客观选择题为主。官方示例包括生活常识世界四大文明古国有哪些自然科学理科群的研究对象是什么自然科学工科关于信息安全的多选题如数据加密是一种提高信息安全性的有效措施是否正确。社会科学为了避免资金供应短缺和倒闭企业经营者需要做什么人文科学结合光绪二十四年1898维新变法的历史背景判断康有为论述科举制度改革的意图四选一。在仓库配置 compassbench_v1_knowledge_gen_bd74e0.py 中可以看到关键实现细节知识任务使用WikiBenchDataset数据路径按data/compassbench_v1.1/knowledge/{split}/{name}.jsonl组织分为common_knowledge、humanity、natural_science、social_science四个子集。提供 Zero-shot 与 Few-shot 两套提示词模板。默认开启with_few_shot True、few_shot_samples 4即从few_shot_prompts中截取最后few_shot_samples * 2 - 2轮对话作为示例例如一丝不苟中的丝的本意五华县体育场位于哪个省西施犬的原产地四库全书四个示例后接{question}。单选题默认开启with_circular_eval True评估器在CircularEvaluator与AccEvaluator之间切换预测后处理统一使用first_option_postprocess并限定选项集合ABCD。知识域还包含填空/闭卷式问答子集mixed/cloze_en.jsonlTriviaQADatasetV3TriviaQAEvaluator推理配置使用GenInferencer设置max_out_len50与stopping_criteria[Question:]用于约束模型在回答后停止生成避免输出串扰。五、创作能力开放式生成的多维度评价创作能力域包含内容扩写、内容续写、内容改写三类开放式任务无法用客观指标直接判分因此其评测强调多次采样 多维度打分。官方示例展示了其任务形态内容扩写给定关键词与风格约束生成故事例如请根据我给出的[外星人入侵、核弹、流亡]这些关键词来撰写一篇[科幻]题材的短篇故事。故事需要拥有[引人入胜]的开头以及[反转]的结局……注意请使用[刘慈欣]的写作风格……大约800字。该题同时约束主题、结构、风格、篇幅等多个维度。内容续写给定题目《新型能源技术在工业生产中的应用与效益》与摘要要求完成一篇不少于1000字的论文考察在既有框架下保持风格一致地展开论述。内容改写要求总结一封公司瑜伽培训通知邮件输出必须包含【重要性】【紧急性】【核心内容】【需要回复内容】四个部分考察对指令化输出结构的遵循能力与信息提炼能力。这类开放式任务的共同特点是Prompt 中明确给出输出格式约束如必须包含指定小节、指定字数便于后续多维度打分与答案抽取。六、推理能力演绎、归纳与溯因的综合考察推理能力域包含逻辑推理与常识推理两类任务。官方示例逻辑推理自定义符号运算题例如695 - 472 - 229、222 - 62 - 166、689 - 439 - ?考察模型从示例中归纳运算规律并外推的溯因/归纳能力。常识推理以美即好效应的定义为题干判断四个选项中哪一项属于该效应考察对日常心理现象的理解与应用。仓库配置 compassbench_v1_reason_gen_d26d08.py 显示推理任务全部使用data_typecircular-mcq与infer_methodgen的圆形轮换选择题型共 13 个数据集覆盖中英文双语中文侧包括常识推理CN_Commonsense、溯因CN_Abductive_Alphanlg_translated、演绎CN_Deductive_BBH3obj_translated、CN_Deductive_LogiQA_zh、归纳CN_Inductive_DEER_translated、CN_Inductive_selfgenerated英文侧包括EN_Commonsense、EN_Abductive_Alphanlg、EN_Deductive_BBH7obj、EN_Deductive_LogiQA_zh_translated、EN_Deductive_OCNLI_translated、EN_Inductive_DEER、EN_Inductive_selfgenerated。由此可以看出推理任务的命名即标注了推理模式Deductive/Inductive/Abductive与数据来源BBH、LogiQA、OCNLI、DEER、AlphaNLG 等便于按推理类型进行细粒度分析与对比。七、数学能力分级数学与 CoT 推理数学能力域按学段分为初等数学小学、中等数学初中和高中、高等数学大学和研究生三级。官方示例初等数学小芳手上有40元。她的爸爸又给了她100元。她花了30元买了一条牛仔裤又花了20元买了一个包。那么小芳还剩下多少钱呢中等数学植树应用题四个含分式方程的选项如 $\frac{400}{x-50}\frac{300}{x}$要求选出正确方程。高等数学有向曲线积分题球面与平面交线四个含 $\pi$ 与 $\sqrt5$ 的选项考察大学微积分能力。数学任务的仓库配置 compassbench_v1_1_math_gen_1dc21d.py 是整个 CompassBench 配置中最具代表性的实现之一其核心开关参数如下参数默认值作用num_shot4上限 4Few-shot 示例数量0 时使用zero_shot_prompts否则从few_shot_prompts截取最后2 * num_shot 2轮with_reasoningFalse是否生成推理路径仅对单选题生效开启时使用{name}_with_reasoning模板with_circular_evalTrue单选题是否启用圆形轮换评估use_ppl_single_choiceFalse单选题是否改用 PPL困惑度模式即把 A/B/C/D 分别填充进模板用PPLInferencer打分配置逻辑会遍历mathbench_sets中的每个子集与题目为单选题配置first_option_postprocess选项限定ABCD为非单选题配置mathbench_postprocess按题目名定制解析。单选题开启 circular 时评估器为CircularEvaluator否则为AccEvaluator推理统一使用GenInferencermax_out_len2048以容纳完整的 CoT 推理过程。数据从data/compassbench_v1.1/math/{split}目录读取abbr 统一为mathbench-{split}-{name}形式。相关的 Few-shot 提示词定义见同目录下的 mathbench_prompt.py。八、代码能力生成、分析到多语言执行代码能力域包含代码理解生成与代码分析两类仓库配置 compassbench_v1_1_code_gen_986f01.py 将其落地为多套主流代码评测基准的组合代码理解/生成官方示例为编写一个 Python 函数用于检查两个数字是否仅在一个位置上不同。仓库中对应openai_humaneval_cn中文 HumanEvalHumanevalDatasetHumanEvalEvaluator、humaneval_plusHumanEvalPlusEvaluator、mbpp_cn与sanitized_mbppMBPPDataset/SanitizedMBPPDatasetMBPPEvaluator。这些数据集使用humaneval_postprocess_v2等后处理提取代码块GenInferencer的max_out_len设为 512。代码分析官方示例为给定truncate_number函数含 docstring 与示例让模型理解其意图。仓库中通过多种数据集形态覆盖humanevalx-{python,cpp,go,java,js}HumanevalXEvaluator依赖code_eval_service启动执行服务器配置中指定ip_addresslocalhost、port5001、lcbench_en/cn-{EASY,MEDIUM,HARD}LCDatasetLCPassKEvaluator数据来自 LCBench2023、TACO-{EASY,MEDIUM,MEDIUM_HARD,HARD,VERY_HARD}TACODatasetTACOEvaluator要求以 python 代码块格式输出。此外代码配置中的 Prompt 模板展示了 Few-shot 设计MBPP 系列使用[BEGIN] ... [DONE]标记包裹完整示例代码并要求模型以[BEGIN]开头生成LCBench 的中英文模板则分别用你是一名专业的 Python 程序员下面是你的任务与英文对应表述附 2–3 个带断言的单测示例后接{text} {test_list}占位符。九、长文本能力2k 到 32k 的多档位上下文考察长文本能力域聚焦长文本理解与推理官方说明为考察模型在不同的长度上下文2k、4k、8k、16k、32k情况下的理解和推理能力。该任务在文档中以略表示示例细节属于需要依托数据文件data/compassbench_v1.1/下的长文本语料进行评测的专项能力。从 OpenCompass 仓库整体能力看长文本评测通常与 needlebench、longbench 等专项基准配套参见 needlebench 配置 与 longbench 配置其核心思想是控制输入上下文的 token 长度档位考察模型在长距离依赖下的信息检索与推理稳定性。十、智能体能力任务规划、工具调用与多轮交互智能体能力域是 CompassBench 2.0 中复杂度最高的板块包含任务规划、工具调用、反思能力、任务执行总结、多轮交互五类任务。官方文档中的题目示例为略但仓库配置 agent/ 目录给出了完整实现主要包括两套基准CI-Bench工具调用基准见 cibench_template_gen_e6b12a.py覆盖 20 个库的 API 工具调用任务英文侧lightgbm、matplotlib、nltk、opencv、pandas、pytorch、scipy、seaborn、sklearn、tensorflow以及对应的_chinese中文侧版本。推理使用AgentInferencer并设置infer_modeevery即以每个问题都执行工具调用的模式驱动模型与环境交互数据配置internet_checkFalse评估器为CIBenchEvaluator。数据路径为data/compassbench_v1.1/agent-cibench/cibench_template{lib}输入列questions、输出列references。T-Eval插件式工具调用评估基准见 mus_teval_gen_105c48.py通过plugin_eval_subject_mapping将 14 个主题映射到对应子集主题覆盖instruct指令遵循、plan规划含 JSON 与文本两种输出、review反思/回顾、reason_retrieve_understand推理-检索-理解、reason、retrieve、understand每个主题均有中英文_zh版本。推理使用ChatInferencer评估器为TEvalEvaluator按主题subset区分评分逻辑后处理为teval_postprocess数据路径data/compassbench_v1.1/agent-teval-p10。这两套基准分别从真实库 API 调用与结构化多步骤任务执行两个角度覆盖了任务规划plan、工具调用retrieve/instruct、反思能力review、任务执行总结与多轮交互的考察目标与官方文档中智能体五类任务的定义一一对应。十一、底层原理圆形轮换评估与格式后处理CompassBench 选择题广泛采用的圆形轮换提问机制是保证评测公平性的关键技术其实现可从源码中直接印证。在 custom.py 中make_circular_mcq_gen_config展示了circular-mcq数据类型的组装方式默认构造Question: {question}\nA. {A}\nB. {B}...形式的人类提示与Answer: {answer}形式的回复模板将option_keys选项键写入数据集并默认挂载CircularOptionSimAccEvaluator评估器。核心评分逻辑位于 icl_circular_evaluator.py 的CircularEvaluator类中其设计要点包括圆形轮换模式定义cp4 [ABCD, BCDA, CDAB, DABC]四种选项轮换方式与cp1 [ABCD]原始方式参考答案以index--ref--circular_pattern三段式字符串编码。多档准确率分别统计无轮换acc_1与四种轮换acc_4下的准确率并按轮换数归一化乘以4 / N。投票式准确率将各轮换下的模型预测映射回原始选项位次back_map统计多数投票结果vote_4/vote_1考察模型是否在不同选项排列下稳定选择同一正确答案。先验分布监控统计模型输出 A/B/C/D 的频率prior_A…prior_D与无法解析的占比prior_-用于监测模型是否存在固定选某个选项的位置偏好这正是通过变换提问方式减少随机影响的可量化依据。此外所有选择题配置都统一挂载first_option_postprocess限定选项集ABCD等后处理器配合 Prompt 中的格式约束将模型输出规整为可判分的标准答案若输出无法提取答案则按文档约定视为回答错误。十二、如何在 OpenCompass 中运行 CompassBench 评测要在本地复现 CompassBench 2.0 评测可按以下步骤进行仓库为只读所有操作均基于查看与运行层面准备数据将 CompassBench v1.1 数据按配置中的路径约定放入data/compassbench_v1.1/例如data/compassbench_v1.1/language/、data/compassbench_v1.1/knowledge/、data/compassbench_v1.1/math/、data/compassbench_v1.1/code/、data/compassbench_v1.1/agent-cibench/、data/compassbench_v1.1/agent-teval-p10/等。组装配置参考 run.py 的用法在评测配置中导入对应能力域的 dataset 列表如compassbench_v1_language_datasets、compassbench_v1_knowledge_datasets、compassbench_v1_reason_datasets、compassbench_v1_1_math_datasets、compassbench_v1_1_code_datasets、cibench_datasets、plugin_eval_datasets配合模型与 summarizer 配置执行python run.py。调整关键开关按需修改各配置顶部的开关参数如num_shot、with_reasoning、with_circular_eval、use_ppl_single_choice、with_few_shot、few_shot_samples体验不同评测设置对结果的影响。代码类任务需执行服务器humanevalx等任务的执行式评测依赖code_eval_service启动代码执行服务器配置中默认localhost:5001可参考 code_eval_service 指南。查看结果运行结束后在输出目录中查看各数据集的分项得分其中单选题会输出acc_1/acc_4、vote_1/vote_4、perf_*、prior_*等多项指标可用于深入分析模型的位置偏好与稳定性。结语CompassBench 2.0 是一套面向大模型综合素质的多能力域评测体系它在任务设计上同时覆盖客观题型选择题、填空题与开放式生成题型在评测机制上采用 Few-shot CoT、圆形轮换选项、格式约束后处理与多次采样多维打分并通过源码级配置compassbench_20_v1_1将语言、知识、创作、推理、数学、代码、长文本、智能体八大能力域逐一落地。无论是想理解年度榜单的评测口径还是希望在自己的模型评测中复现这套多维评估方法都可以从上述配置与实现中找到可直接参考的完整方案。赞分享模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载相关推荐LMDeploy 与 OpenCompass 联合评测指南两阶段学术能力评测实战LMDeploy 与 OpenCompass 联合评测指南两阶段学术能力评测实战 本指南以 LMDeploy 开源仓库的 模型评测文档 https://lin人工智能大模型模型推理服务推理引擎本地部署模型量化BELLE评估体系详解12类指令任务与自动评分系统的设计与实践BELLE评估体系详解12类指令任务与自动评分系统的设计与实践 引言大语言模型评估的痛点与BELLE的解决方案 在中文大语言模型Large Languag人工智能大模型微调RLHF强化学习预训练模型评测OpenCompass评测结果持久化机制详解OpenCompass评测结果持久化机制详解 引言 在大模型评测过程中评测结果的存储与管理是一个重要环节。OpenCompass提供了一套完善的评测结果持久化模型评测人工智能大模型AI 评测上一篇从 .NET 8 升级到 .NET 10Dorisoy.Pan 迁移踩坑实录与完整解决方案下一篇如何让你的第一张文字图片开口说话MaskTextSpotterV3 场景文字识别 demo.py 推理实战手把手教创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表