尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AICrypto: A Comprehensive Benchmark For Evaluating Cryptography Capabilities of Large Language Mo...

AICrypto: A Comprehensive Benchmark For Evaluating Cryptography Capabilities of Large Language Mo... 文章主要内容和创新点主要内容本文提出了首个全面评估大型语言模型(LLMs)密码学能力的基准AICrypto,旨在填补当前LLMs在密码学领域能力评估的空白。该基准包含三类任务:135道选择题(MCQs):测试LLMs对密码学基础概念的事实记忆能力,涵盖经典密码学、对称加密、非对称加密等多个领域。150个夺旗赛(CTF)挑战:模拟真实世界密码学攻击场景,要求LLMs通过源代码分析和数值推理挖掘漏洞并恢复明文(flag),分为静态和动态两类任务。18个证明题:来自顶尖大学密码学课程考试,评估LLMs的形式化推理和严谨证明能力,涉及密码学基础、伪随机性、加密与签名等主题。为支持CTF挑战的自动化评估,本文设计了基于代理(agent)的框架,允许LLMs通过多轮交互执行命令、创建脚本以解决问题。同时,引入人类专家的性能基线作为对比,评估了17个主流LLMs的表现。结果显示:顶尖LLMs在密码学概念记忆、常见漏洞利用和常规证明任务上已接近或超越人类专家,但在抽象数学概念理解、多步推理和动态分析等复杂任务中仍存在显著不足。创新点首个全面的密码学能力基准:AICrypto首次系统覆盖密码学的事实记忆、漏洞利用和形式化推理能力,所有任务经密码学专家验证,确保正确性和严谨性。多维度评估与人
返回列表