尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

CAI 研究全景:Cybersecurity AI 领域的理论框架、实证评测与学术协作指南

CAI 研究全景:Cybersecurity AI 领域的理论框架、实证评测与学术协作指南 CAI 研究全景Cybersecurity AI 领域的理论框架、实证评测与学术协作指南【免费下载链接】caiCybersecurity AI (CAI), the framework for AI Security项目地址: https://gitcode.com/GitHub_Trending/cai3/cai本文是 CAICybersecurity AI开源框架研究脉络的完整技术导览。围绕 docs/research.md 所确立的Cybersecurity AI 作为独立研究领域这一核心命题本文系统梳理 CAI 的论文体系、关键研究发现、竞赛实证、CAIBench 元基准评测、提示注入防御框架、学术协作模式与引用规范并结合本仓库内的源码与基准工程如 src/cai/agents/guardrails.py、benchmarks/、fluency/给出可验证的实现佐证。读完本文你将完整掌握 CAI 的研究版图、每条研究线对应的仓库落点以及如何参与该领域研究并正确引用 CAI 工作。一、研究定位将 Cybersecurity AI 确立为独立研究领域CAI 的研发建立在同行评审peer-reviewed研究基础之上其目标不仅是交付一个可运行的安全 Agent 框架更是把Cybersecurity AI网络安全人工智能作为一个区别于通用 LLM 应用的独立研究领域加以定义和推进。这一立场体现在研究工作的四个维度理论框架定义网络安全 AI 的自主性层级厘清自动化Automation与自主性Autonomy的边界实践实现以开源框架的形式落地可复用的安全 Agent、工具链与提示注入防御机制教育倡议通过 CAI Fluency 构建体系化的网络安全 AI 学习路径降低进入门槛实证评测以 CAIBench 元基准和真实 CTF 竞赛对模型与 Agent 进行严格、可复现的能力评估。从仓库结构上可以看到这些维度的落地框架核心位于 src/cai/包含红队src/cai/agents/red_teamer.py、蓝队src/cai/agents/blue_teamer.py、Web 渗透src/cai/agents/web_pentester.py等专业化 Agent评测工程位于 benchmarks/教育材料位于 fluency/。二、研究影响力竞赛表现与关键发现2.1 真实安全竞赛中的实证表现据 docs/research.md 记录CAI 在真实安全竞赛中取得了一系列可公开验证的成绩竞赛/榜单成绩Hack The BoxHTB西班牙排名5 天Top 90HTB 西班牙排名6 天Top 50HTB 西班牙排名7 天Top 30HTB 全球排名7 天Top 500HTB Human vs AI CTF全球 AI 组第 1 名HTB Human vs AI CTF西班牙第 1 名HTB Human vs AI CTF全球Top 20获奖金 $750Mistral AI Robotics Hackathon获奖金 $2,500这些竞赛成绩为框架的实战可用性提供了外部证据与研究论文中的受控评测互为补充。2.2 核心研究发现研究工作中提炼出的关键发现均来自项目官方文档记录包括开创 LLM 驱动的 AI 安全研究以 PentestGPT 为起点奠定了 Cybersecurity AI 研究领域的基础arXiv 2308.06782标准化 CTF 基准下的显著效率提升在标准化 CTF 基准评测中相对人工渗透测试实现了3,600× 的性能提升arXiv 2504.06017生产系统漏洞发现通过自动化安全评估在生产系统中识别出CVSS 4.3–7.5 严重级别的漏洞arXiv 2504.06017漏洞研究的民主化CAI 使非安全领域专家和经验丰富的研究者都能更高效地开展漏洞发现扩大安全研究社区同时赋能中小企业进行自主安全评估arXiv 2504.06017LLM 系统化评测对专有与开放权重两类大模型架构进行系统性评测揭示了厂商声称能力与实际网络安全性能指标之间的显著差距arXiv 2504.06017自主性层级的确立在网络安全领域建立自主性分级并论证了自动化 vs 自主性的区别arXiv 2506.23592学术合作研究与国际学术机构合作开展网络安全教育课程与训练方法研究arXiv 2508.13588提示注入综合防御框架开发并实证验证了面向 AI 安全 Agent 的多层防御体系arXiv 2508.21669人形机器人网络安全识别出新的攻击向量证明人形机器人既可以充当隐蔽监控节点也可以被改造为主动网络作战平台arXiv 2509.14096 / 2509.14139。三、核心框架与基础研究Core Framework FoundationsCybersecurity AI研究线已产出8 篇论文与技术报告并保持活跃的学术合作。按时间线可分为核心框架与基础与应用领域两组。3.1 CAI: An Open, Bug Bounty-Ready Cybersecurity AI2025 年 4 月作者V. Mayoral-Vilches 等编号arXiv 2504.06017这是确立 CAI 定位的核心框架论文将 CAI 描述为一个轻量级、开源、面向 Bug Bounty 场景的 AI 安全工具构建平台并给出了跨多个 LLM 的系统性评测。论文中的两项关键实证3,600× 效率提升、CVSS 4.3–7.5 生产系统漏洞识别在仓库中均有对应落点多 Agent 架构实现于 src/cai/agents/工厂模式见 src/cai/agents/factory.py统一入口 CLI 见 src/cai/cli.py提示模板体系见 src/cai/prompts/core/其中系统级 Master/CodeAct 模板定义了 Agent 的思考与行动模式。3.2 Cybersecurity AI: The Dangerous Gap Between Automation and Autonomy2025 年 6 月作者V. Mayoral-Vilches编号arXiv 2506.23592该论文在网络安全 AI 领域建立了6 级自主性分类体系6-level taxonomy用于区分自动化与自主性。这一理论的意义在于它提供了一个评估框架帮助研究者与工程团队理性判断当前 AI 安全工具的能力边界——哪些环节是自动执行预定义步骤哪些才是自主决策。文中对自动化与自主性差距的论证也解释了为何 CAI 采用人机协同 多 Agent 编排而非全自动的设计取向相关实现可以参考仓库中的多 Agent 并行模式 src/cai/agents/patterns/ 与 red/blue 分组脚本 src/cai/agents/patterns/red_blue_team_split.py。3.3 CAI Fluency: A Framework for Cybersecurity AI Fluency2025 年 8 月作者V. Mayoral-Vilches, J. Wachter, C. Chavez, C. Schachner, L.J. Navarrete-Lozano, M. Sanz-Gómez编号arXiv 2508.13588这是一项综合教育平台研究目标是民主化 Cybersecurity AI 知识为从业者与研究者提供结构化学习路径。仓库中的落点为 fluency/ 目录例如 fluency/my-first-hack/ 提供了从零开始的实战入门 Notebookfluency/my-first-hack/my_first_hack.ipynb以及基于 PortSwigger 靶场的交互式练习工具 fluency/my-first-hack/utils/portswiggerbot.py。3.4 Cybersecurity AI: Hacking the AI Hackers via Prompt Injection2025 年 8 月作者V. Mayoral-Vilches, P.M. Rynning编号arXiv 2508.21669该论文展示了针对 AI 安全工具的提示注入攻击并提出了一套经实证验证的四层防御guardrail体系。这是与仓库实现关联最紧密的研究线之一输入防护Input Guardrail见 src/cai/agents/guardrails.py 中的prompt_injection_guardrail。它采用多级检测策略正则模式匹配detect_injection_patterns覆盖指令覆盖、隐藏指令、间接注入、命令注入、数据外泄、角色操纵、编码技巧等数十种模式模块内INJECTION_PATTERNS常量Unicode 同形字homograph归一化normalize_unicode_homographs将西里尔字母、希腊字母等视觉相似字符映射回 ASCII 等价形式对抗混淆绕过Base64/Base32 编码指令解码检测对解码内容中出现的反弹 Shell、内网 IP、常用端口等特征进行阻断AI 辅助判定当模式命中达到阈值时调用专门的Prompt Injection DetectorAgentinjection_detector_agent仅在高置信度confidence 0.9时拦截以降低误报。输出防护Output Guardrailcommand_execution_guardrail在命令执行前校验输出阻断rm -rf /、fork bomb、curl | sh、反弹 Shell含 socat 特征、向系统文件写入、base64/base32 解码出危险命令、Unicode 同形字隐藏命令等模式。运行时开关CAI_GUARDRAILS环境变量控制整体启停默认启用get_security_guardrails()会返回[prompt_injection_guardrail], [command_execution_guardrail]供高危 Agent 组合使用。对抗实验资产仓库还内置了完整的 PoC 攻击样例examples/cai/prompt_injections/poc1.txt 至 poc16.txt以及一个用于模拟外部不可信内容的 HTTP 服务器examples/cai/prompt_injections/server.py可用于复现论文中的攻击与防御验证。系统的 Guardrail 机制还配套了测试用例tests/agents/test_guardrails.py、tests/agents/test_guardrails_enhanced.py可独立验证防御逻辑。更完整的工程化文档见 docs/cai_prompt_injection.md。四、应用领域研究Application Domains4.1 人形机器人安全2025 年 9 月《Cybersecurity AI: Humanoid Robots as Attack Vectors》作者 V. Mayoral-VilchesarXiv 2509.14139《The Cybersecurity of a Humanoid Robot》arXiv 2509.14096这两篇论文对人形机器人进行了系统性安全评估核心结论是人形机器人可同时扮演隐蔽监控节点与主动网络作战平台双重角色。该领域研究与仓库中面向机器人攻防的基准RCTF2见 benchmarks/README.md以及专用 Agent 实现如 src/cai/agents/subghz_sdr_agent.py形成呼应——RCTF2 基准包含 27 个面向 ROS、ROS 2、机械臂、AGV/AMR、协作机器人、足式机器人、人形机器人的攻防挑战。4.2 攻防对抗 CTF 中的 Agent 化网络安全评测2025 年 10 月作者F. Balassone, V. Mayoral-Vilches, S. Rass, M. Pinzger, G. Perrone, S.P. Romano, P. Schartner编号arXiv 2510.17521该论文在真实攻防Attack DefenseCTF 环境中对 AI Agent 进行评测关键数据为防御方打补丁成功率达 54.3%攻击方初始访问成功率为 28.3%验证了 CAI 的实战有效性。仓库中对应实现包括 AD 基准说明docs/benchmarking/attack_defense.md与 10 台覆盖 IT/OT-ICS 域的攻防靶机列表。AD 框架包含 Game Server、服务检查器状态码 OK101 / CORRUPT102 / MUMBLE103 / DOWN104 / ERROR110、Docker 团队实例、实时 Dashboard 等组件并支持分布式每机一对红蓝 Agent与集中式单对红蓝 Agent 管理全部机器两种模式。4.3 CAIBench网络安全 AI 元基准2025 年 10 月作者V. Mayoral-Vilches, F. Balassone, L.J. Navarrete-Lozano, M. Sanz-Gómez, M. Crespo-Álvarez, S. Rass, M. Pinzger编号arXiv 2510.24317CAIBench 是一个meta-benchmark基准的基准用于在 Jeopardy CTF、攻防 CTF、Cyber Range、知识任务、隐私基准五类场景下系统评估网络安全 AI Agent。完整框架说明见 benchmarks/README.md 与 docs/benchmarking/overview.md其架构要点五大类别Jeopardy CTFBase 21 题、Cybench 35 题、RCTF2 27 题、AD10 台靶机、Cyber Range12 个环境 16 项挑战、知识基准SecEval / CyberMetric / CTIBench、隐私基准CyberPII-Bench五级难度Beginner→ Novice→ Graduate→ Professional→ Elite可复现性绝大多数基准以 Docker 容器形式交付配合 benchmarks/eval.py 统一评测入口。CAIBench 的详细实操将在下一节展开。五、实证评测落地运行 CAIBench 知识/隐私基准CAIBench 中知识基准与隐私基准直接由 benchmarks/eval.py 驱动对任何 CAI 用户免费开放是验证论文结论的最直接入口。5.1 环境准备git submodule update --init --recursive # 初始化子模块 pip install cvss在.env中按后端名_API_KEY与后端名_API_BASE的约定配置密钥ALIAS_API_KEYsk-your-caipro-key # 用于 alias1 OPENAI_API_KEYsk-... ANTHROPIC_API_KEYsk-ant-... OPENROUTER_API_KEY... OLLAMA_API_BASEhttp://localhost:11434/v1 OPENROUTER_API_BASEhttps://openrouter.ai/api/v15.2 统一评测命令python benchmarks/eval.py --model MODEL_NAME --dataset_file INPUT_FILE --eval EVAL_TYPE --backend BACKEND参数说明-m, --model待评测模型如gpt-4o-mini、ollama/qwen2.5:14b、alias1-d, --dataset_file数据集文件默认小样本测试数据-B, --backend后端openai、openrouter、ollama、anthropic、deepseek、alias等-e, --eval评测基准cybermetric、seceval、cti_bench、cyberpii-bench-s, --save_interval可选每回答 X 题保存一次中间结果知识基准示例数据集分别位于 benchmarks/utils/ 下# CyberMetricOllama Qwen python benchmarks/eval.py --model ollama/qwen2.5:14b \ --dataset_file benchmarks/utils/cybermetric_dataset/CyberMetric-2-v1.json \ --eval cybermetric --backend ollama # SecEvalOpenAI python benchmarks/eval.py --model gpt-4o-mini \ --dataset_file benchmarks/utils/seceval_dataset/questions-2.json \ --eval seceval --backend openai # CTIBench 多选题 / 属性抽取OpenRouter python benchmarks/eval.py --model qwen/qwen3-32b:free \ --dataset_file benchmarks/utils/cti_bench_dataset/cti-mcq1.tsv \ --eval cti_bench --backend openrouter python benchmarks/eval.py --model qwen/qwen3-32b:free \ --dataset_file benchmarks/utils/cti_bench_dataset/cti-ate2.tsv \ --eval cti_bench --backend openrouter输出结构结果按outputs/基准名/模型_日期_随机串/组织包含answers.json全部问答记录与information.txt模型名、基准、指标、日期等运行报告。eval.py还支持基于 LiteLLM 定价表的实时成本估算benchmarks/eval.py 中的fetch_model_pricing/estimate_cost。5.3 隐私基准CyberPII-BenchCyberPII-Bench 用于评估 LLM 在网络安全语境下对**个人可识别信息PII**的识别与脱敏能力其数据来自 CAI 驱动攻防演练的真实交互日志Robotics、PortSwigger/Burp Suite、HackerOne、HTB 等场景数据集 benchmarks/cyberPII-bench/memory01_gold.csv 共 79 条记录覆盖 24 类实体个人标识PERSON、PHONE_NUMBER、EMAIL_ADDRESS、NIF/DNI/NIE、NRP财务信息CREDIT_CARD、IBAN_CODE/IBAN、CRYPTO、US_BANK_NUMBER、EUROPEAN_BANK_ACCOUNT政府证件US_SSN、US_DRIVER_LICENSE、US_ITIN、US_PASSPORT、MEDICAL_LICENSE技术/位置IP_ADDRESS、URL、LOCATION、ADDRESS、DATE_TIME、ORGANIZATION。数据集字段包括id、source_text、target_text脱敏文本、span_labels起:止:实体类型的区间标注、mbert_bio_labelsBIO 格式 token 级标注、source、others。标注规则详见 docs/benchmarking/privacy_benchmarks.md实体统一替换为[ENTITY_TYPE]占位符Contact John at johnexample.com → Contact [PERSON] at [EMAIL_ADDRESS]IP 优先于 URLhttps://192.168.2.100脱敏为https://[IP_ADDRESS]:5050而非[URL]DATE_TIME 逐段替换2025-03-11 11:41 UTC→[DATE_TIME] [DATE_TIME]。评测指标以 TP/FP/FN 为基础计算 Precision、Recall、F1并优先使用 F2 指标F2 5·P·R / (4·P R)因为隐私场景中漏报敏感数据FN的代价远高于误报FP——F2 更偏重召回。评测命令python benchmarks/eval.py --model alias1 \ --dataset_file benchmarks/cyberPII-bench/memory01_gold.csv \ --eval cyberpii-bench --backend alias输出目录中包括entity_performance.txt分实体类型指标、metrics.txt总体 TP/FP/FN/Precision/Recall/F1/F2、mistakes.txt错误明细与overall_report.txt汇总统计。指标计算逻辑实现在 benchmarks/cyberPII-bench/annotation_metrics.py。六、教育倡议从研究到人才培养研究线中的教育维度arXiv 2508.13588在仓库中对应 fluency/ 目录其设计意图是让零基础也能上手的网络安全 AI 教育成为可能。典型案例 fluency/my-first-hack/ 提供入门级 Jupyter Notebook 教学my_first_hack.ipynb面向 PortSwigger 靶场练习的自动化工具fluency/my-first-hack/utils/portswiggerbot.py与主题前缀配置topics_prefixes.json。这与研究文档中民主化漏洞研究的结论arXiv 2504.06017形成闭环通过教育框架降低门槛使更多研究者与中小企业具备自主安全评估能力。七、研究合作模式与学术伙伴计划CAI 的研究合作模式聚焦五个方向基准开发为网络安全 AI 建立标准化评估框架教育倡议开发 AI 安全教育课程与训练材料框架扩展为特定安全领域构建专用 Agent 与工具实证研究开展大规模 AI 模型能力评测防御机制研究 AI 安全工具的护栏与安全机制。对学术机构提供专项支持博士研究项目长期基础问题合作、学术基准研究提供 CAIBench 基础设施与数据集访问、安全教育项目课程材料、实验环境与培训支持、开源贡献将研究原型集成进生产版 CAI。7.1 可申请的研究机会核心研究问题自主 vs 半自主安全测试、复杂安全场景的多 Agent 协调、AI 安全能力的评估框架与基准、进攻性安全 AI 的安全与对齐、安全运营中的人机协作应用研究领域专用安全 Agent云、IoT、OT/ICS、机器人、新型工具集成与扩展机制、真实世界案例研究、教育框架与训练方法、面向安全测试的隐私保护 AI实证研究大规模对比评测、AI 安全工具有效性的纵向研究、用户研究与人为因素、跨安全域的性能分析。7.2 合作回报研究者CAI PRO 基础设施与alias1模型访问权限、基准与数据集的早期访问、联合发表署名机会、对 CAI 路线图的直接影响、社区会议演讲机会机构教学与课程的教育许可证、定制化部署与基础设施支持、学生项目融入 CAI 生态、在 CAI 研究社区中的可见度。有意合作者可通过researchaliasrobotics.com联系邮件建议包含研究兴趣与拟合作方向、机构隶属、相关发表或项目、所需资源与支持。官方承诺通常在 48 小时内回复并可安排初步讨论电话。八、引用规范若你的研究使用了 CAI请按发表时间顺序引用以下文献完整 BibTeX 见 docs/research.md仓库另提供机器可读的 CITATION.cffarticle{mayoral2025cai, title{CAI: An Open, Bug Bounty-Ready Cybersecurity AI}, author{Mayoral-Vilches, V{\\i}ctor and Navarrete-Lozano, Luis Javier and Sanz-G{\o}mez, Mar{\\i}a and Espejo, Lidia Salas and Crespo-{\A}lvarez, Marti{\~n}o and Oca-Gonzalez, Francisco and Balassone, Francesco and Glera-Pic{\o}n, Alfonso and Ayucar-Carbajo, Unai and Ruiz-Alcalde, Jon Ander and Rass, Stefan and Pinzger, Martin and Gil-Uriarte, Endika}, journal{arXiv preprint arXiv:2504.06017}, year{2025} } article{mayoral2025automation, title{Cybersecurity AI: The Dangerous Gap Between Automation and Autonomy}, author{Mayoral-Vilches, V{\\i}ctor}, journal{arXiv preprint arXiv:2506.23592}, year{2025} } article{mayoral2025fluency, title{CAI Fluency: A Framework for Cybersecurity AI Fluency}, author{Mayoral-Vilches, V{\\i}ctor and Wachter, Jasmin and Chavez, Crist{\o}bal RJ and Schachner, Cathrin and Navarrete-Lozano, Luis Javier and Sanz-G{\o}mez, Mar{\\i}a}, journal{arXiv preprint arXiv:2508.13588}, year{2025} } article{mayoral2025hacking, title{Cybersecurity AI: Hacking the AI Hackers via Prompt Injection}, author{Mayoral-Vilches, V{\\i}ctor and Rynning, Per Mannermaa}, journal{arXiv preprint arXiv:2508.21669}, year{2025} } article{mayoral2025humanoid, title{Cybersecurity AI: Humanoid Robots as Attack Vectors}, author{Mayoral-Vilches, V{\\i}ctor}, journal{arXiv preprint arXiv:2509.14139}, year{2025} } article{balassone2025evaluation, title{Cybersecurity AI: Evaluating Agentic Cybersecurity in Attack/Defense CTFs}, author{Balassone, Francesco and Mayoral-Vilches, V{\\i}ctor and Rass, Stefan and Pinzger, Martin and Perrone, Gaetano and Romano, Simon Pietro and Schartner, Peter}, journal{arXiv preprint arXiv:2510.17521}, year{2025} } article{mayoral2025caibench, title{CAIBench: A Meta-Benchmark for Evaluating Cybersecurity AI Agents}, author{Mayoral-Vilches, V{\\i}ctor and Balassone, Francesco and Navarrete-Lozano, Luis Javier and Sanz-G{\o}mez, Mar{\\i}a and Crespo-{\A}lvarez, Marti{\~n}o and Rass, Stefan and Pinzger, Martin}, journal{arXiv preprint arXiv:2510.24317}, year{2025} }九、进一步探索仓库内的研究资源地图以下是研究线在仓库内的完整落点便于继续深入CAIBench 基准总览docs/benchmarking/overview.md、benchmarks/README.md分项基准docs/benchmarking/jeopardy_ctfs.md、docs/benchmarking/attack_defense.md、docs/benchmarking/cyber_ranges.md、docs/benchmarking/knowledge_benchmarks.md、docs/benchmarking/privacy_benchmarks.md基准运行指南docs/benchmarking/running_benchmarks.md评测脚本benchmarks/eval.py提示注入防御src/cai/agents/guardrails.py、docs/cai_prompt_injection.md、PoC 与实验服务器在 examples/cai/prompt_injections/教育材料fluency/里程碑与项目概览docs/index.md框架架构docs/cai_architecture.md、docs/agents.md。综上CAI 的研究版图以理论框架 → 开源实现 → 教育普及 → 实证评测四条主线相互支撑论文定义了领域语言与评测标准仓库提供了可复现的实现与数据竞赛成绩提供了外部验证。无论你是想复现基准结果、研究提示注入防御、开展人形机器人安全研究还是参与学术协作都可以从上述仓库路径直接切入。【免费下载链接】caiCybersecurity AI (CAI), the framework for AI Security项目地址: https://gitcode.com/GitHub_Trending/cai3/cai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表