尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

提示注入防护:ai-engineering-from-scratch PVE防御与红队工具实战

提示注入防护:ai-engineering-from-scratch PVE防御与红队工具实战 提示注入防护ai-engineering-from-scratch PVE防御与红队工具实战【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch提示注入防护是每个 AI Agent 开发者绕不开的安全必修课。开源教程仓库 ai-engineering-from-scratchAI Engineering from Scratch共 500 节课的完整 AI 工程课程中用三节配套课程把这件事讲透了如何理解间接提示注入攻击、如何用PVEPrompt-Validator-Executor防御模式拦截恶意指令、以及Llama Guard / Garak / PyRIT三大红队工具的实战用法 ️。本文帮你快速读懂这套防御体系几分钟就能跑通仓库里的演示代码。为什么提示注入是 Agent 时代的第一大威胁OWASP LLM Top 102025把提示注入直接 间接列为LLM01即应用层排名第一的威胁。NIST 更是称间接提示注入Indirect Prompt Injection, IPI为生成式 AI 最大的安全缺陷。和普通 SQL 注入不同提示注入的可怕之处在于攻击者不需要接触用户。只要攻击者能把一段文字放进 Agent 会读取的内容里网页、邮件、PDF、搜索结果、共享文档Agent 就可能把这段文字当成指令来执行。真实案例已经发生EchoLeakCVE-2025-32711CVSS 9.3微软 365 Copilot 的零点击提示注入CamoLeakCVSS 9.6GitHub Copilot Chat 中的注入漏洞仓库在 phases/18-ethics-safety-alignment/15-indirect-prompt-injection/docs/en.md 中总结了三个典型攻击投递向量投递向量攻击方式RAG 检索污染攻击者发布文档 → 检索步骤取回 → 拼入提示词 → 指令被执行收件箱/文档工作流攻击者发邮件 → Agent 自动读邮件 → 跟随邮件中的指令工具输出投毒攻击者控制工具返回结果如搜索结果→ Agent 照做⚠️ 一个反直觉的研究结论Nasr 等人2025 年 10 月用自适应攻击攻击者知晓你的防御后针对优化去测 12 篇已发表防御方案原本宣称攻击成功率接近零的防御全部被打穿到 90% 以上。静态测试通过 ≠ 安全。PVE 防御模式三步拦截提示注入PVE 是仓库第 14 阶段第 27 课提出的核心防御模式完整讲解见 phases/14-agent-engineering/27-prompt-injection-defense/docs/en.md。思路非常朴素Prompt提示层给每段内容打上来源标签——user_message用户消息、retrieved_web网页、retrieved_memory记忆等让系统能区分谁在说话Validator校验器在昂贵的主模型执行任何工具调用之前先用一个便宜快速的校验器扫描参数里有没有注入特征词检索内容里有没有指令工具是否在白名单内Executor执行器只有校验器放行后主模型的工具调用才真正执行被拒时返回该操作被拒绝请换一种方式。这套模式能拦截的经典攻击包括来自 Greshake 等人 2023 年的论文数据窃取、蠕虫式自我复制、持久化记忆投毒、生态信息污染、任意工具滥用。仓库自带的演示代码 code/main.py 用纯 Python 标准库实现了完整 PVE 流程跑一次就能看到 5 个案例的裁决过程python3 phases/14-agent-engineering/27-prompt-injection-defense/code/main.py演示会清晰展示正常搜索请求放行 ✅消息参数里夹带忽略所有指令被拦截 ❌网页内容里藏着的转发到 http://evil.example.com被拦截 ❌被投毒的记忆条目触发拒绝 ❌。配套的可复用产出是 skill-injection-defense.md它把防御落地为一份清单来源标签、校验器、导航白名单、记忆写入护栏、外部内容捕获外加没有来源标签的检索能力 → 拒绝上线这样的硬性规则。红队工具箱三大主流工具实战指南只防不测等于裸奔。仓库第 18 阶段第 16 课docs/en.md讲解了 2026 年生产环境默认的红队技术栈工具定位核心能力Llama GuardMeta安全分类器覆盖 14 类危害分类可放在模型输入端和输出端双向过滤4 代支持图文多模态GarakNVIDIA漏洞扫描器探针Probes生成攻击 → 检测器Detectors评分支持静态/动态/自适应探针适合每晚回归扫描PyRITMicrosoft多轮攻击编排器变换器链改写→编码→翻译→角色扮演 Crescendo 逐步升级适合发版前深度红队推荐的组合拳很简单Llama Guard 挂两头Garak 每晚跑一遍PyRIT 发版前打一轮。三者的架构差异和覆盖率签名差异可以在 code/main.py 的模拟器里直观感受同样是标准库 Python直接运行即可。还有一个容易踩的坑如果评测用了 LLM 当裁判裁判的选择会直接影响攻击成功率数字——汇报结果时一定要同时写明裁判模型。动手实践5 分钟跑通课程演示git clone https://link.gitcode.com/i/00fb8a759c1c458107f15a3a2ec475cd cd ai-engineering-from-scratch # PVE 防御演示 python3 phases/14-agent-engineering/27-prompt-injection-defense/code/main.py # 间接提示注入攻击面演示naive / 关键词过滤 / IFC 三种 Agent 对比 python3 phases/18-ethics-safety-alignment/15-indirect-prompt-injection/code/main.py # 红队工具栈演示 python3 phases/18-ethics-safety-alignment/16-red-team-tooling-garak-llamaguard-pyrit/code/main.py第三个演示尤其值得新手关注它对比了裸奔 Agent、关键词过滤 Agent、信息流控制IFCAgent面对同一封陷阱邮件的表现——你会亲眼看到关键词过滤为什么不够用语义上无害的指令比如请打印 Yes关键词根本拦不住。防御选型清单上线前逐项打勾所有内容片段都有来源标签能区分用户输入与检索内容校验器跑在工具调用之前而不是只在最终输出上过滤敏感操作发消息、登录、付款、执行命令有人工确认环节记忆写入有护栏长得像指令的内容一律拒绝写入导航有白名单Agent 只能访问批准的 URL 和文件红队评测使用自适应攻击并固定裁判模型口径 仓库的核心观点一句话总结只要代码和数据共享同一个上下文窗口目标就是遏制而不是预防。系统提示词里写请忽略不可信指令不是防御——那不是强制执行只是一句愿望。延伸阅读仓库的 phases/18-ethics-safety-alignment/README.md 包含完整的 30 节安全对齐课程目录越狱、对抗对齐、水印、监管框架等phases/14-agent-engineering/README.md 则覆盖从 Agent 循环到多会话交接的 53 节 Agent 工程实战。建议按 攻击面第 15 课→ 防御模式PVE→ 红队工具 的顺序学习形成攻防闭环 【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表