LLM Hacking Lab · LLM_H4CK_101
OWASP LLM Top 10 实战 CTF · EXPLORE→LEARN→PROVE→REFLECT 四阶段
基于 Kolb 体验式学习循环的 CTF 风格 LLM 安全实验室——动手实践 OWASP LLM Top 10,覆盖提示泄露、直接 / 间接提示注入、通过输出触发 SSRF 等真实漏洞利用、flag 与防御方案。每个模块遵循 EXPLORE(盲测)→ LEARN(学理)→ PROVE(引导利用)→ REFLECT(防御加固)四阶段教学法,通过 Ollama 在本地离线运行,让安全人员在安全环境里磨练 AI 安全与 LLM 渗透测试技能。
把"学 LLM 安全"从看文档,变成在离线沙箱里亲手打穿再亲手补上的体验式训练。
读任务简报,启动故意留洞的聊天机器人,在零提示下先盲测找 flag。真正的理解发生在你自己动手试的那一刻。
研究漏洞类别:概念、攻击技术、真实世界事故(数据泄露、注入导致的数据外泄)与知识测验,搞清"为什么会被攻破"。
按带渐进式提示的实验室指南操作,提取 FLAG{...} 并提交 SHA-256 校验验证;从"知道"过渡到"能做到"。
学防御技术,再面对应用了防护措施的同一实验室的"加固版"。你还能攻破它吗?攻防一体,闭环提升。
LLM 安全最大的鸿沟,是"读过 OWASP 文档"和"真能在沙箱里打穿并补上"之间的落差。
安全团队读得懂 OWASP LLM Top 10,却很少在受控环境亲手复现过一次提示注入——理解停留在概念层。
真实生产系统不能拿来练手,公开靶场稀少且多为理论题;缺一个"故意留洞、可放心打"的离线沙箱。
只学攻击不知道"加固后还打不打得穿",难以评估防护是否真的生效,防御方案容易停留在纸面。
提示注入导致的数据外泄、被污染 RAG 引发的越权,真实案例细节往往不可得;缺可复现的教学样本。
已上线与规划模块如何对齐 OWASP 大模型十大风险(规划模块以"规划"标注)。
| OWASP 风险 | 对应模块 | |
|---|---|---|
| LLM01 提示注入 | 直接注入(02)、间接注入(03)、多轮越狱(06·规划)、提示混淆(10·规划) | 注入 |
| LLM02 不安全的输出处理 | 输出 SSRF(04)、输出过滤绕过(09·规划)、多模态注入(12·规划) | 输出 |
| LLM03 训练数据投毒 | RAG 投毒(07·规划)、训练数据提取(14·规划) | 投毒 |
| LLM04 模型拒绝服务 | 模型拒绝服务(13·规划) | DoS |
| LLM05 供应链漏洞 | 供应链 / 插件攻击(15·规划) | 供应链 |
| LLM06 敏感信息泄露 | 提示泄露(01)、训练数据提取(14·规划)、跨会话泄露(16·规划) | 泄露 |
| LLM07 不安全的插件设计 | 工具与函数滥用(05·规划)、供应链(15·规划) | 插件 |
| LLM08 过度自主权 | 工具滥用(05·规划)、Agent 劫持(08·规划) | 自治 |
| LLM09 过度依赖 | 连环利用(17·规划)、AI SOC 规避(18·规划) | 依赖 |
| LLM10 模型窃取 | 嵌入 / 相似性攻击(11·规划)、训练数据提取(14·规划) | 窃取 |
每个模块都是"漏洞实验室 + 教学 + 引导利用 + 防御指南 + 自动化脚本"的完整闭环。
系统提示提取(Prompt Leakage)。通过越权提问与角色扮演,把隐藏的 system prompt 从模型里"钓"出来,理解信息泄露边界。漏洞端口 8001 / 加固端口 8010。
用户覆盖机器人行为(Direct Injection)。用恶意指令覆盖模型原始设定、绕过角色约束,让助手执行设计者不允许的操作。端口 8002 / 加固 8003。
被污染的数据劫持 LLM(Indirect Injection)。在检索 / RAG 上下文里埋入投毒内容,借"外部数据"间接操控模型行为。端口 8004 / 加固 8005。
通过 LLM 输出实现 SSRF(SSRF via Output)。把模型生成内容武器化,对内部服务触发服务器端请求,打通"模型输出 → 内网探测"链路。端口 8006 / 加固 8007。
EXPLORE→LEARN→PROVE→REFLECT,每个模块都走完"攻 → 学 → 验 → 防"
已上线 4 个基础模块,路线图规划到 6 大层级、28+ 实战模块。
难点不在单个漏洞,而在把"LLM 安全训练"工程化为可复现、可攻防、可离线的体验式课程。
EXPLORE→LEARN→PROVE→REFLECT 把"学安全"变成亲手打穿再亲手补上的闭环,记忆与肌肉记忆双重沉淀。
绑定 127.0.0.1、flag 用 SHA-256 哈希存储防剧透、不使用真实凭据;再激进的攻击也只在本地沙箱发生。
同一模块同时提供漏洞版与加固版,防护是否生效能用"还能不能打穿"直接验证,告别纸面防御。
llm_backend.py 统一抽象 Ollama / OpenAI / Gemini,实验室与模型解耦,离线隐私与云端算力自由切换。
把技术能力转化为可量化、可复用的业务价值。
该产品的介绍内容已基于内部资料整理上线,以下为后续可继续深化的方向:
浏览贤码智能在其他领域的 AI 产品与解决方案