数据集概览
定义:代码执行检测规则数据集(RCE)是由长沙朗慧信息科技有限公司安全实验室构建的高质量Web安全检测数据集。每条数据以「XML规则 + PCAP流量 + HTTP还原文本 + 攻击类型标签 + 标准答案」五元组关联结构组织,覆盖命令注入(Command Injection)、Java反序列化RCE、模板注入(SSTI)、表达式注入、文件包含RCE五大子类型,ATT&CK框架T1059(命令和脚本解释器)和T1203(利用客户端漏洞)映射,专为代码执行漏洞检测模型训练和WAF规则自动生成设计。
| 数据集名称 | 代码执行检测规则数据集(RCE) |
| 数据总量 | 800~20,000条 |
| 数据类型 | 五元组:XML规则 + PCAP流量 + HTTP还原文本 + 攻击类型标签 + 标准答案 |
| 数据来源 | 朗慧安全实验室 + 漏洞平台验证数据(HackerOne/Bugcrowd/CNVD) |
| 授权方式 | 商业授权 附带完整授权文件 |
| 交付周期 | 2-3周 |
| 代码执行子类型 | 命令注入(Command Injection)、Java反序列化RCE、模板注入SSTI(Jinja2/Thymeleaf/Freemarker)、表达式注入(SpEL/OGNL)、文件包含RCE |
| ATT&CK映射 | T1059(Command and Scripting Interpreter)、T1203(Exploitation for Client Execution)、T1190(Exploit Public-Facing Application) |
| 输出格式 | JSONL / CSV / Excel / PCAP |
| 语言 | 中英双语 |
核心数据字段
每条数据包含规则标识、XML检测规则、攻击载荷、HTTP还原文本、PCAP流量及标准答案六大类别,覆盖从规则定义到验证评估的完整闭环。
| 字段类别 | 字段数 | 典型字段 |
|---|---|---|
| 规则标识 | 4 | rule_id(规则唯一ID)、rule_name(规则名称)、category(代码执行子类型)、severity(严重级别:Critical/High/Medium) |
| XML检测规则 | 3 | rule_xml(ModSecurity/CRS格式XML规则)、detection_logic(检测逻辑说明)、matching_patterns(正则匹配模式列表) |
| 攻击Payload | 3 | payload(攻击Payload原文)、payload_type(载荷类型)、obfuscation_level(混淆等级:none/low/medium/high) |
| HTTP还原文本 | 3 | http_request(HTTP请求全文含Headers+Body)、http_response(HTTP响应全文)、content_type(响应Content-Type) |
| PCAP流量 | 4 | pcap_file(PCAP文件名)、pcap_size(文件大小)、packet_count(数据包数量)、protocol(传输层协议) |
| 标准答案 | 4 | is_rce(是否为代码执行攻击:true/false)、rce_type(攻击子类型)、exploit_success(利用是否成功)、cve_ref(关联CVE编号) |
数据样例展示
以下为脱敏后的结构化 JSON 样例,展示SQL注入五元组检测数据的典型格式。
{
"entry_id": "RCE-2024-002341",
"rule_id": "RCE-CMD-0192",
"rule_name": "Command Injection via Pipe Operator",
"category": "Command Injection",
"severity": "Critical",
"rule_xml": "<rule id=\"932150\" phase=\"2\">\n <operator>detectRCE</operator>\n <action>block</action>\n <pattern>(?:;|\\||`|&)\\s*(?:cat|id|whoami|uname|ls|ping|curl|wget|nc|bash)</pattern>\n <target>ARGS|REQUEST_BODY</target>\n</rule>",
"payload": "127.0.0.1 | cat /etc/passwd",
"payload_type": "Command Injection - File Read via Pipe",
"obfuscation_level": "none",
"http_request": "GET /api/ping.php?host=127.0.0.1%20|%20cat%20/etc/passwd HTTP/1.1\r\nHost: vulnerable-app.com\r\n\r\n",
"http_response": "HTTP/1.1 200 OK\r\nContent-Type: text/plain\r\n\r\nPING 127.0.0.1...\nroot:x:0:0:root:/root:/bin/bash\ndaemon:x:1:1...",
"pcap_file": "rce_cmd_pipe_passwd.pcap",
"pcap_size": "14532",
"packet_count": 62,
"technique_id": "T1059.004",
"cve_ref": "N/A",
"answer": {
"is_rce": true,
"rce_type": "Command Injection via Pipe Operator",
"exploit_success": true
}
}AI 应用场景
RCE检测模型训练
五元组关联数据为深度学习模型提供完整训练语料,支持CNN/LSTM/Transformer架构的代码执行检测模型训练,覆盖命令注入、反序列化、SSTI五种RCE类型。
WAF代码执行规则生成
800~20,000条XML检测规则+Payload对应数据,训练AI模型自动提取代码执行攻击特征并生成WAF/ModSecurity格式检测规则,显著提升规则覆盖率。
代码审计AI安全分析
基于攻击Payload和CVE映射,训练代码审计AI自动识别源码中的命令注入函数(system/popen/exec)和不安全反序列化入口点,生成修复建议。
反序列化漏洞检测
丰富的Java/PHP/Python反序列化Gadget Chain数据,训练AI模型识别二进制序列化流中的恶意对象,支持ysoserial全链检测。
沙箱逃逸检测
代码执行Payload变种数据用于训练沙箱逃逸检测AI,识别容器/沙箱环境中的异常系统调用和文件访问模式。
APT攻击链检测
覆盖命令注入→权限提升→持久化→横向移动完整攻击链,训练AI模型从多阶段代码执行行为中识别APT攻击模式。
常见问题
认证专家网络
覆盖数学、物理、化学、生物、地学、计算机六大学科
学术资质审核、专业能力评估、数据标注培训、质量持续监控
AI预标注+专家复核,效率提升300%,准确率99.5%+