尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

火电厂网络安全监测装置部署指南:AGENT、SNMP与104报文配置实战

火电厂网络安全监测装置部署指南:AGENT、SNMP与104报文配置实战 简介本资源为火电厂网络安全监测装置建设项目的技术规范书面向电力监控系统集成商、发电厂网络安全与自动化运维人员以及参与涉网安全改造项目的工程技术人员。文件依据国网福建电力调控中心相关通知要求编制围绕在并网电厂电力监控系统安全Ⅰ、Ⅱ区部署网络安全监测装置展开明确采集主机设备、网络设备和安全防护设备的安全事件并转发至调度端网络安全管理平台数据网关机的技术路径。压缩包内为1个PDF文件约921KB内容涵盖总则、部署方案及目标、技术规范、试验和验收、技术服务和培训、采购清单等章节对功能设计、结构性能、柜内与间接线、与省调及需方设备调试等提出具体要求。目前已有122人学习下载适合需要了解厂站网络安全监测装置采购与实施要求的读者参考可帮助快速把握项目范围、验收要点与培训服务条款。1. 火电厂网络安全监测装置从一台 PDF 规范到可落地的厂站侧部署火电厂里的网络安全监测装置不是一台插上电就能用的盒子。它要接的是电力监控系统里的站控层网络要盯的是后台主机、远动装置、保护测控这些关键节点的异常行为还要把告警按调度要求送到上级平台。很多项目卡住不是因为设备买错了而是技术规范里那些看起来不起眼的条款——AGENT 装在哪、DL/T634.5104 报文怎么解析、SNMP 团体字怎么配——在实施阶段没人逐条对齐。这份「新澳火电厂网络安全监测装置建设项目技术规范」本质上是一份厂站侧安全监测的落地约束文件它规定了监测对象、数据采集方式、告警上报格式和验收标准。适合谁看做电力监控系统二次安防的集成商、火电厂信息中心运维、以及刚接手网络安全监测装置调试的工程师。下面按规范拆解到可执行层面把选型、配置、联调和排错串成一条线。2. 监测对象与采集方式AGENT、SNMP 和 104 报文各管什么2.1 三种采集通道的适用边界网络安全监测装置在火电厂里通常同时用三种方式采集数据不是三选一而是按对象类型分工。站控层主机操作员站、工程师站、历史站装 AGENT因为主机上的进程、端口、USB 插拔、文件变更这些细粒度事件只有主机侧代理才能拿到。网络设备交换机、路由器和部分支持 SNMP 的安防设备走 SNMP采集的是接口状态、流量异常、设备告警。远动通信和调度数据网相关的装置走 DL/T634.5104 报文监听解析的是遥控、遥调、总召这些控制类报文用来发现异常指令和非法访问。常见做法是主机类对象优先 AGENT网络类对象优先 SNMP通信类对象优先 104 监听。三者采集到的数据在装置内部做时间对齐和关联分析最终生成统一格式的安全事件。注意AGENT 不是装得越多越好。火电厂站控层主机数量有限但每台主机的操作系统版本、补丁级别、安全软件冲突情况都不一样装之前必须做兼容性确认。2.2 AGENT 部署的最小步骤与参数以 Linux 主机为例AGENT 部署一般分三步上传安装包、修改配置文件、启动服务并注册到监测装置。下面是一个典型的配置片段具体字段名以实际装置厂商文档为准但结构大同小异。# 解压安装包 tar -zxvf agent_linux_x64.tar.gz -C /opt/security_agent/ # 修改配置文件指定监测装置管理地址和本机标识 cat /opt/security_agent/conf/agent.conf EOF server_ip192.168.10.50 server_port8443 host_idHOST-OPR-01 host_name操作员站01 collect_interval5 enable_process_monitor1 enable_usb_monitor1 enable_file_monitor1 file_monitor_path/etc/passwd,/etc/shadow,/home/operator/.ssh EOF # 启动服务并设置开机自启 systemctl enable security_agent systemctl start security_agent systemctl status security_agent逻辑说明server_ip和server_port指向网络安全监测装置的管理口host_id是装置侧识别主机的唯一标识不能重复。collect_interval是采集周期单位秒火电厂站控层主机一般设 5 到 10 秒太短会增加主机负载太长会漏掉短时异常。file_monitor_path里列的是关键文件/etc/passwd和/etc/shadow被改往往意味着提权或后门账户.ssh目录被改可能是密钥被替换。参数怎么改如果主机 CPU 负载本来就高把collect_interval调到 10 或 15如果规范要求监测 USB 外设enable_usb_monitor必须为 1文件监控路径不要全盘递归只盯关键目录否则 AGENT 自身会把 CPU 吃满。2.3 SNMP 采集的团体字与 OID 配置网络设备走 SNMP 时火电厂里最常见的翻车点是团体字community string没改默认值或者 ACL 没放行监测装置的管理 IP。配置分设备侧和装置侧两步。设备侧以常见交换机为例# 创建只读团体字限制访问源为监测装置IP snmp-server community FirePowerRO ro 192.168.10.50 snmp-server host 192.168.10.50 version 2c FirePowerRO snmp-server enable traps snmp authentication linkdown linkup装置侧需要填的是目标设备 IP、SNMP 版本v2c 或 v3、团体字或 v3 的用户名/认证密码/加密密码、采集 OID 列表。火电厂里常用的 OID 包括1.3.6.1.2.1.1.3.0设备运行时间、1.3.6.1.2.1.2.2.1.8.0接口状态、1.3.6.1.2.1.4.20.1.1IP 地址表。提示SNMP v3 比 v2c 安全但配置复杂度高。如果规范没有强制 v3火电厂内网可以用 v2c 加 ACL 限制源 IP但团体字必须改成强密码不能用 public 或 private。2.4 DL/T634.5104 报文监听的接入点104 规约监听一般通过镜像口或串接方式接入。镜像口更常见因为不影响原有通信。监测装置的一个网口接交换机镜像口配置成混杂模式抓取 2404 端口的 TCP 报文。解析重点是总召C_IC_NA_1、遥控C_SC_NA_1、遥调C_SE_NA_1这些类型标识以及源发地址和传送原因。常见做法是在监测装置里配置 104 解析规则把源 IP、目的 IP、ASDU 类型、传送原因做白名单。比如操作员站发遥控指令是正常的但一个历史站发遥控指令就是异常。白名单之外的 104 报文直接告警。3. 从规范条款到装置配置告警上报与平台对接3.1 告警分级与上报格式火电厂网络安全监测装置的告警一般分三级紧急、重要、一般。紧急告警包括非法遥控、AGENT 被卸载、关键文件被篡改重要告警包括异常登录、USB 未授权接入、SNMP 团体字探测一般告警包括端口扫描、非关键文件变更。上报格式通常按调度规定的 E 语言或 JSON 格式字段包括告警时间、设备 IP、设备名称、告警类型、告警级别、告警描述。配置时要注意时间同步。监测装置、AGENT 主机、网络设备都要对同一 NTP 源否则告警时间错乱关联分析就失效。火电厂里常见做法是站控层配一个 NTP 服务器所有设备指向它。3.2 与上级调度平台的对接参数对接上级平台一般走调度数据网的纵向加密通道监测装置作为客户端主动连接平台。需要配的参数包括平台 IP 和端口、本地装置 ID、证书文件、心跳间隔、告警重传次数。# 监测装置侧平台对接配置示例 platform_ip10.20.30.40 platform_port9443 device_idFD-XINAO-001 cert_path/opt/security_device/cert/client.pem key_path/opt/security_device/cert/client.key heartbeat_interval30 retry_times3 retry_interval10逻辑说明device_id是上级平台识别本厂的唯一编号一般由调度下发。heartbeat_interval是心跳周期30 秒是常见值太短会增加通道负载太长会被平台判定离线。retry_times和retry_interval控制告警重传火电厂网络抖动时重传机制能避免告警丢失。参数怎么改如果调度平台要求加密证书双向认证cert_path和key_path都要填且证书有效期要提前检查。证书过期是导致对接中断的头号原因而且往往在半夜发生。3.3 验收前的自查清单验收前按下面几条逐项过一遍能省掉大量返工。AGENT 是否全部在线在监测装置界面看主机列表离线的主机要查服务状态和网络连通性。SNMP 采集是否正常看装置里网络设备的接口状态和流量曲线有没有数据。104 监听是否生效手动发一条总召报文看装置有没有解析记录。告警上报是否通在装置上模拟一条紧急告警看上级平台有没有收到。时间同步是否一致对比装置、主机、网络设备的时间戳。4. 避坑与排查火电厂现场最常见的五类问题4.1 AGENT 装了但装置显示离线现象主机上systemctl status security_agent显示 running但监测装置里该主机状态是离线。原因AGENT 和装置之间的心跳端口被防火墙拦截或者server_ip配错或者主机有多网卡AGENT 走错了网卡。解决先在主机上telnet server_ip server_port测端口通不通。不通就查防火墙规则火电厂站控层主机一般有主机防火墙要放行 AGENT 的出站端口。如果端口通但还离线检查 AGENT 日志/opt/security_agent/log/agent.log看心跳包有没有发出去。多网卡主机要在配置里指定bind_interface或source_ip。4.2 SNMP 采集不到数据现象装置里网络设备添加成功但接口状态和流量一直是空。原因团体字错误、ACL 没放行、OID 不支持、SNMP 版本不匹配。解决先在监测装置所在网络里用snmpwalk -v 2c -c 团体字 设备IP 1.3.6.1.2.1.1.3.0手动测。如果手动能拿到数据说明装置配置有问题如果手动也拿不到查设备侧 ACL 和团体字。有些老交换机不支持 v2c 的某些 OID要降级到 v1 或换 OID。4.3 104 监听抓不到报文现象镜像口接好了但装置里 104 解析记录为零。原因镜像口配置错误、镜像方向不对、装置网口没设混杂模式、104 通信本身没流量。解决先在镜像口上接笔记本用 Wireshark 抓包确认能看到 2404 端口报文。如果 Wireshark 能看到但装置看不到检查装置网口是否配成混杂模式以及装置是否绑定了正确的网口。如果 Wireshark 也看不到查交换机镜像配置确保镜像源端口和方向正确。4.4 告警上报上级平台失败现象装置本地有告警但上级平台收不到。原因证书过期、平台 IP 或端口变更、纵向加密通道中断、装置 ID 被平台禁用。解决先看装置日志里平台连接状态如果是证书错误更新证书并重启对接服务。如果是连接超时ping 平台 IP 并 telnet 端口。火电厂里纵向加密通道由调度侧管理通道中断要联系调度。装置 ID 被禁用的情况少见但发生过联系平台管理员确认。4.5 时间不同步导致告警关联失效现象同一时间发生的多个告警在装置里显示的时间差了几分钟关联分析结果不对。原因AGENT 主机、网络设备、监测装置各自对不同的 NTP 源或者根本没配 NTP。解决在站控层配一个统一的 NTP 服务器所有设备指向它。监测装置本身也要对 NTP。配置完后用ntpq -p或chronyc sources检查同步状态。火电厂里如果站控层没有 NTP 服务器可以在监测装置上开一个 NTP 服务让其他设备指向它。5. 进阶技巧用白名单和关联规则把误报压下去网络安全监测装置上线初期告警量往往很大大部分是误报。火电厂里最常见的误报来源是正常的运维操作被当成异常登录、正常的文件更新被当成篡改、正常的 104 总召被当成异常指令。压误报的核心思路是白名单加关联规则。白名单分三层。第一层是主机白名单把操作员站、工程师站、历史站的正常进程、端口、登录用户列进去。第二层是网络白名单把正常的 SNMP 采集源、104 通信源和目的列进去。第三层是行为白名单比如每天凌晨 2 点的备份操作、每周一的补丁更新这些时间段内的文件变更不告警。关联规则是把多个低级别告警合成一个高级别告警。比如同一主机在 5 分钟内出现异常登录加 USB 接入加关键文件变更单独看都是重要告警关联起来就是紧急告警。配置关联规则时要注意时间窗口火电厂里一般设 5 到 10 分钟太短会漏关联太长会误关联。下面是一个关联规则的配置示例具体语法以装置厂商为准{ rule_name: 主机入侵关联, window_seconds: 300, conditions: [ {event_type: abnormal_login, threshold: 1}, {event_type: usb_insert, threshold: 1}, {event_type: file_change, threshold: 1, path: /etc/passwd} ], action: raise_alarm, alarm_level: critical, description: 同一主机5分钟内出现异常登录、USB接入和关键文件变更 }逻辑说明window_seconds是关联时间窗口300 秒是 5 分钟。conditions里三个事件类型必须同时满足才触发。action是触发动作raise_alarm表示提升告警级别。alarm_level设为 critical对应紧急告警。参数怎么改如果误报还是多把window_seconds缩短到 180 秒或者把threshold提高到 2。如果漏报多把窗口拉长到 600 秒。火电厂里建议先跑一周观察数据再调参数。验证关联规则是否生效可以手动模拟在一台测试主机上先异常登录再插 USB再改/etc/passwd看装置有没有生成紧急告警。如果没有检查规则有没有启用、事件类型对不对、时间窗口内事件有没有被其他规则过滤掉。我自己的习惯是新装置上线第一个月每天看一次告警列表把误报挑出来加白名单把漏报挑出来加规则。一个月后告警量能降八成以上。这个活没有捷径就是磨。希望帮到你。本文还有配套的精品资源点击获取
返回列表