
2024年7月我们在唐山一家钢厂做轧机监测项目的第一个月加速度传感器坏了三个。不是数据质量问题是物理意义上的坏——普通IEPE传感器标称耐温125°C而轧机轴承座附近的环境温度夏天实测62°C加上设备本体传导的热传感器内部电子件直接老化失效。设备科长倒是见怪不怪你们之前装的我说是。哦那正常上一家也是一个月就坏了。那一刻我明白了在钢铁厂做预测性维护第一个要解决的不是算法问题是让传感器活下来的问题。这篇就把我这两年在钢厂攒下的环境生存经验捋一捋。高温选型、隔热、安装方式一个都不能省先说选型。轧机、加热炉周边直接上高温型压电传感器耐温250°C起步的陶瓷剪切型别心疼那点差价——普通传感器三四百高温型的两千多但坏一次的代价是停机爬架子换传感器人工加误工远超差价。安装方式也有讲究。磁吸安装座方便但高温下磁力衰减40多度就开始打滑。我们吃过亏传感器滑落之后贴在设备防护罩上采回来的振动数据其实是罩子的嗡嗡声还据此误报过一次故障。后来轧机上全部改螺纹安装高温安装脂再垫一片不锈钢隔热垫把传导热隔掉一截。风冷是常规操作。给传感器加个压缩空气吹扫的护罩一举两得降温顺带吹走粉尘。就是得多花一路气源仪表风从哪接、谁出改造费进场之前就得跟厂里谈清楚这种事到了现场再谈就晚了。粉尘IP67只是入场券假故障才是大坑钢铁厂的粉尘量级和一般制造业完全不是一个概念烧结、高炉区域防护不够的设备两周就能糊一层。IP67是底线但我们踩过的更深一个坑是粉尘不直接弄坏传感器它制造假故障。有个配料皮带的电机温度监测突然持续走高眼看要触发报警。运维爬上去一看——散热风罩被粉尘糊死了电机本身没坏是散热失效。你可能会说这报警也不算错啊再不管电机迟早烧。对但监测系统区分不了电机自身故障和环境导致的散热恶化这两种情况的处置措施完全不同工单派错了人人家白跑一趟几次之后一线就不信系统了。所以后来我们的报警逻辑里加了环境关联规则电机温度告警先联动看同区域其他设备的温度趋势——一片都涨先怀疑环境因素散热、季节、负荷单点独涨才指向设备自身问题。就这么一条规则把电机温度类的无效工单砍掉了六成。传感器本体每季度人工巡检一次拿压缩空气吹扫膜片和线缆接头。这个制度看着原始比任何高端算法都保命。强电磁钢厂里信号干净是一种奢侈钢厂是强电磁环境的重灾区大功率变频器、中频炉、直流母线几百伏到几千伏的开关动作此起彼伏。我们第一版采集链路用的普通屏蔽双绞线单端采集信号里全是开关毛刺频谱底噪比干净环境高20个dB特征峰直接泡在噪声里。后来改了三件事屏蔽双绞线双端等电位接地——注意是接在同一个接地排上如果两点接地存在电位差反而引入环流这是另一个坑采集改成差分输入关键长距离传输直接上光纤光电隔离之后什么电磁干扰都过不来。无线方案在这里基本歇菜。我们试过用LoRa传高炉平台的测点数据丢包率高达15%车间钢结构对2.4GHz和470MHz的衰减比想象中狠得多。最后的架构是有线工业以太网边缘计算盒子就地预处理RMS、峭度、包络谱峰值这些特征值上传原始波形本地存储按需调取。这就是现在常说的云边协同只不过在钢厂它是不得不的选择不是赶时髦。传感器自己也要做预测性维护最后这条是我认为最值钱的经验监测传感器本身也会失效、漂移、被干扰得给它们也装一套健康监测。我们写了个很朴素的数据质量巡检脚本每天凌晨跑一遍import numpy as np import pandas as pd def check_sensor_health(df: pd.DataFrame, col: str, fs: float) - list: 传感器数据质量巡检返回问题列表 df: 当日数据(时间索引); col: 测点列名; fs: 采样率 issues [] s df[col].dropna() # 1. 卡值检测连续1小时标准差近零传感器大概率坏了或线缆脱落 win int(fs * 3600) roll_std s.rolling(win).std() if (roll_std 1e-4).sum() len(s) * 0.3: issues.append(f{col}: 疑似卡值(输出长时间无变化)) # 2. 灵敏度漂移本月与上月的日RMS中位数对比漂移超20%告警 # 注意剔除停机时段只用相似工况的数据做对比 # 3. 丢包检测按采样间隔构建完整索引缺失率超5%说明链路有问题 full_idx pd.date_range(df.index.min(), df.index.max(), freqf{1/fs}s) loss_rate 1 - len(s) / len(full_idx) if loss_rate 0.05: issues.append(f{col}: 丢包率{loss_rate:.1%}) return issues踩坑提醒卡值检测的窗口要卡在设备运行时段。钢厂有检修班检修时整条产线停机那时段的数据全是平线会把正常数据误判成传感器卡值。我们从产线PLC拿运行状态位做了过滤才解决。做环境监控永远要问一句这段数据是设备睡了还是传感器死了这套监控上线后抓到过一起典型的灵敏度衰减——某个测点半年内RMS中位数悄悄掉了22%是压电元件老化。要不是脚本天天盯着等它彻底失效那个位置就成了监测盲区而且是悄无声息的那种。最后说两句回头看钢铁厂这两年教会我的事是预测性维护的可靠性上限不是模型准确率决定的是数据可用性决定的。而数据可用性是传感器选型、安装工艺、布线接地、日常巡检这些不性感的工程细节撑起来的。算法工程师纸上谈兵谈不出一个能活过夏天的传感器。去现场摸一摸滚烫的轴承座你就什么都懂了。