尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

华为S2600T维护手册:巡检、热插拔换盘、LUN映射与多路径

华为S2600T维护手册:巡检、热插拔换盘、LUN映射与多路径 简介这份PDF是面向华为OceanStor T系列S2600T存储设备运维人员的维护手册适合初次接触该型号的存储管理员、视频监控项目集成人员及互联网行业IT运维人员用于解决设备发现、业务配置与日常维护中的实操问题。包内共1个PDF文件大小约545KB便于随身保存与快速查阅。手册围绕ISM集成存储管理软件展开先介绍其图形化界面、全网故障监控与配置向导等能力再以视频监控项目为例完整讲解登录ISM、发现设备、创建RAID组如RAID6、设置热备盘、划分LUN、创建主机组与主机、添加iSCSI启动器、映射LUN给主机等基础业务配置流程并说明告警管理与用户名密码保密等安全注意事项。已有516人学习下载读者可据此掌握从设备初始化到资源分配的完整操作套路提升存储运维效率。1. 华为S2600T维护手册翻开第一页先确认你手上这台存储处于什么状态华为S2600T 是双控制器入门级阵列盘位多、单盘容量大一块盘掉线影响的可能是后面几十个业务卷。它跟服务器最大的区别在于绝大多数维护动作必须在线完成。换盘、换电源、换风扇是热插拔控制器和固件是主备轮流做什么时候能动、动之前要确认哪几个状态位手册里都写了但真出告警的时候没人有时间翻 PDF。所以维护手册真正高频被翻的部分只有四块巡检看哪些状态、盘和部件怎么换、LUN 到主机的映射参数怎么配、日志和告警怎么收口。下面按这四块展开适合刚接手 S2600T 的运维、机房现场值班的人也适合想把巡检和换盘动作标准化下来的老手。2. 华为S2600T日常巡检用DeviceManager和CLI把健康状态抓全2.1 巡检之前先把管理通道和只读账号准备好S2600T 有两个控制器每个控制器各自带管理网口现场通常只给其中一个配 IP另一个留给切换后接管。上巡检之前先确认三件事管理口地址和网关贴在设备标签上或者记在 CMDB 里、DeviceManager 能正常打开的浏览器环境、以及一个只读权限的账号。老版本的管理软件对浏览器内核和 Java 版本比较挑用最新的浏览器经常打不开登录页现场终端上固定装一个能用的老版本浏览器比每次临时折腾兼容性省事得多。CLI 走 SSH 或者串口都可以。SSH 需要先确认管理口的服务是开着的串口一般是 115200-8-N-1用 USB 转串口线接控制器上的 Console 口波特率不对会看到满屏乱码这时候先换波特率别急着怀疑设备坏了。真正需要在现场动手的排障场景串口是最后一条不依赖网络的通道值得单独准备一套线材。提示日常巡检用只读账号不要用超级管理员账号避免手滑敲错命令把 LUN 或者映射关系改掉。巡检频率上核心业务每周做一次完整巡检告警平台每天推一次状态摘要就够了。如果这台 S2600T 和华为交换机运维共用同一套监控体系把 SNMP trap 打开之后日常只需要看收敛后的告警结果人工巡检可以降到每月一次把时间留给容量规划和性能基线对比。2.2 DeviceManager 首页必须先看的四个面板登录进去第一屏通常有个绿色的整体状态但只看那个对勾就走等于没巡检。真正要看的是四个地方告警与事件、硬件状态、容量与 RAID 组、性能。告警里重点看有没有反复出现的同一条比如同一块盘的介质错误反复上报这种盘通常已经到了更换临界点硬件状态里双控要都在线、主备关系清楚容量与 RAID 组要看每个 RAID 组是否 Optimal、热备盘有没有被占用性能看趋势比看瞬时值有用得多。巡检项正常表现异常信号优先级控制器双控在线主备明确单控离线、频繁切换高磁盘全部在线无预失效预失效、介质错误重复上报中高RAID 组Optimal热备可用Degraded、重建中二次掉盘高BBU / 超级电容健康无老化告警老化、充电失败中电源与风扇双路正常单路掉电、转速异常中容量水位低于 80%超过 85% 且增长快中高时延与基线持平翻倍且持续超过 15 分钟高注意容量水位最容易被忽略。等它涨到 95% 再走扩容采购流程通常已经来不及了。2.3 一次把控制器、磁盘、LUN、告警捞出来的CLI巡检命令图形界面适合确认状态批量留痕还是得靠命令行。下面这组命令覆盖了前面说的四个面板输出重定向到文件按天归档一周之后就能看出哪些指标在漂移。# 登录管理 CLISSH 或串口进入命令行后逐条执行 # 命令字在不同软件版本上可能略有差异敲之前先用 help 确认可用性 show system # 系统整体状态、运行时间、序列号 show controller # 双控状态、主备关系、缓存、写策略 show enclosure # 机框、电源、风扇、温度传感器 show disk # 全部磁盘槽位、型号、容量、健康、所属 RAID 组 show raid # RAID 组状态、成员盘、热备盘、重建进度 show lun # LUN 容量、归属控制器、映射的主机组 show host # 主机与主机组、发起方 IQN / WWPN show alarm # 当前未清除的告警 show event --level error # 错误级事件便于回溯这套命令的分工是这样的show system和show controller回答「设备还能不能正常接管业务」show disk、show raid、show enclosure回答「硬件有没有悄悄退化」show lun、show host回答「映射关系有没有被人动过」最后两条给上面所有结论做佐证。巡检不是把命令全敲一遍就完事而是要清楚每条输出里哪一列才是判断依据。参数上--level error这类过滤开关各版本不一定都支持没有的话就把事件全量导出后自己过滤show disk在很多版本里支持附加槽位号只看单块盘定位可疑盘时非常省事。有跳板机的话把这段包成一个脚本每天跑和前一天的结果做 diff变了的那一行就是最值得看的信号。2.4 巡检结果分三档别把黄灯拖成红灯绿档是状态正常、指标在基线内记录即可黄档包括单盘预失效、单路电源掉电、BBU 老化、容量超过 80%、时延比基线高出五成以内这类问题本周内处理红档包括 RAID 组降级且没有可用热备、双控只剩一控、容量超过 90%、时延翻倍持续、控制器反复切换这类当天处理。把这三档和工单系统绑起来巡检才算闭环否则巡检报告永远只是一份没人看的 Excel。黄档的处理节奏是最关键的绝大多数存储事故都不是突然发生的而是黄档拖了三个月。3. 华为S2600T硬盘与部件更换热插拔的前提和重建进度的读法3.1 换盘之前先定位槽位再确认 RAID 组硬盘是 S2600T 上换得最多的部件也是最容易换错的地方。动手之前必须先做两件事在 DeviceManager 里对目标盘执行定位让面板上的定位灯闪烁人到机柜前按灯找盘而不是靠数槽位同时确认这块盘属于哪个 RAID 组、这个组里其他成员盘现在的状态。S2600T 的盘位在面板上有丝印编号管理界面里的槽位视图和物理编号是一一对应的但不同机型的排布方向可能不一样所以永远以定位灯为准。找到盘之后再看一眼盘上的状态灯把灯语和界面状态对一遍再拔。灯语含义动作常绿在线正常不动绿闪有 IO 读写不动黄灯常亮预失效或告警计划内更换黄灯闪正在重建或定位先确认是哪种红灯故障、已离线尽快更换注意同一个 RAID 组里绝对不要同时拔两块盘。即使两块都亮红灯也要一块换完、等重建结束、确认状态回到 Optimal 之后再动第二块。3.2 华为S2600T换盘的最小操作序列确认完槽位和 RAID 组之后换盘本身的动作很快慢的是前后的确认。推荐固定成下面这个顺序每一步都有对应的观察点出问题能立刻定位到是哪一步不对。# 1. 定位故障盘确认槽位号、所属 RAID 组、同组其他盘状态 show disk show raid # 2. 如果版本支持把故障盘从 RAID 组中安全离线避免半死盘持续报错刷事件 # 不支持离线操作就直接进入第 3 步多数热插拔场景可以直接拔 mark disk offline CTRL_ID ENCLOSURE_ID SLOT_ID # 3. 物理拔出故障盘插入新盘注意推到位并锁紧扳手 # 4. 确认设备识别到新盘型号容量符合预期 show disk general # 5. 观察重建启动与进度 show raid新盘的要求要提前确认容量不小于原盘、同转速同接口类型、在设备的兼容列表里。用不在列表里的盘有些版本会直接拒绝加入 RAID 组有些会加进去但一直报非认证告警两种都很麻烦。企业环境建议按兼容列表采购别临时拿一块库存盘顶上。如果换的是备件盘而 RAID 组里配了热备盘重建可能在插盘后自动启动这时候界面上的状态会从 Degraded 变成 Rebuilding属于正常现象。要是插进去几分钟都没反应先看show disk里新盘的状态是不是 Online再看 RAID 组有没有识别到这块新成员。3.3 重建进度怎么读重建窗口怎么留重建是整块盘逐条带地重算数据速度受盘容量、RAID 级别、当前业务压力三个因素影响。一块大容量盘在业务高峰期的重建时间可能是空闲时段的好几倍所以换盘时间尽量安排在业务低峰重建期间的性能余量要提前留出来。读进度看show raid输出的重建百分比和预计剩余时间同时盯住同组其他盘的介质错误计数重建期间磁盘负载最高本来就是最容易触发二次故障的时候。有些版本提供重建速率限制参数把重建速度压低换取业务性能是常见取舍代价是重建窗口拉长需要权衡。重建期间有几件事不要做不要再拔同组任何一块盘、不要做固件升级、不要做大规模的 LUN 扩容。这期间任何额外的变更都会让本来可控的降级状态变成数据风险。等状态回到 Optimal 之后再恢复正常的变更节奏。3.4 控制器、电源、风扇这些部件的更换边界非盘部件的更换逻辑和硬盘完全不同主要区别在于对业务是否可见以及换之前要不要处理缓存数据。部件是否热插拔更换前提特别注意硬盘是同组无其他故障盘一次只换一块等重建完成电源模块是另一路供电正常先确认市电与 PDU 是两路独立风扇模块是机框温度可控逐个换别把机箱门敞开太久BBU / 超级电容视版本确认当前缓存写策略降级为写透会明显影响性能控制器否另一控正常、缓存已刷盘换后同步配置与时间硬盘背板否需要停机影响整个机框控制器更换是这里面风险最高的。换之前必须确认另一控工作正常、缓存数据已经落盘否则可能出现缓存数据丢失。换完新控制器之后要检查配置是否同步、时间是否一致、主备关系是否建立这几项任何一项不对都会在下次切换时暴露成故障。4. 华为S2600T的LUN映射与多路径主机侧参数怎么设4.1 存储侧先把 LUN、LUN 组、主机组对齐主机侧认不到盘九成问题出在存储侧的映射链路没对齐。顺序是固定的建 LUN、把同类业务的 LUN 组成 LUN 组、建主机填发起方 IQN 或 WWPN、建主机组、把 LUN 组映射给主机组。中间少一环主机侧就是看不到设备。映射时有两个选择值得提前想清楚。一是归属控制器把同一业务的 LUN 尽量放在同一个控制器上减少跨控转发带来的额外时延。二是容量规划一次映射多大的 LUN跟文件系统类型和后续扩容方式有关Linux 上用 LVM 的话可以按需扩直接裸设备的话预留空间要更保守。主机发起方的 IQN 一定要从操作系统里实际读出来的为准不要手抄或者凭记忆写。IQN 错一个字符映射不会报错只是主机永远发现不了目标排查起来很费时间。4.2 Linux主机侧 iSCSI 登录与多路径配置存储侧映射完成后主机侧的动作分两步登录目标、配置多路径。这两步都有坑尤其是多路径路径分组策略跟阵列前端呈现方式不匹配的时候。# 1. 发现存储侧暴露的目标地址和端口按实际管理网/业务网填 iscsiadm -m discovery -t sendtargets -p 10.10.10.20:3260 # 2. 登录目标IQN 用第 1 步发现出来的实际值不要手写 iscsiadm -m node -T iqn.2006-08.com.huawei:2100xxxxxxxx -p 10.10.10.20:3260 -l # 3. 确认会话和链路状态-P 3 会打印详细的会话参数 iscsiadm -m session -P 3 # 4. 重新加载多路径表并查看路径聚合结果 multipath -r multipath -llmultipath -ll的输出要重点看两件事同一个 LUN 的多条路径是不是聚合到了一个设备名下以及每条路径的状态是不是 active。如果同一个 LUN 在系统里出现了两个独立设备通常说明多路径没生效或者 wwid 没识别检查/etc/multipath.conf的 blacklist 和wwid匹配规则。多路径配置文件的骨架大致是这样具体值按业务容忍度调整# /etc/multipath.conf defaults { user_friendly_names yes path_grouping_policy multibus # 前端按 ALUA 呈现时按实际路径组调整 path_checker tur # 路径检测方式与后端阵列兼容性相关 failback immediate # 原路径恢复后立即切回 no_path_retry 5 # 路径全断后的重试次数按业务容忍度选 }4.3 三个必调参数与取舍存储侧参数能改的不多真正影响主机侧体验的主要在这几个值上。参数位置建议值说明replacement_timeout/etc/iscsi/iscsid.conf15~30链路故障到多路径接管的等待时间越大切换越慢但越不容易误判noop_out_interval/etc/iscsi/iscsid.conf5保活探测间隔双控阵列建议保持默认量级path_grouping_policy/etc/multipath.confmultibus与前端路径组呈现方式相关配错会让聚合失效no_path_retry/etc/multipath.conf5 或 queue路径全断时是排队等待还是直接返回 IO 错误path_checker/etc/multipath.conftur路径健康检测方式部分阵列需要换成 readsector0replacement_timeout是最值得调的一个。调小了链路抖动一下就被判定为故障、触发无谓的路径切换业务会看到一次明显的卡顿调大了真正断链时切换慢IO 会挂住更久。一般从 15 秒起步观察路径切换日志再微调。no_path_retry的选择直接影响业务表现。设成 queue路径全断时 IO 会排队等待而不是立刻报错适合不能容忍 IO 错误的数据库场景设成一个较小的数字IO 快速失败交给上层重试适合能容忍短暂错误的场景。4.4 映射不通时的排查顺序按从下往上的顺序查不要一上来就在主机侧反复重启 iSCSI 服务。第一步存储侧确认 LUN 已经映射到正确的主机组主机组里的 IQN 和主机实际 IQN 完全一致。第二步主机侧执行发现命令看能不能收到目标列表收不到就是网络或者访问控制的问题。第三步能发现但登录失败检查 CHAP 认证配置两边是否一致。第四步登录成功但看不到盘在主机侧执行rescan或者重新扫描 SCSI 总线。第五步看到盘但多路径没聚合回到multipath.conf检查。第五步最容易走弯路因为盘已经出来了业务看起来能用就没人管多路径直到某天一条链路断掉、IO 没有冗余路径可切才发现问题一直在。5. 进阶S2600T日志导出、告警上报与固件升级前的验证5.1 日志和告警一次性收口S2600T 的日志分两类一类是设备本地的运行日志和事件记录用于事后回溯一类是实时告警用于及时响应。本地日志通过管理界面的一键收集功能导出建议在每次变更前后各收集一次变更前后对比能快速定位是不是这次操作引入的问题。实时告警走 SNMP trap 推到监控平台最省事把 trap 目标和团体字配好和华为交换机运维收到的告警放在同一个视图里值班的人只需要看一个面板。trap 里最有价值的是告警 ID 和部件标识用这两个字段做收敛规则可以避免同一条告警反复刷屏。5.2 固件升级前的验证清单固件升级是 S2600T 上风险最高的操作升之前逐项确认下面这张表缺任何一项都建议推迟升级窗口。检查项为什么验证方式双控均在线且主备正常升级要一控一控做show controller无 RAID 组处于降级或重建升级期间没有冗余余量show raidBBU / 超级电容健康缓存保护依赖它show enclosure业务侧多路径正常升级会触发控制器切换multipath -ll配置已备份回退时需要配置导出版本与现有硬件匹配避免升级后部件不识别版本说明与兼容列表升级窗口已确认升级期间性能会下降变更工单升级过程按控制器轮流进行一个升完确认业务恢复、状态正常再动另一个。升级完成后重新确认主备关系、缓存策略、时间同步以及所有 LUN 的映射是否还在。5.3 把巡检做成一个可复用的收敛动作真正省时间的做法是把前面几章的动作收敛成两个东西一个每天定时跑的巡检脚本把 CLI 输出抓下来存成带日期的文件一个每周做一次的 diff 比对只看和上周不一样的行。落到具体操作上脚本里加一句按日期归档再写一行 diff 命令就够了# 每天定时执行输出按日期命名归档 show_all() { for cmd in show system show controller show enclosure \ show disk show raid show lun show alarm; do echo $cmd $cmd done } show_all /var/log/s2600t/inspect_$(date %F).log # 每周比对一次只关心变化的那几行 diff /var/log/s2600t/inspect_$(date -d 7 days ago %F).log \ /var/log/s2600t/inspect_$(date %F).log归档目录记得做轮转半年的日志量不大但放几年不清理会占掉不少空间。这套东西搭起来之后下次再遇到同一类告警先看 diff 里变了的那一行。本文还有配套的精品资源点击获取
返回列表