尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

vSAN 5V0-22.23认证备考:从磁盘组到存储策略的排障实战

vSAN 5V0-22.23认证备考:从磁盘组到存储策略的排障实战 简介这份PDF资料围绕VMware vSAN 8.0认证考试5V0-22.23整理面向备考VCTA/VCP vSAN方向的技术人员也可作为虚拟化运维人员检验知识点的自测题库。内容涵盖磁盘组与OSA/ESA存储池配置、同步延迟性能查看、RAID-5/FTT存储策略调整、vLCM离线升级、全闪存集群部署、高可用与断电恢复等11道典型选择题每道均附答案与关键解析能帮助读者快速定位薄弱环节系统巩固vSAN存储策略、集群运维与故障处理思路。资源为单个PDF文档约296KB体积小巧便于下载后随时翻阅已有72人学习下载适合正在备考VMware vSAN认证或希望梳理vSAN 8.0新特性的虚拟化工程师与架构师。1. vSAN-5V0-22.2319道题、105分钟考的却是脑子里的vSAN排障地图如果你已经在 vSphere 上做过几年运维大概率经历过这种时刻集群里新加了主机vSAN 容量告警却怎么都消不掉或者一台 ESXi 重启后虚拟机起不来存储策略明明白白写着“不满足”。vSAN-5V0-22.23 这张 VMware vSAN Specialist 2022 认证考的就是这类场景。它不问你“vSAN 是什么”而是一上来给一个拓扑让你判断某个磁盘组坏了FTT1 的策略还能不能保住这台虚拟机。19 道题、105 分钟题量不大通过率却一直不高。原因很朴素背题库过不了它考的是你脑子里有没有一张 vSAN 的架构地图和排错思路。适合谁去考正在做 vSphere/vSAN 交付的工程师、准备转超融合架构的运维以及想逼自己把存储策略补扎实的人。2. 从考点倒推 vSAN 架构磁盘组、存储策略与故障域这三座大山5V0-22.23 的考纲不公布原始题库但所有备考资料都会指向同一组核心概念磁盘组怎么构成、存储策略怎么计算、故障域怎么划。把这三件事吃透考试里的判断推理题基本都能稳住。2.1 磁盘组与缓存/容量模型全闪 vSAN 的读写路径vSAN 里最底层的物理单位不是单块盘而是磁盘组。一个磁盘组由一块缓存盘加一到七块容量盘组成。全闪架构下缓存盘和容量盘都是 SSD缓存盘负责写缓冲和读缓存容量盘才是数据最终的家。磁盘组本身也是故障边界组里任何一块盘挂了整个组可能不可用受影响的对象组件就得靠副本或纠删码在其他主机上重建。读写路径要记清楚。写 I/O 先落到缓存盘vSAN 把它合并成较大的顺序写再回落到容量盘读 I/O 如果命中缓存盘就直接返回否则从容量盘读。这个模型解释了考试里一类经典题缓存盘故障意味着什么不是数据丢而是写缓冲没了出现“延迟升高、重建开始”但只要策略满足虚拟机不会立刻宕。反过来说容量盘故障才真正触发组件重建重建时间取决于剩余主机带宽和对象组件数。嵌套实验环境里最容易忽略的是“SSD 标记”。vSAN 判断一块盘是不是缓存盘不看你前端贴的标签而是看存储层是否把设备标记成 SSD。用 Workstation 跑嵌套 ESXi 时普通虚拟磁盘默认不是 SSD必须在 .vmx 文件里给对应盘加 virtualSSD 标记否则磁盘组根本建不起来。这个细节在实机上也一样很多品牌 RAID 控制器没透传 SMART 信息SSD 被识别成 HDDvSAN 就直接罢工。2.2 存储策略与 SPBMFTT、条带化、RAID-5/6 与压缩去重vSAN 的策略机制叫 SPBM基于存储策略的管理虚拟机建在哪、怎么冗余全由策略决定而不是像传统阵列那样按 LUN 分。每条策略里最核心的几项FTT、条带化、纠删码、压缩去重外加可选的故障域和容量预留。FTT允许的故障数和策略形态的对应关系是考纲高频点。FTT0 是单副本性能好但没冗余FTT1 有两种形态镜像RAID-1需要至少 3 台主机纠删码 RAID-5 需要至少 4 台FTT2 同理镜像需要 5 台RAID-6 需要 6 台。考试经常反过来考现有 4 台主机要容忍一台主机宕机不丢数据能不能选 RAID-5能。能不能选 RAID-1 的 FTT1能但空间损耗更大。能不能选 RAID-6不行主机数不够。条带化是另一个容易被低估的参数。默认每个对象只占一个条带条带数调高后组件会被拆到更多块盘上单个对象性能上限更高代价是网络广播和重建开销变大。全闪集群里一般不建议超过 2机械盘场景条带化收益明显但重建风险也成倍增加。压缩去重默认不开启开启后全闪集群通常能省 30% 到 50% 空间但会吃掉一部分 CPU而且去重只对容量层生效缓存层不做去重。考试里常见问法是“某个工作负载适合开压缩还是开条带化”判断依据就是看瓶颈在 IOPS 还是在 CPU。2.3 延伸集群与故障域多站点场景怎么不踩坑故障域Fault Domain解决的是“机架感知”问题。默认策略只保证跨主机冗余但如果整个机架断电所有副本可能都在同一个机架上。把每台主机划进不同的故障域之后vSAN 放置组件时会强制把副本和见证分散到不同故障域代价是占用更多故障域数量。考试题里常给一个 3 机架拓扑问策略能否满足这时候不光数主机还要数故障域。延伸集群Stretched Cluster是故障域的更大尺度版本两个数据中心各放一批主机再在一个第三方站点放见证主机。站点间往返延迟一般要求 RTT 在 5ms 以内网络抖动超过这个值健康检查就会报警。延伸集群下的 FTT1 实际是跨站点的双副本加见证本地站点故障时另一个站点仍持有完整副本。5V0-22.23 对延伸集群考得不深但“见证坏了能不能继续写”“主站点隔离后业务是否继续”这类场景判断值得考前过一遍。3. 用嵌套 vSAN 复现考试场景搭建一套不花钱的 5V0-22.23 练手环境只看资料容易产生“全会”的错觉真正把错题做明白还是要有一个能反复拆坏的 vSAN 环境。单台物理机加 VMware Workstation 就能跑三台嵌套 ESXi再起一个 vCenter 虚拟机整套实验环境占物理内存约 24GB。下面按步骤说清楚怎么搭以及每步命令在做什么。3.1 嵌套环境规划与网络准备VMkernel 与 vSAN 流量标记先规划网络。三台嵌套 ESXi 至少需要两个网络管理网络和 vSAN 网络。生产环境建议 vSAN 单独用一张万兆网卡实验环境用同一虚拟交换机隔离网段就行。嵌套 ESXi 的虚拟网卡用 e1000e 或 VMXNET3 都行但每台主机要额外加一张用于 vSAN 的虚拟网卡。每台 ESXi 启动后第一件事是给 vSAN 网卡配置 VMkernel 并勾选“vSAN”服务。这个步骤在考试里对应的知识点是vSAN 流量需要独立的 VMkernel 接口且必须显式启用 vSAN 服务否则主机哪怕已经加进 vSAN 集群也不会参与存储。命令行操作如下# 在嵌套ESXi的SSH会话中执行先查看现有vmk网卡 esxcli network ip interface list # 新建vmk1并绑定到vSAN专用端口组假设端口组名为vSAN-PG esxcli network vswitch standard portgroup add -v vSwitch0 -p vSAN-PG esxcli network ip interface add -i vmk1 -p vSAN-PG -I 192.168.30.11 -N 255.255.255.0 # 关键一步把vmk1标记为vsan服务 esxcli vsan network set -i vmk1逻辑说明第一步esxcli network ip interface list只是看现状避免网卡名冲突第二步建端口组并给 vmk1 配 IP第三步的esxcli vsan network set -i vmk1是把 vSAN 流量绑定到 vmk1不执行这一步主机就算后来加入了集群vSAN 网络也是断的。参数-i后面跟的是 vmk 编号不是 IP容易写错。3.2 创建 vSAN 集群并声明磁盘组esxcli 与 PowerCLI 两条路网络就位后在 vCenter 里新建数据中心和集群勾选“vSAN”并选择“标准OSA”模式。vSAN 8 的 ESA 模式在嵌套环境里要求比较高实验建议用传统的 OSA。三台主机加进集群后vSAN 会开始尝试收集磁盘但此时没有磁盘组健康检查一定会报错。接下来给每台主机创建磁盘组先看磁盘状态# 在ESXi SSH中执行确认缓存盘与容量盘都被识别为SSD esxcli storage core device list | grep -E Device|Is SSD|Size # 创建磁盘组-s指定缓存盘-d指定一块或多块容量盘 esxcli vsan storage add -s t10.NAAAAA000000000000000001 -d t10.NABBBB000000000000000001 -d t10.NABBBB000000000000000002逻辑说明vsan storage add会自动把符合条件的未分区磁盘纳入 vSAN。-s后的缓存盘必须是 SSD 标记的设备容量盘可以用-d重复传多次一次挂多块。创建完成后立刻验证esxcli vsan storage list能看到磁盘组状态。如果之前磁盘被 VMFS 或分区表占用add 会直接报错不会帮你清理这是安全设计别硬来数据比实验重要。PowerCLI 是另一条路适合想写脚本批量部署的人。连接 vCenter 后用下面这段创建集群并声明磁盘组# 连接vCenter注意密码里的特殊字符用单引号包住 Connect-VIServer -Server vc.lab.local -User administratorvsphere.local -Password Lab!2024 # 创建启用vSAN的集群VsanMode用Normal对应OSA New-Cluster -Name LAB-VSAN -Location Datacenter -VsanEnabled -VsanMode Normal # 批量添加三台ESXi主机 192.168.30.11,192.168.30.12,192.168.30.13 | ForEach-Object { Add-VMHost -Location LAB-VSAN -VMHost $_ -User root -Password Lab!2024 }逻辑说明New-Cluster的-VsanEnabled会在建集群的同时打开 vSAN 开关省去事后手工勾选-VsanMode参数在较新版本 PowerCLI 里有旧版本写-Vsan或建完再设置。Add-VMHost按列表循环加主机vCenter 会自动要求每台主机安装 vSAN VIB。PowerCLI 版本不同参数名偶尔有差异执行前先Get-Command *Vsan*看下本机可用的 cmdlet别直接抄老教程。创建磁盘组在 PowerCLI 里稍微讲究些因为要先拿到磁盘对象# 拿到每台主机的缓存盘和容量盘对象这里以10GB盘为缓存、50GB盘为容量示例 $vmhost Get-VMHost -Name 192.168.30.11 $cache Get-ScsiLun -VmHost $vmhost | Where-Object { $_.CapacityGB -le 10 -and $_.ExtensionData.DeviceClass -eq disk } $cap Get-ScsiLun -VmHost $vmhost | Where-Object { $_.CapacityGB -ge 50 -and $_.ExtensionData.DeviceClass -eq disk } # 创建磁盘组缓存盘只允许一块 New-VsanDiskGroup -VmHost $vmhost -CacheDisk $cache -Disk $cap逻辑说明Get-ScsiLun默认会把所有 LUN 都捞出来包括光驱和 USB 设备所以加了DeviceClass -eq disk过滤。New-VsanDiskGroup的-CacheDisk参数只接受单个 SSD 设备对象-Disk接受数组。如果本机缓存盘和容量盘容量相近建议按名字前缀过滤别按容量猜否则容易把系统盘卷进去——嵌套环境这一步做错顶多重来生产环境做错就是灾难。3.3 创建存储策略并验证组件放置关键命令三台主机的磁盘组就绪后vSAN 集群应该显示正常。现在的重头戏是按考点创建不同策略并在策略里观察组件怎么分布。vSphere Client 的“策略和配置文件”里可以新建 vSAN 策略勾选“站点容灾”之外的各项能力。创建策略本身不难难的是验证它是否真的按预期工作。# 查看集群是否已就绪、主机是否都处于“运行正常” esxcli vsan cluster get # 查看某个虚拟机对象的组件分布vm-101是虚拟机ID esxcli vsan cluster debug object list -i vm-101逻辑说明esxcli vsan cluster get输出里重点看Cluster Config State是不是EnabledCluster Health是不是OK。debug object list能看到对象对应的主机、盘组、策略 UUID这是做“策略是否被满足”类判断题的实机对照。组件列出来之后对照主机数数FTT1 镜像策略应该看到两个副本组件加一个见证RAID-5 应该看到四个数据组件加一个校验组件数量对不上策略就一定有问题。4. vSAN 实操与备考避坑主机在集群里却没有启用 vSAN 服务这类翻车这一章是血泪经验。考 5V0-22.23 的人多数已经在生产上碰过 vSAN但考试和实验环境里的坑比生产还刁钻。以下五条是我在实际搭建和备考中反复见到的高频问题每条都按现象、原因、解决三步写照着排查能省半天时间。4.1 现象主机位于 vSAN 集群中但尚未启用 vSAN 服务这是备考群和实验环境里出现频率最高的一句话。主机明明已经被加进 vSAN 集群vCenter 也显示集群启用了 vSAN但某台主机的“vSAN”状态是未启用磁盘组也建不了健康检查一片红。原因通常有两个。一是该主机根本没有创建 vSAN 的 VMkernel或者建了 VMkernel 但没勾选 vSAN 服务vSAN 流量无法承载。二是主机的 vSAN 集群成员状态没同步常见于主机从集群移除后重新加入残留配置导致 vSAN 服务起不来。解决方法是先补 VMkernel 并重新指定 vSAN 网络然后强制重新加入集群# 在问题主机的SSH执行先看vsan网络是否已绑定 esxcli vsan network list # 如果结果为空说明vmk没绑定vsan服务执行下面这行 esxcli vsan network set -i vmk1 # 查看集群配置状态处于Config In Progress时等待即可 esxcli vsan cluster get如果esxcli vsan cluster get显示“Cluster config not valid”或“Not configured”就需要先离开再重新加入# 退出vSAN集群 esxcli vsan cluster leave # 重新加入autodostart1表示自动开始创建对象 esxcli vsan cluster join -u vSAN UUID参数-u后面的集群 UUID 可以从正常主机的esxcli vsan cluster get里复制。这步操作会临时影响该主机上的 vSAN 对象生产环境要挑维护窗口做。4.2 现象磁盘组反复置备失败提示磁盘被占用或不是 SSD新装的环境里最容易踩的坑esxcli vsan storage add报错说磁盘不属于 vSAN 兼容设备或者干脆说“DISK_IS_SSD: false”。嵌套环境里通常是虚拟磁盘没开 SSD 标记实机环境里通常是 RAID 控制器没有把 SSD 信息透传。解决嵌套环境的办法是在 .vmx 里给磁盘加一行虚拟 SSD 标记我一般加到虚拟 SCSI 控制器对应的那行下面# 编辑 ESXi 虚拟机的 .vmx 文件把缓存盘标记为SSD scsi0:1.virtualSSD TRUE sata0:0.virtualSSD TRUE实机环境只能从控制器层面想办法确认磁盘直通Passthrough或 RAID 卡直通模式下能读取 SSD 健康信息如果控制器不支持vSAN 那侧无论如何都不会认。这块没有太多捷径属于“黑匣子”只能按硬件兼容列表选型。等到esxcli vsan storage list里能看到Is SSD: true这一步才算真正过关。4.3 现象存储策略显示“无法满足”虚拟机无法创建或迁移策略建了虚拟机也选中了新策略但部署向导走到存储这一步灰色提示“此虚拟机的存储策略无法满足”。很多人以为是 vSAN 没配好其实原因多半在主机的数量和策略的冗余要求不匹配。比如 3 台主机选择 FTT1 RAID-1 镜像策略vSAN 需要三个故障域各放一个组件3 台主机是够的但如果选了 RAID-5要求至少 4 个数据组件分布在 4 台不同主机上3 台主机自然满足不了。解决的办法是回到策略里把 FTT 或容错方法调低或者再往集群加主机。验证方法用前面提到的对象列表命令数组件数量就知道还差几台。这类题考试里出现频率极高考前一定要把“主机数、故障域数、FTT”三者的关系自己推一遍别只背结论。4.4 现象健康检查全红但 vCenter 没有告警vSAN 健康检查页面出现大段红色但 vCenter 告警模块干干净净主机也没有明显的黄色感叹号。这类“静默故障”在考试场景里对应的就是网络抖动和延迟问题。vSAN 对延迟很敏感尤其是延伸集群RTT 稍微超过 5ms 就会导致见证连接失败但 vCenter 的普通告警规则并不一定会触发。这时候不要关掉健康检查页面直接开虚拟机先在命令行里定位# 在有问题的ESXi上执行 esxcli vsan health cluster list # 查看vSAN网络配置确认是否启用了多播/单播及MTU esxcli vsan network listhealth cluster list会输出每个检查项的状态重点看VSAN NETWORK HEALTH和CLUSTER PARTITION。如果网络健康检查不过多半是 MTU 不一致vSAN 要求 VMkernel 的 MTU 为 9000而默认是 1500跨交换机没开巨帧时健康检查会报“MTU mismatched”。把 vSAN 专用网络的所有端口和物理交换机都改成 MTU 9000再跑一次检查。4.5 现象嵌套环境 DRS 迁移后虚拟机变的不可访问嵌套 vSAN 实验里开 DRS 的集群有时会在 vSAN 未完全同步时触发虚拟机迁移迁移完成后虚拟机变成“不可访问”或“孤立”。原因在于嵌套环境的虚拟磁盘 IO 性能和网络带宽远低于实机组件同步时间被拉长迁移过程中对象短暂处于降级状态某些操作抢跑就会失败。解决的办法是把实验集群的 DRS 设置为手动模式迁移虚拟机前先跑一遍健康检查确认对象都已同步完成。等实验跑熟后再开全自动 DRS体验生产环境下的真实表现。这个坑不是考试的考点但容易在备考时消耗大量时间提前设置好省心很多。5. 考前一天和出分之后把成绩单黑匣子变成验证工具考试前一天不要再看新知识点把时间花在两件事上一是把 vSphere Client 里 vSAN 相关的界面重新点一遍看磁盘组、策略、健康检查、性能服务几个入口都在哪里这能提升考场里对题干的熟悉度二是把最容易被问的“最小主机数”和“对象组件数”列表默写一遍RAID-1 FTT1 对应 3 台、RAID-5 对应 4 台、RAID-6 对应 6 台镜像 FTT2 对应 5 台。考试系统里 19 道题全部是单选题105 分钟的时长对大多数人是充裕的。我的习惯是第一遍快速答完标记有疑问的题第二遍回来对着题干里的“主机数量、当前策略、故障主机位置”三个要素逐项核对改答案的次数一般不超过两三次。答题界面里有个 Mark 功能不确定的题标出来别在一道题上耗太久。考完当场会出一份非正式成绩单上面按领域分项显示是否达标。这里有个很多老考生在用的“黑匣子”技巧浏览器打开 HTML 版成绩单后右键查看源代码搜索“percent”或“score”相关关键字能看到每个考试领域的精确百分比。这些信息比证书本身更能反映短板——比如“Stretched Cluster”领域得分低回来后就把延伸集群的文档和实验重新过一遍下次升级 VCDX 或换项目时心里有底。实操环境里验证也同样重要。我的习惯是改完任何策略后先跑一遍esxcli vsan health cluster list再迁一台测试虚机确认对象布局符合预期最后才动生产负载。这套流程帮我躲过好几次全闪集群的容量规划失误。5V0-22.23 这张证书本身不值多少钱值钱的是备考过程中被迫建立起来的 vSAN 架构直觉磁盘组坏了要不要慌、加一台主机能解锁哪种策略、跨站点延迟到什么程度该报警。把这些变成肌肉记忆之后再去考一次会发现题目考的就是你每天在做的事。希望帮到你。本文还有配套的精品资源点击获取
返回列表