尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

超融合HCI网络与存储避坑:四网平面、aSAN、HA与P2V要点解析

超融合HCI网络与存储避坑:四网平面、aSAN、HA与P2V要点解析 简介这份资料是面向华为HCI认证备考者与超融合技术学习者的考试题库内容紧扣超融合平台核心概念覆盖分布式虚拟防火墙、aSAN存储、四网复用、虚拟机配置最佳实践、虚拟路由器、NFS存储及计算虚拟化等高频考点同时也包含FIO压测命令、FC存储挂载、虚拟存储数据平衡、虚拟机迁移空间计算等实操场景题。文档以单选题配参考答案的形式呈现既能帮助检验理论掌握程度又能针对易混淆概念快速查漏补缺适合考前冲刺或日常学习自测。包体为单份docx文档大小约49KB轻巧便携可直接导入笔记软件或打印使用。目前已有510人学习浏览题目涉及HCI 6.2.0新增特性及常见排错思路对备考华为HCI认证或想系统理解超融合技术的人员有较强参考价值。通过刷练这些题目读者可以熟悉考试出题风格梳理aSAN分层、数据平衡、克隆迁移等易错点为通过认证或项目实践奠定基础。1. 刷完这套 HCI 单选题我先把“网络”和“存储”的坑分清楚做超融合交付这些年我见过太多同行在 HCI 项目上栽跟头业务虚拟机跨主机访问不通查了半天发现是 VXLAN 和业务网的流量路径没理清存储性能测试数据难看结果问题出在副本策略和分层命中率上。这套 HCI 考试题库看着是 107 道单选题实际上把深信服超融合最容易被误解的点全翻出来了——网络平面职责、aSAN 分层条带、HA 触发边界、P2V 迁移空间计算全都是项目现场会被客户追问、也最容易答错的内容。这份资源适合三类人一是刚接触超融合、需要系统建立概念框架的新手刷完能避开“只知道建虚拟机”的盲区二是正在备考 HCI 相关认证的工程师题目覆盖面和答案精度足够当模拟卷用三是在做深信服超融合方案选型或交付评估的从业者可以用题目里的“错误选项”反推出平台的边界和限制。我读完最直观的感受是这题库不是让你背答案的是让你记住哪些配置组合不能碰哪些“常识”在超融合里其实是错的。2. 网络平面管理、业务、存储、VXLAN 四条网线的职责边界选择题八成考点在这2.1 先记住四个平面的职责再谈四网复用超融合平台最容易被新手搞混的就是网络平面。题目里反复出现的四网在 HCI 6.2.0 里指管理网、业务网、数据通信网VXLAN和存储网。这四个平面各管一段不能想当然地复用或省略。网络平面主要职责典型带宽要求备注管理网平台管理、主机间控制通信、Web 控制台访问千兆起步HA 决策依赖此网断了反而不会触发 HA业务网虚拟机对外提供业务服务的流量按业务规模规划可复用 VXLAN 口但要注意高性能模式VXLAN 数据通信网集群内不同主机间虚拟机互访的 Overlay 流量万兆推荐跨主机同网段互访默认走 VXLAN存储私网虚拟存储的副本写入、数据重建、IO 传输万兆必须不能与管理网、VXLAN、业务网复用这里有个关键点存储私网是独立平面。题目里专门考了一条——存储私网不能与管理网、VXLAN、业务网复用。我在项目里见过有人为了省交换机端口把存储私网跟业务网塞进同一个 VLAN结果存储重建时业务直接卡死。判断依据很简单存储 IO 对时延极其敏感混用后任何突发流量都会冲击存储性能而且存储私网的链路故障检测逻辑跟业务网完全不一样。还有一个反直觉的认知VXLAN 口才是集群内虚拟机之间数据通信的口不是业务口。物理出口断了同主机内的虚拟机互访可能没感觉但跨主机的互访会立刻出问题。所以规划网络时先画一张四网拓扑图标清楚每个物理网口归属哪个平面再动手配置。2.2 物理出口与端口组Access 和 Trunk 都能配一个网口只能属于一个物理出口物理出口是虚拟网络和物理网络的桥接点对内连接虚拟机或虚拟路由器对外对接主机物理网卡。这里有两个高频考点。第一个是端口组类型。很多人以为端口组只能配 Trunk实际不是——端口组可以配置为 Trunk 或 Access 两种类型。Access 用于单一 VLAN 透传Trunk 用于多 VLAN 场景。我平时做配置时如果物理出口下只有一个业务网段直接配 Access 更省事要承载多个 VLAN 才用 Trunk而且需要提前规划业务网络避免后续扩容时改端口组引发中断。第二个坑是网口与物理出口的关联关系。一台主机的同一个物理网口不能同时关联给多个物理出口。这个限制在规划多出口场景时特别容易翻车——比如你想把一台主机的万兆口既分给“业务出口 A”又分给“备份出口 B”平台不允许。正确做法是每个物理出口绑定独立的物理网口或者用链路聚合把多个网口绑成一个逻辑口再接出口。还有个日常被忽略的点数据通信口可以与物理出口复用VXLAN 口也可以与物理出口复用但前提是交换机的对应端口要开启巨帧。如果不开启网口高性能模式实际项目中可能导致两种严重后果接在物理出口下的虚拟机无法正常访问集群外的网络运行在不同主机上、接在同一个虚拟交换机下的同网段虚拟机无法互访。我曾经排查过一个案例虚拟机 ping 网关通、ping 对端虚拟机不通最后发现就是网口高性能模式没开交换机 MTU 还是默认的 1500VXLAN 报文被分片丢弃。开启高性能模式后交换机端口必须同步开启巨帧如果交换机硬件不支持巨帧至少把 MTU 调整到 1600 或以上否则 VXLAN 封装后的数据包会被静默丢弃。2.3 虚拟路由器与分布式交换机流量路径决定排错方向虚拟网络拓扑里虚拟交换机 aSwitch、虚拟路由器 aRouter、分布式虚拟防火墙 aFw 是三个核心组件。注意这里没有“虚拟 IPS 设备”——网络安全设备走的是 NFV 导入模板的路线不是拓扑里直接拖出来的。先说虚拟路由器。它支持两种关键能力一是分布式运行二是 HA。当某个主机节点的路由器故障后会在其他节点重新拉起避免网络无法恢复。但真正容易理解错的是流量路径——同一主机内不同网段的虚拟机互访很多人以为流量直接走虚拟路由器的三层转发就完事了实际流量会经过虚拟路由器再回到分布式虚拟交换机最终到达目标虚拟机。这个“绕一圈”的特性决定了排错思路不同网段不通时先看虚拟路由器是否健康再看两端的虚拟交换机端口配置。还有一个经常被误解的题虚拟机 A 和虚拟机 B 运行在不同主机时是不是必须通过虚拟路由器通信不是。同网段互访走 VXLAN 就行只有跨网段才需要经过虚拟路由器。这个边界搞清楚后网络排查能少走很多弯路。物理出口的对接关系也值得注意。物理出口对内可以连接虚拟路由器、虚拟网络设备或虚拟机对外连接到主机物理网络。但端口组的配置要提前规划特别是 Trunk 类型一旦涉及多 VLAN 透传交换机侧和平台侧的 VLAN 列表必须一致否则就会出现“平台上看配置都对实际流量不通”的诡异现象。3. 存储 aSAN分层、条带、副本三个机制不搞懂性能测试做了也白做3.1 分层不是“越大越好”条带化也不是“越高越好”aSAN 是深信服自研的分布式存储系统核心机制有三个分层Tier、条带化Striping、副本Replica。这三个机制直接决定存储性能和容量利用率也是题库里计算密集的考点。分层机制的描述有个常见错误——分层空间大小不是占用 SSD 整个磁盘的 90%。aSAN 会把 SSD 的一部分空间用作分层缓存但具体比例需要根据磁盘容量和业务模型确定。分层的核心思想是虚拟机的写操作直接快速写入分层立即向上层返回写入成功减少写 IO 延迟读操作优先从分层命中避免从 HDD 容量层读取。分层淘汰算法方面题库里有个陷阱选项说用的是 LRULeast Recently Used但 aSAN 实际根据数据被访问的次数和最近被访问的时间来区分冷热对扫描性读操作不会误判为热数据。这一点在性能调优时特别重要——如果你发现某块盘的缓存命中率持续偏低不要急着加 SSD先看业务模型是不是大量顺序扫描。条带化技术相对直白把一块连续数据切分成多个小块并发存储到不同物理硬盘上提高并发读写能力。注意条带化不是越高越好——它提高的是并发能力不解决单点延迟问题。未经条带化处理的数据每次只能写入一块磁盘性能差距明显。项目里做存储规划时我会根据磁盘数量和数据盘组大小决定条带宽度避免过小的条带造成碎片。副本机制是数据安全的基础。多副本配合仲裁机制保障数据一致性当检测到坏道时自动从另一副本读取数据修复。这里有个关键行为定时坏道扫描会自动修复坏道上的数据修复时从另一副本拷贝数据来修复硬盘坏道——注意不是“直接修复坏道”而是通过副本重建数据。3.2 FIO 测试命令别用错常见用法里根本没有“全部读”存储性能测试是交付验收的必经环节但 FIO 的用法很多人一开始就用错了。题库里明确指出来FIO 的常见简单用法不包括“全部读”。全部读是“All Read”混合场景不是基础测试项基础测试应该是顺序读、顺序写、随机读、随机写四个维度分别测。我一般用 FIO 测超融合虚拟存储时命令是这样写的# 顺序读测试iodepth32块大小 128K持续 60 秒 fio --nameseqread --filename/dev/vdb --rwread --bs128k --iodepth32 \ --ioenginelibaio --direct1 --size4G --numjobs4 --runtime60 \ --group_reporting --time_based # 随机写测试iodepth16块大小 4K持续 60 秒 fio --namerandwrite --filename/dev/vdb --rwrandwrite --bs4k --iodepth16 \ --ioenginelibaio --direct1 --size4G --numjobs4 --runtime60 \ --group_reporting --time_based参数含义说明--rw指定读写模式read 是顺序读、randwrite 是随机写题目里考的“全部读”对应的是rwread之外的混合模式不要混为一谈--bs是块大小大块测吞吐小块测 IOPS--iodepth是每个作业的并发 IO 深度常规存储在 16 到 32 之间不要盲目拉高--direct1绕过操作系统页缓存真实压测存储后端。测试环境本身也有硬件门槛。题库里明确说了几个边界每台主机数据盘个数不低于 6 个、缓存盘个数不低于 2 个、存储网络必须要万兆。至于“至少需要 4 台主机”这个说法是错的——3 台主机起步的超融合集群也具备做性能测试的条件但测试结果和最终交付配置强相关。我建议测试环境尽量按交付配置一比一搭建否则性能数据没有参考意义。IO 深度这个参数特别要重视。IOmeter 配置里需要手动配置# of Outstanding I/Os商业存储的性能测试数据默认深度是 32。FIO 里对应就是--iodepth32。很多人用默认深度 1 去测测出来的 IOPS 惨不忍睹那不代表存储真实水平。3.3 数据平衡与扩容磁盘扩容不触发主机扩容必触发扩容触发数据平衡的规则跟直觉相反。磁盘扩容不一定会触发数据平衡主机扩容一定会触发。原因很简单新磁盘加入存储池后数据是否重新分布取决于集群的平衡策略而新主机加入后为了把其他主机的 IO 压力分散到新主机上数据平衡必然启动。数据平衡会对当前业务的 IO 产生影响所以平台建议配置在空闲时间段进行。实际操作中我会在业务低峰期手动触发数据平衡并观察平衡期间的存储时延曲线。如果时延抖动明显说明平衡任务的 IO 优先级过高应该调整限速参数。存储私网的高可用设计也有专门术语。每台主机单链路接入存储交换机是无链路聚合场景每台主机双链路接入单台存储交换机是单交换机链路聚合每台主机双链路接入两台做了堆叠的存储交换机是双交换机链路聚合。注意“两台主机的两条存储链路对接”不属于双交换机链路聚合那只是点对点直连。做双交换机链路聚合时两台交换机要配置 MLAG这样任意一台交换机故障存储通信都不中断。4. 虚拟机可靠性HA 触发边界、备份快照分工、P2V 迁移空间项目翻车高发区4.1 HA 没那么“智能”管理网断了反而不触发存储网断了必触发超融合平台的高可用HA是保障业务连续性的核心机制但它的触发条件比想象中苛刻。题里反复考的一个反直觉结论是虚拟机所在主机只有管理网络中断时不会触发 HA。原因是管理网是控制面HA 的决策和执行都依赖管理网通信管理网都断了主控无法感知主机状态更无法下发迁移指令。对比之下以下几种情况会触发 HA物理出口中断业务网断存储网络中断管理网和物理出口同时中断。判断逻辑是——HA 关注的是“业务是否还能持续运行”。业务出口断了虚拟机对外服务中断平台能感知并触发切换存储网断了虚拟机的磁盘 IO 无法保障即使本地有副本也必须 HA。这里有一个很容易记反的点存储网中断、管理网不中断时即使该主机本地有虚拟机的副本虚拟机也会 HA。很多人以为“本地有副本就能扛住”但副本的可用性需要存储网络参与仲裁存储网断了副本也变成不可信状态必须迁移到其他主机。我在实际配置 HA 时会注意两点一是把故障检测敏感度参数调好太敏感会导致网络抖动时频繁 HA太迟钝则业务中断时间过长二是虚拟机的运行位置要设置为“自动选择”否则 DRS动态资源调度和 HA 都没有生效前提。DRS 根据集群负载动态调整虚拟机运行位置采用在线主机迁移方式迁移过程不中断业务——但前提是你没手动固定虚拟机的主机归属。4.2 快照不是防勒索的后悔药CDP 才能找回单个文件备份、快照、CDP 三者分工不同很多项目里混为一谈等真出事才后悔。快照是虚拟机的历史时间点状态虚拟机文件损坏或系统无法开机时可以还原到正常状态。但快照不能替代备份——快照文件跟虚拟机在同一存储上存储坏了快照也没了而备份可以把数据放到独立存储或 NFS 里。勒索病毒场景下快照的作用取决于快照时间点。如果快照在病毒感染之前创建回滚可以恢复但如果病毒加密过程持续进行快照时间点之后的数据可能已经被加密恢复后不一定干净。CDP持续数据保护则不同它记录连续的 IO 变化日志支持恢复到任意时间点。题目里专门考了一条CDP 支持 NTFS 和 FAT32 文件系统的单个文件找回Linux 系统反而不支持而且 2 节点的集群不支持 CDP 备份至少需要 3 节点。一致性快照是另一个容易混淆的概念。多个虚拟机加入同一个一致性组后打快照可以确保所有虚拟机恢复到同一时刻。这里有个硬限制单个一致性组内的虚拟机数量总和不允许超过 64 个虚拟机加入一致性组之前打的快照不允许回滚。做数据库集群比如 Oracle RAC的一致性快照时特别要注意业务对数据一致性的要求否则恢复出来的数据库可能处于不一致状态。4.3 克隆的三种方式和 P2V 迁移的空间账克隆方式分三种链接克隆、全量克隆、快速全量克隆。链接克隆可以秒级启动因为它引用同一个源数据不复制完整磁盘全量克隆是完整复制不能秒级启动快速全量克隆借助存储快照能力也能秒级启动。无论哪种克隆虚拟机克隆出来后 MAC 地址都会变化IP 地址如果依赖 DHCP 则可能重新分配如果配了静态 IP 则跟原虚拟机一致——这正是克隆后最容易翻车的点克隆多台虚拟机没改 IP直接导致全网 IP 冲突。P2V 迁移是物理机转虚拟机的过程空间计算有陷阱。如果源服务器是 Linux 且通过 LVM 管理磁盘即使实际只用了 60G迁移到超融合平台也需要预留 100G 空间——因为 LVM 的磁盘管理方式是按卷分配迁移工具必须按磁盘总大小而非已用空间做镜像。Windows 服务器的简单卷则不同迁移所需空间按实际使用量计算。我给出的建议是迁移前先确认源端磁盘分区类型再规划目标存储容量否则容易在中途因为空间不足失败。P2V 迁移后虚拟机无法正常开机是高频故障。通用排查方法是取消 fastio 磁盘——迁移工具默认给虚拟磁盘启用的 fastio 加速在某些系统上会导致启动失败。注意改 CPU 核数、改网卡类型、改磁盘大小都不是通用解法它们只适用于特定场景。VMware 纳管迁移的端口和磁盘类型限制也要提前确认vCenter 需要放通 443 端口ESXi 需要放通 902 端口VMware 虚拟机的磁盘如果是 RDM 类型不支持被纳管迁移独立模式的磁盘也有兼容性问题。迁移前先检查磁盘模式比迁移中报错再回头处理省事得多。5. 避坑107 道题反复出现的六类项目现场问题5.1 存储私网调整不是“无损操作”现象项目交付时发现存储私网 IP 规划不合理想在界面上直接改结果虚拟机 IO 中断数据库会话断开。原因存储私网负责虚拟存储的副本写入和数据重建调整配置会影响存储通信。题里说“可以在线调整存储私网配置无需将虚拟机和虚拟网络设备关机”是错误说法实际上调整存储私网会影响所有依赖存储的主机。解决调整前先迁移走该存储网络下的所有虚拟机或者安排在业务停机窗口操作。修改后逐个主机确认存储私网连通性再恢复业务。5.2 交换机没开巨帧跨主机虚拟机互访不通现象物理出口高性能模式已开启但运行在不同主机上的同网段虚拟机无法互访ping 不通接在物理出口下的虚拟机访问集群外网络也超时。原因VXLAN 封装后数据包变大交换机端口 MTU 默认 1500大包被丢弃或分片导致通信异常。解决在交换机对应端口开启巨帧MTU 9000。交换机硬件不支持巨帧时把 MTU 调整到 1600 或以上至少能容纳 VXLAN 封装开销。注意管理网络、VXLAN 网络所接入的交换机要开启 IGMP Snooping否则组播流量泛滥。5.3 克隆虚拟机 MAC 地址变化业务授权失效现象用克隆快速批量发放虚拟机后部分业务系统无法启动提示授权失效或网络冲突。原因克隆出来的虚拟机 MAC 地址与原虚拟机不一致部分软件授权绑定 MAC同时克隆出的多台虚拟机 IP 地址如果还保持原来配置直接造成 IP 冲突。解决克隆前把原虚拟机关机或断开网卡克隆后立即登录修改 IP 和主机名涉及授权绑定的系统提前在业务层面完成 MAC 变更登记。5.4 把快照当防勒索手段恢复后数据仍然不干净现象虚拟机中勒索病毒管理员用快照回滚系统恢复了但数据还是被加密的状态。原因快照只能恢复到创建快照的时间点如果快照是在病毒感染后创建的或者病毒加密行为已经持续了一段时间快照里包含的数据仍是加密后的文件。解决重要业务系统同时启用 CDP 持续数据保护并定期做独立备份到 NFS 或外部存储。恢复时先检查恢复到的时间点是否在加密行为之前。5.5 NFS 存储的挂载范围搞错只有主控能访问现象给超融合集群添加 NFS 存储后部分主机无法识别 NFS 上的虚拟机。原因NFS 存储连接时只挂到了主控主机其他主机没有同步挂载。题目里明确说给超融合集群添加 NFS 存储时不能只连接到主控需要确保所有需要访问该存储的主机都能挂载。解决添加 NFS 存储后逐台主机确认挂载状态如果主机侧无法访问检查 NFS 共享导出权限和网络连通性。NFS 存储通常用于存放备份或模板不建议直接在上面运行核心生产虚拟机。5.6 Legacy 启动方式选错系统盘超 2TB 无法识别现象第三方服务器安装 HCI 后系统盘超过 2TB 但只能识别到 2TB 不到的空间。原因启动方式选错了 Legacy BIOSLegacy 模式不支持单分区超过 2TB。题目里说系统盘超过 2TB 才用 Legacy 是错的正好相反——超过 2TB 必须用 UEFI 启动方式。解决BIOS 里切换启动方式为 UEFI确认磁盘分区表为 GPT再安装或恢复 HCI 系统。6. 把题库当配置核对清单用我的快速自检方法刷完这套 HCI 题库后我没有停在“记住答案”这一层而是把错误选项反推成“禁止操作”清单每次做超融合交付前都会过一遍。具体方法是把所有考网络平面的题目汇总把每道题的错误选项提炼成一条检查项——比如“物理出口端口组不要只配 Trunk”“数据通信口可以与物理出口复用但交换机的巨帧必须开”“存储私网不能复用”。然后把这些检查项按计算虚拟化、存储、网络、可靠性四个维度整理成一张表格交付前去平台上一项项核对。我平时还会拿题目里的场景做模拟排查练习。比如题里说“不同主机上的虚拟机互访只能通过 VXLAN”这是错的——实际还可以通过业务网、也可以通过业务网和 VXLAN 并行。根据这个就可以推导出排查思路跨主机互访不通时先检查两端虚拟机的网络接入方式和流量路径不要一头扎进 VXLAN 的配置里。把题库当成故障字典用比死记硬背答案有价值得多。最后分享一个我的个人习惯每次在超融合平台上做任何涉及网络的变更之前我都会强制自己先画一遍四网拓扑图确认每一个物理网口归属哪个平面存储私网有没有被误用VXLAN 的 MTU 设置是否和交换机对齐。画完图再操作变更后马上做一遍连通性验证。这套流程看起来耗时但能省掉大量半夜排障的时间。希望帮到你——尤其是正在备考 HCI 或者准备做超融合交付的朋友刷题别只追求正确率把每个错误选项背后的真实场景吃透项目里才能少踩坑。本文还有配套的精品资源点击获取
返回列表