华为交换机核心display命令详解:从设备健康到故障排查全指南 1. 开局一张嘴排查全靠“show”网络工程师的日常如果你刚接触华为交换机或者从其他厂商的设备转过来面对命令行界面CLI那一堆命令是不是有点无从下手别慌这几乎是每个网络工程师的必经之路。华为交换机的命令体系尤其是信息查看类命令设计得其实相当规整和强大。它们就像是设备的“体检报告”和“监控仪表盘”是日常运维、故障排查、性能分析乃至割接变更前风险评估的基石。我干了十几年网络从早期的思科到现在的华为华三一个深刻的体会是命令记得再熟不如理解其背后的逻辑和查看的意图。今天我就抛开那些枯燥的命令手册以一个老网工的角度跟你聊聊华为交换机上那些最常用、最核心的“show”命令华为体系里更多是display但意思一样。我们不止看命令怎么敲更要搞清楚为什么要在这个时候看这个信息以及怎么看懂它输出的海量内容。掌握了这些你就能从“只会敲命令”进阶到“懂得看门道”。2. 设备身份与健康状态一切排查的起点当你登录一台交换机无论是通过Console线现场操作还是远程Telnet/SSH第一件事绝对不是急着去配什么业务。你得先搞清楚“我在哪”和“它是否健康”。这是所有后续操作的前提忽略这一步很可能在错误的方向上越走越远。2.1 确认设备“身份证”display device这个命令是你的第一眼。输入display device你会看到一个类似设备机框的视图。对于盒式交换机比如常用的S5700 S6700系列它通常只显示一个单板信息。但对于框式交换机如CE12800系列它会列出所有槽位和板卡。关键看什么槽位状态Slot每个槽位是“Present”在位还是“Absent”不在位这能帮你快速发现是否有板卡没插好或物理故障。板卡类型Board Type确认设备型号是否与你预期的相符特别是处理板、接口板。状态Status最常见的状态是“Normal”。如果看到“Abnormal”异常、“Offline”离线或者“PowerOff”断电那就意味着硬件出了问题需要立即关注。注册状态Register通常是“Registered”。如果未注册板卡可能无法正常工作。一个实操心得在大型机房设备标签可能模糊或错误。display device输出的设备型号和软件版本是确认设备身份最可靠的方式。我习惯在每次登录新设备时先执行这个命令并截图存档作为本次操作环境的基准记录。2.2 检查核心“生命体征”display health设备硬件没问题那它的“身体”是否健康呢display health命令就是设备的全面体检报告。它会集中显示关键硬件的温度、电压、功率和风扇状态。输出信息深度解读温度Temperature会列出CPU、板卡、光模块等关键部位的温度。旁边会有阈值Threshold和当前状态。状态分为“Normal”、“Warning”、“Minor”、“Major”、“Critical”。一旦出现“Warning”及以上就需要分析是环境散热问题还是设备负载过高或是传感器故障。特别注意光模块温度过高是光链路闪断的常见原因之一。电压Voltage检查各路电压是否在正常范围内。电压异常通常指向电源模块故障或背板问题比较严重。风扇Fan显示每个风扇模块的转速和状态。如果某个风扇显示“Absent”或转速异常会影响散热长期可能导致设备过热保护关机。功率Power显示电源模块的输入/输出功率、额定功率和余量。在做板卡扩容前必须检查功率余量是否足够否则可能导致新板卡无法上电或系统不稳定。注意display health的信息非常关键但有些型号的交换机可能需要特定的License或版本支持才能看到全部详情。如果命令报错或信息简略可以尝试display environment或display power、display fan等更细化的命令。2.3 查看系统“简历”与运行时间display version与display clockdisplay version可能是你用得最多的命令之一。它汇总了设备的软件版本、硬件型号、启动时间、补丁信息等。为什么这个命令如此重要故障排查很多软件BUG是版本特定的。当你遇到一个诡异的问题首先应该查版本然后去官网搜索该版本的“版本说明书”或“已知问题列表”很可能直接找到答案和解决方案。功能确认某些高级功能如VXLAN、EVPN、NetStream需要特定版本或License支持。display version可以帮你快速确认。运行稳定性display version输出的最后几行通常包含“System uptime is”这就是设备的连续运行时间。一台运行了几年的设备如果突然出现奇怪问题可能需要考虑是否因内存碎片、软件老化等原因建议在业务低峰期重启一次。display clock看起来简单但时间同步是网络可管理性的基础。日志时间错乱、证书验证失败、与服务器对接异常都可能源于时间不同步。务必确保设备时钟准确并配置NTP网络时间协议同步。3. 接口与链路数据转发的高速公路网络的核心是连通性而连通性的物理体现就是接口和链路。这部分命令使用频率最高也最需要仔细查看。3.1 接口状态总览display interface brief这是最高效的接口状态速查表。命令输出一个表格包含接口名、物理状态PHY、协议状态Protocol、入方向错误、出方向错误、描述等信息。如何快速诊断物理状态PHY为 Down这通常是物理层问题。检查网线/光纤是否插好、对端设备是否上电、本端或对端接口是否被shutdown。如果是光口检查光模块型号是否匹配、光纤是否插反、光衰是否在正常范围可通过display transceiver interface查看。协议状态Protocol为 Down物理层通了但数据链路层没通。对于以太网口这通常意味着自协商失败速率、双工模式不匹配或者有环路导致STP生成树协议将接口阻塞。需要检查两端的配置是否一致。错误计数Input errors/Output errors持续增长这是黄金指标如果错误包CRC、Giants、Runts等数量在不断快速增加说明链路上存在物理问题如网线质量差、接口或光模块硬件故障、电磁干扰等。一个健康的链路错误计数应该是极低且稳定的。一个关键技巧使用display interface brief | include up可以快速过滤出所有状态为Up的接口在设备接口很多时非常有用。反之include down可以快速定位故障接口。3.2 接口深度探针display interface [interface-type interface-number]当你通过brief命令发现某个接口有异常比如错误计数高、流量异常就需要用这个命令进行“深度体检”。它会显示该接口极其详细的信息。需要重点关注的数据域Last 300 seconds input/output rate过去5分钟的平均输入/输出速率。这是判断接口流量负载最直接的依据。对比接口的带宽可以知道是否接近拥塞。Input/Output bandwidth utilization输入/输出带宽利用率。百分比显示更直观。各种错误包计数明细比brief视图更详细会列出CRC、Jabbers、Giants等具体类型的错误。CRC错误通常指向物理链路问题Giants巨帧可能和MTU设置有关。广播/组播/未知单播包计数如果广播包数量异常高可能网络中存在环路或病毒。最后链路状态变化时间Last link flapping显示接口最后一次Up/Down变化的时间。如果这个时间频繁变化即接口在“震荡”是严重的网络不稳定信号必须查明原因可能是物理链路不稳定、STP计算、错误配置导致。3.3 光模块信息侦探display transceiver interface光口的问题一半以上和光模块相关。这个命令可以查看光模块的厂商、型号、序列号、波长、以及最重要的——发送光功率Tx Power和接收光功率Rx Power。如何判断光功率是否正常命令输出中会有“Current”值即当前实测光功率。同时会给出该型号光模块的“Alarm”阈值报警阈值和“Warn”阈值警告阈值。正常情况当前光功率应在“Alarm High”和“Alarm Low”之间且远离“Warn”阈值。常见问题Rx Power 过低接近或低于 Alarm Low接收光太弱。原因可能是光纤过长、弯曲半径过小、连接器脏污、光纤类型不匹配单模/多模混用或对端发送光功率本身不足。Rx Power 过高接近或高于 Alarm High接收光太强可能烧坏接收器。原因可能是光纤距离太短未加衰减器或使用了放大器。Tx Power 异常本端光模块发送部分可能故障。提示清洁光纤连接器是解决光口问题最简单有效的方法之一。在进行任何复杂配置排查前如果光功率异常先用专业的光纤清洁笔或清洁纸清洁两端光纤接头。4. 网络层与路由指挥数据包去向的大脑接口是公路路由就是交通指挥系统。数据包从哪个路口进该从哪个路口出全靠路由表来决定。4.1 路由表总览display ip routing-table这是网络层排查的“总地图”。它显示了设备已知的所有IP路由路径。看懂路由表条目一条典型的路由条目包含目标网络/掩码Destination/Mask、协议Proto、优先级Pre、开销Cost、下一跳NextHop、出接口Interface。协议Proto这条路由是谁告诉交换机的Direct直连路由。接口配了IP地址且物理Up自动产生。最可靠。Static静态路由。管理员手动配置。OSPF、IS-IS、BGP等动态路由协议学习到的。RIP较少见但仍有使用。优先级Pre当去往同一个目标网络有多条不同来源的路由时优先级数值越小越优。直连路由优先级为0静态路由通常为60OSPF内部路由为10BGP为255。设备会选择优先级最优的路由放入“活跃路由表”。下一跳NextHop和出接口Interface数据包实际被转发到的下一个设备地址和本地出口。排查路由问题的思路目标网络是否存在display ip routing-table x.x.x.xx.x.x.x是目标IP可以快速查询去往某个具体IP的路由。路由是否最优检查是否存在多条路径当前活跃的是否是你期望的那一条。下一跳是否可达用ping命令测试下一跳IP地址。如果下一跳不可达即使路由表里有这条路由数据包也发不出去。出接口状态是否Up路由指向的出口接口必须物理和协议状态都是Up的。4.2 路由协议邻居关系display ospf peer/display bgp peer对于运行OSPF、BGP等动态路由协议的设备邻居关系是路由学习的基础。邻居建立不起来或者状态不稳定路由自然学不到或时断时续。display ospf peer brief查看OSPF邻居的简要状态重点关注“State”字段。Full状态才是正常的邻接状态。如果停留在“Init”、“2-Way”、“ExStart”等状态说明邻居间Hello包、MTU、区域ID、认证等参数配置有误。display bgp peer查看BGP邻居状态重点关注“State”字段。Established状态才是正常的BGP会话状态。如果状态是“Active”、“Connect”、“Idle”等说明TCP 179端口连接未能成功建立需要检查IP可达性、ACL过滤、AS号配置等。一个常见坑点OSPF邻居在广播型网络中需要选举DR/BDR。如果网络拓扑变更但DR/BDR未重新选举可能导致部分邻居无法达到Full状态。此时可以尝试在接口下执行ospf dr-priority 0让该接口不参与选举或者重启OSPF进程来强制重新选举。4.3 地址解析与网关display arp与display ip interface briefdisplay arp查看ARP表这是IP地址到MAC地址的映射表。如果ping不通同一个网段内的设备但接口是Up的很可能是ARP学习出了问题。检查ARP表里是否有目标IP对应的MAC条目。没有的话可能是对方设备禁用了ARP响应或者存在ARP欺骗攻击。display ip interface brief专门查看三层接口VLANIF接口、Loopback接口、物理三层口的IP地址配置和状态。快速确认哪个接口承载着哪个网段以及接口协议状态Protocol Status是否为Up。三层接口协议Down通常是因为其对应的物理接口或VLAN不存在/未Up。5. 交换与安全数据转发的规则与安检交换机除了路由更基础的功能是二层交换。同时安全策略是保障网络稳定的防线。5.1 MAC地址表display mac-address这是交换机的“学习笔记”记录了哪个MAC地址从哪个接口学习到的。对于排查二层环路、终端位置定位、非法接入等问题至关重要。关键应用场景定位终端已知一个用户的IP地址可以先ARP找到其MAC地址然后用display mac-address | include xxxx-xxxx-xxxx查找这个MAC地址出现在哪个接口下从而定位用户连接的物理端口。检测环路如果同一个MAC地址在短时间内频繁地在多个不同接口上出现MAC地址漂移这强烈暗示网络中存在二层环路。可以使用display mac-address flapping命令专门查看MAC地址漂移记录。检查MAC地址学习数量display mac-address summary可以查看每个接口学习的MAC地址数量。如果一个接入端口学习到了成百上千个MAC地址那很可能其下联了一个未做端口隔离的小交换机或者该端口被错误地配置成了Trunk/Hybrid类型且允许了大量VLAN通过。5.2 VLAN信息display vlan查看设备上所有VLAN的创建情况以及每个VLAN包含了哪些接口。确认业务VLAN是否已正确创建用户接入端口是否划分到了正确的VLAN中。display vlan [vlan-id]可以查看特定VLAN的详细信息。5.3 端口安全与绑定display port-security如果配置了端口安全如限制学习MAC数量、MAC地址绑定这个命令可以查看端口的违规计数、绑定的MAC地址列表等。当用户无法上网时如果其接口配置了端口安全首先应该检查这里是否有违规记录。5.4 ACL策略命中计数display acl [acl-number]访问控制列表ACL是常用的流量控制和安全工具。配置了ACL但感觉没生效别急着改配置先看看计数器。display acl命令会显示每条ACL规则匹配命中的数据包数量。排查步骤查看你配置的ACL编号的命中计数。如果计数为0说明没有流量匹配这条规则。可能的原因有流量根本就没经过应用了该ACL的接口ACL规则的条件源IP、目的IP、端口号写错了与实际流量不符ACL的应用方向inbound/outbound搞反了。如果计数在增加说明ACL正在生效。你可以通过reset acl counter [acl-number]清空计数器然后重现问题流量再次查看就能明确知道是哪条规则命中了。6. 系统日志与诊断信息设备的“黑匣子”当问题已经发生或者设备行为异常时日志和诊断信息是还原现场、定位根因的最重要依据。6.1 实时日志display logbuffer与terminal monitordisplay logbuffer查看设备日志缓冲区中保存的历史日志信息。但更常用的是在排查问题时开启terminal monitor和terminal trapping命令将系统的实时日志信息打印到当前终端屏幕上。这样当你进行某个操作比如插拔一条线、重启一个服务时就能立刻看到系统产生了什么日志对于定位一些瞬间发生的故障非常有效。如何高效看日志系统日志通常包含时间戳、模块名、级别、信息内容。级别从高到低有emergency、alert、critical、error、warning、notice、informational、debugging。重点关注error和warning级别的信息。模块名指出是哪个功能模块报的错比如IFNET接口网络、ARP、OSPF、DEV设备等。信息内容这是关键可能直接告诉你“链路协议Down”、“检测到CRC错误”、“邻居状态改变”、“电源故障”等。6.2 诊断信息收集display diagnostic-information这是一个“万能”收集命令。当你需要向华为技术支持求助或者自己想对设备进行一次全面的状态快照时就使用这个命令。它会自动执行几十个常用的display命令包括我们上面提到的几乎所有命令并将结果保存到一个文本文件中。使用技巧display diagnostic-information系统会提示你将信息保存到哪个文件通常是flash:/diag_xxx.txt。收集完成后你可以用FTP/TFTP工具将这个文件下载到本地里面包含了收集时刻设备的完整状态信息是事后分析的宝贵资料。强烈建议在每次进行重大变更如升级软件、修改核心配置之前先执行一次display diagnostic-information并保存作为变更前的基准状态。6.3 进程状态与资源display cpu-usage与display memory-usage网络设备也是计算机CPU和内存是其核心资源。如果设备出现响应缓慢、命令执行卡顿、协议收敛慢等问题一定要检查资源使用率。display cpu-usage查看CPU利用率的历史记录5秒、1分钟、5分钟平均值和实时值。如果长期超过70%-80%就需要警惕。display cpu-usage task可以查看具体哪个任务进程占用了最多的CPU。display memory-usage查看内存利用率。交换机的内存主要用于存储路由表、MAC表、ACL表项、协议状态和报文缓冲。如果内存利用率持续高于90%可能会导致新业务无法创建、设备性能下降甚至重启。一个经验在业务高峰期和低峰期分别收集display cpu-usage和display memory-usage的信息了解设备的资源使用基线这样当异常发生时你才能一眼看出“不正常”在哪里。掌握这些命令并理解其输出背后的含义你就拥有了独立运维华为交换机的基本能力。记住命令是工具解决问题的思路才是核心。每次排查时带着“从全局到局部从状态到原因”的思路灵活组合使用这些命令你就能像老中医一样对网络设备的“健康状况”了然于胸。