ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

中科曙光服务器培训:从硬件到运维的避坑实操指南

中科曙光服务器培训:从硬件到运维的避坑实操指南 简介这是一份中科曙光服务器基础培训课件适合新入行的服务器运维、企业IT技术支持及需要系统补强硬件知识的网络工程师。内容先从服务器与PC机、工作站、小型机的区别讲起再按塔式、机架式、刀片式等形态分类并展开讲解CPU指令集架构CISC/RISC/EPIC、单路/双路/多路及部门级/企业级等服务规模分级覆盖面较为完整。同时课件用服务器性能评价标准5高梳理了I/O性能、管理能力、可靠性、可用性、可扩展性等关键指标并结合曙光I620、I840、TC6600等具体机型帮助读者把理论对应到实际产品与选型场景。资源包共1个文件为PPTX演示文稿体积约42.47MB图文结构清晰便于自学或内部培训直接使用。目前已有601人学习下载适合作为服务器入门培训、日常答疑和知识点复习的实用参考资料。1. 中科曙光服务器培训教程v0.3 这份课件解决的是机房里最基础的慌第一次被带进机房的运维新人多半有过这种体验机柜里几十台 2U 设备长得差不多前面板指示灯闪烁的颜色和频率各不相同开机自检时“嘀”一声之后屏幕上滚动的信息根本不知道往哪儿看。中科曙光服务器培训教程汇总服务器基础知识-v0.3.pptx 这个标题里真正值钱的是那个 v0.3——它说明这份课件不是一次定稿的是随着学员反复提问被改出来的。这类培训材料解决的就是从零到一的问题服务器由哪几部分组成、哪些硬件参数能改、装完系统之后怎么接管这台机器。适合刚接触服务器的运维新人、集成商工程师以及要给渠道做内训的技术负责人。把这套基础补上至少下次进机房不会对着服务器发愣。2. 曙光服务器硬件构成从 CPU 到电源先分清哪些参数能改2.1 CPU 选型核心数、主频和内存通道的三角关系服务器培训和 PC 培训最大的区别在于不能只按“性能”去理解 CPU。曙光整机里经常碰到海光或 Intel 两套 x86 平台选型时核心数、主频、内存通道三者要放在一起看而不是单看核心数堆得多高。通常 2 路服务器里每颗 CPU 的内存通道数决定你能插多少根内存条。常见规格是每颗 CPU 提供 8 个内存通道配 16 个 DIMM 插槽。这意味着如果你图便宜只买一颗 CPU就得接受一半内存插槽空着、无法扩容的后果反过来核心数少的 CPU 配超大内存在数据库类负载里也会浪费预算。培训时最该让学员记住的是CPU 型号后面那一串字母和数字里面藏着内存类型DDR4 还是 DDR5、内存通道数、最大支持容量这些决定了后面整机的扩展边界。实操上我一般让学员先做一张简单的表CPU 型号、核心数、主频、内存通道数、最大支持内存、支持 RAID 存储控制器的 PCIe 插槽数量。这张表对着曙光官网的参数页填一遍比背 PPT 有效得多因为填完就会发现不同平台之间内存通道差异很大。2.2 内存不是越大越好通道、频率和插槽顺序服务器内存踩坑率常年排在前三问题几乎都出在同一个地方没按顺序插。很多人拿 PC 的习惯来插服务器内存随意找空槽位插满结果开机后容量显示减半或者干脆黑屏无显示。内存通道的逻辑是每颗 CPU 管理若干个通道每个通道又有自己的插槽顺序。新手最常见的问题是左右两边插槽分布不均匀导致通道内存数量不对称。更隐蔽的是混插不同频率的内存系统会统一降到最低频率跑性能白白牺牲。培训里我会用一张槽位示意图反复强调插槽顺序先看机箱盖内侧的标签确认 CPU0 和 CPU1 各自对应的通道再按通道 A/B/C/D 的顺序插入。判断是否成功的标准很简单进 BIOS 内存信息页确认内存容量、频率、每通道插满数量都符合预期。这也是装机后一分钟内能做的第一项体检。2.3 硬盘与存储介质SATA、SAS、NVMe 用在哪曙光服务器培训里硬盘章节通常篇幅不长但恰恰是最容易混淆的部分。SATA 盘兼容性好、价格便宜适合做冷数据或备份存储SAS 盘支持双端口在热插拔背板场景里更可靠适合做数据库数据盘NVMe SSD 走 PCIe 通道延迟低适合跑虚拟化和缓存层。选型时看三个参数接口类型、盘位尺寸、转速或协议版本。2.5 寸盘位可以装 SAS/SATA SSD3.5 寸盘位一般装大容量机械盘2.5 寸 NVMe 盘位则通常直接走 PCIe 通道。培训里经常有人问能不能把 3.5 寸机械盘和 2.5 寸 SSD 混插在同一个背板里答案是看背板设计有的支持混合有的不支持强行混插会导致背板识别不到。不看背板规格就下单是这类问题最常见的起因。另外值得强调的是硬盘和 RAID 是两码事。RAID 是磁盘阵列层面的事硬盘只是物理介质。这个关系理不清后面做阵列规划和数据恢复时会吃大亏。2.4 电源与散热冗余和功耗是最容易被低估的两件事很多培训课把电源和散热放在最后草草带过但实际机房里宕机原因里电源和散热占比不小。曙光的机架式服务器通常配两个冗余电源模块关键在“冗余”不是“双倍”。单电源模块功率余量要在系统满载功耗上加 20-30%两个模块加起来能覆盖满载即可多出来的空间留给升级。散热方面机架式服务器是前进风后出风前面板堵了、防尘网积灰、机柜冷通道被堵都会导致风扇转速拉满或 CPU 降频。培训时会教一个实用技巧进 BIOS 或 BMC 看风扇转速和进风温度如果风扇长期跑在 80% 以上而环境温度并不高先去检查前面板有没有异物堵塞。电源与散热这类系统设计问题和服务器虚拟化、服务器集群这种上层架构不同它是底层物理规律改不了也绕不过去。3. 固件与远程管理BIOS 和 BMC 是运维的第一道门3.1 BIOS 里需要理解的几个关键项BIOS 是每次装机都要碰的黑匣子。培训里不需要背完每个菜单但要能回答这几个问题引导模式用 UEFI 还是 Legacy启动顺序里有没有包含 U 盘和 PXECPU 的 NUMA、超线程、VT-d 开关在哪电源模式选性能还是能效UEFI 已经是主流新装机基本都用 UEFI GPT 分区。如果还用老的 Legacy 引导装 Windows Server 时要注意硬盘分区表别转成 MBR。NUMA 开关对虚拟化和数据库影响最大很多性能问题不是 CPU 不够用而是 NUMA 开关被关掉导致内存访问跨节点延迟。BIOS 设置里我最常强调的是一条原则改任何一项之前先截图或拍照保存原值尤其是启动模式、内存频率、PCIe 链路速度和 TPM 开关。改完进不来系统时有一条后悔药可吃就是你之前拍下的照片。这个习惯在服务器运维里成本最低、回报最高。3.2 BMC 网口的初始配置与 IPMI 命令行服务器的 BMC基板管理控制器是独立于操作系统的带外管理通道断网、宕机、系统挂了都能用它看屏幕和开关机。培训里必须会做的一件事拿到新服务器后第一时间配置 BMC 网口 IP。3.3 固件版本查看与升级的基本顺序固件升级是最容易翻车的环节但培训里又绕不开因为服务器出厂固件往往不是最新版。隐患点在于BIOS、BMC、RAID 卡控制器三者之间存在兼容性问题升级顺序错了可能升完 RAID 卡固件后 BMC 日志报错。查看固件版本的常规路径开机进 BIOS 看版本号BMC 登录界面看 BMC 固件操作时用查询命令核对 RAID 卡固件版本确认三者版本搭配与厂商发布的兼容性说明一致后再生级。升级顺序一般按先 BMC、再 BIOS、再 RAID 卡控制器的做法来跑。升级时必须注意整个过程不能断电不能远程升级到一半断开连接不能让系统处于高负载状态。最稳妥的做法是接上 UPS 和串口或 IPMI 会话保底哪怕本地终端断电还能从带外看到升级进度。4. 从 RAID 到系统部署把物理磁盘变成可用计算资源4.1 服务器磁盘阵列怎么做RAID 级别对比与选型RAID 是物理硬盘和操作系统之间的逻辑层。规划磁盘阵列时第一件事不是问用什么 RAID 卡而是问业务需要什么级别。常见做法是系统盘用 RAID 1数据盘用 RAID 10 或 RAID 6追求容量用 RAID 5 但要接受重建时间长的风险。按可用容量和最少盘数可以做一张对比表简化选型。RAID 级别最少盘数可用容量冗余能力适用场景RAID 02满容量无临时计算、缓存RAID 12一半容量单盘故障系统盘、日志盘RAID 53(n-1)/n单盘故障文件存储、备份RAID 64(n-2)/n双盘故障数据仓库、归档RAID 104一半容量每组最多坏1块数据库、虚拟化RAID 10 比 RAID 5 在随机读写场景下性能和安全性都好但容量少一半。RAID 6 能扛住双盘同时故障在数据量大的阵列里更安心。选择时还要看 RAID 卡缓存的写策略有电池或电容保护时开 Write Back没保护就老老实实用 Write Through避免掉电丢数据。在服务器虚拟化和服务器集群层面对硬盘的需求前面加存储池以及副本或纠删码机制很多时候可以先不做高配 RAID再靠上层分布式冗余补底。但底层单机硬 RAID 依然是交付时默认要求。4.2 用 RAID 卡创建阵列的操作路径以 MegaRAID 系列卡为例开机自检时按提示进入 RAID 配置界面操作路径一般是创建虚拟磁盘选择需要的 RAID 级别勾选参与阵列的物理盘设置条带大小初始化后保存退出。条带大小默认 256KB 通常适用大多数场景数据库日志盘可以调成 64KB大文件存储调成 1MB改完后性能差异实际感受明显。命令行方式适用于批量交付和脚本化。storcli 工具是常见做法# 查看阵列控制器状态 storcli64 /c0 show # 用4块盘建RAID10条带256KB命名VD0 storcli64 /c0 add vd typeraid10 drives252:0-3 stripe256 nameVD0 # 查看虚拟磁盘初始化进度 storcli64 /c0/v0 show init命令里的 252 是 RAID 卡背板编号0-3 是物理盘槽位具体编号以实际环境为准。storcli 语法比较一致但不同 RAID 卡对应的驱动和工具版本未必通用先加载对应驱动再看控制器能否识别。如果发现 vd 建完但系统里看不到盘先检查 RAID 卡驱动是否匹配再检查是否忘了初始化。物理操作层面热插拔盘位前确认槽位对应关系拔错了盘在重建期间是不可逆的这个操作顺序培训时必须反复强调。4.3 系统安装与虚拟化场景的衔接RAID 建完后装系统本身就是个过滤项曙光服务器安装 Windows Server 或主流 Linux 发行版时RAID 卡驱动需要单独注入做到一半找不到本地磁盘多半就是这个原因。可以先把驱动包放到 U 盘安装时加载驱动识别出虚拟磁盘后再继续。装系统时分区方式建议统一UEFI 引导对应 GPT 分区系统盘剩余空间不分区留给虚拟化或容器数据后续使用。装完第一件事是更新网卡和存储控制器驱动再配置 BMC 和业务网口地址并开启时间同步。这样常见的服务器搭建诉求比如后续部署虚拟化平台或跑容器服务才有干净的底层环境。5. 服务器运维落地避坑指南几个直接导致翻车的现场5.1 BMC 管理网与业务网 IP 冲突现象BMC 网口配好后业务网或上层监控系统出现 IP 冲突告警严重时业务网断断续续。原因很多新人把 BMC 管理网口和业务网口插在同一个交换机上又图省事直接复用业务网 IP 网段两个设备在同一广播域内互相抢占地址交换机端口报错。解决管理网单独划一个独立 VLAN配置时避免和业务 IP 段重叠。BMC 网口按规范写进资产表同时禁用 BMC 上不需要的协议。管理通道的安全性优先于便利性这是服务器运维的第一条硬规矩。5.2 内存插槽顺序错位导致容量减半现象插了 8 根内存系统显示只有 4 根容量进 BIOS 看到部分通道未识别。原因没按 CPU 通道顺序插导致部分通道空置、部分通道插满系统无法启用未满通道。解决翻开机箱盖内的示意图按 CPU0/CPU1 分别对应的通道顺序依次插入。换内存后再进 BIOS 确认完整识别并测试。插内存前先拍照插完后核对槽位数量。5.3 RAID 重建期间误拔盘现象阵列里一块盘亮红色故障灯维护时误把健康盘拔了出去结果阵列降级甚至失效数据丢失。原因故障盘指示灯和健康盘外观差异不明显又没有先核对盘位编号和系统日志就动手操作。解决拔盘前单盘逐一核对 bay 编号和系统识别盘号做到号、灯、日志三方一致再操作。重建期间不要把阵列里其他盘拔走数据比时间值钱。更换盘后回到第 4 章的命令去确认 rebuild 进度。5.4 时间总是不准NTP 配置被忽略现象服务器日志时间偏移登录审计定位不到真实事件证书校验偶尔报错。原因机房服务器没配 NTP 或者 NTP 源不通。物理机默认不带硬件时钟同步策略重启后时间偏差更大。解决业务网能访问外网时直接使用公共 NTP 源配置开机自启。内网有标准时间服务器时优先内网同步。配完用chronyc sources -v查同步状态和层级。5.5 固件升级中途断电现象BMC 刷新进度条卡死刷新工具无响应重启后 BMC 页面进不去。原因刷新操作失去了电源保障或者有人在这期间直接把机器重新上电。解决升级前先把机器切换到维护模式接上 UPS通过 IPMI 会话盯住进度期间严禁其他操作。刷挂后第一时间通过串口或维修跳线恢复 BMC且不要连续刷写多次容易造成更严重的固件损坏最好联系原厂支持远程确认恢复路径。6. 把培训内容变成能力用一张健康自查表验收服务器培训结束不等于会了验收的标准不是能复述概念而是能独立完成一台服务器的上电、配置、装系统、做 RAID、进入管理界面。我自己带人时会要求对方拿着下面这张表做完一整轮再签字确认。检查项操作动作预期结果开机自检观察屏幕和指示灯无报错进入启动阶段BMC 网口配置固定 IP 并连接能登录能远程开关机BIOS 版本记录版本号与兼容性说明一致内存识别BIOS 内存页核对容量、频率、通道正确RAID 状态storcli 或配置界面查看级别、容量、状态正常时间同步chronyc 或 w32tm 查询同步层面正常业务网络对端 ping 通延迟平稳这套表跑完能覆盖 80% 的交付验收场景。剩下的 20% 是靠日志和告警在长期运行里才能暴露的问题。所以我现在的习惯是每次做完一台服务器顺手把 BMC 日志导出存一份把 RAID 健康和固件版本快照留底三个月后再翻出来对一遍很多问题的苗头在早期日志里就能看到。服务器这行最大的进步不是背会多少规格参数而是知道每个环节的破坏点在哪里。希望帮到你。本文还有配套的精品资源点击获取
返回列表