简介:中科曙光服务器培训教程汇总《服务器基础知识-v0.3》是一份面向服务器运维、技术支持及IT入门者的基础培训PPT,由技术支持中心主讲,旨在帮助零基础学员系统建立服务器知识框架。整份资源为单个pptx课件,体积约42.47MB,内容自成体系,涵盖服务器形态与种类、服务器硬件部件介绍、服务器软件介绍三大模块,并通过大量对比表格解析服务器与PC机、工作站、小型机的区别,以及I/O性能、管理能力、可靠性、可扩展性等关键评价指标。课件还梳理了塔式、机架式、刀片式等主流服务器形态,按CPU数量、指令集架构、应用功能与服务规模等多个维度介绍服务器分类思路,并补充计算机基本概念与服务器性能“5高”评价标准,知识点覆盖全面。目前已有600人学习下载,适合需要快速入门硬件基础、参与企业内训或准备数据中心运维岗位的读者收藏学习。
1. 中科曙光服务器培训为什么要系统过一遍:v0.3课件背后的真实需求
第一次接触中科曙光服务器培训教程,很多人会把它当成一份“看过就忘”的PPT。但做过运维现场的人都知道,“服务器基础知识”六个字的范围非常大:从CPU、内存、硬盘背板这些硬件概念,到RAID策略、BMC远程管理、操作系统安装这些动手环节,每一块单拎出来都能写一本书。这份v0.3版本,正是想把散落的点串成线。
我在运维交接时见过这样的场景:对方翻出一块移动硬盘,里面躺着几年前的服务器培训课件,版本号停在v0.3,问我“这些够不够用”。翻了翻发现,硬件架构讲得挺细,但缺了磁盘阵列的实操步骤和远程管理卡配置方法,典型的“课件不错,但不闭环”。
培训的价值不在“讲什么”,而在“讲完怎么落地”。真正接手一台中科曙光服务器时,RAID卡怎么进、BMC地址怎么配、固件版本的兼容问题,这些细节才决定能否顺利交付。这份笔记适合刚入行的运维工程师、中小企业IT负责人,以及想把课件迭代成实战手册的培训组织者。
2. 服务器基础知识培训到底讲什么:硬件架构、固件与远程管理的完整地图
一份服务器培训课件,如果只把CPU和内存参数罗列一遍,基本等于没讲。有价值的部分是“硬件之间的关系”:CPU通过什么总线访问内存,硬盘通过什么控制器接入系统,远程管理走哪条独立通道。把这张关系图记住,后面所有配置操作才有依据。
2.1 服务器里到底有几类硬件:CPU、内存、硬盘之外的三个角色
课件开篇通常会讲CPU、内存、硬盘的组成原理,这部分对从业者来说大多是“已知信息”。我一般建议把注意力放在三类容易被带过的角色上。
第一个是RAID卡(磁盘阵列卡),它决定你的数据如何分布在多块硬盘上。中科曙光服务器的入门级机架式机型,板载RAID控制器多为LSI或Broadcom方案,开机自检时按Ctrl+R或Ctrl+H可以进配置界面。课件里如果有RAID卡截图,建议把截图里的菜单项和真机界面逐个对应一遍,因为固件版本差异会让菜单名称对不上。
第二个是网卡。服务器网卡往往有多个物理端口,对应不同的PCIe通道。有些端口是光口,需要配光模块和光纤跳线;有些是电口,用普通RJ45网线。课件里出现“万兆网卡”这类词时,至少要知道物理端口上的指示灯状态对应哪个业务,否则后面IP配错都不知道从哪里查。
第三个是BMC管理芯片。它独立于主机的CPU和操作系统运行,只要有电源就能访问。BMC自带IP地址,通过浏览器或命令行登录后,可以完成开关机、查看硬件健康状态、挂载ISO镜像等操作。中科曙光服务器的BMC默认IP地址,通常在机器后背板的铭牌标签上有标注,一般是192.168.x.x的固定地址。
这三个角色在课件里可能各占一两页,但到了现场,决定你能不能“远程把服务器搞定”的就是它们。
2.2 RAID磁盘阵列级别怎么选:课件表格和实际生产环境的差异
RAID是服务器基础培训绕不过去的主题,因为它是数据安全的第一道防线。课件里通常把RAID 0、RAID 1、RAID 5、RAID 10的定义各列一张表,但实际选型的逻辑比定义更直接,取决于三个问题:坏一块盘你能不能接受数据丢失、性能优先还是容量优先、预算内有多少块硬盘。
| RAID级别 | 最少硬盘数 | 冗余能力 | 可用容量 | 典型场景 |
|---|---|---|---|---|
| RAID 0 | 2 | 无 | 100% | 临时存储、性能测试 |
| RAID 1 | 2 | 单盘故障 | 50% | 系统盘、日志盘 |
| RAID 5 | 3 | 单盘故障 | (n-1)/n | 文件共享、归档存储 |
| RAID 10 | 4 | 每组单盘故障 | 50% | 数据库、虚拟化存储 |
我见过不少新人在课上学了RAID 5,到了现场给四块盘的服务器配RAID 5,结果可用容量只有三块盘,随机写入性能也因校验计算上不去。而同样四块盘做RAID 10,性能和冗余都兼顾。如果业务是跑数据库或虚拟化,RAID 10通常是最稳的选择;归档类场景才优先考虑RAID 5或RAID 6。
RAID配置里还有一个常被忽略的参数:缓存策略。写回(Write Back)模式下,数据先写入RAID卡的高速缓存,再延迟写入硬盘,性能好但断电时有丢失风险;直写(Write Through)模式性能稍差但更安全。生产环境建议开启写回,前提是RAID卡带有电池或电容保护模块,否则断电瞬间缓存里的数据全丢。
另一个操作细节是,创建阵列后一定要执行“初始化”。如果跳过,新阵列会处于未初始化状态,系统安装时可能识别不到完整容量,甚至在某些固件版本下触发重建流程,把刚建好的阵列状态搞成异常。正确的顺序是:先确认硬盘上不需要保留数据,再创建阵列,再初始化,最后装系统。
2.3 BMC/IPMI远程管理:默认IP、登录凭据与管理网段规划
服务器和普通PC最本质的区别之一就是远程管理。服务器放在机房,运维人员坐在办公室,中间靠的是BMC。培训课件里对BMC往往只用一页带过,但实际运维里它承担了超过一半的救场工作。
中科曙光服务器的BMC管理页面,核心功能大致如下表:
| 功能模块 | 作用 | 使用场景 |
|---|---|---|
| 远程控制台 | 相当于远程的显示器加键鼠 | 看系统安装界面、做图形化配置 |
| 电源控制 | 开机、关机、重启、强制断电 | 操作系统无响应时远程处理 |
| 健康监控 | CPU温度、风扇转速、电源状态 | 巡检时确认整机状态 |
| 虚拟介质 | 把ISO镜像挂载到服务器光驱位置 | 免U盘安装操作系统 |
配置BMC时,第一件事是规划IP。BMC的IP最好独立划分一个管理网段,比如10.10.10.0/24,和业务网段完全分开。很多中小企业把BMC的IP随便设到业务网段里,结果和某台业务机器冲突,管理界面登录不上,服务器出了故障只能跑机房。这属于典型的“课件没讲,现场遭殃”,说多了都是血泪经验。
我一般在工单表里单独记一列“BMC地址”,和业务IP分开管理。遇到设备下电再上电后BMC失联的情况,先检查是不是有别的设备占用了这个IP。另外,浏览器访问BMC页面建议用Chrome或Edge,很多新固件已经取消了老的ActiveX插件方案,页面打不开时先换浏览器,别急着怀疑硬件。
2.4 从单机到集群:一台中科曙光服务器怎么撑起多个业务
培训课件最后几页通常会展望集群,但对大多数中小企业来说,真实的起点是单机。你需要评估“一台服务器能承担多少角色”,这里的关键是服务器虚拟化。
常见做法是:一台物理机安装虚拟化平台,上面创建多台虚拟机,分别承担文件服务器、业务数据库、应用服务等角色。结合服务器虚拟化技术,一台16核64G的机器可以稳定跑4到6台轻量级虚拟机。
资源规划我习惯按下面这个表来估算:
| 虚拟机角色 | CPU分配 | 内存分配 | 磁盘IO特征 |
|---|---|---|---|
| 文件服务器 | 2核 | 4G | 顺序读写为主 |
| 业务数据库 | 4核 | 8G | 随机读写较高 |
| 应用服务 | 2核 | 4G | 混合型 |
注意物理机的资源不是全部可分配的。虚拟化平台本身要占CPU和内存,磁盘阵列写缓存也要吃内存,BMC也要占一部分系统资源。我的习惯是把总内存打个八折,再按上表分配,这样出现突发流量时机器还有余量。
集群的概念在这个阶段只需要理解到“多台物理机通过网络协同对外提供服务”即可。真正做集群要考虑共享存储、网络冗余、负载均衡策略,复杂度会成倍上升。小企业从单机加虚拟化起步,是最稳妥的路径。
3. 把v0.3课件落到真机操作:RAID初始化、Linux安装与时间同步的完整路径
前面把硬件地图梳理完了,接下来是真正的动手环节。我按一台新到的中科曙光服务器从拆箱到能跑业务的顺序,把关键操作拆成四步。每一步都有对应的命令或界面操作,照着做至少不会迷路。
3.1 首次上电的第一件事:进RAID卡配置界面把存储初始化做对
新服务器第一次通电,别急着装系统。先花十分钟把RAID配好,后面能省一天的事。
开机自检时留意屏幕提示,一般在出现中科曙光Logo或RAID控制器信息时,按Ctrl+R(LSI方案)或Ctrl+H(Broadcom方案)进入配置界面。界面里能看到当前连接的物理硬盘,通常是Unconfigured Good状态。
创建阵列的操作路径是:
- 在阵列卡主界面选择“Configuration Wizard”或“Create Virtual Drive”
- 选择RAID级别,根据硬盘数量和业务类型参照前文表格
- 勾选参与阵列的物理硬盘
- 设置条带大小(Strip Size),默认64KB即可,数据库场景可以调到256KB
- 设置缓存策略为Write Back,初始化方式选Full Initialize
- 确认后创建,退出并重启
初始化这一步很多人会跳过。快速初始化(Fast Init)虽然快,但有些固件版本在快速初始化后仍会后台做一致性校验,如果此时断电,阵列状态可能变成Degraded。我所有的生产服务器都做全量初始化,时间多花半小时,换来的是后续重建时的安心。
创建完阵列后,按Ctrl+P可以查看虚拟驱动器状态,正常应该是Optimal或Online。如果显示Foreign,说明硬盘是之前从别的阵列上拔下来的,需要先执行“Import Foreign Configuration”导入配置,再继续后续操作。
3.2 做一个Linux系统安装U盘:分区方案、驱动与引导的关键设置
RAID就绪后,下一步是装系统。这里以服务器Linux环境为例,装Ubuntu Server 22.04,适合大多数线上业务。
先在管理电脑上用UItraISO或dd命令把镜像写入U盘:
# 在Linux管理机上制作启动U盘,/dev/sdb是U盘设备名,务必确认无误 sudo fdisk -l # 列出所有磁盘,找到U盘对应的设备名 sudo dd if=ubuntu-22.04-server.iso of=/dev/sdb bs=4M status=progress sync # 等缓冲区数据全部落盘后,再拔出U盘dd命令的of参数指向U盘设备而不是分区,写错会把管理机自己的硬盘数据清空。bs=4M是每次写入4MB,速度较快;status=progress能看到实时进度。这条命令在生产环境里“翻车”的案例很多,核心原因就是把of写成了/dev/sdb1之类的分区名。
U盘插入服务器后,开机进入BMC远程控制台,选择从U盘引导。Ubuntu Server安装器会问两个关键问题:
| 配置项 | 推荐值 | 说明 |
|---|---|---|
| 分区方案 | 使用整个磁盘,LVM | 便于后续扩容逻辑卷 |
| 软件选择 | OpenSSH server | 装完就能远程登录 |
分区这一步,我通常在LVM里单独划一个/boot分区(1GB),剩下的空间全部交给根分区。/boot独立出来的原因是某些RAID卡驱动在LVM之上加载会有顺序问题,独立分区能减少引导失败的几率。这个经验是从一次PXE装系统失败后总结出来的。
装完重启,系统会提示移除安装介质。如果设置了BMC的虚拟介质挂载了ISO镜像,记得在BMC界面把挂载卸载掉,否则重启后可能又进入安装器。
3.3 配置服务器时区与时间服务器:让日志时间不再“穿越”
系统装完第一件事,不是装软件,而是先看时间。新装好的Linux服务器默认时区可能是UTC,和北京时间差8小时。这个问题在日志排查时特别折磨人:应用报错的时间和你实际看到的时间对不上,所有排查都会变慢。
用下面两条命令先把时区改掉:
# 设置时区为东八区(北京/上海时间) sudo timedatectl set-timezone Asia/Shanghai # 查看当前时间、时区和时间同步状态 timedatectl statustimedatectl是systemd自带的工具,不需要额外安装。设置时区后,配合时间服务器同步,能让服务器始终和标准时间保持一致。
接下来安装并配置chrony作为NTP客户端:
sudo apt install chrony -y sudo systemctl enable --now chrony sudo chronyc makestep # 立即同步一次,跳过渐进调整过程chronyc makestep会立刻把系统时间跳到标准时间,适合刚装完系统的场景。如果不执行这一步,chrony会默认以缓慢调整的方式校准,对于偏差超过几分钟的系统,要等很久才能校准到位。
生产环境里建议在/etc/chrony/chrony.conf中显式指定可靠的时间服务器:
# /etc/chrony/chrony.conf 关键配置行 server ntp.aliyun.com iburst server pool.ntp.org iburst local stratum 10iburst参数让chrony在启动后的前四次同步中快速拉齐时间,适合刚开机的服务器。local stratum 10表示在无法联网时,本机可以继续以低优先级时间源对外提供时间服务,这样内网其他小机器可以从这台服务器同步时间,形成一个内部的时间服务器节点。
3.4 一台物理机当三台用:小企业虚拟化架设的最简参数方案
装好系统、调好时间后,接着考虑怎么让一台物理机承载多个业务。对小企业来说,单独为一套OA买一台服务器不现实,虚拟机是默认方案。
我常用的是KVM加Web管理面板的组合。安装KVM相关组件:
sudo apt install qemu-kvm libvirt-daemon-system virtinst -y sudo systemctl start libvirtd sudo systemctl enable libvirtd参数说明:qemu-kvm是虚拟化引擎,libvirt-daemon-system提供统一管理接口,virtinst用来创建虚拟机。装完后,用virsh list --all确认libvirtd正常运行。
创建第一台虚拟机的命令如下:
sudo virt-install \ --name app-server \ --memory 4096 \ --vcpus 2 \ --disk path=/var/lib/libvirt/images/app-server.qcow2,size=50 \ --os-variant ubuntu22.04 \ --network bridge=br0 \ --cdrom /var/lib/libvirt/images/ubuntu-22.04-server.iso--memory 4096分配4G内存,--vcpus 2分配2个虚拟CPU核,--disk指定磁盘镜像路径和大小50GB,--network bridge=br0把虚拟机的网卡桥接到物理网卡,这样虚拟机对外呈现的IP和物理机在同一子网,管理起来最方便。
如果物理机内存只有64G,按前文的规划,4到6台这样规格的虚拟机是安全的。我一般会留8到16G内存给物理机操作系统和磁盘缓存,剩下的才敢全部分配出去。
4. 服务器运维最常见的五个坑:现象、原因与解决办法
这里把现场最容易踩的五个坑集中拿出来写。每一条都按“现象→原因→解决”的方式记录,方便你对着排查。
4.1 重启后系统找不到硬盘:RAID配置没写回阵列卡
现象:RAID 10配置完成后,系统装到一半,或者重启一次,直接提示“No boot device found”。进RAID配置界面一看,阵列状态变成“Foreign”或“Missing”。
原因:创建阵列后没有执行初始化,配置没有写回阵列卡的EEPROM。另外,如果硬盘位置在关机后被物理调整过,RAID卡也会识别不到原来的阵列。
解决:开机自检按Ctrl+R进入RAID卡界面,先执行“Import Foreign Configuration”把外部配置导回来,确认虚拟驱动器状态变成Optimal后再继续。这条“后悔药”只对配置存在但没导入了的情况有效,如果是新阵列没初始化,只能重建阵列并重新装系统。所以我的习惯是:创建阵列后先重启一次,确认阵列状态稳定了再开始装系统。
4.2 服务器时间始终差8小时:时区与时间服务器都没配
现象:新装好的Linux服务器,date命令显示的时间和北京时间差8小时,应用日志时间对不上,定时任务到点不执行。
原因:安装系统时地区选项选择了UTC,时区没有设置为Asia/Shanghai;同时系统没有配置时间服务器,硬件时钟漂移后无法自动校准。
解决:执行sudo timedatectl set-timezone Asia/Shanghai修正时区,然后按3.3节的方法配置chrony并指向可靠的时间服务器。这里还有一个隐藏点:如果是双系统(比如服务器上同时装了Linux和Windows),两套系统对硬件时钟的处理方式不同——Linux默认把硬件时钟当UTC,Windows默认当本地时间。解决办法是在Linux下执行sudo timedatectl set-local-rtc 1,让硬件时钟按本地时间解释。
4.3 BMC管理页面登录不上去:IP冲突或凭据过期
现象:浏览器打开BMC的IP地址,要么一直转圈,要么提示密码错误。重启BMC后有时能恢复,但过一阵又失联。
原因:最常见的是BMC的IP和业务网段里的某台机器冲突;其次是有同事改过BMC密码,初始密码已经不适用。
解决:先用物理方式到服务器面前,看看背面铭牌标注的默认IP和默认凭据,通过BMC的物理复位按钮恢复出厂设置。然后把BMC的IP规划到独立管理网段,比如10.10.10.0/24,不要和业务网段混用。这个坑我踩过两次之后,所有服务器的BMC地址都单独登记在资产管理表里,统一管理。
4.4 虚拟化平台安装后CPU跑不满:BIOS里两个开关没开
现象:ESXi或KVM装好之后,虚拟机启动报“虚拟化不可用”,或者CPU只能识别物理核的一半。
原因:BIOS里Intel Virtualization Technology(VT-x)和VT-d两个选项默认关闭,虚拟化底层指令集不可用。
解决:开机进BIOS,找到“Processor Configuration”,把“Intel Virtualization Technology”和“VT-d”都设为Enabled。需要注意,不同中科曙光机型BIOS菜单位置有差异,但关键词通常是“Virtualization”或“SVM Mode”。改完保存重启后,在Linux里执行grep -E "vmx|svm" /proc/cpuinfo确认虚拟化标志位已经出现。
4.5 课件里的命令在真机上报错:固件版本带来的玄学差异
现象:按培训课件里的命令操作,提示“invalid parameter”或“command not found”,界面菜单位置也和截图完全不同。
原因:课件制作时的固件版本和实际设备不一致。RAID卡固件、BMC固件、BIOS版本各自独立迭代,命令参数和界面名称都会变,这不是机器坏了,是版本差异。
解决:先通过BMC页面把BIOS版本、BMC版本、RAID卡固件版本都记录下来,和课件封面的版本号对一下。命令执行前先查版本帮助,比如ipmitool mc info可以查看BMC版本信息。更重要的是,把每台设备的实际界面截图保存下来,标注固件版本,沉淀到自己的运维手册里。固件差异这种问题看着像“玄学”,本质是版本管理没跟上。
5. 从v0.3到v1.0:验证培训效果并沉淀自己的运维手册
5.1 验证清单:按课件给自己做一次实操考核
看完培训课件,能不能上手,用下面这份清单自测一遍:
| 验证项 | 操作 | 预期结果 |
|---|---|---|
| RAID配置 | 进RAID卡界面查看阵列状态 | 状态Optimal,容量识别正确 |
| 远程管理 | 从办公电脑访问BMC页面 | 能登录并看到整机健康信息 |
| 时间同步 | 执行timedatectl status | 时区为上海,时间为标准时间 |
| 虚拟化验证 | 用virsh list --all查看虚拟机 | 显示已创建的虚拟机列表 |
| 固件版本记录 | 查询BIOS/RAID/BMC版本并记录 | 记录与设备型号对应清晰 |
每一项都花不了几分钟,但能把“学过”变成“会做”。我在带人时一般要求两周内独立完成一次“从裸机到虚拟机跑通应用”的全流程操作,能走通基本说明培训过关了。
5.2 把课件升级成运维手册:三个必须收集的素材
课件是别人的,手册才是自己的。拿到v0.3或任何版本的培训课件,我建议做三件事:
第一,把课件里每个操作步骤和真机截图对应起来,凡是和截图不一致的地方,用新的截图替换并标注固件版本。第二,把命令行的实际输出保存成文本文件,和课件里的示例输出做diff,差异大的命令要重点标注。第三,把踩过的坑按“现象→原因→解决”格式追加到对应章节末尾,形成自己的避坑索引。
这套手册不需要一次写完整。每处理一次故障、每装一台新设备,就往里补一条记录。半年后再回看,它的价值远远超过原始培训课件。我现在接手任何一批新服务器,都会先给每台设备建一条档案,记录序列号、BMC地址、固件版本、RAID配置和业务角色,后续所有变更都追加在这条档案里。
希望帮到你。
本文还有配套的精品资源,点击获取