鲲鹏920服务器配置
配置环境
- 鲲鹏920 7260
- 华为Atlas300i Duo96G
- openEuler 24.03 (LTS-SP2)
驱动安装
用户可使用如下命令查询当前环境是否安装驱动,若返回驱动相关信息说明已安装。
npu-smi info
groupadd HwHiAiUser
useradd -g HwHiAiUser -d /home/HwHiAiUser -m HwHiAiUser -s /bin/bash
dnf install -y make dkms gcc linux-headers-$(uname -r)
下载驱动
chmod +x Ascend-hdk-<chip_type>-npu-driver_<version>_linux-<arch>.run
chmod +x Ascend-hdk-<chip_type>-npu-firmware_<version>.run
./Ascend-hdk-<chip_type>-npu-driver_<version>_linux-<arch>.run --full --install-for-all
./Ascend-hdk-<chip_type>-npu-firmware_<version>.run --full
reboot
查看显卡信息:npu-smi info
查看模板规格:npu-smi info -t template-info
vnpu配置
命令格式如下:
npu-smi set -t create-vnpu -i id -c chip_id -f vnpu_config [-v vnpu_id] [-g vgroup_id]
|
类型 |
描述 |
|
id |
设备id。通过npu-smi info -l命令查出的NPU ID即为设备id。 |
|
chip_id |
芯片id。通过npu-smi info -m命令查出的Chip ID即为芯片id。 |
|
vnpu_config |
虚拟化实例模板名称,可参见虚拟化规则章节中的“虚拟化模板”。 |
|
vnpu_id |
指定需要创建的vNPU的id。 首次创建可以不指定该参数,由系统默认分配。若重启后业务需要使用重启前的vnpu_id,可以使用-v参数指定重启前的vnpu_id进行恢复。 取值范围。 Atlas 推理系列产品 vnpu_id的取值范围为[phy_id*16 + 100, phy_id * 16+107]。 Atlas 训练系列产品 vnpu_id的取值范围为[phy_id*16 + 100, phy_id * 16+115]。 说明 phy_id表示芯片物理ID,可通过执行ls /dev/davinci*命令获取芯片的物理ID。例如/dev/davinci0,表示芯片的物理ID为0。 vnpu_id传入4294967295时表示不指定虚拟设备号。 同一台服务器内不可重复创建相同vnpu_id的vNPU。 |
|
vgroup_id |
虚拟资源组vGroup的id,取值范围0~3。vGroup的概念可以参见虚拟化规则章节中的“虚拟化模式”,仅Atlas 推理系列产品支持本参数。 |


在2卡上创建一个vNPU:
npu-smi set -t create-vnpu -i 2 -c 0 -f vir04_4c_dvpp
查看:npu-smi info -t info-vnpu -i 2 -c 0
2.2.2 销毁指定vNPU
npu-smi set -t destroy-vnpu -i id -c chip_id -v vnpu_id
内核版本回退
一定不要升级。系统升级以后显卡驱动不能用了。怎么办
查看系统中已安装的所有内核版本
rpm -q kernel

index=0 → 最新内核(111)
index=1 → 上一个版本(110)
index=2 → 更早版本(98)
grub2-set-default 2
grub2-editenv list
可以看到:saved_entry=1
reboot
配置桥接网络
列出所有连接,识别哪些是多余的
nmcli con show
删除那个未绑定设备的“网桥 br0”
nmcli con delete d2d68553-f97e-7549-7a26-b34a26f29318
重新创建干净的网桥配置
创建主网桥连接(静态 IP)
nmcli con add type bridge ifname br0 con-name br0 \
ipv4.addresses 192.168.16.34/24 \
ipv4.gateway 192.168.16.1 \
ipv4.dns "114.114.114.114" \
ipv4.method manual \
autoconnect yes
将 enp125s0f0作为从属接口加入网桥
nmcli con add type bridge-slave ifname enp125s0f0 master br0 con-name br0-slave-enp125s0f0
#停用当前正在使用的 enp125s0f0连接
nmcli con down enp125s0f0
禁止它开机自启
nmcli con modify enp125s0f0 connection.autoconnect no
(可选)删除它,避免未来冲突
nmcli con delete enp125s0f0
激活主网桥
nmcli con up br0
激活 slave(enp125s0f0加入网桥)
nmcli con up br0-slave-enp125s0f0
下边这个是解决虚拟机网络一会没有的
nmcli con modify br0 bridge.stp no
nmcli con up br0
验证并重启测试
nmcli con show
ip addr show br0
systemctl restart NetworkManager # 或直接 reboot
reboot
安装虚拟机
yum install -y qemu
yum install -y libvirt
systemctl start libvirtd
ls /dev/kvm
ls /sys/module/kvm
rpm -qi qemu
rpm -qi libvirt
systemctl status libvirtd
yum install -y qemu-img
sudo dnf install cockpit libvirt qemu-kvm -y
sudo dnf install cockpit-machines -y
sudo systemctl enable --now cockpit.socket libvirtd
# 启动 Cockpit 服务
sudo systemctl start cockpit
# 设置开机自启
sudo systemctl enable cockpit
# 检查服务状态(确保 active (running))
sudo systemctl status cockpit
#arm的
sudo dnf install edk2-aarch64 -y
systemctl stop firewalld
systemctl disable firewalld

创建虚拟机的时候只能点击创建并运行。点击创建并编辑的话启不来。
使用lvm thin动态硬盘
pvcreate /dev/sda
vgcreate vg_thin /dev/sda
lvcreate -L 10T --thinpool thin_pool vg_thin
手动在精简池中创建卷
sudo lvcreate -V 2T --thin -n vm1-disk vg_thin/thin_pool
查看创建的卷
sudo lvs -a vg_thin
使用这个精简卷安装系统
virt-install \
--name vm1 \
--memory 16384 \
--vcpus 8 \
--cpu host-passthrough \
--disk /dev/vg_thin/vm1-disk,bus=virtio \
--cdrom /iso/openEuler-24.03-LTS-SP2-aarch64-dvd.iso \
--network bridge=br0,model=virtio \
--graphics vnc \
--osinfo linux2022
然后在cockpit vnc里边一步一步安装。
昇腾计算产业是基于昇腾系列(HUAWEI Ascend)处理器和基础软件构建的全栈 AI计算基础设施、行业应用及服务,https://devpress.csdn.net/organization/setting/general/146749包括昇腾系列处理器、系列硬件、CANN、AI计算框架、应用使能、开发工具链、管理运维工具、行业应用及服务等全产业链
更多推荐

所有评论(0)