转载地址:https://bbs.huaweicloud.com/forum/thread-113020-1-1.html

作者:Mr.Yu

在ModelArts上 训练模型时,需要将数据从OBS上上传到cache中使用,数据集过大时耗时很长。
可以将数据打包,传输,然后在cache路径下os命令解压,并用于后续访问。

针对modelzoo中的train.py可以在之前添加如下几行:

1

2

3

4

5

6

7

8

9

10

import os

import moxing as mox

data_url = 'obs://hit-yw/datazip/'

local_data_url = './cache/'

data_name = 'data.zip'

mox.file.copy_parallel(data_url, local_data_url)

zip_command = "unzip -o %s -d %s" % (local_data_url+data_name ,local_data_url)

os.system(zip_command)

img=cv.imread(local_data_url+'train.jpg')

data_url 设置你自己OBS桶中的数据压缩包的位置。
local_data_url 设置训练时运行环境中的数据存储cache路径。
os.system("unzip image_data.zip") 利用系统unzip命令解压你的训练数据压缩包。
imread读取使用你的训练图片。

训练集过大时,可以减少数据传输耗费的时间。

Logo

昇腾计算产业是基于昇腾系列(HUAWEI Ascend)处理器和基础软件构建的全栈 AI计算基础设施、行业应用及服务,https://devpress.csdn.net/organization/setting/general/146749包括昇腾系列处理器、系列硬件、CANN、AI计算框架、应用使能、开发工具链、管理运维工具、行业应用及服务等全产业链

更多推荐