关于数据变换

 为什么需要数据变换?通常情况下,直接加载的原始数据并不能直接送入神经网络进行训练,此时我们需要对其进行数据预处理。

在day3的数据集中学到,MindSpore提供基于Pipeline的数据引擎,通过数据集(Dataset)数据变换(Transforms)实现高效的数据预处理。其中Dataset是Pipeline的起始,用于加载原始数据。

数据变换(Transforms)在数据处理Pipeline中有着相当重要的作用,它们用于在数据被送入模型进行训练或推理之前,对数据进行预处理和转换。这些变换可以确保数据符合模型的输入要求,提高模型的性能和泛化能力。

数据转换的大致分类

Common Transforms

Common Transforms通常指的是在数据处理过程中常用的变换操作。(可以应用于各种数据类型,如图像、文本等)

Vision Transforms

Vision Transforms是专门用于图像数据处理的变换操作。在Mnist数据处理过程中,使用了RescaleNormalizeHWC2CHW变换。

Text Transforms

Text Transforms是专门用于文本数据处理的变换操作。与图像数据不同,文本数据需要有分词(Tokenize)、构建词表、Token转Index等操作。

Lambda Transforms

Lambda函数是一种不需要名称的匿名函数,它由一个单独的表达式组成,该表达式在调用时会被求值。Lambda Transforms可以加载任意定义的Lambda函数,提供足够的灵活度。

Logo

昇腾计算产业是基于昇腾系列(HUAWEI Ascend)处理器和基础软件构建的全栈 AI计算基础设施、行业应用及服务,https://devpress.csdn.net/organization/setting/general/146749包括昇腾系列处理器、系列硬件、CANN、AI计算框架、应用使能、开发工具链、管理运维工具、行业应用及服务等全产业链

更多推荐