PyTorch数据加载方法包括自定义数据集、处理每个原始样本、使用DataLoader生成batch_size个样本,并通过collate_fn重新设置批量中的加载格式
发布时间
阅读量:
阅读量
一、自定义Dataset
Dataset是一个包装类:
- 通过将数据封装为一个Dataset类实例后,并将其传递给DataLoader对象,我们可以更加高效地对数据执行相关操作。
- 我们可以通过继承自Dataset结构来整合数据集的源文件路径、规模信息以及其他非关键功能模块的内容,并使这些整合好的组件能够被DataLoader有效地调用。
1、“文本分类”任务下使用自定义Dataset
class.txt:所有类别
finance
realty
stocks
education
science
society
politics
sports
game
entertainment
train.txt:训练数据样式
中华女子学院:本科层次仅1专业招男生 3
两天价网站背后重重迷雾:做个网站究竟要多少钱 4
东5环海棠公社230-290平2居准现房98折优惠 1
卡佩罗:告诉你德国脚生猛的原因 不希望英德战踢点球 7
82岁老太为学生做饭扫地44年获授港大荣誉院士 5
记者回访地震中可乐男孩:将受邀赴美国参观 5
冯德伦徐若�隔空传情 默认其是女友 9
传郭晶晶欲落户香港战伦敦奥运 装修别
全部评论 (0)
还没有任何评论哟~
