Advertisement

PyTorch数据加载方法包括自定义数据集、处理每个原始样本、使用DataLoader生成batch_size个样本,并通过collate_fn重新设置批量中的加载格式

阅读量:

一、自定义Dataset

Dataset是一个包装类:

  • 通过将数据封装为一个Dataset类实例后,并将其传递给DataLoader对象,我们可以更加高效地对数据执行相关操作。
  • 我们可以通过继承自Dataset结构来整合数据集的源文件路径、规模信息以及其他非关键功能模块的内容,并使这些整合好的组件能够被DataLoader有效地调用。

1、“文本分类”任务下使用自定义Dataset

class.txt:所有类别

复制代码
    finance
    realty
    stocks
    education
    science
    society
    politics
    sports
    game
    entertainment

train.txt:训练数据样式

复制代码
    中华女子学院:本科层次仅1专业招男生	3
    两天价网站背后重重迷雾:做个网站究竟要多少钱	4
    东5环海棠公社230-290平2居准现房98折优惠	1
    卡佩罗:告诉你德国脚生猛的原因 不希望英德战踢点球	7
    82岁老太为学生做饭扫地44年获授港大荣誉院士	5
    记者回访地震中可乐男孩:将受邀赴美国参观	5
    冯德伦徐若�隔空传情 默认其是女友	9
    传郭晶晶欲落户香港战伦敦奥运 装修别

全部评论 (0)

还没有任何评论哟~