温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

怎么用gdc-client批量下载TCGA数据

发布时间:2021-11-10 10:15:34 来源:亿速云 阅读:588 作者:柒染 栏目:大数据

怎么用gdc-client批量下载TCGA数据,很多新手对此不是很清楚,为了帮助大家解决这个难题,下面小编将为大家详细讲解,有这方面需求的人可以来学习下,希望你能有所收获。

GDC的在线下载功能只适用于下载小的数据集,当需要下载数据量较大的TCGA数据时,必须借助于GDC官方提供的客户端工具gdc-client。网址如下

https://gdc.cancer.gov/access-data/gdc-data-transfer-tool

该软件是一个命令行工具,支持windows, linux, mac OS多种操作系统,可以通过以下两种方法来下载文件

1. Manifest

首先通过GDC在线数据库筛选自己感兴趣的数据集,然后通过购物车图标将数据集添加到购物车中,示意如下

怎么用gdc-client批量下载TCGA数据

点击导航栏的Cart按钮,点击下载Manifest文件

怎么用gdc-client批量下载TCGA数据

该文件内容如下所示

怎么用gdc-client批量下载TCGA数据

第一列为文件的uuid, 在GDC数据库中,所有的信息都用一个uuid唯一标识。利用manifest文件批量下载的用法如下

gdc-client download -m gdc_manifest_20190610_105445.txt

结果下载到当前目录,每个文件保存在uuid对应的文件夹下,示意如下

怎么用gdc-client批量下载TCGA数据

这里我下载的是FPKM的基因表达量,文件内容如下

怎么用gdc-client批量下载TCGA数据

可以看到没有表头信息,而且每个样本是分开的,在实际使用中,我们通常需要整合到一张表中,得到一个行为基因,列为样本的基因表达量的表格。通过这种方式下载的数据,没有文件对应的样本信息,这个信息可以通过下载SampleSheet得到,该文件的内容如下

怎么用gdc-client批量下载TCGA数据

保存了每个样本对应的样本等信息,通过结合这个数据,可以整理得到基因表达量的表格。

2. UUID

第二种方式直接使用文件对应的uuid进行下载, 点击文件名称,可以看到UUID的信息,如下所示

怎么用gdc-client批量下载TCGA数据

通过uuid下载文件的用法如下

gdc-client download cadfedcc-2742-42ad-9fd3-733d01086392

这两种方式本质上是一样的,都是通过文件的uuid来对应到唯一的一个文件,并进行下载。需要注意的是,这种方式只能够下载得到原始文件,如果需要下游分析,需要自己调整文件格式。

看完上述内容是否对您有帮助呢?如果还想对相关知识有进一步的了解或阅读更多相关文章,请关注亿速云行业资讯频道,感谢您对亿速云的支持。

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI