• 论坛首页
  • 我的丁香客
  • 找人
    查找好友
  • 更多
    丁香园
    丁香通
    丁香人才
    丁香会议
    丁香搜索
    丁香医生
    丁香无线
    丁香导航
    丁当铺
    文献求助
    医药数据库
    丁香诊所
    来问医生
登录 注册

生物信息

关注今日:11 | 主题:139853
论坛首页  >  生物信息学讨论版   >  NGS & Microarray
  • 发帖
    每发1个新帖
    可以获得0.5个丁当奖励
  • 回帖

分享到:

  • 微信

    微信扫一扫

  • 微博
  • 丁香客
  • 复制网址

ONT全长转录组测序分析(二)

  • 只看楼主
  • 页码直达:
  • 直达末页
楼主 ScorpioGirls
ScorpioGirls
丁香园准中级站友

  • 145
    积分
  • 586
    得票
  • 209
    丁当
  • +1 积分
  • 1楼

ONT全长转录组测序分析(二)

(一)原始下机数据介绍

此次专题主要学习和记录一些在分析ONT测序产品如ONT全长转录组,ONT甲基化以及ONT重测序中的所思所想所得。个人所知有限,如有理解错误,还请批评指正。

Nanopore测序的下机数据的原始数据格式为包含所有原始测序电信号的二代fast5格式。通过MinKNOW2.2软件包中的Guppy软件进行base calling后会将fast5格式数据转换为fastq格式,用于后续质控分析。

上次我们提到对于ONT原始下机数据混样建库和非混样建库数据稍微有些区别。混样主要是需要凑够样本数达到一个上机lane的测序量,目前三代全长转录组一个样本基本产出2G就可以满足下游分析,因此,多属于混样建库测序。

对于一次下机的数据,文件如下:

  • fast5:原始电信号文件,以.fast5为文件结尾。此文件既有测序得到的序列信息,还有甲基化修饰信息。经过basecall,MinKNOW2.2软件包中的Guppy软件可以将fast5文件转换得到fq文件。测序仪本身是带有这个basecall功能的。

  • fastq:由fast5文件转换而来,以.fastq或.fq结尾,与二代格式一样,四行为一个单位,只不过序列要长很多,这是三代的一个优势。


fail和pass文件夹是根据测序仪设置的一个指标比如Q值>7对数据进行的一个处理,fail代表指标没有达到这个标准,pass指通过了这个标准。


  • final_summary.txt文件:



  • *sequencing_summary.txt文件:主要存储了一些read长度,每个read的平均测序质量(MeanQscore)等信息,作为对数据进行长度,N50,MeanLength,MaxLenght等指标统计,后续过滤等用途。



下期将介绍:

  • 数据过滤标准

  • 一般初步会对数据做哪些指标统计

  • 如何评价这个数据质量




  • 邀请讨论
  • 不知道邀请谁?试试他们

    换一换
2020-02-28 20:01 浏览 : 7245 回复 : 0
  • 投票 2
  • 收藏 1
  • 打赏
  • 引用
  • 分享
    • 微信扫一扫

    • 新浪微博
    • 丁香客
    • 复制网址
  • 举报
    • 广告宣传推广
    • 政治敏感、违法虚假信息
    • 恶意灌水、重复发帖
    • 违规侵权、站友争执
    • 附件异常、链接失效
    • 其他
湖心 编辑于 2020-02-29 15:00
  • • #医生的昵称有多好笑#这是你们热爱工作的表现吗?哈哈哈哈

关闭提示

需要2个丁当

丁香园旗下网站

  • 丁香园
  • 用药助手
  • 丁香通
  • 文献求助
  • 丁香人才
  • 丁香医生
  • 丁香导航
  • 丁香会议
  • 手机丁香园
  • 医药数据库

关于丁香园

  • 关于我们
  • 丁香园标志
  • 友情链接
  • 联系我们
  • 加盟丁香园
  • 版权声明
  • 资格证书

官方链接

  • 丁香志
  • 丁香园新浪微博
引用回复