关灯
护眼
字体:大 中 小
上一章
目录
下一页
赵阳没有立刻给出答复,他表情严肃地看着幕布上的基因表达调控网络图,此时他的大脑正在飞速运转。
在179智商的推演下,结合他LV5的数学和信息学等级,很快,他脑海中构建出了几种处理这种高维度生物数据的数学模型。
“常规的负二项分布模型处理这种带有大量重复串行的数据,必然会导致方差估计不准。”
沉默了一会儿之后,赵阳看着顾明教授和周围的众人,缓缓说出了自己的分析。
“这种农作物本身的基因组过于庞大,市面上现成的商业生信分析软件,底层的统计算法大多是基于普通的二项分布或者泊松分布。在面对海量重复串行和测序深度不均时,极其容易将背景噪音放大,这就是你们得出几万个假阳性差异基因的根本原因。”
会议室里的众人都安静地听着。两个研二的学长连连点头,他们这几天被这些假阳性数据折磨得痛不欲生。
“我来吧,教授。你把测序的原始数据文档全部拷贝给我。”
赵阳看着顾明教授,直接给出了最终的解决方案。
“我回去重新写一个比对和定量算法。不用现成的软件,我直接在底层用隐马尔可夫模型(HMM)和多维主成分分析(PCA)结合的方式,对你们的表达量矩阵进行重新聚类。”
赵阳的语气里带着绝对的自信。
“隐马尔可夫模型可以通过观察到的测序串行串行状态,推断出隐藏的真实基因表达状态,最大程度滤除测序仪产生的物理噪音。然后用PCA降维,剥离次要因素。”
“我会尽可能地将假阳性的范围压缩到一百个基因以内。然后结合加权基因共表达网络分析,找出连接度最高的Hub基因。最多两天时间,我给你们一个个位数的候选基因列表。你们直接拿去打抗体或者做qPCR验证就行了。”
会议室里安静了下来。
周围众人眼神之中都带着不可思议的目光看着赵阳。
两天?
那两个学长面面相觑,都从对方的眼里看到了震惊。
这里面的原始测序数据可是以TB来计算的!光是把这几个TB的FASTQ文档在计算机里解压读取一遍,普通的服务器都需要十几个小时。
自己写底层算法?还要在两天内跑完数据,输出最终的个位数靶点列表?
两天时间也太短了。这在传统的生物信息学分析流程里,是绝对不可能完成的任务。
“两天时间够吗?”
顾明教授也有些迟疑地看着赵阳。他知道赵阳在数学和计算机上极强,但这毕竟是庞大的数据。
“我们这个实验倒也是没有那么急,距离结题还有一段时间,你可以多花点时间稳妥处理……”
“够了。”
赵阳笑着摇了摇手,打断了顾明教授的话。
“不过就是洗数据改算法的事情。底层的数学逻辑我刚才已经在脑子里构建完了,剩下的只是敲代码和让CPU跑运算的物理时间。两天时间足够了。”
“真不愧是数学天才!计算机天才!真厉害啊!”
顾明教授兴奋地说道,双手用力搓了搓。
“咱们实验室要是能把这个耐旱的内核基因敲定下来,绝对能再发一篇高水平的《Nature Counications》或者子刊。这对于咱们生科院来说也是大成绩!”
两个学长也是满脸佩服地看着赵阳。别人看着头皮发麻的TB级数据,在赵神嘴里,就象是做一道普通的初中数学应用题一样轻松。这就是智商上的绝对碾压。
“行,那今天下午你们先把数据整理一下拷进移动硬盘里。后续如果有需要做凝胶电泳、PCR或者提质粒的湿实验操作,我也会参与。”
赵阳说道。他没有忘记自己来实验室的根本目的。做真实的生化实验是可以获取生物学经验的,赵阳绝对不会放过这些刷经验的机会。
“没问题。湿实验这块让顾青带你熟悉流程,她现在是咱们实验室这批人里手法最稳的。你跟着她学,上手最快。”
顾明教授直接安排道。
组会开得很短,也很高效。确定了方向和分工后,大家便散会了。
赵阳跟着顾青走出了会议室,回到了实验室外部的操作台前。
“那几个TB的测序数据都在那台数据服务器的硬盘里,文档太大,拷贝出来大概需要两个多小时。”
顾青指了指角落里的一台主机。
“趁着拷贝数据的这个时间,我先带你熟悉一下目前的实验流程和最近的一批样本吧。”
“好。”
赵阳点点头,顺手从旁边的衣架上拿了一件崭新的白色实验服穿上,将扣子扣好。
顾青看着穿上白
本章未完,请点击下一页继续阅读>>『加入书签,方便阅读』
上一章
目录
下一页