人类基因组计划,到底用了谁的基因组?
人类基因组计划与曼哈顿原子弹计划、阿波罗计划一起,并称为二十世纪自然科学史上“三计划”,但是,发生在世纪之交的人类基因组计划无论是从深度、广度还是后续的影响,都无愧于史上最伟大的科学工程和人类协作(之一)。
虽然大名鼎鼎,但是普通人谈起它,总有种“知道了又没完全明白”的感觉,比如在这篇推送(《生物书上一笔带过的这个计划,远比你想象的烧钱》)的评论区就有读者提出了如下问题:
所以我们还是单独开一篇,来讲一讲这个伟大计划的细节和背后的一些事情。
计划的伊始
1977年,桑格、吉尔伯特等人发明了DNA测序技术,人类首次有了读懂DNA这由ATGC四种碱基组成的天书的能力,再加上PCR技术的发明(点这里看PCR是啥),科学家纷纷开始了对基因的检测。
这个时候,他们遇到了一些问题。
首先是标准参考的问题。人的基因是ATGC组成的,这些序列上的变化就是变异或者突变,而生物的性状差异、疾病发生等很大程度和这些变异有关。那么问题来了,到底谁是正常谁是变异呢?在没有一个标准之前,科学家是无法给出这个结论的。
其次,基因命名非常混乱。当时,人们并不清楚人类到底有多少基因、这些基因到底有什么功能,甚至这些基因的序列到底是什么样子都不清楚。那个时候基因命名完全取决于测序者的研究内容和角度。比如BRCA1基因,这个命名是来自于乳腺癌,但是它的另一各名字叫PPP1R53,意思是蛋白质磷酸化调节亚基,它还有另一个名字叫FANCS,来源于范可尼贫血病。在当年计算机技术尚不发达且缺乏统一数据库的情况下,可以想象多少精力和财力被浪费了。
至于对基因的定位、解读基因、遗传进化分析乃至更多的应用,更是无从谈起,因此亟需构建一个人类的标准参考基因组(需要指出的是,这里的标准并非我们通俗理解的准则和规范,更不能理解为完美等,更确切的说,是建立这个参考基因组之后,大家都以它为基础参考的意思,因此这个参考基因组后来也更新了很多次)。
1985年,加州大学圣克鲁斯分校组织了一次著名的研讨会,科学家们集中讨论了利用测序技术来构建参考基因组的可行性。随后圣达菲研讨会、冷泉港研讨会等一系列顶级科学家参与的研讨不断推动着构建参考基因组计划的前行。特别是圣达菲研讨会让这个伟大计划走向了由官方资助的路线,人类基因组计划的人力、财力和物力支持得到了保障。最终在1990年,这项雄心勃勃的计划正式获批,预算高达30亿美元。
当然,如此宏大的科学计划自然离不开国际间的合作,英国、法国、日本、德国和中国先后加入到这项计划,形成国际人类基因组测序联盟(IHGSC)通力合作开展。
路线和技术之争
人类基因组计划是由多国科学家共同共建的,到底是怎么构建的呢?
首先是对人类基因组进行分包,各自承担一部分,有的是团队形式分担,也有的是以国家形式承担,比如我国就承担了3号染色体的短臂上一部分30Mb的序列。
然后就是将基因组进一步分割成更小的约为150Kb的片段,然后将其连接到细菌人工染色体上进行复制来分别扩增,这样既可以让工程难度降低又可以按照分割来区分先后顺序以便最终的组装。
接下来就是测序了,在这方面,人类基因组计划团队选择的主要方法是一代测序技术。
这种技术是怎么进行的呢?这是一个非常精妙的设计,为了方便理解,我们将测序和PCR技术联合起来讲解一下。
DNA的基础单元是脱氧核糖核苷酸,它的结构如下图所示,
四种脱氧核糖核甘酸dATP、dTTP、dGTP、dCTP,统称为dNTP或者碱基
这其中有两个很关键的结构,那就是羟基和磷酸基团。DNA之所以能形成一条链,就在于核苷酸的羟基和另一个核苷酸的磷酸基团结合从而连接起来。PCR就是利用了这种思路,在引物引导下让核苷酸挨个连接到引物之后形成完整的DNA。
如果发生一点变化,比如,我们将核苷酸上这个羟基进一步脱氧让它变成双脱氧核苷酸(ddNTP),这个化学反应就没法完成了,于是DNA就没法延续下去,这就是一代测序的核心原理。桑格测序就是利用这个原理来完成DNA测序,而后来进一步发展出来的链终止技术极大的简化了这个过程,它利用了电泳技术加上荧光标记技术来进行。
这个方法的步骤如下:
在进行测序PCR的时候,科学家会加入DNA模板、引物、聚合酶以及dNTP和ddNTP。
可以想象,随着扩增,DNA会因为ddNTP的加入被随机终止掉,形成大小不一的DNA片段,最终形成了“引物+第一个核苷酸”一直到“引物+全部核苷酸”的所有片段。
然后,采用一种名叫毛细管凝胶电泳的技术来将DNA片段进行分离。分离的原理也很简单,DNA分子是有电荷的,总的电荷量和DNA的长度有关。将DNA加入到用琼脂糖制作的凝胶中,然后给与电压,于是DNA就会在电流推动下移动,就像在凝胶中游泳一样,这就是电泳的名字来历。不同长度的片段移动速度有差异,于是DNA就根据大小分开了。
接下来,科学家们创意地给ddNTP加上了荧光标记,比如ddTTP标记为红色,ddCTP标记为蓝色,ddATP标记为绿色,ddGTP标记为黄色等(这个并非绝对,也有其他标记色,主要是为了区分)。根据荧光颜色就可以推测出终止位置到底是哪种碱基,如果是红色荧光那就是T,如果是蓝色荧光那就是C。
这样一来,在电泳和荧光的辅助下,我们就能够读出所有片段的最后一个碱基。
而所有的DNA都是来自于同一个模板扩增,起始是共同的引物序列,接下来是随机终止,于是在足够多的重复之下,我们就可以得出每一个位置的碱基信息。
通过这种简单巧妙的设计,科学家就可以非常精准地获得DNA的序列,而且这种技术的保真度非常高,所以直到今天依然采用。当然,这种技术也有些问题,那就是,测序长度不会特别长,一般也就是800-1000个碱基对。想象一下,人类基因组有30亿个碱基对,这样一段段测下去,无论是成本还是工作量都是非常大的。在官方资助下、6国科学家齐心协力、耗费了27亿美元花了十多年才完成。
而就在官方协力的人类基因组计划进行过程中,1998年,一个叫文特尔的科学家和他私人公司开启了一项私人资助的探索,他们决定采用一种叫做全基因组霰弹枪定序法(也叫鸟枪法)的技术来测定基因组。这项技术顾名思义就是把基因组像用霰弹枪一样打成随机的小片段,然后用链终止法给所有这些片段进行测序。接下来,利用先进的计算机对这些碎片进行拼接来形成完整的基因组。
相比于一条一条染色体、一段一段序列分别测绘的办法,这种技术更加快捷也更加廉价,以至于仅仅花了两三年的时间就完成了国际合作花了十多年时间才搞定的基因组,并且花费不到国际团队的十分之一。这种技术后来也为二代测序技术的诞生提供了很好的参考。
当然我们必须指出,鸟枪法并不是完全凭空进行,它的完成还是利用了官方团队提供的基因组图谱,而且也存在一些问题,比如高度重复序列导致的计算错误等。
总体上,这两种技术是有互补的,对于人类基因组的总体完成是共同成就的。
当然,人类基因组计划绝非简单的测序,还包括了很多内容。
比如,基因组的物理图谱绘制,通俗的理解就是这些测序片段的排列和间距信息。这是一个非常基础的问题,甚至可以说是测序的先行步骤。比如,人体46条染色体也就是22+XY,哪条染色体归哪个团队,这先要分开。然后具体某一条染色体,再进一步划分像我们上面提到的搁在细菌人工染色体上进行复制。这个时候的先后顺序还是比较明确的,当我们进一步分割的时候,需要使用一种叫做酶切的技术,不同的酶可以识别不同的切割位点,这样就可以确定酶切开的两个片段的先后顺序,不仅如此,通过不同的酶,我们还能构建出不同的切割方式,而这些切割方式之间会有重叠的部分,于是我们就能够还原它们的位置了。
再比如,基因的识别和注释,这就需要借助非常专业的分子生物学知识。得益于许多科学家对基因的研究,我们已经一定程度上可以从DNA的序列上来判断出哪些片段是基因,比如含有CAAT、TATA的启动子区域、真核生物ATG开始的起始密码子、外显子、内含子、终止密码子、回文序列组成的转录终止点等,这一系列都可以让我们更好地识别基因。当然,识别基因后,对这个基因进行说明、注释等自然是少不了的。
因此人类基因组计划的工作量是非常大的,耗费了许多人财物才完成。
那些无名的贡献者
可能有人会好奇,人类基因组计划,自然是要用人的基因组,那到底用的是谁的DNA呢?
答案是不完全清楚,但是,有一点很明确,那就是,绝对不是某一个单独个体的DNA。
国际合作用的基因组是来自于公共捐赠者的样本,并且做了保护处理,所以我们不清楚到底是谁的样本。而文特尔私人的测序DNA则是来源于纽约的一名男性匿名捐赠者,后来文特尔在给Science的公开信里提到,他还把自己的DNA用于基因组测序,可能这是我们唯一比较明确到个人的捐赠信息。
不过,在最初进行HGP工程的时候,原则上,同一段DNA区域,我们只选择一个个体来源的DNA,这样就可以避免选择哪个做参考基因组的困难。因此,我们可以认为,人类参考基因组其实是多个个体的基因序列拼起来的,但是在每一段上是唯一的。至于后来测的那些DNA序列,那就用来和这个组装好的参考基因组进行比较啦,相同的就不用管了,不同的,我们就称之为变异,并且形成了一个变异数据库比如dbSNP。
在这里我们可以看到分布在全人类基因组上密密麻麻的变异,有常见变异也有罕见变异,有单个碱基的变异也多个碱基片段的插入、缺失、微卫星乃至结构变异。我们的生物学差异无论是身高、外貌还是疾病、健康都和这些位点息息相关。
值得一提的是,尽管在我们语境下往往会把变异倾向于有感情色彩的理解,但是在生物学上并非如此,以单个碱基变异为例,我们更倾向于称之为单核苷酸多态性,例如某个位点在人群中既存在A又存在C等,但是这些并不能确定哪个是好哪个是坏,甚至更多的情况下,它们只是单纯的中性的多样性。所以现在也有无数的科学家在对各种位点情形通过各种各样的实验来进行探究,来探讨这些变异到底对我们人体有什么影响。
HGP虽然在2003年宣布完成,其实基因组的测序远没有完成。
首先,基因组并不完整。
囿于当时的技术限制,有不少区域是没有测通的(看这里),科学家需要不断解决重复序列的问题。直到2023年底,人类才最后把Y染色体的重复序列解决了。不仅如此,对基因的分析也在进行,包括后续关注到的非编码区域等都加深了人们对基因组的认知。
其次,基因组的多样性问题。
尽管人类基因组计划采用了多个样本进行检测,但是相对于人类这个数十亿的群体来说,实在是太少了。人类经过长期进化适应,形成了非常丰富的多样性。不同肤色、不同长相、乃至不同族群的人,他们的基因都有很大的差异。科学家需要进行更多的人类基因组测序,才能进一步形成对人类基因组的多样性认知,这也是后续开展的泛基因组项目,比如千人基因组计划、万人基因组计划等。在这期间,无数人为丰富人类基因组的多样性提供了支持,让我们可以更好地了解人类基因组,挖掘基因功能,解析基因变异,推动人类疾病研究等。
现在,对人类基因组的检测依然还在进行中,既有对基因和生物性状的关联研究,也有对人类起源、进化、迁徙的研究,更有对疾病和基因的研究和医疗推动、药物研发,随着研究的深入,基因组作为遗传信息的核心载体,也必将为人类的进步带来更大的贡献。