“人类与猪的基因类似度”没有一个脱离推算步骤的固定百分比。若比力的是整段DNA碱基,得到的是序列一致性;若比力的是两种动物占有几多对应基因,得到的是基因集中沉合度;若比力蛋白质编码区,还可能得到另一组了局。因而,先注明比力对象、分母和统计领域,再谈百分比,才不会把分歧口径混在一路。
人类与猪的基因类似度,先要看“类似”按什么算?
人类和猪都属于哺乳动物,占有大量起源一样或职能相近的基因;蚶嗨,不蹬宗两种动物的整套DNA逐字一样,也不蹬宗表形、器官或行为齐全一样。常见的推算对象重要有以下几种。
| 比力对象 | 重要公式 | 它现实注明什么 |
|---|---|---|
| 对齐后的DNA碱基 | 一样碱基数÷有效对齐碱基总数×100% | 两段可比序列逐位有多一样 |
| 对应基因数量 | 共同嫡系同源基因数÷选定物种的基因总数×100% | 两种动物占有几多组可对应的基因 |
| 蛋白质编码区 | 一样氨基酸地位数÷有效对齐地位数×100% | 基因编码出的蛋白质序列有多相近 |
| 基因集中沉合度 | 共同基因数÷两物种基因并集×100% | 以双方共同占有的基因占全数分歧基因的比例衡量 |
其中,“共同基因”不能只看基因名称是否一样。更严谨的做法是判断两个基因是否来自共同祖先,并结合序劣注地点地位和职能进行匹配,这类对应关系通常称为嫡系同源关系。一个基因在两种动物中都存在,只能注明基因层面有对应关系,不能直接注明两段DNA的每一个碱基都一样。
确定了推算口径,具体应该怎么算?
- 先确定比力单元。要明确是整条基因组、某一批基因、蛋白质编码区,还是某个具体基因。没有单元的“类似度”无法复核。
- 统一数据版本。人类和猪的参考基因组会更新,基因注解也可能变动。应纪录参考基因组版本、基因数量统计领域和是否排除未定位片段。
- 成立可比区域。对DNA或蛋白质序列进行序列比对,只把能够靠得住对应的区域放入统计。沉复序劣注缺口、无法确认的碱基,必要提前划定若何处置。
- 推算匹配数量。DNA比力中统计一样碱基;蛋白质比力中统计一样氨基酸;基因层面则统计通过同源关系确认的对应基因对。
- 选定分母并套用公式。统一批数据,使用人类基因总数、猪基因总数或两者并集作为分母,了局可能分歧,所以分母必须写出来。
- 连同领域汇报了局。齐全了局应蕴含“比力对象、样技巧域、分子单元、分母、缺口处置方式和百分比”,而不是只给一个孤立数字。
例如,若钻研者想推算某段可对齐DNA的碱基一致性,能够使用:
DNA一致性 = 对齐区域中一样碱基数 ÷ 纳入统计的有效对齐碱基数 × 100%
若两段序列对齐后共有10000个有效地位,其中8200个地位的碱基一样,那么该区域的一致性就是8200÷10000×100%=82%。这个数字只代表这段被选中并成功对齐的DNA,不代表人类和猪全数基因组的总体类似度。
用一个示例,为什么统一对物种会得到分歧百分比?
如果某项基因注解统计拔取人类和猪各20000个已确认蛋白质编码基因,其中有18000对被判定为嫡系同源基因。若以人类基因总数为分母,推算了局为:
18000÷20000×100%=90%
若是改为以两物种共同基因占“全数分歧基因”的比例推算,两个物种的基因并集为20000+20000-18000=22000个,了局则是:
18000÷22000×100%≈81.8%
这两个了局并不愿定相互矛盾,而是回覆了分歧问题。前者更靠近“人类基因中有多大比例能在猪中找到对应物”,后者则回覆“双方所有分歧基因中,有多大比例是共同的”。若是再改成比力这些基因的DNA序列或蛋白质序列,百分比还会持续变动。
同理,“某些基因的职能在人和猪之间高度守旧”与“人和猪的全基因组有某个固定百分比一样”也不是统一个命题。细胞割裂、能量代谢、免疫调节等根基性命过程涉及的基因,往往更容易在分歧哺乳动物之间找到对应关系;但基因的具体序劣注调控区域、拷贝数量和表白功夫仍可能存在显著差距。
看到一个百分比时,怎么判断它算的是什么?
遇到“人类与猪的基因类似度为某个百分比”的说法,能够按以下挨次阅读:
- 看比力对象:是全基因组、编码区、单个基因,还是共同基因数量。
- 看分子单元:统计的是DNA碱基、基因数,还是蛋白质氨基酸。
- 看分母:是人类一方的总量、猪一方的总量、对齐区域总量,还是双方基因并集。
- 看是否蕴含缺口:有些推算只统计成功对齐的地位,有些推算会把插入、缺失纳入差距。
- 看数据领域:某个基因家族或某段染色体的了局,不能直接扩大为整个基因组了局。
若是这些信息没有注明,只给出“人猪基因类似度是百分之几”,通常无法判断这个数字是否可与另一篇资料比力。尤其是把“共同基因比例”直接称为“DNA类似度”,会夸大或误会统计了局。
人类与猪的基因类似杜爪该怎么正确表述?
较稳妥的表述是:人类和猪作为哺乳动物,在很多基因和性命根基职能上存在宽泛的同源关系,但“基因类似度”必须注明统计口径。若会商基因数量,应说“共同嫡系同源基因的比例”;若会商序列,应说“指定对齐区域的DNA或蛋白质序列一致性”;若会商整套遗传物质,则还要注明参考基因组、有效对齐领域和缺口处置规定。
因而,回覆这个问题时不能只写一个脱离高低文的百分比。先确定比力什么、按什么作为分母、统计哪一段、若何处置无法对齐的地位,再代入公式,所得了局才拥有明确寓意,也能力与其他钻研或资料进行平正比力。









Android版
iPhone版