人和动物的DNA没有一个合用于所有物种、所有钻研的统一匹配率。推算时,必须先注明比力的是哪些DNA片段,以及“匹配”按什么规定计数。若比力的是对齐后的碱基序列,常用口径是“一样碱基数÷参加比力的碱基数×100%”;若统计的是双方有几多基因能找到对应基因,得到的则是基因对应比例,不能直接称为整套DNA的匹配率。
先确定统计口径:比碱基,还是比基因
碱基序列一致率比力的是DNA序列中的A、T、C、G。将两段可比序列分列对齐后,逐位统计一样碱基,了局反映所选序列在该口径下有多一致。它适合描述特定基因、特定区域,或经过筛选后可能相互比力的基因组区域。
基因对应比例则统计一方的基因中,有几多能在另一方找到同源或对应基因。它回覆的是“有几多基因能够找到对应对象”,并不暗示这些基因的碱基有同样比例齐全一样。即便无数基因都能找到对应基因,具体序列仍可能存在不少差距。
此表,序列一致率、序列覆盖领域和基因对应比例是分歧指标。覆盖领域暗示有几多序列成功进入比力;一致率暗示进入比力的序列有几多地位一样。只汇报一个百分比而不交代指标,容易把分歧寓意混为一谈。
碱基匹配率的推算步骤
- 确定比力对象。写明显动物物种,以及比力的是某个基因、某段DNA,还是基因组中经过筛选的区域。“人和动物”领域太宽,分歧物种的了局不能共用一个数值。
- 选定可比序列。必要找出两者中可能对应比力的同源区域,并用序列比对将相应地位分列起来。若把无法对应的区域、沉复序列等纳入或排除,推算了局会产生变动。
- 划定缺口若何计数。插入或缺失会让比对了局出现空位D芄恢煌臣扑蕉加屑罨牡匚,也能够把含空位的地位视为不匹配并纳入分母。两种做法都能推算,但必须明确注明选取哪一种。
- 按公式推算并汇报领域。注明一样地位数、分母若何确定,以及序列覆盖领域。若多个片段长度分歧,通常应汇总一样碱基总数和可比地位总数后推算,不能不加权地单一均匀每个片段的百分比。
公式:碱基一致率=一样碱基地位数÷纳入统计的比对地位数×100%。
示例:缺口规定分歧,百分比也会变
如果某段人类DNA与一种动物的对应序列比对后共有1000个比对地位,其中50个地位含有插入或缺失,剩下950个双方都有碱基的地位中,有870个碱基一样。
- 若排除含缺口的地位:870÷950×100%≈91.6%。
- 若把全数1000个比对地位都放入分母,并将含缺口地位视作不匹配:870÷1000×100%=87%。
两个了局来自统一组比对数据,差距在于分母口径,而不是DNA忽然变得更类似或更分歧。现实钻研还必要交代所用物种样本、基因组版本、筛选规定和比对领域,读者能力判断百分比具体代表什么。
怎么对待“人和狗DNA匹配率约84%”
单独看到“约84%”无法判断它是全基因组碱基一致率、某类基因的对应比例,还是对特定区域进行比对后得到的了局。若没有指出比力序劣注推算步骤和分母,就不能把它当作人和狗整套DNA的固定匹配率。类似数字可能描述的是某一钻研口径,不应直接套用于其他物种或其他统计方式。
因而,引用人和狗,某人和其他动物的类似度数据时,最好同时查看三个信息:比力的对象是什么、百分比怎么算、覆盖了哪些序列。若是资料只写“DNA类似度”而没有这些注明,更稳妥的做法是把数字视为口径未明的概括,不据此揣度两种生物整体有几多DNA齐全一样。
让了局可比力的汇报方式
一个明显的了局至少应写明物种和数据起源、比力区域、序列比对与筛选规定、缺口处置方式,并别离给出一致率和覆盖领域。若统计的是基因,则应称为“基因对应比例”或明确注明所用基因集中;若统计的是碱基,则使用“序列一致率”,并交代分母。这样分歧钻研的数字才有比力基础,也能预防把部门基因了局误读成整套基因组的统一比例。
简言之,人和动物DNA匹配率的推算主题不是寻找一个通用百分比,而是先确定可比序列与计数口径,再按一样碱基数除以纳入统计的地位数?诰见飨,数字才有明确寓意。









Android版
iPhone版