基因编辑技术被发现数十年后,首批基于该技术的疗法正逐步走向临床应用。然而,安全性问题始终是这一领域面临的重大挑战。尽管我们已能将编辑操作精准定向至目标基因,但人类基因组体量庞大,即便是极为罕见的DNA序列,也可能在基因组中偶然出现多次。
正因如此,所有早期基因编辑系统都存在已知的"脱靶效应"——即对错误序列发动编辑。这类事件发生的概率虽低,但一旦需要编辑大量细胞(而治疗方案通常确实涉及大量细胞),错误的出现便几乎不可避免。
围绕如何最大程度地减少乃至消除脱靶编辑,学界已投入大量努力。近期发表于《自然》杂志的一项研究中,研究人员描述了如何对AI蛋白质折叠软件AlphaFold进行改造,以识别基因编辑蛋白中导致脱靶效应的关键区域,并对这些区域加以修改,从而降低相关风险。
基因编辑系统的三大核心组件
基因编辑系统由三个核心组件构成。
第一个组件是向导RNA,它能够与目标基因组序列发生碱基配对。针对同一基因,可以设计出多种向导RNA。因此,提升系统安全性的一个思路是:优先选择与基因组其他位置相似度极低的序列。这一策略目前已作为基因编辑系统基础设计流程的标准步骤被广泛采用。
第二个组件是Cas蛋白,以CRISPR系统中的Cas9蛋白命名。它同时与向导RNA和基因组RNA相互作用,帮助维持相互作用的特异性。
当RNA与DNA之间的碱基配对出现过多错配时,Cas9(或其他Cas家族成员)便无法稳定结合。借助多种改造手段,研究人员已开发出脱靶倾向更低的改良版Cas家族蛋白。
第三个组件是在Cas9结合DNA后与其相互作用、并对DNA进行修改的蛋白质。在最初的CRISPR系统中,该蛋白会切断双链DNA的两条链,产生难以精确控制的损伤。此后,研究人员对其他蛋白质进行了改造,使其能够与Cas9协同作用,催化对DNA更为精细的修改——例如切除单个碱基,或进行影响碱基配对方式的化学修饰。
脱靶问题为何难以消除
总体而言,向导RNA与基因组之间的碱基配对长度约为18个碱基。从统计学角度来看,这样的序列在随机DNA中平均约每700亿个碱基才会出现一次,而人类基因组仅约30亿个碱基,理论上不会造成问题。然而,Cas9实际上能够容忍少量错配碱基,而不丧失与DNA结合的能力。可被容忍的碱基变异数量与具体位置因情况而异,这使得提前判断哪些向导RNA可能存在风险变得十分困难。
提升安全性的一条路径,是更深入地理解脱靶相互作用的发生机制。
AlphaFold如何助力改造蛋白质
这项研究的团队来自中国多家机构,他们提前对研究思路进行了系统推演。完全匹配的DNA-RNA杂合体呈现一种结构,而存在一个或多个错配碱基的杂合体则呈现略有不同的结构。进化已将Cas9的结构优化为与前者稳定结合,但显然并未阻止Cas9 采取略有差异的构象,从而与错配结构发生相互作用。
如果能够识别出Cas9中介导这些问题性相互作用的区域,就可以对其进行修改,从而有可能将其阻断。
研究团队的第一步是构建一个大规模脱靶编辑位点库。他们采用了一种改良版CRISPR系统,该系统能够将DNA碱基腺嘌呤转化为相关化学物质肌苷,随后分离出含有肌苷的DNA片段。他们使用10种不同的向导RNA重复这一流程,并对每种向导RNA产生的大量修改DNA片段进行分析,从而全面呈现脱靶序列的类型分布。
Q&A
Q1:AlphaFold在基因编辑研究中是如何被应用的?
A:研究人员对AI蛋白质折叠软件AlphaFold进行改造,用于识别基因编辑蛋白中导致脱靶效应的关键区域。通过分析完全匹配与存在错配的DNA-RNA杂合体的结构差异,研究团队得以定位Cas9蛋白中介导脱靶相互作用的具体部位,并对这些区域进行修改,从而降低脱靶风险。
Q2:基因编辑的脱靶效应是什么?为什么难以完全避免?
A:脱靶效应是指基因编辑系统对错误的DNA序列发动编辑。理论上,18个碱基的向导RNA序列在人类基因组中应该是唯一的,但Cas9蛋白能够容忍少量碱基错配并仍然与DNA结合,且可容忍的错配数量和位置因情况而异,导致哪些向导RNA存在风险难以提前判断。编辑细胞数量越多,错误发生的可能性越大。
Q3:研究团队是如何构建脱靶编辑位点库的?
A:研究团队使用了一种改良版CRISPR系统,该系统能将DNA碱基腺嘌呤转化为肌苷,再通过分离含肌苷的DNA片段来锁定脱靶位点。他们使用10种不同的向导RNA重复这一流程,并对每种向导RNA产生的大量修改DNA片段进行分析,最终构建出能够全面反映脱靶序列类型的大规模位点库。
