#健闻登顶计划# 【值得高度关注】AlphaFold“涉足病毒蛋白相互作用领域”——数据库新增常见病毒的蛋白复合物!一个几乎涵盖地球上所有已知蛋白质高级结构的数据库正在升级,能更好解析那些研究尚不充分、致死性强的物种——病毒。国际科学权威杂志《自然》对此做了新闻解读。
研究人员向AlphaFold蛋白高级结构数据库新增8000余组病毒蛋白复合物,即发生相互作用的蛋白分子配对。该数据库存储由AlphaFold2人工智能工具生成的蛋白质三维结构,且对公众开放。本次新增数据含23个病毒科,全部可感染人类。此次更新同时在这个应用广泛的免费AlphaFold数据库内上线了一个“疫情防范专题门户”。
今年早些时候,研究人员曾录入来自20种研究较为充分的生物(包括人类、小鼠以及结核致病菌)的170万组蛋白相互作用配对。这是AlphaFold数据库首次收录蛋白复合物。该数据库由总部在英国欣克斯顿的欧洲分子生物学实验室‑欧洲生物信息研究所(EMBL‑EBI)维护。
此前的研究盲区:尽管AlphaFold数据库拥有超300万用户,收录绝大多数已知蛋白的高级结构,但病毒一直是其中的研究盲区。寨卡病毒、登革热病毒等,大量单体蛋白都缺少高质量数据库条目。
造成该现状的原因是:部分病毒复制时,其RNA分子会先翻译生成一种“多蛋白”,之后再被切割成多个具备功能的独立分子。因此,仅依靠病毒基因序列,往往无法判断一个病毒蛋白的起止位点,这就会造成结构预测结果残缺。
为解决该问题,日内瓦瑞士生物信息学研究所的研究人员,梳理出数千种切割自多蛋白的病毒蛋白的精准序列。格罗夫联合全球多家机构的科研人员,一共分析了约2800种病毒的41774个蛋白序列,其中包含猴痘、麻疹、乙肝的致病病毒。
拿到这些序列后,利用AlphaFold2预测出40746组同二聚体(homodimers)以及近170万组异二聚体(heterodimers)。不过其中仅有2749组同二聚体、5279组异二聚体的预测结果达到入库标准,被收录进AlphaFold 数据库。
这些预测结果并未包含修饰在许多病毒蛋白表面的糖分子,而这类糖分子能帮助病毒逃避免疫系统识别。此外很多病毒蛋白的复合物规模比二聚体更大。例如,帮助新冠病毒及其他冠状病毒侵染宿主细胞的刺突蛋白,由三条相同蛋白构成;HIV用于入侵细胞的包膜蛋白同样是三聚体。
下一步很自然的工作就是纳入这类“三聚体”的高级结构预测。但对于规模更大的蛋白复合物,科研人员往往还不清楚每种组分的分子拷贝数量。“实践才是检验成果的标准。把数据公开之后,所有研究人员就可以开展深度挖掘”。
研究启示:预测二聚体或蛋白复合物的高级结构,能更快更准确找到抑制剂,从而强有力的应对新发传染病。这比单个蛋白的高级结构预测显然迈进了一大步!
