队伍名称
NJTech-SynCAR
SynCAR丁二胺合成关键酶改造融合半理性设计与 AI 闭环进化,提升羧酸还原酶 MAB2962 对 GABA 的催化效率
南京工业大学生物与制药工程学院T3 生物制造
项目名称
SynCAR丁二胺合成关键酶改造
T3 生物制造羧酸还原酶改造酶活与交叉验证
南京工业大学 NJTech-SynCAR 盯着羧酸还原酶(CAR):先用半理性设计筛出优秀变体,再把突变位置、方式和酶活数据交给蛋白质语言模型学习,让它预测下一批更有潜力的方案。
- 队伍名称
- NJTech-SynCAR
- 所属院校
- 南京工业大学生物与制药工程学院
参赛队伍相关影像仅用于赛事展示与报道,肖像权归本人所有。如对肖像使用存在异议,请通过 联系我们 向组委会反馈,我们将核实情况并作相应处理。
项目背景
先说清楚 CAR 是干什么的
酶就像大自然提供的「高效催化剂」,能让工业生产更快、更环保。它的本事是把羧酸转化为醛 —— 而醛类化合物是医药、香料和新能源领域的常用原料。这条路线在技术路线图上画得很清楚:L-谷氨酸 → γ-氨基丁酸(GABA)→ 1,4-丁二胺。最后那个 1,4-丁二胺,是尼龙-46 等聚合物的单体,目前主要靠石化路线生产。把它换成生物制造,卡点就落在中间这一步的酶效率上。队徽把这件事变成了一个双关:CAR 三个字母被拼成一辆车,车身是 DNA 双螺旋。
研究路径
两条腿:先半理性,再交给模型
路线图的第一个模块是半理性设计 —— 序列分析、结构预测、构建突变库,用传统方法先拿到一批可靠的数据点。第二个模块才是 AI。把突变位置、方式和酶活性等数据交给人工智能学习,AI 总结规律、预测更有潜力的改造方案,再通过「实验—学习—再设计」的循环不断进化。顺序在这里是有意义的。蛋白质语言模型需要有标注的活性数据才能微调,而这批数据只能来自实验台。所以不是「AI 先给答案、实验去验证」,而是先有一轮实打实的半理性筛选,模型才有东西可学。复筛结果图就是这批数据的样子:几十个突变体按 PSSM 归一化后的表现排序,从最高一路排到最低。
- 目标酶
- MAB2962
- 改造位点
- 342、514、281、420
- 模型底座
- ESM2(35M、150M、650M 比选)
项目过程
项目推进与验证路径
- 01
阶段 1
位点是这么一个一个试出来的
柱状图记录了 342 位单点突变,以及以 D281P 为亲本继续组合 514 位突变的实验比较。部分突变体的细胞催化活力高于相应亲本。 - 02
阶段 2
模型选型是比出来的,不是挑出来的
底座是 esm2_t33_650M_UR50D,33 层,隐藏维度 1280;冻结 0–21 层(共 22 层,占 66.7%),总参数 651.0M,其中可训练 218.1M。训练集 105 条、测试集 35 条,做四折交叉验证。四折的 Spearman 相关系数分别是 0.618、0.705、0.455、0.227。两组数放在一起看,信息量比任何一个单独的数字都大:折与折之间的方差很明显,说明在这个数据量级上,结果对数据划分相当敏感。
项目证据
项目图表与方法记录
团队协作
计算、实验与候选复核记录
故事节点
项目过程与团队记录
屏幕上的另一半:结构与接触
一张里,左边是蛋白的三维结构(蓝色卡通模型),右边是残基间的接触热图,两者并排;另一张是同一套界面的深色模式,下方带着一张数据表。还有一张是代码:把 Excel 里的突变记录解析成结构化数据 —— 用正则把「A123B」这样的写法拆成位点与替换氨基酸,单点与双点突变分开处理,活性值逐条对上号。这类脚本不出现在任何成果图里,但它决定了模型到底吃进去了什么。
从单个突变体到平台化 CAR 设计
路线图的第三个模块叫平台化 CAR 设计:CAR 通用突变、知识迁移、SynCAR 平台。改一个酶,做完就结束了;让模型学会改一类酶,意味着这次积累的突变—活性数据、这套微调流程、这份可迁移的设计流程,本身就是产出。第四个模块列出了预期目标:高活性羧酸还原酶变体、AI 驱动的 CAR 设计能力、丁二胺绿色制造、可迁移的设计流程、更低成本的 CAR 反应。到那时,这套平台需要拿出的不只是一个更好的数字,而是它确实迁移过一次的证据。
