项目名称
虚拟细胞赋能蛋白高效表达
T5 虚拟细胞毕赤密码子优化生成指标对照
TJU-Pichia 比较模型生成和规则优化两条密码子优化路线,用同一套指标评估差异,并据第一轮结果确定下一轮约束。
- 队伍名称
- TJU-Pichia
- 所属院校
- 天津大学合成生物与生物制造学院
参赛队伍相关影像仅用于赛事展示与报道,肖像权归本人所有。如对肖像使用存在异议,请通过 联系我们 向组委会反馈,我们将核实情况并作相应处理。
项目背景
毕赤酵母密码子适配问题
乳铁蛋白在婴幼儿食品和保健品领域需求旺盛,但天然提取产量有限。毕赤酵母是常用的乳铁蛋白表达宿主,但其密码子偏好与乳铁蛋白天然编码序列存在差异。同一个氨基酸可以由多个密码子编码,而每种宿主对这些同义密码子的偏好不同。毕赤酵母的密码子使用偏好与乳铁蛋白差异显著,导致产量低、稳定性差。密码子优化在不改变蛋白氨基酸序列的前提下,使编码序列适配宿主表达偏好。传统做法是规则替换:查出宿主最偏好的那个密码子,逐位换上去。项目引入序列生成模型,以同时考虑密码子偏好、序列长度与表达约束。
研究路径
模型生成与规则优化对照
第一轮 DBTL 设置模型生成与规则优化两条对照路线。opt1_model_based:把同一条乳铁蛋白氨基酸序列输入 Pichia-CLM 预训练模型,推理生成优化后的 CDS 序列,不加任何后置规则过滤。opt2_rule_based:采用毕赤酵母经典的高频密码子替换规则,逐位替换。两条路线使用同一套指标与计算脚本进行对照。两套序列使用完全一致的计算代码,批量计算 GC 含量、CAI、ENC、稀有密码子统计与综合评分,消除工具误差;全部计算代码与原始序列 FASTA 文件归档 GitLab。项目团队还预先写下了预期结果 —— 规则优化会拿到更高的 CAI 和综合评分,模型序列更短但密码子多样性极低。
- 目标宿主
- 毕赤酵母
- 对照路线
- 模型生成、规则优化
- 复核指标
- GC、CAI、ENC
项目过程
项目推进与验证路径
- 01
阶段 1
两种优化路线的指标对比
长度上,opt1 是 498 bp,opt2 是 2073 bp。同一条氨基酸序列的两种优化结果,长度差异源于密码子选择策略不同。GC 含量:opt1 全局 33.53%,opt2 为 37.39%。决定性的一组:CAI 0.8011 对 0.905;宿主高频偏好密码子占比 0.6% 对 30.68%;密码子阶段综合评分 31.92 对 76.04。纯 AI 模型自主生成的序列虽然能规避稀有密码子并达到基础 CAI 阈值,但未能充分贴合毕赤酵母内源密码子使用偏好;传统规则优化牺牲了序列长度,却大幅提升了各项核心指标。两组唯一打平的地方是稀有密码子 —— 都是 0,都能规避翻译提前终止的问题。 - 02
阶段 2
模型生成与约束筛选融合
Learn 阶段比较两条路线:模型生成序列较短、GC 较低,规则优化的密码子适配度更高;下一轮将融合模型生成与多约束筛选。下一轮将搭建模型生成与多约束后置筛选的融合管线。第一轮的失败,直接定义了第二轮的结构。 - 03
阶段 3
跨学科协作与模型调试
做算法的同学一开始和做实验的同学思路很难对齐,后期实验数据也一直达不到预期。团队采用坐在一起讨论、梳理问题、分工试错,一点点磨合。
项目证据
项目图表与方法记录
团队协作
计算、实验与候选复核记录
队伍影像
