Project title
虚拟细胞赋能蛋白高效表达
T5 虚拟细胞毕赤密码子优化生成指标对照
TJU-Pichia 比较模型生成和规则优化两条密码子优化路线,用同一套指标评估差异,并据第一轮结果确定下一轮约束。
- Team name
- TJU-Pichia
- Institution
- 天津大学合成生物与生物制造学院
Images and videos related to participating teams are used only for event showcases and reporting. Portrait rights belong to the individuals concerned. If you have any objection to the use of portraits, please contact the organizing committee through Contact us. We will verify the matter and take appropriate action.
项目背景
毕赤酵母密码子适配问题
乳铁蛋白在婴幼儿食品和保健品领域需求旺盛,但天然提取产量有限。毕赤酵母是常用的乳铁蛋白表达宿主,但其密码子偏好与乳铁蛋白天然编码序列存在差异。同一个氨基酸可以由多个密码子编码,而每种宿主对这些同义密码子的偏好不同。毕赤酵母的密码子使用偏好与乳铁蛋白差异显著,导致产量低、稳定性差。密码子优化在不改变蛋白氨基酸序列的前提下,使编码序列适配宿主表达偏好。传统做法是规则替换:查出宿主最偏好的那个密码子,逐位换上去。项目引入序列生成模型,以同时考虑密码子偏好、序列长度与表达约束。
研究路径
模型生成与规则优化对照
第一轮 DBTL 设置模型生成与规则优化两条对照路线。opt1_model_based:把同一条乳铁蛋白氨基酸序列输入 Pichia-CLM 预训练模型,推理生成优化后的 CDS 序列,不加任何后置规则过滤。opt2_rule_based:采用毕赤酵母经典的高频密码子替换规则,逐位替换。两条路线使用同一套指标与计算脚本进行对照。两套序列使用完全一致的计算代码,批量计算 GC 含量、CAI、ENC、稀有密码子统计与综合评分,消除工具误差;全部计算代码与原始序列 FASTA 文件归档 GitLab。项目团队还预先写下了预期结果 —— 规则优化会拿到更高的 CAI 和综合评分,模型序列更短但密码子多样性极低。
- 目标宿主
- 毕赤酵母
- 对照路线
- 模型生成、规则优化
- 复核指标
- GC、CAI、ENC
项目过程
项目推进与验证路径
- 01
阶段 1
两种优化路线的指标对比
长度上,opt1 是 498 bp,opt2 是 2073 bp。同一条氨基酸序列的两种优化结果,长度差异源于密码子选择策略不同。GC 含量:opt1 全局 33.53%,opt2 为 37.39%。决定性的一组:CAI 0.8011 对 0.905;宿主高频偏好密码子占比 0.6% 对 30.68%;密码子阶段综合评分 31.92 对 76.04。纯 AI 模型自主生成的序列虽然能规避稀有密码子并达到基础 CAI 阈值,但未能充分贴合毕赤酵母内源密码子使用偏好;传统规则优化牺牲了序列长度,却大幅提升了各项核心指标。两组唯一打平的地方是稀有密码子 —— 都是 0,都能规避翻译提前终止的问题。 - 02
阶段 2
模型生成与约束筛选融合
Learn 阶段比较两条路线:模型生成序列较短、GC 较低,规则优化的密码子适配度更高;下一轮将融合模型生成与多约束筛选。下一轮将搭建模型生成与多约束后置筛选的融合管线。第一轮的失败,直接定义了第二轮的结构。 - 03
阶段 3
跨学科协作与模型调试
做算法的同学一开始和做实验的同学思路很难对齐,后期实验数据也一直达不到预期。团队采用坐在一起讨论、梳理问题、分工试错,一点点磨合。
项目证据
项目图表与方法记录
团队协作
计算、实验与候选复核记录
Team films
