Project title
Yeast promoter designAI-driven closed-loop optimization
T4 基础科学解脂耶氏酵母荧光与交叉验证
ProMeta 训练四路启动子强度预测器,并用内部交叉验证和两个外部数据集比较单模型、stacking 与简单平均的泛化表现。
- Team name
- ProMeta
- Institution
- 大连理工大学生物工程学院
Images and videos related to participating teams are used only for event showcases and reporting. Portrait rights belong to the individuals concerned. If you have any objection to the use of portraits, please contact the organizing committee through Contact us. We will verify the matter and take appropriate action.
队伍口号
“读懂序列,设计精准基因开关 ”
项目背景
开关,和调速器
启动子就像基因表达的「开关和调速器」,决定细胞中某个基因何时启动、表达多强。两个词都要。开关管有无,调速器管强弱 —— 而代谢工程真正需要的是后者:一条通路上不同酶的表达量得配比得当,多一分堆积、少一分断流。所以这个项目的目标不是「找到一个强启动子」,而是队伍写在最后的那句:获得一批强度梯度明确、序列多样、便于应用的调控元件。强度梯度明确,是为了能挑;序列多样,是为了同时用多个时不会因同源重组而失稳;便于应用,是为了真的能装进载体。
研究路径
四路模型,先在内部比一轮
团队在同一核心数据集上比较四路启动子强度预测器,统一采用 5 折折外预测(OOF)。CNN 集成、LSTM/GRU 集成、DNABERT2-W29 与 Stacking 的 Pearson R 分别为 0.5290、0.5370、0.5030 和 0.5658。Stacking 的二级学习器仅使用基础模型的折外预测结果,避免将训练集拟合值混入集成评估;这些内部比较结果仍需通过独立外部数据检验泛化表现。
- 底盘
- 解脂耶氏酵母
- 外部验证集
- n=82、n=85
- 生成模型
- WGAN
项目过程
项目推进与验证路径
- 01
阶段 1
外部数据集上的模型比较
团队在两个外部数据集上比较内部最强的 Final stacking 与三个基础模型简单平均(Base3 平均)。Literature-82 上,Base3 平均与 CNN、DNABERT 的 Spearman ρ 均为 0.60,Final stacking 为 0.57;Kendall τ 分别为 0.43 和 0.41,不一致对比例分别为 0.29 和 0.30。Wang2023-rescued85 上两者 Spearman ρ 分别为 0.46 和 0.45。两个外部数据集都未显示 stacking 优于简单平均,因此团队把外部验证与内部排序分开报告。 - 02
阶段 2
生成这一侧:3360 条,筛到 42 条
预测器之外,另一半是生成。项目团队用 WGAN 按目标强度生成候选序列,然后一层层筛。漏斗图把每一层的数量都标了出来:原始生成 3360 条 → 通过格式与打分输入 3222 条 → 由冻结模型打分 3222 条 → 每个目标取 Top100,合计 700 条 → Top30,210 条 → Top6,42 条。如果打分器跟着生成器一起更新,生成器很容易学会去骗打分器,而不是真的写出好序列。另外两张图分别检查生成器听不听话:一张看设定的目标强度与生成候选的平均预测强度是否跟得上,另一张看 GC 含量与预测强度的关系,并按两种过滤口径(balanced_only 与 strict_safe)分色。 - 03
阶段 3
模型、生成与实验如何衔接
工作分为模型训练与集成、候选启动子生成、实验推进和数据回流。干实验侧负责文献、模型和候选筛选,湿实验侧负责 DNA 合成、荧光验证及实测强度与预测值对照,总体统筹负责项目设计和进度衔接。
项目证据
项目图表与方法记录
团队协作
