项目名称
酵母启动子设计AI 驱动的闭环优化
T4 基础科学解脂耶氏酵母荧光与交叉验证
ProMeta 训练四路启动子强度预测器,并用内部交叉验证和两个外部数据集比较单模型、stacking 与简单平均的泛化表现。
- 队伍名称
- ProMeta
- 所属院校
- 大连理工大学生物工程学院
参赛队伍相关影像仅用于赛事展示与报道,肖像权归本人所有。如对肖像使用存在异议,请通过 联系我们 向组委会反馈,我们将核实情况并作相应处理。
队伍口号
“读懂序列,设计精准基因开关 ”
项目背景
开关,和调速器
启动子就像基因表达的「开关和调速器」,决定细胞中某个基因何时启动、表达多强。两个词都要。开关管有无,调速器管强弱 —— 而代谢工程真正需要的是后者:一条通路上不同酶的表达量得配比得当,多一分堆积、少一分断流。所以这个项目的目标不是「找到一个强启动子」,而是队伍写在最后的那句:获得一批强度梯度明确、序列多样、便于应用的调控元件。强度梯度明确,是为了能挑;序列多样,是为了同时用多个时不会因同源重组而失稳;便于应用,是为了真的能装进载体。
研究路径
四路模型,先在内部比一轮
团队在同一核心数据集上比较四路启动子强度预测器,统一采用 5 折折外预测(OOF)。CNN 集成、LSTM/GRU 集成、DNABERT2-W29 与 Stacking 的 Pearson R 分别为 0.5290、0.5370、0.5030 和 0.5658。Stacking 的二级学习器仅使用基础模型的折外预测结果,避免将训练集拟合值混入集成评估;这些内部比较结果仍需通过独立外部数据检验泛化表现。
- 底盘
- 解脂耶氏酵母
- 外部验证集
- n=82、n=85
- 生成模型
- WGAN
项目过程
项目推进与验证路径
- 01
阶段 1
外部数据集上的模型比较
团队在两个外部数据集上比较内部最强的 Final stacking 与三个基础模型简单平均(Base3 平均)。Literature-82 上,Base3 平均与 CNN、DNABERT 的 Spearman ρ 均为 0.60,Final stacking 为 0.57;Kendall τ 分别为 0.43 和 0.41,不一致对比例分别为 0.29 和 0.30。Wang2023-rescued85 上两者 Spearman ρ 分别为 0.46 和 0.45。两个外部数据集都未显示 stacking 优于简单平均,因此团队把外部验证与内部排序分开报告。 - 02
阶段 2
生成这一侧:3360 条,筛到 42 条
预测器之外,另一半是生成。项目团队用 WGAN 按目标强度生成候选序列,然后一层层筛。漏斗图把每一层的数量都标了出来:原始生成 3360 条 → 通过格式与打分输入 3222 条 → 由冻结模型打分 3222 条 → 每个目标取 Top100,合计 700 条 → Top30,210 条 → Top6,42 条。如果打分器跟着生成器一起更新,生成器很容易学会去骗打分器,而不是真的写出好序列。另外两张图分别检查生成器听不听话:一张看设定的目标强度与生成候选的平均预测强度是否跟得上,另一张看 GC 含量与预测强度的关系,并按两种过滤口径(balanced_only 与 strict_safe)分色。 - 03
阶段 3
模型、生成与实验如何衔接
工作分为模型训练与集成、候选启动子生成、实验推进和数据回流。干实验侧负责文献、模型和候选筛选,湿实验侧负责 DNA 合成、荧光验证及实测强度与预测值对照,总体统筹负责项目设计和进度衔接。
项目证据
项目图表与方法记录
团队协作
