MITCE·

AI辅助虚拟筛选如何避免把数据泄漏写成模型突破

高分可能来自相似骨架、批次线索或预处理重复;只有拆分策略与外部验证经得起复查,性能才有迁移意义。

随机拆分会低估化学系列之间的依赖

分子数据不是彼此独立的普通表格行。同一骨架的衍生物共享大量结构特征,随机拆分很容易让近邻同时进入训练和测试。模型因此看见熟悉系列,而不是面对真正未知化学空间。

骨架拆分更严格,但仍需检查不同骨架之间的高相似片段。时间拆分则模拟未来发现过程,可以暴露数据库和实验流程随时间变化带来的漂移。

预处理也可能泄漏测试信息

若在拆分前根据全体数据选择特征、填补缺失或调整阈值,测试集合已经影响训练过程。即使模型代码从未直接读取测试标签,评价仍会偏乐观。

所有会学习数据分布的步骤都应放入训练管线,并只在训练折中拟合。最终测试集在模型和阈值确定前保持封闭。

重复实验记录不能当成独立样本

同一化合物在多个数据库、实验批次或文献中可能重复出现。若没有统一标识,模型会把重复记录视为更多证据,也可能把同一对象分到测试侧。

合并时不能只按名称。盐形式、立体异构和测量条件需要保留,冲突结果也不应被简单平均掉。冲突本身可能揭示实验范围。

指标要匹配真实筛选任务

候选库中活性物通常非常稀少。准确率在高度不平衡数据上几乎没有解释力,早期富集、精确率、召回率与校准更接近实际筛选成本。

选择指标前先写清实验能够验证多少候选、漏掉活性物的代价和误报成本。一个模型不可能同时在所有目标上取得同样优先级。

解释图只能说明模型关注什么

注意力、特征贡献和相似结构能帮助审查模型,但它们解释的是计算决策,不是分子作用机制。模型关注某个片段,可能因为它与实验批次或数据库来源相关。

机制判断仍需结构、结合、细胞和因果扰动等独立证据。可解释模型降低黑箱程度,却不能跨过证据等级。

上线后还要监测数据漂移

研究数据库、供应库和实验条件持续变化。训练时常见的化学空间可能逐渐失去代表性,模型的概率也会失准。

保留输入分布、失败类别和人工复核结果,定期与固定基准比较。更新模型时不能覆盖旧版本,否则无法判断改善来自算法还是测试集合变化。

AI研究任务登记表

下面各项帮助团队把当前判断重新连接到设备、文件或模型条件。实际项目可以删减无关字段,但未知条件应明确标记,不要凭经验补齐。

项目复核理由处理方式
原始数据源原始数据源决定接收者能否还原当前条件,应与原始来源同时保存。缺少原始数据源时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明原始数据源由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
获取日期当获取日期发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一获取日期条件。若两份获取日期无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
许可范围许可范围无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的许可范围会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
化合物标识复核化合物标识时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份化合物标识记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
结构标准化结构标准化决定接收者能否还原当前条件,应与原始来源同时保存。缺少结构标准化时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明结构标准化由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
重复记录当重复记录发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一重复记录条件。若两份重复记录无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
冲突测量冲突测量无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的冲突测量会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
实验批次复核实验批次时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份实验批次记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
数据库来源数据库来源决定接收者能否还原当前条件,应与原始来源同时保存。缺少数据库来源时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明数据库来源由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
标签阈值当标签阈值发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一标签阈值条件。若两份标签阈值无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
缺失处理缺失处理无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的缺失处理会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
特征选择复核特征选择时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份特征选择记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
训练管线训练管线决定接收者能否还原当前条件,应与原始来源同时保存。缺少训练管线时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明训练管线由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
随机拆分当随机拆分发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一随机拆分条件。若两份随机拆分无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
骨架拆分骨架拆分无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的骨架拆分会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
时间拆分复核时间拆分时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份时间拆分记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
机构拆分机构拆分决定接收者能否还原当前条件,应与原始来源同时保存。缺少机构拆分时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明机构拆分由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
外部验证当外部验证发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一外部验证条件。若两份外部验证无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
测试封闭测试封闭无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的测试封闭会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
调参记录复核调参记录时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份调参记录记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
类别比例类别比例决定接收者能否还原当前条件,应与原始来源同时保存。缺少类别比例时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明类别比例由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
基线模型当基线模型发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一基线模型条件。若两份基线模型无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
早期富集早期富集无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的早期富集会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
精确率复核精确率时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份精确率记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
召回率召回率决定接收者能否还原当前条件,应与原始来源同时保存。缺少召回率时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明召回率由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
校准误差当校准误差发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一校准误差条件。若两份校准误差无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
置信区间置信区间无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的置信区间会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
失败目标复核失败目标时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份失败目标记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
近邻相似度近邻相似度决定接收者能否还原当前条件,应与原始来源同时保存。缺少近邻相似度时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明近邻相似度由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
批次线索当批次线索发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一批次线索条件。若两份批次线索无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
解释方法解释方法无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的解释方法会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
人工审查复核人工审查时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份人工审查记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
候选预算候选预算决定接收者能否还原当前条件,应与原始来源同时保存。缺少候选预算时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明候选预算由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
实验反馈当实验反馈发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一实验反馈条件。若两份实验反馈无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
模型漂移模型漂移无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的模型漂移会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
版本回退复核版本回退时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份版本回退记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
复查日期复查日期决定接收者能否还原当前条件,应与原始来源同时保存。缺少复查日期时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明复查日期由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
责任角色当责任角色发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一责任角色条件。若两份责任角色无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
本文讨论一般研究与设备方法,不提供医疗诊断,也不代表旧科研工具仍在运行。涉及正式项目时,应以当前软件说明、数据授权和专业审查为准。

需要把模型条件放进实际交接时,可参考国际任务指南;设备与文件来源问题则见客户端下载说明

返回方法卷宗