AI辅助虚拟筛选如何避免把数据泄漏写成模型突破
高分可能来自相似骨架、批次线索或预处理重复;只有拆分策略与外部验证经得起复查,性能才有迁移意义。
随机拆分会低估化学系列之间的依赖
分子数据不是彼此独立的普通表格行。同一骨架的衍生物共享大量结构特征,随机拆分很容易让近邻同时进入训练和测试。模型因此看见熟悉系列,而不是面对真正未知化学空间。
骨架拆分更严格,但仍需检查不同骨架之间的高相似片段。时间拆分则模拟未来发现过程,可以暴露数据库和实验流程随时间变化带来的漂移。
预处理也可能泄漏测试信息
若在拆分前根据全体数据选择特征、填补缺失或调整阈值,测试集合已经影响训练过程。即使模型代码从未直接读取测试标签,评价仍会偏乐观。
所有会学习数据分布的步骤都应放入训练管线,并只在训练折中拟合。最终测试集在模型和阈值确定前保持封闭。
重复实验记录不能当成独立样本
同一化合物在多个数据库、实验批次或文献中可能重复出现。若没有统一标识,模型会把重复记录视为更多证据,也可能把同一对象分到测试侧。
合并时不能只按名称。盐形式、立体异构和测量条件需要保留,冲突结果也不应被简单平均掉。冲突本身可能揭示实验范围。
指标要匹配真实筛选任务
候选库中活性物通常非常稀少。准确率在高度不平衡数据上几乎没有解释力,早期富集、精确率、召回率与校准更接近实际筛选成本。
选择指标前先写清实验能够验证多少候选、漏掉活性物的代价和误报成本。一个模型不可能同时在所有目标上取得同样优先级。
解释图只能说明模型关注什么
注意力、特征贡献和相似结构能帮助审查模型,但它们解释的是计算决策,不是分子作用机制。模型关注某个片段,可能因为它与实验批次或数据库来源相关。
机制判断仍需结构、结合、细胞和因果扰动等独立证据。可解释模型降低黑箱程度,却不能跨过证据等级。
上线后还要监测数据漂移
研究数据库、供应库和实验条件持续变化。训练时常见的化学空间可能逐渐失去代表性,模型的概率也会失准。
保留输入分布、失败类别和人工复核结果,定期与固定基准比较。更新模型时不能覆盖旧版本,否则无法判断改善来自算法还是测试集合变化。
AI研究任务登记表
下面各项帮助团队把当前判断重新连接到设备、文件或模型条件。实际项目可以删减无关字段,但未知条件应明确标记,不要凭经验补齐。
| 项目 | 复核理由 | 处理方式 |
|---|---|---|
| 原始数据源 | 原始数据源决定接收者能否还原当前条件,应与原始来源同时保存。缺少原始数据源时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明原始数据源由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 获取日期 | 当获取日期发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一获取日期条件。若两份获取日期无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 许可范围 | 许可范围无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的许可范围会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 化合物标识 | 复核化合物标识时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份化合物标识记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 结构标准化 | 结构标准化决定接收者能否还原当前条件,应与原始来源同时保存。缺少结构标准化时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明结构标准化由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 重复记录 | 当重复记录发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一重复记录条件。若两份重复记录无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 冲突测量 | 冲突测量无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的冲突测量会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 实验批次 | 复核实验批次时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份实验批次记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 数据库来源 | 数据库来源决定接收者能否还原当前条件,应与原始来源同时保存。缺少数据库来源时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明数据库来源由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 标签阈值 | 当标签阈值发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一标签阈值条件。若两份标签阈值无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 缺失处理 | 缺失处理无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的缺失处理会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 特征选择 | 复核特征选择时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份特征选择记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 训练管线 | 训练管线决定接收者能否还原当前条件,应与原始来源同时保存。缺少训练管线时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明训练管线由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 随机拆分 | 当随机拆分发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一随机拆分条件。若两份随机拆分无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 骨架拆分 | 骨架拆分无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的骨架拆分会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 时间拆分 | 复核时间拆分时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份时间拆分记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 机构拆分 | 机构拆分决定接收者能否还原当前条件,应与原始来源同时保存。缺少机构拆分时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明机构拆分由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 外部验证 | 当外部验证发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一外部验证条件。若两份外部验证无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 测试封闭 | 测试封闭无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的测试封闭会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 调参记录 | 复核调参记录时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份调参记录记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 类别比例 | 类别比例决定接收者能否还原当前条件,应与原始来源同时保存。缺少类别比例时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明类别比例由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 基线模型 | 当基线模型发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一基线模型条件。若两份基线模型无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 早期富集 | 早期富集无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的早期富集会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 精确率 | 复核精确率时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份精确率记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 召回率 | 召回率决定接收者能否还原当前条件,应与原始来源同时保存。缺少召回率时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明召回率由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 校准误差 | 当校准误差发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一校准误差条件。若两份校准误差无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 置信区间 | 置信区间无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的置信区间会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 失败目标 | 复核失败目标时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份失败目标记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 近邻相似度 | 近邻相似度决定接收者能否还原当前条件,应与原始来源同时保存。缺少近邻相似度时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明近邻相似度由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 批次线索 | 当批次线索发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一批次线索条件。若两份批次线索无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 解释方法 | 解释方法无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的解释方法会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 人工审查 | 复核人工审查时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份人工审查记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 候选预算 | 候选预算决定接收者能否还原当前条件,应与原始来源同时保存。缺少候选预算时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明候选预算由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 实验反馈 | 当实验反馈发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一实验反馈条件。若两份实验反馈无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 模型漂移 | 模型漂移无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的模型漂移会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 版本回退 | 复核版本回退时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份版本回退记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 复查日期 | 复查日期决定接收者能否还原当前条件,应与原始来源同时保存。缺少复查日期时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明复查日期由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 责任角色 | 当责任角色发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一责任角色条件。若两份责任角色无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |