诱饵集合设计不当,会怎样让虚拟筛选看起来过于准确
若诱饵与活性物在简单物化性质上过度可分,模型可能学会识别数据集,而不是识别结合规律。
负样本并不是随便挑一批不活跃分子
虚拟筛选需要比较活性化合物与诱饵分子的排序。理想诱饵在关键物化性质上与活性物相近,却采用不同拓扑结构并被认为不与目标结合。这个条件很难完全满足,因为“没有活性记录”不等于已证实无活性。
若诱饵的分子量、电荷或疏水性与活性物明显不同,简单分类器就可能取得很高指标。此时模型识别的是集合制作规则,而不是目标相关的化学信息。
富集指标依赖候选池
同一算法放入不同活性物比例、不同难度诱饵与不同数据库时,早期富集和曲线面积都会变化。把一个数字从论文表格中抽出来,与另一套基准直接比较,容易得到错误结论。
报告指标时应同时写明活性物、诱饵来源、拆分方式、重复结构处理和评价区间。没有这些条件,分数无法被另一团队复核。
外部测试要真正离开训练分布
随机拆分可能把高度相似的骨架分到训练与测试两侧。模型在测试集中遇到的仍是熟悉化学系列,表现会高于面对新骨架时的真实能力。
可以采用骨架拆分、时间拆分或独立项目数据进行验证。每种拆分测量的迁移难度不同,结果应分别呈现,不要用平均值掩盖失败类型。
RADER的历史价值在问题意识
RADER试图提高大规模诱饵检索效率,并提供更细的查询模板与集合生成选项。今天阅读这类工具,重点不在恢复旧服务,而在理解基准集合本身也是模型设计的一部分。
新项目应保留诱饵生成条件和原始集合。未来更换算法时,团队才能区分性能变化来自模型还是基准。
模型验证任务登记表
下面各项帮助团队把当前判断重新连接到设备、文件或模型条件。实际项目可以删减无关字段,但未知条件应明确标记,不要凭经验补齐。
| 项目 | 复核理由 | 处理方式 |
|---|---|---|
| 活性物来源 | 活性物来源决定接收者能否还原当前条件,应与原始来源同时保存。缺少活性物来源时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明活性物来源由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 活性阈值 | 当活性阈值发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一活性阈值条件。若两份活性阈值无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 诱饵来源 | 诱饵来源无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的诱饵来源会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 物化性质范围 | 复核物化性质范围时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份物化性质范围记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 电荷匹配 | 电荷匹配决定接收者能否还原当前条件,应与原始来源同时保存。缺少电荷匹配时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明电荷匹配由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 分子量分布 | 当分子量分布发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一分子量分布条件。若两份分子量分布无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 疏水性分布 | 疏水性分布无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的疏水性分布会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 拓扑差异 | 复核拓扑差异时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份拓扑差异记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 重复结构 | 重复结构决定接收者能否还原当前条件,应与原始来源同时保存。缺少重复结构时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明重复结构由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 骨架拆分 | 当骨架拆分发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一骨架拆分条件。若两份骨架拆分无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 随机拆分 | 随机拆分无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的随机拆分会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 时间拆分 | 复核时间拆分时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份时间拆分记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 外部测试 | 外部测试决定接收者能否还原当前条件,应与原始来源同时保存。缺少外部测试时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明外部测试由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 候选池规模 | 当候选池规模发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一候选池规模条件。若两份候选池规模无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 活性物比例 | 活性物比例无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的活性物比例会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 早期富集 | 复核早期富集时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份早期富集记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 曲线面积 | 曲线面积决定接收者能否还原当前条件,应与原始来源同时保存。缺少曲线面积时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明曲线面积由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 置信区间 | 当置信区间发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一置信区间条件。若两份置信区间无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 随机种子 | 随机种子无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的随机种子会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 失败类别 | 复核失败类别时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份失败类别记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
| 基准版本 | 基准版本决定接收者能否还原当前条件,应与原始来源同时保存。缺少基准版本时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明基准版本由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。 | 写入来源清单,并与原始对象使用同一任务编号。 |
| 生成规则 | 当生成规则发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一生成规则条件。若两份生成规则无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。 | 安排另一位成员抽样核对,记录复核时间与结论。 |
| 适用目标 | 适用目标无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的适用目标会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。 | 保留旧值、新值和修改原因,不直接覆盖早期记录。 |
| 实验验证 | 复核实验验证时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份实验验证记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。 | 无法确认时暂停下游使用,并标出当前影响范围。 |
本文讨论一般研究与设备方法,不提供医疗诊断,也不代表旧科研工具仍在运行。涉及正式项目时,应以当前软件说明、数据授权和专业审查为准。