MITCE·

诱饵集合设计不当,会怎样让虚拟筛选看起来过于准确

若诱饵与活性物在简单物化性质上过度可分,模型可能学会识别数据集,而不是识别结合规律。

负样本并不是随便挑一批不活跃分子

虚拟筛选需要比较活性化合物与诱饵分子的排序。理想诱饵在关键物化性质上与活性物相近,却采用不同拓扑结构并被认为不与目标结合。这个条件很难完全满足,因为“没有活性记录”不等于已证实无活性。

若诱饵的分子量、电荷或疏水性与活性物明显不同,简单分类器就可能取得很高指标。此时模型识别的是集合制作规则,而不是目标相关的化学信息。

富集指标依赖候选池

同一算法放入不同活性物比例、不同难度诱饵与不同数据库时,早期富集和曲线面积都会变化。把一个数字从论文表格中抽出来,与另一套基准直接比较,容易得到错误结论。

报告指标时应同时写明活性物、诱饵来源、拆分方式、重复结构处理和评价区间。没有这些条件,分数无法被另一团队复核。

外部测试要真正离开训练分布

随机拆分可能把高度相似的骨架分到训练与测试两侧。模型在测试集中遇到的仍是熟悉化学系列,表现会高于面对新骨架时的真实能力。

可以采用骨架拆分、时间拆分或独立项目数据进行验证。每种拆分测量的迁移难度不同,结果应分别呈现,不要用平均值掩盖失败类型。

RADER的历史价值在问题意识

RADER试图提高大规模诱饵检索效率,并提供更细的查询模板与集合生成选项。今天阅读这类工具,重点不在恢复旧服务,而在理解基准集合本身也是模型设计的一部分。

新项目应保留诱饵生成条件和原始集合。未来更换算法时,团队才能区分性能变化来自模型还是基准。

模型验证任务登记表

下面各项帮助团队把当前判断重新连接到设备、文件或模型条件。实际项目可以删减无关字段,但未知条件应明确标记,不要凭经验补齐。

项目复核理由处理方式
活性物来源活性物来源决定接收者能否还原当前条件,应与原始来源同时保存。缺少活性物来源时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明活性物来源由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
活性阈值当活性阈值发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一活性阈值条件。若两份活性阈值无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
诱饵来源诱饵来源无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的诱饵来源会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
物化性质范围复核物化性质范围时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份物化性质范围记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
电荷匹配电荷匹配决定接收者能否还原当前条件,应与原始来源同时保存。缺少电荷匹配时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明电荷匹配由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
分子量分布当分子量分布发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一分子量分布条件。若两份分子量分布无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
疏水性分布疏水性分布无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的疏水性分布会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
拓扑差异复核拓扑差异时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份拓扑差异记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
重复结构重复结构决定接收者能否还原当前条件,应与原始来源同时保存。缺少重复结构时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明重复结构由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
骨架拆分当骨架拆分发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一骨架拆分条件。若两份骨架拆分无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
随机拆分随机拆分无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的随机拆分会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
时间拆分复核时间拆分时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份时间拆分记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
外部测试外部测试决定接收者能否还原当前条件,应与原始来源同时保存。缺少外部测试时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明外部测试由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
候选池规模当候选池规模发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一候选池规模条件。若两份候选池规模无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
活性物比例活性物比例无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的活性物比例会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
早期富集复核早期富集时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份早期富集记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
曲线面积曲线面积决定接收者能否还原当前条件,应与原始来源同时保存。缺少曲线面积时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明曲线面积由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
置信区间当置信区间发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一置信区间条件。若两份置信区间无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
随机种子随机种子无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的随机种子会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
失败类别复核失败类别时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份失败类别记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
基准版本基准版本决定接收者能否还原当前条件,应与原始来源同时保存。缺少基准版本时,即使文件本身完整,也无法确认它是否属于当前任务。团队还应说明基准版本由谁产生、在什么阶段冻结,以及后续哪些结果依赖这项记录。写入来源清单,并与原始对象使用同一任务编号。
生成规则当生成规则发生变化时,保留前后版本与原因,避免把方法变化误写成样本变化。比较结果前先确定两侧使用的是同一生成规则条件。若两份生成规则无法统一,应分别报告对应条件下的结果,而不是合并成一个平均结论。安排另一位成员抽样核对,记录复核时间与结论。
适用目标适用目标无法确认时应标记未知范围,不用默认值隐藏资料缺口。未知的适用目标会降低结论等级,却比一个未经核实的确定答案更可靠。后续补齐信息时,应新增修订记录并说明它改变了哪些判断。保留旧值、新值和修改原因,不直接覆盖早期记录。
实验验证复核实验验证时要查看它和相邻步骤的关系,单独一个数值不足以支持结论。若两份实验验证记录彼此冲突,应保留差异并回到产生环节核对。只有来源与时间顺序清楚以后,才决定哪一项进入正式版本。无法确认时暂停下游使用,并标出当前影响范围。
本文讨论一般研究与设备方法,不提供医疗诊断,也不代表旧科研工具仍在运行。涉及正式项目时,应以当前软件说明、数据授权和专业审查为准。

需要把模型条件放进实际交接时,可参考国际任务指南;设备与文件来源问题则见客户端下载说明

返回方法卷宗