研究背景
Molecular encoders在基于成对分子形态数据的预训练方面取得了进展,例如CLOOME和CellCLIP。这些编码器被提出作为表型预测的廉价替代品,避免了运行Cell Painting检测的必要性。
研究方法
我们设计了一种实验方案,以控制可能夸大性能的两种混淆因素:编码器预训练边界内的泄漏,以及表型活性和细胞毒性之间的相关性。
实验结果
我们对包括与CLOOME输入和层计数相匹配的非预训练MLP控制在内的六个表示进行了测试,在两个不同的Cell Painting检测上进行。我们发现,一旦控制了这些混淆因素,预训练的分子编码器在物理化学描述符上没有显示出明显的优势,并且在整个表示中,毒性通常比表型活性更容易预测。
结论
我们的结果表明,在将表型预训练的编码器作为表型药物发现的替代品之前,应该进行泄漏感知、混淆控制的评估,并将其作为标准实践。