搞科研的同行们,特别是做药物筛选和肿瘤药理的朋友,肯定对海量数据怎么下手头疼过。CellMiner这个数据库,说白了就是NCI-60那60种癌细胞系的药物反应和分子数据大本营。它不是那种让你点两下就出结果的傻瓜工具,但一旦摸清门道,挖起药来比翻文献快十倍。今天我就手把手带你从零开始,怎么注册、怎么查药、怎么关联基因,直接上实战案例,让你看完就能跑数据。

先说注册和登录。CellMiner的网址是discover.nci,进去后别急着点“Analysis Tools”,先点右上角“Login/Register”。注册很简单,填个邮箱设个密码,几分钟就能收到确认邮件。别嫌麻烦,不登录你只能看静态表格,登录后才能用“Pattern Comparison”和“Drug Data”这些核心功能。登录后,首页会显示“CellMiner 2.4”版本,下面有四个大模块:Drug Data、Gene Data、Pattern Comparison和Download。新手最容易犯的错是直接点“Drug Data”查药名,结果发现数据太多看不懂——别慌,我们一步步来。
接下来是查询单个药物的IC50和分子指纹。假设你想查“紫杉醇”(Paclitaxel)在NCI-60细胞系里的表现。点开“Drug Data”,在“Search by Drug Name”里输入“paclitaxel”,回车。你会看到一个表格,每行是一种药物(可能有多个版本,比如紫杉醇有NSC编号125973和125973-O等)。点开NSC编号,会弹出详细页面,里面包含每个细胞系的GI50(生长抑制50%浓度)、TGI(总生长抑制)和LC50(致死浓度)。最有用的是“Drug Activity”图表,直接显示这60种细胞系对紫杉醇的敏感性排序。你还能下载CSV,拉到Excel里自己排序。记住,GI50值越小,说明这个药对该细胞系越敏感——比如白血病细胞系往往比实体瘤更敏感,这能帮你初步判断药的特异性。
光查药不够,你还得知道药效和什么基因有关。这就用到“Pattern Comparison”功能了。登录后,点这个模块,左边选“Drug Activity”,右边选“Gene Expression”或“Protein Level”。以紫杉醇为例,左边搜“paclitaxel”,选中它的NSC编号;右边搜“TP53”(p53基因),选中探针ID(比如205200_at)。点击“Calculate Correlation”,系统会算出一个皮尔逊相关系数(r值)和P值。如果r值接近-0.5且P<0.05,说明TP53表达越高,紫杉醇越敏感——这正好符合文献里野生型p53增强紫杉醇凋亡的结论。你还能一次选多个基因做热图,看哪些基因簇和药物活性强相关。这个功能最实用,能帮你快速锁定药物作用的潜在靶点或耐药因子。
再说一个高级玩法:用“Drug Data”里的“Drug Set”功能做批量分析。比如你想对比“拓扑异构酶抑制剂”这类药物的共性。在“Drug Data”里点“Search by Drug Set”,下拉菜单选择“Topoisomerase inhibitors”,系统会列出所有这类药(如伊立替康、依托泊苷等)。然后点“View Activity Matrix”,你就能看到这些药在60种细胞系里的GI50矩阵热图。颜色越红表示越敏感(GI50小),越蓝表示越耐药。你一眼就能看出,结肠癌和肺癌细胞系普遍对这类药敏感,而黑色素瘤和肾癌相对耐药。这个矩阵还能导出做聚类分析,帮你发现不同药物之间的活性相似性——比如伊立替康和SN-38(它的活性代谢物)的活性谱几乎一样,说明机制高度一致。
数据下载和本地分析也不能跳过。在主页点“Download”,你能找到“Drug Data”的完整表格(有2万多个化合物的GI50数据)、“Gene Data”(包括mRNA、miRNA、蛋白质和DNA甲基化)以及“Drug Activity and Gene Expression Matrix”。最推荐的是“NCI-60 Drug Activity Matrix”这个文件,直接是一个有2万多列(每个化合物一列)的矩阵,行是60种细胞系。你可以在R或Python里用这个矩阵做PCA或t-SNE降维,看药物聚类。比如你下载后跑个PCA,会发现微管抑制剂(如长春新碱)和抗生素类(如放线菌素D)明显分成两群。这种宏观视角能帮你判断新药属于哪个已知类别,或者是不是全新机制。
来个实战案例:挖一种抗癌中药的潜在靶点。假设你对“黄芩素”(Baicalein)感兴趣。先在“Drug Data”里搜“baicalein”,发现它只有NSC编号(比如123456),但没有完整GI50数据——很多天然产物在NCI-60库里数据不全。这时候别放弃,用“Pattern Comparison”选“Drug Activity”里别的类似物,比如“Baicalin”(黄芩苷),查到它的活性谱。然后选“Gene Expression”里所有基因,跑一个全基因组相关性分析。系统会给你一个排名前100的基因列表。你导出后,用DAVID或Enrichr做GO富集,发现这些基因集中在“细胞周期G2/M检查点”和“DNA损伤修复”通路。这就提示黄芩素的抗癌机制可能和阻滞细胞周期有关,和文献报道一致。整个过程从查药到出结论,不到20分钟,比你翻几十篇文献快得多。
CellMiner这个数据库,核心就是让你用最少的时间,把药物和基因的关系可视化。别被它的老界面吓到,注册、查药、关联、下载、实战,这五步走下来,你就能从新手变成能独立挖数据的熟手。下次写文章需要药物筛选的初步证据,别再只引用文献了,自己跑一遍CellMiner,数据说话,审稿人也服气。现在就打开浏览器,从注册开始,动手试试吧。


