Cell | 卵母细胞PCA轨迹复现
生信经典文献解读 005
今天这条不是只看结果图。视频从一个空的复现项目开始,把数据路径、R 脚本、PCA 分群和 marker 趋势图一步步跑出来。
这段视频用的是公开数据 GSE130664,对应 Cell 文章:
Single-Cell Transcriptomic Atlas of Primate Ovarian Aging
论文 DOI:10.1016/j.cell.2020.01.009
视频里跑的是一个教学版小流程:从卵母细胞表达矩阵和 barcode 注释表开始,筛出目标 oocyte 细胞,做归一化、选择高变基因、PCA 降维、状态划分,最后画出 PCA 状态图和几个 marker 沿 PC1 的动态趋势。
这类视频适合刚开始做单细胞复现的同学。因为它没有一上来就塞一堆 Seurat 对象,而是把路径和脚本拆开给你看。
视频先看哪里?
先看项目结构。
开头展示的是一个标准复现目录:
my-rawdata/
demo-rawdata/
demo-data/
scripts/
results/
readme/
conda-env/这一步很基础,但很重要。很多人学单细胞卡住,不是不会画 PCA,而是数据、脚本和结果全堆在一个文件夹里。今天能跑,明天就不知道哪个版本对。
第二个要看的是路径设置。
视频里脚本读入了两个文件:
GSE130664_merge_UMI_count.txt.gz
GSE130664_barcode_information.txt.gz一个是表达矩阵,一个是细胞注释。表达矩阵放在 my-rawdata,注释表也放在 my-rawdata,结果统一写进 results。这个习惯比你多背几个函数更有用。
第三个要看的是结果图。
最后生成两类图:
- Oocyte PCA states;
- Marker expression dynamics along PC1。
前者把教学细胞分成 4 个状态,后者看 ATP6、DNTT1、FIGLA、SOX17、WEE2、ZP1 等 marker 沿 PC1 的变化。
这类复现到底在练什么?
不是练“会不会调用 PCA”。
真正要练的是这几个动作:
- 从 GEO 数据里找到表达矩阵和注释表;
- 根据注释表筛出目标细胞;
- 用清楚的路径管理输入和输出;
- 归一化表达矩阵;
- 选择高变基因;
- 用 PCA 把发育状态拉开;
- 用 marker 趋势图解释 PC1 方向。
这比直接下载别人整理好的 RDS 更适合教学。你知道每一步怎么来的,后面换自己的数据时才不会慌。
为什么选卵母细胞这个例子?
卵母细胞发育状态很适合做入门案例。
一方面,数据量不需要特别大。视频里保留 120 个 oocyte 细胞,足够演示 PCA 状态分布和趋势图。
另一方面,marker 的变化比较直观。你能看到不同基因沿 PC1 有上升、下降或非线性变化。学生第一次看这种图,很容易理解“降维轴不只是坐标,它可以对应一个连续状态变化”。
这比只看一个 UMAP 聚类图更容易讲清楚。
今天这条适合谁?
如果你刚开始学单细胞,这条适合先跟一遍。
如果你已经能跑 Seurat,但每次复现文章都会被路径、数据格式和脚本顺序卡住,也适合看。
如果你是老师或助教,这条可以直接改成课堂练习。让学生从空目录开始,最后交 results 里的两张图。比让学生复制一大段代码更能看出问题。
完整包里会有什么?
文章里不直接放完整脚本和数据。
想跟着视频完整跑,需要这些东西:
- GSE130664 输入文件整理说明;
01_oocyte_pca_trajectory_demo.R教学脚本;- conda 环境和 R 包说明;
- demo 数据目录;
- PCA 状态图和 marker 趋势图输出;
- 常见报错和路径检查说明。
如果你想拿完整复现包,或者想把自己的单细胞数据改成同款 PCA 轨迹分析,加客服微信:
客服微信:15259811736
备注“卵母细胞PCA轨迹复现”,说明你想要脚本、数据整理方式或云平台上机流程。
云平台上跑的好处
这类小流程看着简单,真正带学生时很容易出问题。
有人 R 包版本不同,图不一样。有人路径写错,文件读不进来。有人结果图覆盖了旧版本,最后不知道哪张是对的。
云平台适合把这些东西固定下来。目录固定、环境固定、脚本固定、结果固定。学生跟着跑,老师也容易检查。
今天这个例子不大,但它很适合打基础。你把这条跑通了,后面再做更复杂的拟时序、发育轨迹、marker 动态和文章图复现,会顺很多。
服务器地址:https://vip.r-py.com/
参考: