6.5 KiB
6.5 KiB
AGENTS.md — RGC-ADOA 项目
项目概述
基于 Kang et al., Science Advances (2026)(ref/sciadv.adx7815.pdf)公开的单细胞数据,对 OPA1 突变导致的常染色体显性视神经萎缩(ADOA) 小鼠视网膜进行再分析。文献精读笔记见 doc/文献精读_Kang2026_ADOA_OPA1.md。
分析目标
- 核心问题:RGC、Müller 胶质细胞、小胶质细胞(microglia)在缺失/突变 OPA1 后发生什么改变?
- 常规分析:不同细胞类型的差异基因与富集分析,重点关注这 3 类细胞的 IFN–JAK–STAT 通路是否异常活化,泛化为炎症通路活化情况分析。
- 研究假设:OPA1 敲除 → 线粒体损伤 →(a)直接影响能量代谢;(b)损伤线粒体激活炎症通路 → 损伤神经元。
注:原文只做了能量代谢轴(ETC/糖酵解/线粒体自噬),没有分析炎症通路、Müller 胶质细胞和小胶质细胞——这是本项目的增量空间。
目录约定
| 目录 | 用途 |
|---|---|
data/ |
原始数据 + 重要可复用中间数据(如 h5ad) |
ref/ |
参考文献、软件文档等,只读 |
doc/ |
分析计划、分析报告、调研报告等 md 文档 |
script/ |
代码、脚本 |
output/ |
脚本输出;图片默认 PNG,300 ppi |
代码托管(Gitea)约定
- 远端:自托管 Gitea
https://gitea.rainotes.top/rain/RGC-ADOA.git(不是 GitHub),分支main。 - 不进 git:
data/(26G 原始/中间数据)——.gitignore已忽略。多设备接续时data/需单独rsync/scp传输,其余目录随git pull同步(见README.md)。 - 进 git:
script/、doc/、ref/、output/及仓库配置文件(.gitignore/.gitattributes/README.md/AGENTS.md)。 - 提交身份:
rain <wjs_Rain@126.com>(已写入仓库本地 config)。 - 换行符:
.gitattributes设* text=auto,仓库内统一 LF;跨 Windows/Linux 勿手动改动换行符。 - 服务器存储/性能有限:新增大体量文件(尤其二进制、大表,>100MB)先确认是否需要进 git,勿误把数据/大文件提交进历史。
- 提交前自查:
git status确认data/未被暂存;git ls-files data/应为空。 - 凭据走 Git Credential Manager,推送无需重复输密码。
数据来源
- snRNA-seq:GEO GSE292269(BioProject PRJNA1237794)——已下载,
data/GSE292269_RAW.tar(332MB)+ 解压至data/GSE292269/{WT,Opa1V291D_S1,Opa1V291D_S2}/- 3 个样本,均为 360 天小鼠全视网膜 pooled nuclei:
- GSM8855044 — WT(Opa1+/+)
- GSM8855045 — Opa1V291D_S1
- GSM8855046 — Opa1V291D_S2
- ⚠️ GEO 存放的是 raw feature-barcode 矩阵(barcodes 各含 110–145 万条,矩阵元数据标注 Cell Ranger 4),需自行做空液滴过滤;54,232 features(扩展注释)
- 探索发现:WT 文库核数与质量明显低于两个突变样本(knee plot 见
output/01_qc/knee_plots.png),比较时注意 - 原文每组 n=5 只小鼠 pooled;原始 FASTQ 在 SRA(PRJNA1237794),一般用不到
- 3 个样本,均为 360 天小鼠全视网膜 pooled nuclei:
- 空间转录组(Visium HD FFPE,280 天):GEO 未收录,原文也未给出 accession,待找
- 补充材料已就位(
ref/):sciadv.adx7815_sm.pdf(图 S1–S9、表 S1–S4,含表 S3 注释 marker——无 microglia)+ref/Data files/(S2 全细胞类型 DEG 表、S3–S12 各细胞类型完整 ORA 富集结果、S1 空间代谢组定量)。预查要点见doc/第一轮分析计划_v1.md§1.1。
计算环境(已实测)
- Windows 11 + Git Bash;Python 3.14.4,scanpy 1.12.4 已装(scverse 生态为主)
- 未安装 R —— 不要写 Seurat/R 脚本;富集分析用 Python 方案(gseapy/decoupler/pathway-enrichment skill)
uv、curl可用;网络访问 GEO/NCBI FTP 正常- 分析主栈:scanpy + anndata;差异表达 pseudobulk 用 pydeseq2;富集/模块打分类 pathway-enrichment skill(gseapy/MSigDB,注意小鼠基因集);视需要 scvi-tools/scvelo
可用 skill(与本项目相关)
- 单细胞:
scanpy、anndata、scvi-tools、scvelo - 富集:
pathway-enrichment(ORA/GSEA/模块打分,含 MSigDB/GO/KEGG/Reactome/WikiPathways) - 差异表达(pseudobulk):
pydeseq2 - 查库:
gget、bioservices(ID 转换、通路查询) - 文献/网络:
exa-search(搜索一律走 Exa,不用内置 WebSearch)、paper-lookup - 读文献:
pdf2md(PDF → md) - 画图:
scientific-visualization(出版级)、matplotlib、seaborn - 算力评估:
get-available-resources(跑大任务前调用)
全局规则要点(来自用户全局 CLAUDE.md)
- 识图分流:Kimi 系模型直接 Read 图片;DeepSeek 系必须用
node ~/.claude/skills/vision/vision.js "<图片绝对路径>" "用中文描述"。 - 网络搜索一律用
exa-searchskill,禁用内置 WebSearch。 - 回复与文档一律用简体中文,技术术语保留英文原文。
报告规则
doc/下的分析报告必须以 markdown 图片语法插入脚本生成的 figure,使用绝对路径(正斜杠),例如:- 每张图紧跟一句话图注,说明结论而不是只描述内容;报告正文中引用过的图必须实际嵌入,不允许只写相对路径或文件名。
数据分析注意事项(再分析时务必记住)
- 生物学重复陷阱:WT 只有 1 个 pooled 样本,突变 2 个——细胞级 Wilcoxon 检验存在严重 pseudoreplication 风险。核心结论必须以 pseudobulk(样本为单位聚合)+ 谨慎统计为准,细胞级检验只作探索。
- 基因型与批次混杂:3 个样本 = 3 个独立建库,WT/mutant 之间差异与批次效应不可完全分离,解释时留有余地。
- microglia 稀少:全视网膜约 1.9 万核中小胶质细胞占比很低(通常 <1%),炎症分析可能面临细胞数不足;需要时放宽聚类分辨率专门捞免疫细胞(P2ry12/Aif1/C1qa 等 marker)。
- snRNA-seq 特性:核测序中 mito% 指标不适用常规阈值;炎症/即刻早期基因表达与 scRNA-seq 有偏差。
- 原文的阴性结果:ISR(p-eIF2α/ATF4)免疫荧光未见激活——我们做炎症通路时注意与该结果对照叙述。