Files

6.5 KiB
Raw Permalink Blame History

AGENTS.md — RGC-ADOA 项目

项目概述

基于 Kang et al., Science Advances (2026)ref/sciadv.adx7815.pdf)公开的单细胞数据,对 OPA1 突变导致的常染色体显性视神经萎缩(ADOA) 小鼠视网膜进行再分析。文献精读笔记见 doc/文献精读_Kang2026_ADOA_OPA1.md

分析目标

  1. 核心问题:RGC、Müller 胶质细胞、小胶质细胞(microglia)在缺失/突变 OPA1 后发生什么改变?
  2. 常规分析:不同细胞类型的差异基因与富集分析,重点关注这 3 类细胞的 IFN–JAK–STAT 通路是否异常活化,泛化为炎症通路活化情况分析。
  3. 研究假设:OPA1 敲除 → 线粒体损伤 →(a)直接影响能量代谢;(b)损伤线粒体激活炎症通路 → 损伤神经元。

注:原文只做了能量代谢轴(ETC/糖酵解/线粒体自噬),没有分析炎症通路、Müller 胶质细胞和小胶质细胞——这是本项目的增量空间。

目录约定

目录 用途
data/ 原始数据 + 重要可复用中间数据(如 h5ad)
ref/ 参考文献、软件文档等,只读
doc/ 分析计划、分析报告、调研报告等 md 文档
script/ 代码、脚本
output/ 脚本输出;图片默认 PNG300 ppi

代码托管(Gitea)约定

  • 远端:自托管 Gitea https://gitea.rainotes.top/rain/RGC-ADOA.git不是 GitHub),分支 main
  • 不进 gitdata/26G 原始/中间数据)——.gitignore 已忽略。多设备接续时 data/ 需单独 rsync/scp 传输,其余目录随 git pull 同步(见 README.md)。
  • 进 gitscript/doc/ref/output/ 及仓库配置文件(.gitignore/.gitattributes/README.md/AGENTS.md)。
  • 提交身份rain <wjs_Rain@126.com>(已写入仓库本地 config)。
  • 换行符.gitattributes* text=auto,仓库内统一 LF;跨 Windows/Linux 勿手动改动换行符。
  • 服务器存储/性能有限:新增大体量文件(尤其二进制、大表,>100MB)先确认是否需要进 git,勿误把数据/大文件提交进历史。
  • 提交前自查git status 确认 data/ 未被暂存;git ls-files data/ 应为空。
  • 凭据走 Git Credential Manager,推送无需重复输密码。

数据来源

  • snRNA-seqGEO GSE292269BioProject PRJNA1237794)——已下载data/GSE292269_RAW.tar332MB+ 解压至 data/GSE292269/{WT,Opa1V291D_S1,Opa1V291D_S2}/
    • 3 个样本,均为 360 天小鼠全视网膜 pooled nuclei
      • GSM8855044 — WTOpa1+/+
      • GSM8855045 — Opa1V291D_S1
      • GSM8855046 — Opa1V291D_S2
    • ⚠️ GEO 存放的是 raw feature-barcode 矩阵barcodes 各含 110145 万条,矩阵元数据标注 Cell Ranger 4),需自行做空液滴过滤54,232 features(扩展注释)
    • 探索发现:WT 文库核数与质量明显低于两个突变样本knee plot 见 output/01_qc/knee_plots.png),比较时注意
    • 原文每组 n=5 只小鼠 pooled;原始 FASTQ 在 SRAPRJNA1237794),一般用不到
  • 空间转录组(Visium HD FFPE280 天)GEO 未收录,原文也未给出 accession,待找
  • 补充材料已就位ref/):sciadv.adx7815_sm.pdf(图 S1–S9、表 S1S4,含表 S3 注释 marker——无 microglia+ ref/Data files/(S2 全细胞类型 DEG 表、S3–S12 各细胞类型完整 ORA 富集结果、S1 空间代谢组定量)。预查要点见 doc/第一轮分析计划_v1.md §1.1。

计算环境(已实测)

  • Windows 11 + Git BashPython 3.14.4scanpy 1.12.4 已装scverse 生态为主)
  • 未安装 R —— 不要写 Seurat/R 脚本;富集分析用 Python 方案(gseapy/decoupler/pathway-enrichment skill
  • uvcurl 可用;网络访问 GEO/NCBI FTP 正常
  • 分析主栈:scanpy + anndata;差异表达 pseudobulk 用 pydeseq2;富集/模块打分类 pathway-enrichment skillgseapy/MSigDB,注意小鼠基因集);视需要 scvi-tools/scvelo

可用 skill(与本项目相关)

  • 单细胞:scanpyanndatascvi-toolsscvelo
  • 富集:pathway-enrichmentORA/GSEA/模块打分,含 MSigDB/GO/KEGG/Reactome/WikiPathways
  • 差异表达(pseudobulk):pydeseq2
  • 查库:ggetbioservicesID 转换、通路查询)
  • 文献/网络:exa-search搜索一律走 Exa,不用内置 WebSearch)、paper-lookup
  • 读文献:pdf2mdPDF → md
  • 画图:scientific-visualization(出版级)、matplotlibseaborn
  • 算力评估:get-available-resources(跑大任务前调用)

全局规则要点(来自用户全局 CLAUDE.md)

  • 识图分流:Kimi 系模型直接 Read 图片;DeepSeek 系必须用 node ~/.claude/skills/vision/vision.js "<图片绝对路径>" "用中文描述"
  • 网络搜索一律用 exa-search skill,禁用内置 WebSearch。
  • 回复与文档一律用简体中文,技术术语保留英文原文。

报告规则

  • doc/ 下的分析报告必须以 markdown 图片语法插入脚本生成的 figure,使用绝对路径(正斜杠),例如: ![knee plot](D:/个人文档/PROJECTS/RGC-ADOA/output/01_qc/knee_plots.png)
  • 每张图紧跟一句话图注,说明结论而不是只描述内容;报告正文中引用过的图必须实际嵌入,不允许只写相对路径或文件名。

数据分析注意事项(再分析时务必记住)

  1. 生物学重复陷阱WT 只有 1 个 pooled 样本,突变 2 个——细胞级 Wilcoxon 检验存在严重 pseudoreplication 风险。核心结论必须以 pseudobulk(样本为单位聚合)+ 谨慎统计为准,细胞级检验只作探索。
  2. 基因型与批次混杂:3 个样本 = 3 个独立建库,WT/mutant 之间差异与批次效应不可完全分离,解释时留有余地。
  3. microglia 稀少:全视网膜约 1.9 万核中小胶质细胞占比很低(通常 <1%),炎症分析可能面临细胞数不足;需要时放宽聚类分辨率专门捞免疫细胞(P2ry12/Aif1/C1qa 等 marker)。
  4. snRNA-seq 特性:核测序中 mito% 指标不适用常规阈值;炎症/即刻早期基因表达与 scRNA-seq 有偏差。
  5. 原文的阴性结果ISRp-eIF2α/ATF4)免疫荧光未见激活——我们做炎症通路时注意与该结果对照叙述。