Paper Radar · 2026-09-04
今日编辑判断:最值得优先读的是 Scaling recipes 和 Dynema。前者讨论“单细胞 foundation model 到底怎样规模化才有规律”,后者直接处理一个统计遗传学里很核心的问题:如何在不 pseudobulk 的情况下保留 cell-state variation,又不把同一 donor 的细胞误当成独立样本。AnnFlux 则更偏 perturbation modeling 的动态建模思路。
1. MUST READ — Scaling recipes for single-cell RNA sequencing foundation models: when do scaling laws hold?
Federico Borra, Giacomo Ciro’, Arianna Castellini, Giovanni Gatti, Andrea Tangherloni, Francesca Meteora Buffa
bioRxiv · 2026-09-01 · Paper ↗
为什么值得看:这不是又一篇“把模型做大一点”的 scFM 工作,而是在问一个更基础的问题:语言模型中的 scaling law / training recipe 到底能不能迁移到单细胞转录组? 对真正准备训练或优化 single-cell foundation model 的人,这比单纯比较 benchmark 排名更有工程价值。
核心问题与方法
作者系统考察模型规模、训练计算量、网络深度/宽度以及学习率等因素与预训练 loss 的关系,并用较小规模实验去估计更大训练任务的收益。公开摘要和作者说明显示:
- scRNA-seq foundation model 中确实可以观察到经验 scaling law,但其稳定性依赖于模型 formulation;
- 最优 learning rate 会随 model size 与 depth 系统变化;
- 随计算预算增加,最优 architecture 本身也应该变化,而不是固定结构后只增加参数;
- 某些 scaling relationship 与语言模型中的经验规律差异很大,其中至少一个方向甚至相反。
我最关注的技术点
真正值得借鉴的是 “先做可外推的小规模实验,再决定大训练 run” 的思路。对于单细胞模型,这意味着 compute allocation 不应只按 parameter count 规划,而需要联合考虑数据表示、深度/宽度和优化器超参数。
从 HPC 角度,这也提示:GPU 利用率优化只是第二层问题。第一层问题是 你是否在一个合理的 scaling regime 里使用 GPU。如果 architecture / learning-rate scaling 本身不合适,再好的 CUDA kernel 也只是更快地训练一个次优配置。
局限与需要警惕的地方
预训练 loss 的可预测 scaling 并不自动等价于 downstream biological utility 的 scaling。这一点与今天下面那篇 scFM reproducibility benchmark 形成了非常有意思的对照:训练目标可能随规模稳定变好,但 annotation、spatial transfer、regulatory inference 等任务未必同步改善。
与我们的方向连接:single-cell foundation model · GPU/HPC · training efficiency · perturbation modeling
推荐优先级:必读
2. MUST READ — Efficient genome-wide mapping of reproducible, context-dependent eQTLs at single-cell resolution
Jose Alquicira-Hernandez, Elizabeth Dorans, Yoshihiko Tomofuji, Aparna Nathan, Soumya Raychaudhuri
bioRxiv · 2026-08-29 · Paper ↗
方法名:Dynema (Dynamic eQTL mapping in single cells)
为什么值得看:很多所谓 sc-eQTL 分析最终仍然是在 donor × cell type 层面做 pseudobulk。Dynema 试图直接保留 cell-level expression 与连续 cell-state context,同时用正确的方差估计处理同一 donor 内细胞相关性。
统计模型的关键点
Dynema 用 Poisson model 对单细胞计数建模,并使用 cluster-robust variance estimator (CRVE),以 donor 作为 cluster 来处理同一个人的多个细胞之间的相关性。
这个设计解决的是典型的 pseudoreplication 问题:
- 如果把每个 cell 当独立样本,标准误会严重偏小;
- 如果完全 pseudobulk,又会丢失 cell-state 内部的动态 variation;
- CRVE 提供了一个中间路径:估计仍发生在 cell level,但 inferential unit 保持在 donor level 的相关结构上。
对于 context-dependent eQTL,可以把核心问题理解为 genotype effect 是否随 cell state 改变,即关注类似 G × context 的交互项,而不是只估计一个固定的平均 eQTL effect。
结果
作者在两个独立 T-cell 数据集中发现可复现的 cell-state-dependent eQTL。部分信号会被 pseudobulk 方法漏掉,而且不少 context-dependent signal 与 lead eQTL 在条件分析后仍表现为独立效应。作者进一步报告了包括 TSPAN32 在内的自身免疫相关位点与这些动态 eQTL 的 colocalization。
对 fine-mapping / SuSiE 的启发
我认为这里最值得延伸的不是“把 Dynema 换成 SuSiE”,而是建立两层模型:
- Dynema / cell-level GLM 提供 context-specific marginal association evidence;
- 在 variant level 用 LD-aware fine-mapping(例如 SuSiE)分解多 causal signal;
- 再把 context-dependent effect、functional annotation 或 AlphaGenome-derived variant score 放进 prior / enrichment 层。
关键点是:cell-level likelihood 与 LD fine-mapping 解决的是不同层面的 dependence,不能简单把“细胞数”当作 fine-mapping 的有效样本量。
局限
Poisson mean-variance assumption、稀疏计数、cell-state measurement error,以及 donor 数量相对于 cell 数量仍然有限,都会影响真实有效信息量。CRVE 能修正 cluster correlation,但不会凭空增加 donor-level independent information。
与我们的方向连接:sc-eQTL · statistical genetics · colocalization · fine-mapping · functional priors
推荐优先级:必读
3. WORTH READING — AnnFlux: object-conditioned neural stochastic differential equations for single-cell perturbation dynamics
Heesun Choi, Gaeun Byeon, Hayoon Park, Jongseo Park, Sungbin Lim, Joon-Yong An
bioRxiv · 2026-09-03 · Paper ↗
为什么值得看:大多数 perturbation model 学的是静态的 control → perturbed endpoint 映射;AnnFlux 把问题改成 细胞群体在 latent state space 中如何随时间被 perturbation 推动。
方法直觉
AnnFlux 使用 object-conditioned neural SDE。在概念上,可以把 latent trajectory 写成:
dz_t = fθ(z_t, t, object) dt + gθ(z_t, t, object) dW_t
其中 drift field fθ 描述 perturbation 对细胞状态演化方向的系统性推动,而 stochastic term 描述 population-level variability。关键设计是把 gene/drug 等 perturbing object 显式作为条件变量,因此可以逐个 perturbation 查询其 drift,并在统一 latent geometry 中比较不同 genes 与 drugs 的作用方向。
对于训练时没有见过的 perturbation,作者使用 prior-knowledge embedding 表示 perturbing object,使模型有机会从 object similarity 泛化到 unseen interventions。
实验信号
论文报告模型能够:
- 插值一个 EMT time course 中 held-out timepoint;
- 预测 unseen perturbations;
- 在 distributional fidelity 上优于只给 point estimate 的方法;
- 预测 held-out perturbation combinations;
- 将模型预测的 IFN-response signature 与独立 pan-cancer spatial atlas 中 TLS proximity 联系起来。
我最关注的统计问题
SDE 的优势是自然建模 distribution → distribution 的 transport,而不是只预测平均表达向量。但 latent SDE 也带来 identifiability 问题:不同 drift/diffusion 组合可能解释相似 endpoint distributions;若 timepoint 很稀,动态方向的约束通常弱于表面看起来的模型复杂度。
后续值得重点检查作者如何定义 distributional loss、如何约束 drift field,以及 combination generalization 是否真正跨 object / cell context,而不是主要依赖训练集邻域插值。
与我们的方向连接:perturbation modeling · neural SDE · single-cell dynamics · spatial validation
推荐优先级:值得读
4. MUST READ — Accessible and reproducible deployment reveals the practical boundaries of single-cell foundation models
Siyu Hou, Penghui Yang, Wenjing Ma, Jinxi Xiang, Jade Xiaoqing Wang, Hui Wan, Ying Ma, Xiang Zhou
bioRxiv v2 · 2026-09-02(大幅修订版) · Paper ↗
为什么值得看:这是很适合拿来给 scFM “降温”的 benchmark。作者不是只比一个 classification leaderboard,而是先解决 deployment / preprocessing / environment 不一致,再系统比较 13 个 scFM 与传统方法、近 100 个数据集。
主要结论
- 更大的 parameter count、更复杂 architecture、更大的 pretraining corpus 或更复杂 input encoding,都没有稳定转化为更好的 downstream performance;
- embedding geometry 的某些可测性质能够跨模型解释 zero-shot performance 差异;
- scFM 最清晰的优势集中在 极低 supervision 场景,例如 rare-cell annotation 和 source-absent cell state 的 open-set detection;
- 在多数其他设置中,传统方法仍然具有竞争力,甚至更合适;
- scFM representation 对 spatial-domain recovery 的 transfer 不稳定;
- gene embeddings 可以捕获较宽泛的 functional relatedness,但并不能可靠恢复 context-specific regulatory relationships。
和 Scaling recipes 放在一起看
这两篇最好连续读:
- Scaling recipes 问:训练 loss 是否有可预测的 scaling behavior?
- Practical boundaries 问:这些 representation 最终在生物任务上究竟什么时候真的有用?
二者并不矛盾。一个模型完全可能在 pretraining objective 上呈现漂亮的 power-law scaling,同时 downstream biological effect size 很小。这提醒我们做 scFM 时必须把 optimization scaling 与 scientific utility scaling 分开评估。
对算法论文 benchmark 的启发
如果以后我们自己做 single-cell foundation model / representation method,benchmark 至少应该加入:
- classical baseline;
- supervision fraction curve,而不是单一点;
- dataset shift / open-set setting;
- zero-shot 与 fine-tuned 分开;
- 计算成本与 preprocessing sensitivity;
- representation geometry 或其他机制层面的诊断,而不只是最终 accuracy。
与我们的方向连接:single-cell foundation models · benchmarking · reproducibility · representation learning
推荐优先级:必读
5. WORTH READING — A Measure of Transcriptional Dyscoordination for Quantifying Aging in Single Cells
Yilin Yang et al.; Nancy R. Zhang (corresponding)
bioRxiv v2 · 2026-08-28 · Paper ↗
为什么值得看:这篇更像“统计方法 + 生物问题”的工作,而不是 foundation model。作者试图定义一个 unsupervised、first-principles 的 single-cell statistic,用来量化细胞表达是否偏离正常的 coordinated transcriptional structure,并显式考虑 technical noise。
核心思想
作者把 aging-related transcriptional alteration 区分为不同维度,其中“dyscoordination”不是平均表达整体平移,而是一个细胞相对于可预测表达结构的异常偏离。方法强调:
- 学习正常表达中的 predictable structure;
- 量化单个细胞偏离该结构的程度;
- 校正技术噪音影响;
- 用 simulation 与 classical intrinsic-noise 指标做正交验证。
实证结果
作者报告 dyscoordination 在 genotoxic injury 和 senescence induction 后升高,在 senolytic depletion 后下降;跨 mouse、rat、human tissues 随年龄升高,在 regenerative compartments 尤其明显。人 T-cell 分析还显示该指标与 clonal expansion、effector function 相关,并进一步与 chromatin-based mitotic age 和 genome instability 发生跨模态关联。
为什么方法上值得借鉴
这类研究的价值不只在 aging。它展示了一种很通用的建模套路:把高维单细胞数据中的“失调”定义为偏离 learned conditional structure,而不是简单 variance 或 entropy。 如果将来研究 disease-associated cell states、perturbation instability 或 donor-specific regulatory disruption,这种 residual-structure 思路值得复用。
与我们的方向连接:single-cell statistics · unsupervised modeling · biological noise
推荐优先级:值得读
Resource Watch
GWAS Catalog REST API v2:如果你的脚本还在用 v1,应该开始迁移
GWAS Catalog · migration guide 2026-08-19 · Migration guide ↗ · GWAS Catalog ↗
8 月 2 日的 Catalog snapshot 显示目前包含 7,784 publications、1,188,619 top associations、193,739 full summary statistics。API v2 的变化对后续自动化抓 GWAS/QTL 资源很重要:
- 从大量
/search/findBy...endpoint 改为直接在 resource endpoint 上加 filter; - query 参数大量改为 snake_case;
- publications、genes、ancestries 成为 first-class resources;
- trait query 支持 ontology child-trait behavior;
- gene query 的默认 gene set 与 v1 不完全相同,复现旧行为时要留意
extended_geneset=true; - v2 文档给出 15 queries/s 的请求限制;
- full genome-wide summary-statistics API 仍是另一条正在重构的数据访问路径,不应把 top-association API 与 full summary statistics 混为一谈。
对这个 Paper Radar 的意义:后续如果我们增加“新增 GWAS study / summary statistics / credible-set resource”自动监测,应该优先基于 v2 和官方 download metadata 设计,而不是继续依赖 legacy v1。
GPU / HPC Watch
过去 7 天里,我没有找到一篇质量足够高、又真正属于“GPU 加速单细胞分析”的新论文,因此今天不为了凑数塞旧文章。
当前仍建议持续关注 rapids-singlecell:它是 scverse 体系里最成熟的 AnnData-first GPU pipeline 之一,底层主要依赖 CuPy + NVIDIA RAPIDS。后续雷达会重点监控 preprocessing、PCA、neighbors、UMAP、clustering、batch correction、DE、sparse kernel 与 multi-GPU 相关的新 release / benchmark。
筛选窗口:优先最近 48 小时;不足时扩展到最近 7 天。资源更新允许回看最近 1–3 个月。所有预印本均未经过最终同行评审,方法与结果可能在后续版本中变化。