Daily Paper Radar

每天只留下真正值得读的论文。

关注统计遗传学、单细胞与空间组学、QTL / fine-mapping、foundation models、regulatory sequence models,以及 GPU / HPC 科研计算。

1Issues
3–6Daily picks
Latest issue · 2026-09-04

Paper Radar · 2026-09-04

今天重点关注 scRNA-seq foundation model scaling laws、真正单细胞分辨率的 context-dependent eQTL、neural SDE perturbation dynamics,以及 scFM 可复现性边界;资源侧关注 GWAS Catalog REST API v2。

single-cellstatistical-geneticsQTLfoundation-modelsperturbationGPU-HPCresources

今日编辑判断:最值得优先读的是 Scaling recipesDynema。前者讨论“单细胞 foundation model 到底怎样规模化才有规律”,后者直接处理一个统计遗传学里很核心的问题:如何在不 pseudobulk 的情况下保留 cell-state variation,又不把同一 donor 的细胞误当成独立样本。AnnFlux 则更偏 perturbation modeling 的动态建模思路。

1. MUST READ — Scaling recipes for single-cell RNA sequencing foundation models: when do scaling laws hold?

Federico Borra, Giacomo Ciro’, Arianna Castellini, Giovanni Gatti, Andrea Tangherloni, Francesca Meteora Buffa
bioRxiv · 2026-09-01 · Paper ↗

为什么值得看:这不是又一篇“把模型做大一点”的 scFM 工作,而是在问一个更基础的问题:语言模型中的 scaling law / training recipe 到底能不能迁移到单细胞转录组? 对真正准备训练或优化 single-cell foundation model 的人,这比单纯比较 benchmark 排名更有工程价值。

核心问题与方法

作者系统考察模型规模、训练计算量、网络深度/宽度以及学习率等因素与预训练 loss 的关系,并用较小规模实验去估计更大训练任务的收益。公开摘要和作者说明显示:

我最关注的技术点

真正值得借鉴的是 “先做可外推的小规模实验,再决定大训练 run” 的思路。对于单细胞模型,这意味着 compute allocation 不应只按 parameter count 规划,而需要联合考虑数据表示、深度/宽度和优化器超参数。

从 HPC 角度,这也提示:GPU 利用率优化只是第二层问题。第一层问题是 你是否在一个合理的 scaling regime 里使用 GPU。如果 architecture / learning-rate scaling 本身不合适,再好的 CUDA kernel 也只是更快地训练一个次优配置。

局限与需要警惕的地方

预训练 loss 的可预测 scaling 并不自动等价于 downstream biological utility 的 scaling。这一点与今天下面那篇 scFM reproducibility benchmark 形成了非常有意思的对照:训练目标可能随规模稳定变好,但 annotation、spatial transfer、regulatory inference 等任务未必同步改善。

与我们的方向连接:single-cell foundation model · GPU/HPC · training efficiency · perturbation modeling
推荐优先级:必读


2. MUST READ — Efficient genome-wide mapping of reproducible, context-dependent eQTLs at single-cell resolution

Jose Alquicira-Hernandez, Elizabeth Dorans, Yoshihiko Tomofuji, Aparna Nathan, Soumya Raychaudhuri
bioRxiv · 2026-08-29 · Paper ↗

方法名:Dynema (Dynamic eQTL mapping in single cells)

为什么值得看:很多所谓 sc-eQTL 分析最终仍然是在 donor × cell type 层面做 pseudobulk。Dynema 试图直接保留 cell-level expression 与连续 cell-state context,同时用正确的方差估计处理同一 donor 内细胞相关性。

统计模型的关键点

Dynema 用 Poisson model 对单细胞计数建模,并使用 cluster-robust variance estimator (CRVE),以 donor 作为 cluster 来处理同一个人的多个细胞之间的相关性。

这个设计解决的是典型的 pseudoreplication 问题:

对于 context-dependent eQTL,可以把核心问题理解为 genotype effect 是否随 cell state 改变,即关注类似 G × context 的交互项,而不是只估计一个固定的平均 eQTL effect。

结果

作者在两个独立 T-cell 数据集中发现可复现的 cell-state-dependent eQTL。部分信号会被 pseudobulk 方法漏掉,而且不少 context-dependent signal 与 lead eQTL 在条件分析后仍表现为独立效应。作者进一步报告了包括 TSPAN32 在内的自身免疫相关位点与这些动态 eQTL 的 colocalization。

对 fine-mapping / SuSiE 的启发

我认为这里最值得延伸的不是“把 Dynema 换成 SuSiE”,而是建立两层模型:

  1. Dynema / cell-level GLM 提供 context-specific marginal association evidence;
  2. 在 variant level 用 LD-aware fine-mapping(例如 SuSiE)分解多 causal signal;
  3. 再把 context-dependent effect、functional annotation 或 AlphaGenome-derived variant score 放进 prior / enrichment 层。

关键点是:cell-level likelihood 与 LD fine-mapping 解决的是不同层面的 dependence,不能简单把“细胞数”当作 fine-mapping 的有效样本量。

局限

Poisson mean-variance assumption、稀疏计数、cell-state measurement error,以及 donor 数量相对于 cell 数量仍然有限,都会影响真实有效信息量。CRVE 能修正 cluster correlation,但不会凭空增加 donor-level independent information。

与我们的方向连接:sc-eQTL · statistical genetics · colocalization · fine-mapping · functional priors
推荐优先级:必读


3. WORTH READING — AnnFlux: object-conditioned neural stochastic differential equations for single-cell perturbation dynamics

Heesun Choi, Gaeun Byeon, Hayoon Park, Jongseo Park, Sungbin Lim, Joon-Yong An
bioRxiv · 2026-09-03 · Paper ↗

为什么值得看:大多数 perturbation model 学的是静态的 control → perturbed endpoint 映射;AnnFlux 把问题改成 细胞群体在 latent state space 中如何随时间被 perturbation 推动

方法直觉

AnnFlux 使用 object-conditioned neural SDE。在概念上,可以把 latent trajectory 写成:

dz_t = fθ(z_t, t, object) dt + gθ(z_t, t, object) dW_t

其中 drift field 描述 perturbation 对细胞状态演化方向的系统性推动,而 stochastic term 描述 population-level variability。关键设计是把 gene/drug 等 perturbing object 显式作为条件变量,因此可以逐个 perturbation 查询其 drift,并在统一 latent geometry 中比较不同 genes 与 drugs 的作用方向。

对于训练时没有见过的 perturbation,作者使用 prior-knowledge embedding 表示 perturbing object,使模型有机会从 object similarity 泛化到 unseen interventions。

实验信号

论文报告模型能够:

我最关注的统计问题

SDE 的优势是自然建模 distribution → distribution 的 transport,而不是只预测平均表达向量。但 latent SDE 也带来 identifiability 问题:不同 drift/diffusion 组合可能解释相似 endpoint distributions;若 timepoint 很稀,动态方向的约束通常弱于表面看起来的模型复杂度。

后续值得重点检查作者如何定义 distributional loss、如何约束 drift field,以及 combination generalization 是否真正跨 object / cell context,而不是主要依赖训练集邻域插值。

与我们的方向连接:perturbation modeling · neural SDE · single-cell dynamics · spatial validation
推荐优先级:值得读


4. MUST READ — Accessible and reproducible deployment reveals the practical boundaries of single-cell foundation models

Siyu Hou, Penghui Yang, Wenjing Ma, Jinxi Xiang, Jade Xiaoqing Wang, Hui Wan, Ying Ma, Xiang Zhou
bioRxiv v2 · 2026-09-02(大幅修订版) · Paper ↗

为什么值得看:这是很适合拿来给 scFM “降温”的 benchmark。作者不是只比一个 classification leaderboard,而是先解决 deployment / preprocessing / environment 不一致,再系统比较 13 个 scFM 与传统方法、近 100 个数据集

主要结论

和 Scaling recipes 放在一起看

这两篇最好连续读:

二者并不矛盾。一个模型完全可能在 pretraining objective 上呈现漂亮的 power-law scaling,同时 downstream biological effect size 很小。这提醒我们做 scFM 时必须把 optimization scalingscientific utility scaling 分开评估。

对算法论文 benchmark 的启发

如果以后我们自己做 single-cell foundation model / representation method,benchmark 至少应该加入:

与我们的方向连接:single-cell foundation models · benchmarking · reproducibility · representation learning
推荐优先级:必读


5. WORTH READING — A Measure of Transcriptional Dyscoordination for Quantifying Aging in Single Cells

Yilin Yang et al.; Nancy R. Zhang (corresponding)
bioRxiv v2 · 2026-08-28 · Paper ↗

为什么值得看:这篇更像“统计方法 + 生物问题”的工作,而不是 foundation model。作者试图定义一个 unsupervised、first-principles 的 single-cell statistic,用来量化细胞表达是否偏离正常的 coordinated transcriptional structure,并显式考虑 technical noise。

核心思想

作者把 aging-related transcriptional alteration 区分为不同维度,其中“dyscoordination”不是平均表达整体平移,而是一个细胞相对于可预测表达结构的异常偏离。方法强调:

实证结果

作者报告 dyscoordination 在 genotoxic injury 和 senescence induction 后升高,在 senolytic depletion 后下降;跨 mouse、rat、human tissues 随年龄升高,在 regenerative compartments 尤其明显。人 T-cell 分析还显示该指标与 clonal expansion、effector function 相关,并进一步与 chromatin-based mitotic age 和 genome instability 发生跨模态关联。

为什么方法上值得借鉴

这类研究的价值不只在 aging。它展示了一种很通用的建模套路:把高维单细胞数据中的“失调”定义为偏离 learned conditional structure,而不是简单 variance 或 entropy。 如果将来研究 disease-associated cell states、perturbation instability 或 donor-specific regulatory disruption,这种 residual-structure 思路值得复用。

与我们的方向连接:single-cell statistics · unsupervised modeling · biological noise
推荐优先级:值得读


Resource Watch

GWAS Catalog REST API v2:如果你的脚本还在用 v1,应该开始迁移

GWAS Catalog · migration guide 2026-08-19 · Migration guide ↗ · GWAS Catalog ↗

8 月 2 日的 Catalog snapshot 显示目前包含 7,784 publications、1,188,619 top associations、193,739 full summary statistics。API v2 的变化对后续自动化抓 GWAS/QTL 资源很重要:

对这个 Paper Radar 的意义:后续如果我们增加“新增 GWAS study / summary statistics / credible-set resource”自动监测,应该优先基于 v2 和官方 download metadata 设计,而不是继续依赖 legacy v1。


GPU / HPC Watch

过去 7 天里,我没有找到一篇质量足够高、又真正属于“GPU 加速单细胞分析”的新论文,因此今天不为了凑数塞旧文章。

当前仍建议持续关注 rapids-singlecell:它是 scverse 体系里最成熟的 AnnData-first GPU pipeline 之一,底层主要依赖 CuPy + NVIDIA RAPIDS。后续雷达会重点监控 preprocessing、PCA、neighbors、UMAP、clustering、batch correction、DE、sparse kernel 与 multi-GPU 相关的新 release / benchmark。


筛选窗口:优先最近 48 小时;不足时扩展到最近 7 天。资源更新允许回看最近 1–3 个月。所有预印本均未经过最终同行评审,方法与结果可能在后续版本中变化。