样本与测序
用配对肿瘤–正常证据区分体细胞与种系事件
用配对肿瘤–正常证据区分体细胞与种系事件
分别评估 HLA-I 肿瘤逃逸与 HLA-II 的 APC 呈递路径
从预测分数走向可解释的候选组合
控制连接区、翻译、纯度与递送
证明表达、天然呈递和 T 细胞杀伤
THE SHORT ANSWER
适用于尚未锁定平台、以编码新抗原为主的个体化肿瘤疫苗研发。以下数字是预算与 assay 验证网格,不是跨癌种、跨平台的临床标准。
若必须先做预算,新鲜且 purity ≥50% 可用肿瘤 WES 150–200×、正常 80–100×作为情景网格;purity 20–50% 或 FFPE 可预留 250–300× / 120–150×,但必须以文库复杂度和 LoD 验证收敛。需要 SV、非编码或非经典 ORF 时,WGS 可从 ICGC 的肿瘤 60× / 正常 30×研究级起点出发,按低纯度和目标 VAF 加深。1·2·26
它用于确认 mutant allele expression、转录本、融合、异常剪接与 HLA allele expression。预算可先按50–100M paired-end fragments设网格,降解、融合或低表达目标再做饱和度模拟;合同必须写清按 reads 还是 read pairs 计数。PE150 不是 mRNA 平台的必要条件。2·3·12
用正常血 DNA做 A/B/C 与 DR/DQ/DP 高分辨率分型;WES/WGS/RNA 推断只作交叉核对。采购时写入全/近全基因相位、等位平衡、歧义处理和重复规则,而不只写“测多少×”。3·4·6
不要把 8–11 aa 最小表位直接硬拼。公开先例中,autogene cevumeran 的 SNV 窗口为 27 aa,最多 20 个候选分到两条 RNA、每条不超过 10 个,并使用 10 aa G/S-rich linker;V940 可编码最多 34 个。12·14
以编码 SNV/indel 为主时,配对 WES + 肿瘤 RNA-seq + 正常血专门 HLA是常见且务实的基础组合;发现 SV、非编码或非经典 ORF 时改为配对 WGS + RNA-seq + 专门 HLA。成本效益取决于样本、平台和周转目标;深度按可用独立 reads 与经验证 LoD 结算。
DEPTH WORKBENCH
一个有用的近似:二倍体、杂合、克隆性突变的期望 VAF 约为 purity ÷ 2;期望突变 reads ≈ 有效深度 × VAF。30% purity 的 150× WES,理想情况下约有 22 个突变 reads,但 CNV、亚克隆、重复和捕获偏差都会进一步降低;因此必须以真实材料验证 LoD。
蛋白编码突变是当前个体化疫苗最成熟的来源,深 WES 在成本、周转和低 VAF 灵敏度间更均衡。
01 · SEQUENCING
“测得更深”不能修复坏样本。先做病理复核、肿瘤纯度/坏死评估、显微切割、DNA/RNA 质量与样本身份核对,再决定深度。
| 数据层 | 证据锚点 / 预算网格 | 它最擅长回答 | 何时升级 / 降级 | 关键 QC |
|---|---|---|---|---|
| 配对 WES | 无跨平台统一值;预算网格可设 purity ≥50%:150–200× / 80–100×;purity 20–50%:250–300× / 120–150× | 编码 SNV/indel、部分 CNV;成熟、快、单位成本深 | 先按目标 VAF、捕获均一性和可用独立 reads 模拟;FFPE 或更低 purity 先改善样本再谈加深2·26 | on-target、30×覆盖比例、duplicate、FFPE C>T、cross-contamination |
| 配对 WGS | ICGC 研究级起点:肿瘤 60× / 正常 30×;复杂/低纯度项目预算可上调 | SNV/indel + CNV/SV、非编码、均一覆盖、相位 | 发现型、复杂 SV、非经典抗原优先;上调多少由目标 VAF 与验证 LoD 决定1·26 | 独立覆盖、插入片段、mapping、SV caller 共识、纯度/倍体 |
| 肿瘤 RNA-seq | 无统一值;预算网格 50–100M paired-end fragments,须定义计数单位 | mutant expression、融合、剪接、HLA 表达、转录本相位 | 按基因/融合检测饱和度、DV200、有效比对与目标表达水平调整;读长由 assay 验证2·3·12 | RIN 或 DV200、rRNA、strandedness、junction saturation、位点有效覆盖、RNA VAF |
| 专门 HLA NGS | 不设统一 ×/locus;按实验室验证的最低位点有效读数/覆盖 | 相位清楚的 I/II 类等位基因与歧义解析 | 文献中的 100×仅是特定算法/数据集基准,不是临床放行阈值4·5·6 | 最低 locus 覆盖、allele balance、dropout、ambiguity、一致性与数据库版本 |
| 多区域/转移灶 | 按临床问题选 2–3 个区域 | 克隆性、空间异质性、共有 truncal targets | 低 TMB、高异质性或多病灶优先;不能用混样掩盖区域差异 | 分别建库、分别 purity/CNV,再做跨区组合 |
由 WES/WGS 反推等位拷贝数与癌细胞比例;候选优先级应使用 CNV 校正后的 clonality,而不是裸 VAF。
短读长先用两个 caller 共识;重要 fusion/frameshift 以 RT-PCR/靶向测序验证 ORF。长读长用于相位和完整 isoform,不是默认替代。
用于接种前后克隆扩增、组织迁移与 MRD 动力学;它们不替代候选发现所需的肿瘤组织 RNA。
Ribo-seq 支持非经典 ORF 的实际翻译;HLA-IP LC–MS/MS 给出天然呈递强阳性,但未检出不能当作绝对阴性。
代价是捕获偏差、HLA 区覆盖不均,以及对 SV、非编码和部分融合的能力有限。
WGS 也必须配 RNA;DNA 上“可能编码”不等于实际转录和呈递。
HLA DESIGN
正常血给出患者的胚系 HLA。HLA-I 候选还要看肿瘤 LOH/ASE、B2M 与加工通路;HLA-II 候选则要分别记录宿主 APC 呈递能力和肿瘤 HLA-II 状态,后者低表达本身不是通用硬淘汰条件。24·25
02 · NEOANTIGEN RANKING
先清除变异或序列不可信的候选,把表达未检出和 HLA 状态不确定单独标注并复核,再在可行集合内排名,最后按 HLA、克隆、CD4/CD8 和变异类型做组合约束。
DNA + RNA 确认,注释风险最低,是当前主线。
新生序列更“异物”,但必须重建 ORF、NMD 与相位。
必须有 junction、正确阅读框与正交验证。
需要更强的正常组织排除、Ribo-seq、蛋白组或直接呈递证据。
肿瘤支持、正常阴性、过滤伪影、样本身份一致
正确转录本、相位、frameshift/fusion ORF 与 mutant window
mutant RNA 阳性优先;未检出时检查有效覆盖、纯度、转录本与正交结果
I/II 类 EL %Rank 与加工;HLA-I 逃逸、HLA-II APC 路径分别解释
mutant-vs-WT 差异、foreignness、TCR 模型仅作辅助
优先 clonal/truncal、驱动或多区域共有突变
窗口长度、连接区、重复/毒性 motif、序列稳定与平台容量
somatic call、蛋白改变、正常对照支持体细胞归属、HLA genotype 可信;表达和逃逸按证据充分度分层,未检出不自动等于阴性。
EL %Rank、表达、RNA VAF、癌细胞比例、pMHC 稳定性、mutant-vs-WT 差、外源相似性、MS/T-cell 证据。
在患者实际等位基因允许时,分散覆盖多个 HLA-I 与 HLA-II 组合,兼顾 CD8/CD4、多个克隆和不同通路;不为凑数牺牲证据质量。
ALGORITHM MAP
| 任务 | 主路径 | 交叉工具 | 决定性注意点 |
|---|---|---|---|
| 变异与克隆性 | Mutect2 + Strelka2;indel 可加 Lancet | FACETS / Sequenza + PyClone-VI | 必须保留 caller、版本、过滤原因与原始支持 reads |
| HLA 分型 | HLA-HD / HISAT-genotype | OptiType(I 类)+ arcasHLA(RNA) | 临床构建用正常血专门分型作锚点,推断工具用于交叉核对 |
| HLA-I 呈递 | NetMHCpan 4.2e(EL %Rank) | MHCflurry 2.0 / MixMHCpred / HLAthena | 0.5% / 2% 只是工作点;锁定 context 模式、allele 库、肽长与补丁版本7 |
| HLA-II 呈递 | NetMHCIIpan 4.3k | MixMHC2pred | 同时跑 DR、DQ、DP;默认 1% / 5% 也不是免疫原性证明8 |
| 端到端 | pVACtools 7.1.2 | Vaxrank / MuPeXI / ImmunoNX | 固定数据库、转录本、HLA 库和模型版本后才能复现9 |
| TCR 识别 | PRIME / BigMHC / DeepImmuno(辅助) | 外源相似性、WT 对照与结构特征 | 只作次级排序;不能替代自体 T 细胞实验 |
03 · CONSTRUCT
“几个 base pair 接起来”不是起点。先定义 mutant protein context,再反向翻译。25–31 aa可作为 SNV 开发网格,用于同时评估 HLA-I 8–11mer 与 HLA-II 15mer;最终窗口须由具体平台实验收敛。
不是通用疗效标准。若只有 6 个可信候选就做 6 个;不要用弱候选凑数。
autogene cevumeran 将突变置中、两侧各 13 aa;fusion/frameshift 应按真实新 ORF 调整。12
10×27 aa 为 810 nt;9×10 aa G/S-rich linker 为 270 nt,合计约 1,080 nt,未计 targeting domain。12
该平台每条不超过 10 个;其他平台的窗口、linker、RNA 条数和 ORF 长度必须单独验证,不设统一上限。12
truncal 优先,必要时保留少量亚克隆候选应对异质性
A/B/C 与 DR/DQ/DP 不集中于单一 allele
不要只做 CD8;临床研究中 CD4 应答经常占重要部分
HLA-I 肿瘤逃逸与 HLA-II APC 呈递分开判断,再跨通路分散
04 · CODON OPTIMIZATION
正确做法是生成一组同义候选,在硬约束下寻找多目标 Pareto 前沿,再用相同 cap、UTR、poly(A) 与递送做小规模表达/呈递筛选。
蛋白序列完全一致;无意外 AUG/stop、frame、长同聚体、禁用限制位点、强 cryptic splice/poly(A)、高重复与供应商禁区。
预先定义并报告 AUG 周围的比较窗口(例如 50–100 nt),避免过强局部 hairpin;窗口本身不是统一生物学阈值。
同时看 CAI、codon-pair、整体/窗口 GC、MFE、ensemble diversity、重复与 RNase-sensitive motif。
mRNA 半衰期、翻译曲线、正确产物、天然呈递、先天炎症与 T 细胞激活共同决定。
TOOL SCORECARD
“支持”表示公开版本中有直接功能;“部分”表示需外接规则;“非核心/未验证”表示不能据此替代实验。数值总分只有在同一 rubric、同一版本和同一验证集内才可比较。
| 工具 | 核心能力 | 透明度 | 约束能力 | 结构建模 | 推荐用法 |
|---|---|---|---|---|---|
| LinearDesign | CAI × 全局 MFE 的 Pareto 设计 | 支持:论文与参数可查 | 部分:需二次筛查 | 支持:全局结构目标 | 输出候选与参数;再叠加制造硬约束15 |
| mRNAid | GC、motif、稀有密码子、U depletion、MFE | 支持:多目标可解释 | 支持:规则较完整 | 支持:含 MFE 目标 | 适合生成多目标候选集16 |
| DNA Chisel | 自定义 hard constraints + objectives | 支持:规则与日志可查 | 支持:强项 | 非核心:需外接模型 | 适合作为可审计约束引擎17 |
| 商业合成平台 | 合成、motif 与工艺可制造性 | 未验证:通常黑箱 | 部分:供应商内部 | 未验证:需索取方法 | 只在同一供应商、同一版本内比较 |
05 · mRNA ARCHITECTURE
最重要的分叉不是“要不要修饰”这么简单,而是N1mΨ 高表达/低非特异炎症与未修饰 uridine 的可控自佐剂作用。治疗性肿瘤疫苗中,两者都有临床平台,必须与递送共同评估。
提高稳定与翻译,降低 IFIT 识别。共转录或酶法均可,关键是 cap 率、方向、Cap0/1 分布和未加帽 RNA。21
在目标 APC/肌细胞中筛选表达曲线;检查 uAUG、局部结构、miRNA/RBP 位点。不要直接复制商业疫苗序列。
模板编码通常更均一;酶法需额外控制长度分布。100–120 nt 可作为工程网格,必须按本平台表达与稳定性实验收敛,不是通用放行值。
用 HPLC、cellulose 或经验证替代工艺降低 dsRNA,并以适用方法定量残留;依据工艺能力、效力和先天免疫风险建立可验证接受限与趋势控制。20·29
全长比例、截短/延长体、残留 DNA/NTP/酶、聚集体、内毒素与生物负载进入 CMC 控制矩阵。FDA 的 2023 文件是预防性 LNP-mRNA 公开研讨会材料而非正式指南,2026 效力文件仍为非约束草案。18·29
Signal、endosomal/lysosomal targeting 或 MITD 可提高 I/II 类呈递,但增加 ORF 和加工复杂度;需要 ligandome/T-cell 数据。
06 · DELIVERY
递送决定 mRNA 到达谁、在哪里翻译、引发多强的先天免疫。平台、给药途径和核苷化学必须成套验证;V940 的 IM 证据不能直接外推到 ID,后者应作为独立开发路线。
V940 是 IM 个体化 mRNA-LNP、每条可编码最多 34 个新抗原;随机 IIb 已发表,2026-08-19 官方公告三期达到 RFS 与 DMFS 顶线终点。产品仍属 investigational,完整数据、同行评议与监管审评尚待完成。14·31
通过电荷/粒径把 RNA 导向脾与淋巴器官 APC;可把未修饰 uridine 的先天刺激纳入机制。需要成熟输注与细胞因子风险控制。13·28
可直接验证整条构建在患者 APC 中的表达、加工、呈递和 T 细胞激活;但白细胞单采、个体化生产和批间差异使其更复杂。
可用于特定早研问题,但转染、稳定性、批间差异或工艺成熟度通常不如前述平台。不要把“配方简单”误当作“临床路径简单”。
07 · VALIDATION
最有价值的证据链是:突变真实 → 突变表达 → 天然呈递 → 突变特异 T-cell → 自体肿瘤杀伤。预测结合、外源肽刺激和真正肿瘤识别是三个不同层级。
| 要证明的逻辑 | 推荐实验 | Go 的含义 | Fail 后怎么做 |
|---|---|---|---|
| 突变是真的 | 同一样本的独立建库或靶向深测;必要时 ddPCR | 肿瘤支持、正常阴性、链偏/FFPE 伪影可解释 | 不进入候选池 |
| 突变被表达 | RNA-seq + IGV 人工复核;靶向 RNA / ddPCR | 突变等位 reads 阳性为优先证据;转录本与相位正确 | 未检出先查位点覆盖、纯度和可比对性;充分灵敏度下仍无支持才降级或淘汰 |
| HLA 能呈递 | 重组 pMHC 结合/稳定性;转染 APC 后 HLA-IP LC–MS/MS | 至少一条正交证据支持;MS 阳性是强证据27 | 改窗口/顺序;持续阴性则淘汰 |
| T 细胞会识别 | ELISpot + AIM/ICS;multimer;TCR-seq | mutant > WT,CD4/CD8 表型明确,可重复 | 回到候选排序;排查 naïve 频率与 assay 灵敏度 |
| 能杀肿瘤 | 自体肿瘤、类器官或 HLA 匹配靶细胞杀伤;HLA 阻断 | 杀伤依赖突变与 HLA,而非只杀 peptide-pulsed 细胞 | 若只认高浓度肽,原则上 No-Go |
| 构建能工作 | 整条 mRNA 转染 APC;蛋白/targeted MS + T 细胞激活 | 连接后仍正确加工呈递,无异常 reading frame | 重排、换 linker 或拆成两条 RNA |
| 产品可放行 | identity、完整性、cap、poly(A)、dsRNA、残留 DNA、无菌/内毒素 | 使用平台验证的规格与趋势控制18·29 | 批次 No-Go;不能用免疫活性抵消质量失败 |
| 递送可重复 | 粒径/PDI、包封率、游离 RNA、细胞摄取/内体逃逸、potency | 物化 + 细胞功能矩阵同时合格 | 回到配方或工艺,不直接推进患者批 |
样本身份、病理纯度、DNA/RNA/HLA、变异相位、重复建库、版本锁定。没有这一层,后面所有“免疫原性”都可能针对错误序列。
pMHC binding/stability、HLA stabilization、转染 APC 的 HLA-IP LC–MS/MS。MS 未检出不是绝对阴性,但阳性是强证据。
mutant vs WT、无关肽、mock mRNA、空 LNP、HLA blocking 全部入组;ELISpot 至少配一项 AIM/ICS/multimer/杀伤正交方法。
效力 assay matrix、稳定性、重复给药、biodistribution、HLA 转基因/人源化模型、临床 PBMC/TCR/ctDNA 与肿瘤活检。
Mutant vs WT:证明突变特异,而非原蛋白自反应。
Peptide-pulsed vs minigene/mRNA:区分外源加载与天然加工。
HLA blocking / knockout:确认限制性 allele。
Empty LNP / mock RNA:剥离载体和先天刺激。
自体肿瘤 / 类器官:确认真实靶细胞能被识别。
预设阳性/阴性阈值:盲法、重复与 assay acceptance 先于结果。
RECOMMENDED STACK
病理复核 + 肿瘤纯度/坏死 + 身份追踪。实体瘤正常对照通常用外周血;血液肿瘤需经验证的非造血正常来源,不能机械照搬。
先按 purity、目标 VAF、捕获均一性和 assay LoD 反推;预算可用页面情景网格。WGS 以 ICGC 60×/30×研究级起点为锚;WES/RNA 不设跨平台统一深度或读长。
正常血专门高分辨率 NGS,覆盖 A/B/C、DRB1/3/4/5、DQ 与 DP;HLA-I 肿瘤 LOH/ASE、B2M/加工通路与 HLA-II APC 呈递路径分开解释。
以 pVACtools 7.1.2 为可审计主干,NetMHCpan 4.2e + NetMHCIIpan 4.3k,并用第二套 presentation 模型交叉;锁定模式、数据库、参数和容器摘要。
把 12–20 个、25–31 aa 当开发网格。公开 27 aa 先例为最多 20 个、两条 RNA、每条 ≤10 个、10 aa G/S linker;最终设计做全 HLA junction scan。
Cap1、筛选过的 UTR、受控 poly(A)、经验证工艺降低并定量残留 dsRNA;N1mΨ-LNP 与 U-RNA–LPX 作为两套平台逻辑,不混用结论。
平台开发或样本允许时,对扩展候选集做 pMHC/自体 T-cell 筛查;患者批生产采用与周转时间匹配的分层证据。整构建仍须重新验证加工呈递与功能。
平台化 CMC + patient-batch identity/integrity;伦理、知情同意、遗传数据保护、GMP 和监管沟通从项目第一天并行。
样本身份或 HLA 经复核仍不确定;在充分位点覆盖/灵敏度与正交复核后仍无表达支持;CD8 候选只依赖已确认丢失/失活的 HLA-I;整构建不能天然呈递;T 细胞只识别高浓度外源肽而不识别适当肿瘤靶;mRNA/LNP 质量或效力矩阵不合格。
EVIDENCE LEDGER
参数来自指南、工具官方文档和人体/方法学原始研究。不同平台之间不能直接复制放行阈值;本文将“临床先例”“工程起点”和“通用原则”分开表述。
本网站用于研究设计和临床转化讨论,不是患者个体医疗建议,也不替代肿瘤内科、病理、临床遗传、免疫学、药学、伦理、GMP 与监管团队的共同审查。任何人体使用必须进入获批临床试验或合规医疗路径。