思考

数据驱动的精准医疗新范式

医行研苑
2026.07
20 分钟

过去一个多世纪,现代医学建立在"平均疗效"的假设之上:随机对照试验(RCT)回答的核心问题是"某干预在一群人中的平均获益是否优于对照",临床指南据此给出针对人群的标准化方案。然而,平均值的另一面是个体差异——同样的降压药,有人血压骤降、有人毫无反应,甚至出现严重不良反应;同样的化疗方案,在不同患者身上的生存期可能相差数倍。统计学上的"有效",落到具体患者身上未必有效。

一、范式转移的三块基石

精准医疗并非单一技术突破的产物,而是数据、临床与算法三类基础设施协同成熟的结果。三者缺一不可,共同构成新范式的"三块基石"。

(一)多组学数据的成本拐点

基因测序成本的指数级下降,是精准医疗得以普惠的底层前提。1990 年启动的人类基因组计划(HGP)耗资约 27 亿美元、历时 13 年才完成首个人类基因组图谱;而据美国国家人类基因组研究所(NHGRI)追踪数据,单个人类全基因组测序(WGS)成本已从十年前的约 1000 万美元,降至 2024 年的不足 1000 美元,下降速度远超摩尔定律。

更值得关注的是新一轮成本下探。Illumina 于 2022 年发布的 NovaSeq X 系列借助 XLEAP-SBS 化学技术,将单基因组测序成本压至约 200 美元,使全基因组测序从研究走向规模化临床应用成为可能。中国华大智造(MGI)通过国产测序仪进一步将单基因组成本压至约 100 美元。长读长测序方面,PacBio 于 2024 年为 Revio 系统推出 SPRQ 化学技术,将 HiFi 人类基因组成本降至 500 美元以下,同时将 DNA 起始量减少四倍、数据产出提升 33%。

成本的下降不止于基因组。蛋白组学、代谢组学、微生物组学同步进入"多组学并轨"时代:Illumina NovaSeq X 系列 25B 流动槽可在一次运行中同时完成全外显子组与转录组测序,实现"多组学成本低于单一组学"的拐点。这意味着,对患者进行基因组、转录组、蛋白组、代谢组与微生物组的联合画像,在经济上已具备可行性。多组学数据的可获得性,是精准医疗从"单基因决策"升级为"系统级决策"的物质基础。

(二)临床数据的标准化积累

组学数据描绘的是分子的"静态快照",要理解疾病在真实世界的动态演进,离不开临床数据的规模化积累。其中两个变量尤为关键:电子病历(EMR)的普及率与真实世界证据(RWE)被监管接受的程度。

中国电子病历系统应用水平分级评价自 2011 年启动以来,三级医院电子病历应用水平已普遍达到 4 级及以上,海量结构化诊疗数据在医院信息系统中沉淀,为后续的数据治理与二次分析奠定了基础。但仅有数据还不够,关键在于监管是否认可这类数据可作为决策依据。

这一突破在 2024 年取得实质性进展。2024 年 11 月,国家药品监督管理局药品审评中心(CDE)发布《基于疾病登记的真实世界数据应用指导原则(试行)》(2024 年第 48 号通告),指导申办者在药品临床研发中规范应用基于疾病登记的真实世界数据。这是中国继 2020 年《真实世界数据用于医疗器械临床评价技术指导原则》之后,向药物领域延伸 RWE 应用的关键一步,标志着中国正式迈入"真实世界证据驱动监管决策"的新阶段。

监管框架的完善,意味着真实世界数据(RWD)——来源于电子病历、死亡登记、医保理赔、患者登记系统、不良反应监测系统等多渠道的日常诊疗数据——可经规范治理后转化为支持药品上市、适应症扩展与标签变更的证据。这与美国 FDA 在《21 世纪治愈法案》(2016)框架下推动 RWE 用于新药审评的逻辑一脉相承,为罕见病用药、儿童用药、肿瘤创新药等难以开展大规模 RCT 的领域开辟了现实路径。

(三)算法能力的跃升

数据是原料,算法是把原料转化为决策的引擎。2024 年人工智能在生命科学领域的突破,显著降低了从数据到洞见的转化成本。

最具代表性的是 DeepMind 的 AlphaFold 系列。2024 年 5 月发布的 AlphaFold 3 可同时建模蛋白质、DNA、RNA、小分子配体及其相互作用,被视为蛋白质结构预测领域的里程碑,被类比为人类基因组计划的重要突破;2024 年 11 月,AlphaFold 3 全面开源并推出免费的 AlphaFold Server 平台。在配体结合预测上,AlphaFold 3 对未知口袋的预测准确率达 76.4%,蛋白质与 DNA 结合预测成功率为 65%(传统方法仅 28%),抗体-抗原复合物预测准确率达 62%,约为传统方法的两倍。

算法跃升的影响是双向的。在影像识别端,AI 已能以接近甚至超越放射科医师的灵敏度检出肺结节、乳腺癌微钙化与糖尿病视网膜病变;在药物筛选端,AI 将候选化合物从靶点发现到先导化合物的周期由传统 4–5 年压缩至 1–2 年;在结构生物学端,AlphaFold 数据库已覆盖超过 2 亿个蛋白质结构,使此前依赖 X 射线晶体学耗时数月的结构解析变为近乎实时的计算查询。组学数据的规模化与算法能力的跃升相互放大,形成"数据越多—模型越准—应用越多—数据越多"的正循环。

二、精准医疗正在兑现的四个场景

范式是否成立,最终要由场景验证。以下四个场景中,精准医疗已从"探索性研究"转为"可量化的临床获益"。

(一)肿瘤精准诊疗:靶向治疗与免疫治疗的双轮驱动

肿瘤是精准医疗兑现最充分的领域,核心逻辑是"先分子分型、后选择疗法"。全景变异分析(Comprehensive Genomic Profiling, CGP)panel 可一次性评估肿瘤组织中数百个基因变异,为患者匹配靶向药物、免疫治疗与临床试验。

2024 年 11 月,由 Illumina、Providence 与微软研究院联合开展的大型研究发表于《JCO 肿瘤学实践》。研究证实,CGP panel 可评估肿瘤中 500 余种遗传变异,是指导患者接受先进精准治疗、改善总体生存率的有力工具;早期开展 CGP 可显著提升患者匹配到精准治疗的比例。这一结论为 CGP 进入肿瘤一线诊断流程提供了高水平循证支持。

在疗效动态监测层面,循环肿瘤 DNA(ctDNA)已成为评估治疗响应的"液体活检"指标。2024 年世界肺癌大会(WCLC)公布的一项研究显示,贝福替尼治疗 6 周后,13 名 ctDNA 阳性患者中 10 名达到 ctDNA 清除(清除率 90%);剂量提升至 100 mg/d 后,12 周时 ctDNA 清除率达 100%;在 8 例脑转移患者中,7 例观察到抗肿瘤活性。这是首个根据血浆 ctDNA 清除来调整 TKI 剂量的临床研究,标志着精准医疗从"一次性分子分型"走向"全程动态分型"。

在免疫治疗领域,PD-L1 表达、肿瘤突变负荷(TMB)、TERT 等生物标志物已被证实对疗效具有预测价值。一项针对晚期肝细胞癌的研究中,多因素 Cox 回归显示 PD-L1≥1%(HR 25.07)、TMB≥5 Mut/Mb(HR 86.67)等指标对靶向与免疫治疗的生存预测具有显著意义。精准医疗正在将"泛癌种治疗"细化为"分子特征驱动的治疗"。

(二)罕见病诊断提速:从"诊断 Odyssey"到"分子快车道"

罕见病单病种发病率低,但病种总数超过 7000 种,约 80% 具有遗传基础,且多发生于儿童。传统诊断路径依赖临床表现逐项排查,平均确诊周期长达 5–7 年,被称为"诊断奥德赛"(Diagnostic Odyssey)。全外显子测序(WES)与全基因组测序(WGS)显著缩短了这一周期。

多项 2024 年研究印证了 WES 在罕见病诊断中的价值。捷克一项针对疑难罕见病患儿的研究显示,WES 总体诊断率为 43%,其中 11 个变异为此前未被任何公共数据库报道的新发变异;总体临床可用性(即可指导至少一项医疗决策改变)达 76%。中国东南地区一项针对 144 例罕见遗传病患儿的研究显示,WES 总体诊断率为 42.36%,其中 Trio-WES(先证者-父母三方测序)诊断率高达 51.43%,显著高于单人 WES 的 33.78%。西班牙一项针对神经发育障碍患儿的研究中,单纯先证者外显子测序在智力障碍组诊断率达 20.8%,经家系验证后总体诊断率进一步提升 4.6%。

诊断率从传统临床路径的不足 10% 跃升至 40%–50%,意味着近半数既往"无法诊断"的患儿获得了明确的分子诊断,进而有机会接受针对性治疗、遗传咨询与再生育风险评估。对罕见病而言,"诊断即治疗、诊断即干预"正在成为现实。

(三)药物基因组学:让"对症下药"升级为"对基因下药"

同一药物在不同个体中的疗效与不良反应差异,相当部分源于药物代谢酶、转运体与靶点的遗传变异。药物基因组学(Pharmacogenomics)的目标,是在用药前根据基因型选择药物与剂量。

经典案例已具备成熟循证基础:CYP2C19 慢代谢型患者对氯吡格雷的反应不佳,心血管事件风险升高;CYP2D6 超快代谢型患者使用可待因可能因吗啡过量转化而出现严重不良反应;HLA-B*15:02 阳性者使用卡马西平发生重症皮肤反应风险显著升高,相关基因检测已被纳入多国用药指南。

2024 年,多基因风险评分(Polygenic Risk Score, PRS)与药物基因组学的结合成为新趋势。一项发表于《The Pharmacogenomics Journal》的研究显示,在钙通道阻滞剂(CCB)治疗中,纳入脂蛋白 A 与肥胖相关 PRS 可较单一药物基因组变异更准确地预测停药与心力衰竭等临床结局。美国心脏协会杂志发表的超 30 万人研究显示,冠心病多基因风险评分(CAD-PRS)与传统临床风险评分结合,可改善一级预防中他汀类药物启动或延缓的决策。另一项由 Oni-Orisan 等开展的研究显示,CHD PRS 前 20% 高风险人群从他汀治疗中获得的相对风险降低幅度更大。

PRS 的临床落地也已进入国家级实践。英国国家医疗服务体系(NHS)在其健康检查(NHS Health Check)项目中整合了心血管疾病多基因风险评分,评估其在 40–74 岁无已知心血管疾病人群中识别高风险个体的能力。这意味着多基因风险评分正从科研走向公共卫生决策工具。

(四)疾病风险预测:从"已病救治"到"未病先防"

精准医疗的第四个场景,是在疾病发生前进行风险分层与早期干预。与传统基于年龄、性别等粗粒度变量的风险评估不同,多基因风险评分可基于数十至上百万个常见遗传变异位点的累积效应,对个体未来患病风险进行量化。

UK Biobank、芬兰 FinnGen、美国 All of Us 等大型生物样本库的建立,为 PRS 的训练与验证提供了规模化数据底座。在此基础上,PRS 已在冠心病、2 型糖尿病、乳腺癌、阿尔茨海默病等多种疾病中显示出风险分层能力:高遗传风险人群的发病风险可达低风险人群的 3–5 倍,且这种分层能力独立于传统临床风险因素。

值得强调的是,遗传风险高并非"宿命"。多项研究表明,对高遗传风险人群强化生活方式干预(如戒烟、控重、运动)或药物干预(如他汀),可显著降低实际发病风险,即"遗传风险越高,干预获益越大"。这一发现为健康管理的精准化提供了科学依据,也为下文"精准健康"的延伸埋下伏笔。

三、数据驱动范式的现实瓶颈

精准医疗的图景令人振奋,但将其规模化落地仍面临三重结构性瓶颈。

(一)数据孤岛:组学与临床数据"看得见、连不上"

数据驱动的前提是数据的可获取、可关联、可计算。然而现实中,数据分散在不同主体之间:测序数据沉淀在第三方检验机构,电子病历锁在医院信息系统,医保数据归集于医保部门,可穿戴设备数据停留在个人 App。各主体间数据标准不一、接口不通、共享意愿不足,形成大量"数据孤岛"。

更深层的问题在于"组学数据—临床数据"的割裂。基因变异的临床意义判定(ACMG 分级)高度依赖表型信息,但表型数据往往以非结构化文本形式散落于病历之中,难以与基因型自动关联。即使国家层面已发布 RWD 治理相关标准,涵盖数据安全、提取、清洗、转换、传输存储与质量控制六大环节,但标准的落地执行仍依赖医院的信息化能力与治理投入。隐私保护与数据安全同样是绕不开的议题——基因组数据具有唯一识别性,一旦泄露将对个人与家族产生不可逆影响,这要求在数据共享与隐私保护之间建立精细的平衡机制,如联邦学习、差分隐私、数据可用不可见等技术路径。

(二)支付缺口:技术可及不等于经济可及

测序成本的下降解决了"做得起"的问题,但"用得起、报得了"仍存缺口。目前,基因检测在我国大部分地区尚未纳入医保支付范围,全外显子测序、肿瘤 CGP、PRS 等检测往往需患者自费,单次费用从数千元至上万元不等,对普通家庭构成现实负担。这意味着技术成本的下降红利,并未等比例传递到患者端。

支付机制的滞后也影响了临床落地节奏。若缺乏医保支付支撑,医院缺乏开展精准检测的内生动力,企业缺乏持续投入研发的商业回报,最终制约精准医疗的规模化普及。如何在医保基金可持续与新技术可及之间取得平衡,探索按疗效付费、商保补充、多层次支付等机制,是破局的关键。值得关注的是,部分商业健康险已开始将肿瘤基因检测、药物基因组学检测纳入保障范围,为多元支付提供了探索样本。

(三)人才断层:复合型精准医学人才供给不足

精准医疗的落地需要兼具临床医学、遗传学、生物信息学、数据科学背景的复合型人才,而现行医学教育体系尚未系统培养这类人才。一方面,临床医生普遍缺乏基因组学知识与基因报告解读能力,难以将检测结果转化为诊疗决策;另一方面,生物信息学人才多集中于科研机构,缺乏临床场景的实战经验,算法产出与临床需求之间存在"两张皮"。

遗传咨询师是连接检测结果与临床决策的关键角色,但我国遗传咨询师队伍建设尚处起步阶段,认证体系、执业准入、薪酬归属等配套不完善,人才供给远不能满足需求。基层医疗机构的精准医学能力更为薄弱,进一步加剧了优质医疗资源的不均衡。人才培养是一个长周期过程,需在医学院校课程改革、住院医师规范化培训、继续医学教育等环节系统推进,难以一蹴而就。

四、从"精准诊疗"到"精准健康"

精准医疗的下一程,是从"已病的精准诊疗"延伸至"未病的精准健康"。这一延伸包含三层含义。

健康管理颗粒度细化。 传统健康管理多停留在年度体检的群体性指标层面,而精准健康要求基于个体多组学数据、可穿戴设备连续监测数据与生活方式数据,构建个体化的健康基线与动态画像。血压、血糖、心率变异、睡眠结构、肠道菌群构成等指标,不再以"是否超标"二元判断,而以个体基线为参照评估偏离趋势。

干预时机前移。 精准风险预测的价值,在于将干预窗口从"疾病确诊后"前移至"风险积累期"。基于 PRS 与动态监测数据,可在疾病发生前数年甚至数十年识别高风险人群,通过生活方式干预、药物预防、筛查频次调整等手段延缓或阻止疾病发生。前述"遗传风险越高、干预获益越大"的发现,为前移干预提供了科学支撑。

全生命周期健康陪伴。 精准健康不是一次性的检测报告,而是覆盖全生命周期的持续陪伴。从出生时的新生儿基因筛查、儿童期的生长发育与罕见病监测、成年期的慢性病风险预警、到老年期的衰老相关疾病管理,精准健康要求建立以个体为中心、贯穿全生命周期的健康数据档案与干预体系。这对数据连续性、服务连续性与机构协同能力提出了更高要求,也意味着医疗服务模式需从"以疾病为中心"向"以人为中心"重构。

这一转变需要医疗服务协调能力的支撑:在检测、诊断、治疗、康复、随访各环节之间建立顺畅衔接,为患者提供从基因检测咨询、专家预约、特药协助到跨境医疗协调的一站式支持。这正是数据驱动范式落地的"最后一公里"。

结语

数据驱动的精准医疗新范式,本质上是把医学决策的分辨率从"人群"提升到"个体"。基因测序成本的指数级下降、真实世界证据的监管接纳、人工智能的算法跃升,共同把这一范式从愿景推向现实;肿瘤、罕见病、药物基因组学与疾病风险预测四个场景已开始兑现临床价值。但数据孤岛、支付缺口与人才断层三重瓶颈提醒我们,精准医疗的规模化普及仍是一场需要制度、产业与人才协同推进的长期工程。

从更长的视野看,精准医疗的终点并非更精准地"治病",而是更精准地"保健康"——把干预窗口前移、把健康颗粒度细化、把全生命周期纳入陪伴。当数据真正流动起来、技术与人文真正结合起来,"具体的人"才能从平均值的阴影中完整地走出来。

文献引用附录

  • 美国国家人类基因组研究所(NHGRI)
  • Illumina
  • 国家药监局药审中心(CDE)
  • DeepMind / AlphaFold
  • Providence 与微软研究院
  • 英国国家医疗服务体系(NHS)

相关推荐

同栏目更多精彩内容

思考

医疗数据资产的边界与未来

数据正在从"系统的副产品"变成"机构的核心资产"。在医疗健康领域,每一次门急诊就诊、检验检查、用药记录、影像报告,都在持续生成海量且高价值的数据。医疗健康数据的年增长率已超过48%,然而这些数据大多"沉睡"在各机构信息系统中,形成了大量"数据孤岛",既未能释放其临床科研与商业价值,也面临隐私泄露与合规违规的双重风险……

2026.06阅读全文 →
思考

医疗AI的伦理与实践平衡

人工智能正在以前所未有的速度进入诊室、影像科与病房。据中国药科大学研究团队发表于《JMIR Medical Informatics》的回顾性分析,自2020年国家药品监督管理局(NMPA)批准首款人工智能医疗器械(AIMD)以来,截至2025年6月30日,中国累计已有154款AI医疗器械获批上市,年复合增长率高达49.53%。艾瑞咨询预测,到2025年中国AI医疗核心市场规模将突破千亿元大关。在肺结节检测、糖网病筛查、冠脉CT血管成像辅助评估等领域,AI辅助诊断软件已在数百家医院落地生根。

2026.05阅读全文 →
思考

从信息化到智能化的转型路径

过去二十年,中国医疗行业完成了一场规模空前的信息化建设。从HIS(医院信息系统)的普及到电子病历的全面推广,从互联互通测评到互联网医院的蓬勃发展,信息系统已经渗透到医疗机构运营的每一个角落。然而,"系统建起来了"并不等于"能力长出来了"。大量医院在完成信息化部署后发现,系统之间的数据壁垒依然存在,临床决策仍然高度依赖医生个人经验,管理层的决策依然缺乏数据支撑。信息化建设的投入与产出之间,存在着一条尚未跨越的鸿沟。

2026.06阅读全文 →