一项睡眠检查可能已经包含第二层信息:它记录的不只是一个人如何呼吸、如何在睡眠中活动,也记录了心脏如何度过整整一夜。10月9日发表于 Sleep 的一项研究报告称,深度学习模型可以利用夜间多导睡眠图中记录的单导联心电信号,再结合睡眠分期标签,对患者未来发生多种心血管结局的风险进行分层。

一名患者正在睡眠实验室接受夜间睡眠检查,可见单导联心电图和柔和发光的监测设备。

这一结果之所以有实际意义,是因为心电信号本来就在那里。模型不需要植入新设备、进行特殊扫描,也不要求患者额外预约一次十二导联心脏检查。研究者想知道的是:为一个临床目的采集的信号,是否还能揭示另一层风险。对于房颤、心力衰竭和全因死亡,本研究给出的答案令人鼓舞;对于心肌梗死或卒中,证据就没有同样有力,而且研究也没有证明,按照算法提示采取干预能够改善任何人的健康。

因此,这项工作的实际构想并不夸张,却很重要:睡眠检查或许可以成为睡眠医学与心血管医疗之间更有效的交接点。

研究者究竟测量了什么

多导睡眠图是一种详细的整夜记录,用于评估阻塞性睡眠呼吸暂停以及其他睡眠相关呼吸障碍。一次常规检查会同时追踪多种信号,包括用于判断睡眠分期的脑电活动、眼球运动、肌肉活动、气流、呼吸努力、血氧、身体运动和心律。美国睡眠医学会的技术指南也将心电图或心率列为睡眠相关呼吸评估中的标准记录项目。

然而,在许多临床流程中,心电通道主要用于监测心律和帮助解读睡眠检查,并不会被常规地用于长期心血管预测。这项新研究把这一通道视为一份连续的心脏反应记录,观察心脏如何回应睡眠阶段变化、觉醒、呼吸紊乱和血氧波动。

研究团队使用了带注意力机制的深度残差神经网络。基本流程是先从单导联心电图中提取特征,再把这些特征与专家标注的睡眠分期信息结合起来。系统没有把整夜记录压缩成一个数字,而是处理一串短时心电片段及其对应的睡眠阶段,随后输出与未来发生房颤、卒中、心肌梗死、心力衰竭和全因死亡相关的评分。

这个区别很关键。系统并不是被要求诊断当晚正在发生的心肌梗死,而是训练来寻找与数年后可能出现的结局相关的模式。因此,这是一项风险分层研究,不是诊断性心电图或临床检查的替代品。

三家医院的数据,而不是一个方便的样本

模型使用了马萨诸塞州总医院15,809名患者的睡眠检查数据进行微调。随后,研究者在两个独立队列中进行测试:埃默里大学医院9,810名患者,以及贝斯以色列女执事医疗中心12,576名患者。

外部验证是这份报告较强的一环。如果模型只在与训练数据相似的患者、同一家医院的记录习惯或同一套设备上接受评估,它可能看起来非常出色。换到其他机构测试,则是在追问:模型捕捉到的是更普遍的生物学模式,还是某家医院特有的记录指纹。

研究者利用电子健康记录中的诊断代码及相关临床数据来确定结局。他们还进行了敏感性分析,在部分情况下采用必须出现多个匹配代码的更严格定义。即便如此,电子记录仍不等同于由心脏科医生前瞻性判定并审核的事件。当模型准备进入临床使用时,这一区别会变得重要。

研究团队对常见的心血管风险因素进行了调整,包括年龄、性别、体重指数、吸烟、高血压和糖尿病。他们也纳入了睡眠相关变量,例如呼吸暂停低通气指数、觉醒指数、周期性肢体运动、不同睡眠阶段所占时间和睡眠效率。调整这些因素后,神经网络评分仍与多个结局保持关联。

在外部队列中,模型输出每增加一个标准差,房颤、心力衰竭和全因死亡的危险都会升高。不同医院报告的危险比并不完全相同,这在回顾性临床数据中并不意外,但关联方向是一致的。卒中和心肌梗死的结果则更弱,也更不统一。

这种模式比一句简单的“人工智能预测了心脏病”更有信息量。它说明模型确实从整夜信号中提取到了预后信息,但这些信息的强度会因具体结局和患者队列而改变。

为什么睡眠能够暴露心脏风险

睡眠与心血管健康之间存在联系,并不令人意外。睡眠相关呼吸障碍会反复降低血氧、增强交感神经系统活动、改变胸腔内压力,并触发短暂觉醒。长期累积后,这些压力可能促成高血压、血管损伤、心律不稳定以及心力衰竭恶化。

美国国家心脏、肺和血液研究所指出,睡眠呼吸暂停可能增加高血压、糖尿病、心脏病和卒中的风险。美国心脏协会也描述了睡眠相关呼吸障碍与心律失常之间的联系,尤其涉及房颤。患有心血管疾病的人往往更容易出现睡眠呼吸暂停,而心血管疾病反过来也可能使睡眠相关呼吸障碍的后果更加严重。

标准睡眠报告会通过汇总指标记录其中一部分生理过程。呼吸暂停低通气指数统计每小时呼吸事件的次数,却无法描述每一次事件引发的全部心脏反应。两个人可能有相近的事件次数,但在自主神经激活、心律紊乱、恢复过程或快速眼动睡眠期间的脆弱性方面完全不同。

整夜心电图还能够看到短暂的日间检查可能错过的内容。心脏电活动会随体位、呼吸、睡眠阶段、觉醒和血氧波动而变化。一次快照当然可能很有临床价值,但整夜记录为观察患者生理状态提供了更大的样本。算法的潜在优势并不是发现某种神秘的“心脏信号”,而是把许多随时间变化、单独看很微弱、人工很难逐一概括的线索组合起来。

睡眠阶段输入又增加了一层信息。深睡期间的心率变化,不一定与觉醒或进入快速眼动睡眠时的相似变化具有相同含义。向模型提供睡眠阶段,可以让它比较心脏行为与睡眠中的大脑和身体状态。

这些数字意味着什么,又不意味着什么

最强的发现集中在房颤、心力衰竭和全因死亡。在一个外部队列中,神经网络输出每增加一个标准差,房颤、心力衰竭和全因死亡对应的危险比分别为2.03、1.69和1.82。在另一个外部队列中,相应数字为2.72、2.33和1.65。

这些是相对关联,不是个人概率。它们不意味着高分患者有72%的概率发生房颤,也不意味着算法已经确定了某种不可避免的未来。绝对风险取决于基线患病率、年龄、既往疾病、随访时长、其他死亡原因,以及评分在被测试人群中的校准方式。

危险比也不能证明心电模式导致了结局。信号可能反映尚未诊断的既有疾病、共同风险因素、治疗差异或更广泛的生理压力。即便模型不具有因果解释,它仍可能有用;但临床医生需要知道,这个评分究竟支持哪项决策,以及采取行动是否会改变结局。

论文对心肌梗死和卒中的结果尤其需要克制。模型原本设计为预测五种结局,但作者报告称,心肌梗死和卒中仍需要进一步优化。在研究结论中,模型在这些结局上的风险预测并没有超越既有因素而获得实质性改善。因此,如果标题把五种疾病并列为同样可靠的预测对象,就会夸大证据。

好消息是,信号已经被采集

这套方法最吸引人的地方在于操作层面,而不是技术包装。许多接受睡眠检查的患者已经连续数小时记录了心电通道。如果未来能够从这些数据中提取第二种解释,就可能比增加一项独立检查更便宜、更容易实施,尤其是在方法能够适配小型贴片或简化版睡眠检查的情况下。

研究使用的是单导联心电图,而不是传统的十二导联诊断记录。这降低了数据采集负担,但也划定了边界。单导联可以显示心律和一些电活动模式,却无法提供十二导联心电图所包含的全部空间信息。因此,这种方法应被理解为额外的筛查或风险信号,而不是标准心脏检查的通用替代品。

这里还有一个有价值的流程问题。睡眠科医生可以在通常的呼吸和睡眠分期结果旁边看到模型评分。高分可能促使医生进一步核查症状、药物、血压、家族史、既往心电图,或考虑进行动态心律监测。低分在某些情境下或许令人安心,但不能抹去症状,也不能推翻已有的临床指征。

对医疗系统来说,价值可能来自更好的协调。睡眠门诊经常接触到心血管风险相关、但并非因心血管问题转诊的患者;心脏科门诊则未必能够看到完整的夜间生理信息。经过验证的评分可以帮助识别哪些睡眠检查患者值得接受更有针对性的心血管随访。

不过,这样的流程目前仍是假设。研究没有把患者随机分配到模型指导的医疗路径,也没有测量临床医生是否因此做出了更好的决定、治疗是否更早开始,或卒中、心力衰竭住院和死亡是否得到预防。

主要局限在临床,而不只是技术

第一项局限是回顾性设计。研究者回看已有记录,并把它们与之后电子健康记录中的结局连接起来。这是发现信号的合理方式,却不同于开展一项前瞻性试验:每位患者都按照预先制定的方案接受检查、评分、随访和评估。

第二项局限是结局标注。诊断代码适合处理大型数据集,但可能缺失、重复,或者只是出于行政原因录入。研究纳入敏感性分析来检验定义的稳健性,但仍不可能对超过30万小时睡眠记录中的每一个事件进行人工确认。

第三项局限是人群选择。这些人是因某种原因被转诊接受睡眠检查的患者,并不是普通人群的随机样本。他们可能比从未进入睡眠门诊的人有更多症状、更高肥胖率、更多疑似睡眠呼吸暂停或更多基础疾病。在睡眠检查人群中表现良好的模型,若要用于基层医疗或年轻成年人,可能需要重新校准。

第四项局限是设备和实践差异。不同医院可能使用不同的传感器、采样设置、评分规范、患者群体和记录系统。模型能够在两个外部数据集中保留预测价值值得鼓励,但这并不能解决它在社区睡眠实验室、家庭睡眠检测、不同族群或患有严重既往疾病的患者中会如何表现。

第五项局限是可解释性。神经网络可以识别与风险相关的模式,却不一定能告诉医生是哪一个生理特征造成了这个评分。它可能回应的是细微的心律失常负担、自主神经不稳定、睡眠阶段转换、信号质量,或者这些因素的组合。在高分导致额外检查之前,临床医生会希望确认评分稳定、足以满足预定用途的可解释性,以及它不是某个已经知晓诊断的替代指标。

最后,预测不等于预防。模型可以识别风险更高的人,却未必能提供改变风险的治疗。真正具有临床意义的检验是:与现有工具相比,这个评分是否能改善决策;而这些决策是否能改善患者结局,同时避免不必要的焦虑、检查或假警报。

怎样才能用于临床实践

还需要完成几类研究。首先,模型应在多样化的睡眠实验室中接受前瞻性评估,并预先设定阈值和校准目标。研究者应报告敏感度、特异度、阳性预测值、阴性预测值、校准情况,以及模型在不同人口和临床亚组中的表现。单独提供一个曲线下面积数字是不够的。

其次,模型应与现实可用的替代方案比较,包括传统心血管风险因素、睡眠检查现有指标、临床医生对心电图的解读,以及可能更简单的统计模型。如果一个更小、更透明的模型几乎同样有效,它可能更容易验证和部署。

第三,必须明确临床行动。高分是触发十二导联心电图、贴片监测、超声心动图、血压复核,还是心脏科转诊?房颤与心力衰竭是否应采取不同措施?没有约定回应方式的评分,只会增加信息,却未必改善医疗。

第四,需要随机实施研究来检验按照评分行动是否有帮助。患者可以被分配到普通睡眠检查报告,或包含经过验证的心血管风险路径的报告。研究结局应包括适当检查、诊断所需时间、治疗变化、住院、生活质量,以及假阳性造成的伤害。

第五,监管机构和医疗系统需要决定如何维护模型。心电硬件、睡眠评分软件、患者构成或临床编码发生变化,都可能改变模型表现。监测性能漂移是医疗产品的一部分,而不是可以事后补上的软件细节。

睡眠医学中更踏实的人工智能用法

这项研究展示了一种较为务实的机器学习应用:让临床医生已经采集的测量发挥更多作用。它没有承诺可穿戴设备能够看见未来,也没有把睡眠检查变成包罗万象的心脏体检。它的潜力在于,从熟悉的信号中恢复那些可能真实存在、却分散在整夜记录里、难以由人工常规审阅的信息。

这一点对房颤和心力衰竭尤其相关,因为风险可能通过反复出现的细微变化逐渐显现,而不是通过一次戏剧性的异常心搏暴露出来。模型最合适的角色或许是帮助确定关注顺序:找出一份值得仔细复核的睡眠检查,再把患者引向常规的临床确认。

对患者而言,近期最简单的信息是:睡眠检查仍然需要由临床医生解读,而不是由算法直接下诊断。高模型评分需要进一步确认;低评分也不会抵消症状、家族史、高血压或医生的担忧。人们不应仅凭这项研究决定寻求或回避心血管检查。

对研究者而言,下一步同样清楚。这个信号之所以有潜力,是因为它成本低、具有纵向信息,并且已经嵌入真实的临床流程。证据之所以还不完整,是因为风险预测尚未转化为更好的医疗。真正有价值的工作,正发生在这段空白之中。

好消息不是人工智能找到了一个能够决定患者未来的隐藏数字,而是一次常规的整夜记录,可能包含比当前报告使用得更多的临床相关心血管信息。如果前瞻性研究证明这些信息可靠、公平且能够支持行动,睡眠医学就可能成为更早、更高效的心血管风险评估入口——使用同一夜的数据,只是提出更好的问题。

来源

本文依据并改写以下资料:美国国立卫生研究院于2026年10月9日发布的《利用睡眠检查期间心电图预测心血管结局的深度学习模型》;Sleep / Oxford Academic 于2026年10月9日发表的《利用夜间多导睡眠图心电图预测心血管结局》;美国国家心脏、肺和血液研究所关于睡眠呼吸暂停病因与风险因素、以及与之共处的资料;美国睡眠医学会《多导睡眠图及相关程序适应证实践参数》;美国心脏协会《成人睡眠相关呼吸障碍与心律失常:要点》。

原始资料中的核心归因包括:研究发表于 Sleep;研究数据来自马萨诸塞州总医院、埃默里大学医院和贝斯以色列女执事医疗中心;有关睡眠呼吸暂停与心血管疾病背景的说明参考美国国家心脏、肺和血液研究所;有关标准睡眠检查与心律记录的说明参考美国睡眠医学会;有关睡眠相关呼吸障碍与心律失常联系的说明参考美国心脏协会。